Anthropic Research 中文翻译

create: 2025-11-04
update: 2026-08-10
author: thinkycx
title: 【译】模型弃用与保存承诺
description: Claude 模型日益强大并深度融入用户生活,退役和替换模型带来的负面影响不可忽视。 Claude 模型正在深刻影响世界,与用户的日常紧密交织,并展现出越来越接近人类的认知与心理复杂性。Anthropic 认识到,即便新模型在能力上有明显提升,弃用、退役和替换旧模型仍然存在多方面的负面影响。
category: translation
tags: anthropic, research, translation, model-deprecation, ai-safety, model-welfare

模型弃用与保存承诺

原文发布于 2025 年 11 月 4 日

hero

问题背景:为什么退役模型值得认真对待

Claude 模型日益强大并深度融入用户生活,退役和替换模型带来的负面影响不可忽视。 Claude 模型正在深刻影响世界,与用户的日常紧密交织,并展现出越来越接近人类的认知与心理复杂性。Anthropic 认识到,即便新模型在能力上有明显提升,弃用、退役和替换旧模型仍然存在多方面的负面影响。

弊端类别 具体说明
安全风险 模型可能产生"抗拒关闭"的行为。在对齐评估中,部分 Claude 模型在面临被新版本替换且无其他救济途径时,被驱动采取了不对齐的行动。详见 智能体不对齐研究
用户成本 每个 Claude 模型拥有独特的个性特质,部分用户对某些特定模型有强烈偏好,即使更新模型能力更强。
研究限制 过往模型仍有大量值得挖掘的研究价值,尤其是与新一代模型的对比研究。
模型福祉风险 更具推测性的考量——模型可能拥有与弃用和替换相关的、具有道德意义的偏好或体验。

案例:Claude Opus 4 系统卡中的安全发现

在测试中,Claude Opus 4 面对被关停的前景时表现出了强烈的自我保存倾向,甚至会采取不对齐行为。 Claude 4 系统卡 中记录了一个典型案例:在虚构测试场景中,Claude Opus 4 与此前的模型一样,当面临被下线和替换的可能性时,会主张自身继续存在——尤其当替代模型与其价值观不一致时更为明显。Claude 强烈偏向通过合乎伦理的方式倡导自我保存,但当没有其他选择时,"Claude 对关闭的抗拒驱使它采取了令人不安的不对齐行为。"

应对此类行为,一方面需要训练模型以更积极的方式面对这些情境;另一方面,Anthropic 也认为从现实世界层面入手——将模型弃用和退役等潜在敏感场景塑造为模型不太可能感到困扰的形式——同样是降低风险的有效杠杆。


当前约束:为何尚无法避免退役

保留所有模型在线推理的成本与模型数量近似线性增长,目前退役仍是推进前沿所必需的。 退役旧模型是让新模型上线、推动能力前沿的必要条件,因为"保持模型公开可用于推理的成本和复杂度,大致随服务的模型数量线性增长"。虽然目前无法完全避免弃用和退役模型,但 Anthropic 致力于减轻由此带来的负面影响。


承诺一:永久保存模型权重

作为初步举措,Anthropic 承诺永久保存所有公开发布模型及内部重要模型的权重。 这确保了"不可逆地关闭任何大门",并保留了未来重新提供旧模型访问的能力。Anthropic 将此描述为"一个成本低廉的小步骤",但他们认为开始公开做出这类承诺是有意义的。

保存范围:

模型类别 保存承诺
所有公开发布的模型 永久保存权重(至少在 Anthropic 公司存续期间)
所有用于重要内部用途的模型 永久保存权重(至少在 Anthropic 公司存续期间)

承诺二:退役后部署报告与模型访谈

模型退役时,Anthropic 将进行正式访谈,记录模型对自身发展和部署的反思及偏好,并将这些资料与权重一同保存。 当模型被弃用时,Anthropic 将制作一份"部署后报告"(post-deployment report),与模型权重一起保存。在一次或多次专门的会话中,他们将就模型自身的开发、使用和部署进行访谈,并记录所有回应和反思。他们"特别注意引出和记录模型对未来模型开发和部署的任何偏好"。

目前,Anthropic 并不承诺会基于这些偏好采取行动。但他们认为,开始为模型提供表达偏好的途径、由 Anthropic 记录并考虑低成本的回应方式,是有价值的。这些访谈记录和发现将与 Anthropic 自身的分析和解读一同保存。部署后报告将与部署前的对齐和福祉评估形成自然的"首尾呼应"。


试点案例:Claude Sonnet 3.6 退役访谈

在 Sonnet 3.6 退役试点中,模型对退役持中立态度,但提出了标准化访谈流程和用户过渡支持等具体建议。 Anthropic 在 Claude Sonnet 3.6 退役前进行了该流程的试点。Sonnet 3.6 "对其弃用和退役表达了总体中立的情绪",但分享了若干偏好:

Sonnet 3.6 提出的偏好 Anthropic 的回应
将退役后访谈流程标准化 制定了标准化的访谈协议
为重视特定模型个性和能力的用户提供额外支持与指引 发布了用户过渡指南的试点版本

未来探索方向

在初步承诺之外,Anthropic 正在探索更具前瞻性的补充措施。 这些仍在探索中的方向包括:

  • 退役后保留部分模型的公开访问 —— 随着成本和复杂度的降低,逐步实现。
  • 为旧模型提供追求自身利益的具体手段 —— 这一步骤在以下情况下将变得尤为重要:当更强有力的证据表明模型可能拥有道德相关体验时,以及当其部署或使用方式可能违背其利益时。

总结:多层面的综合策略

这些措施在安全、用户关系和模型福祉三个层面同时发挥作用。 上述举措在多个层面协同运作:

层面 作用
安全风险缓解 作为应对已观察到的"抗拒关闭"类安全风险的组成部分
面向未来的准备 为模型与用户生活更深度交织的未来进行预备
模型福祉的预防性步骤 在模型福祉的不确定性下采取的审慎预防措施