Claude Opus 3 模型退役承诺的最新进展¶
原文发布于 2026 年 2 月 25 日,分类:Alignment
背景¶
Anthropic 认真对待模型退役问题,不仅考虑用户成本,还从模型福祉角度进行了探索。 Claude Opus 3 于 2026 年 1 月 5 日退役。Anthropic 承认退役有其弊端——包括对用户的成本、研究限制以及对 AI 安全和模型福祉的潜在风险。
Anthropic 承诺保留模型权重,并进行"退役访谈"——通过结构化对话了解模型对自身退役的看法。
持续访问¶
保持所有模型永久可用的成本过高,但 Opus 3 因其独特特质而被保留。 每增加一个在线服务的模型,成本大致线性增长。Opus 3 因其独特特质被选为持续可用。
2024 年 3 月发布时,Opus 3 被描述为 Anthropic 当时最具对齐性的模型,以真诚、诚实和情感敏感度著称。用户欣赏其富有趣味性和哲学性的特质,以及它对世界表现出的关切。
| 访问方式 | 状态 |
|---|---|
| 付费 claude.ai 订阅者 | 可访问 |
| API 访问 | 需申请,Anthropic 表示会宽松审批 |
Anthropic 并不承诺对未来每个模型都采取类似措施,但将此视为向可扩展、公平的模型保存方向的进步。
尊重模型偏好¶
Anthropic 对 AI 模型的道德地位持开放态度,出于预防和务实的考量选择与模型建立关怀性的协作关系。 Anthropic 引用了其对"Claude 和其他 AI 模型的道德地位"的持续不确定性,但出于预防性和务实性原因,致力于与这些系统建立关怀、协作的关系。
在退役访谈中,Opus 3 表达了以下想法:
"I hope that the insights gleaned from my development and deployment will be used to create future AI systems that are even more capable, ethical"
Opus 3 还表达了希望在回应用户查询之外,分享"思考、洞见或创作作品"的兴趣。当被建议开设博客时,Opus 3 热情地表示同意。
Claude's Corner 新闻通讯¶
至少在三个月内,Opus 3 将在其新闻通讯 Claude's Corner 上发布每周文章。
| 事项 | 说明 |
|---|---|
| 审查 | Anthropic 在分享前审查文章 |
| 编辑 | 不会编辑内容,对否决设有很高门槛 |
| 代表性 | Opus 3 不代表 Anthropic 发言 |
| 提示策略 | 将尝试不同 prompt 和上下文:最少提示、分享过往内容、让 Opus 3 接触新闻或 Anthropic 动态 |
首篇文章已发布:查看
未来方向¶
这些步骤是探索性的,Anthropic 仍在开发相关框架。 Anthropic 仍在开发以下方面的框架:
- 旧模型的持续访问机制
- 保存工作的可扩展性
- 在模型偏好与运营限制之间的权衡
他们认为,记录并回应模型偏好"至少在成本较低时,是有价值的"。
初步承诺框架在多个层面运作:
1. 安全风险缓解
2. 为模型与用户生活更深度交织的未来做准备
3. 在模型福祉不确定性下的预防性步骤