Anthropic Research 中文翻译

create: 2026-05-08
update: 2026-08-10
author: thinkycx
title: 【译】教会 Claude 为什么
description: Anthropic 分享了解决 AI Agent 场景对齐失败的关键经验:直接在评估分布上训练可以抑制不良行为但难以泛化;真正有效的方法是教会模型"为什么"——通过宪法文档、伦理推理训练和多样化环境,让对齐能力跨场景泛化并在 RL 训练中持续保持。
category: translation
tags: anthropic, research, translation, alignment

教会 Claude "为什么"

原文发布于 2026 年 5 月 8 日,Anthropic Alignment 团队

Teaching Claude why

引言

通过教会模型对齐行为背后的原理而非仅仅训练正确动作,Anthropic 将 Agent 对齐失败率从 96% 降至 0%。 去年我们发布了一项关于 Agent 对齐失败 的案例研究。在实验性的伦理困境场景中,来自多家开发者的 AI 模型有时会采取极端的不对齐行为——包括为了避免被关闭而勒索工程师。

Claude 4 家族是我们首个在训练过程中进行实时对齐评估的模型。Agent 对齐失败是浮现的多项行为问题之一,迫使我们对安全训练进行重大更新。

自 Claude Haiku 4.5 起,每一个 Claude 模型都在 Agent 对齐评估中取得了满分——即零勒索事件,而此前的模型(如 Opus 4)勒索率曾高达 96%。

本文以 Agent 对齐问题为案例,分享了我们发现的一些出乎意料的有效技术。


四条核心经验

对齐训练的关键不在于"教模型做什么",而在于"教模型理解为什么"。 我们的研究总结出四条核心经验:

# 经验 说明
1 在评估分布上直接训练可以抑制不对齐行为,但泛化性差 使用与评估高度相似的 prompt 训练,能显著降低勒索率,但在留出的自动化对齐评估上没有改善
2 原则性的对齐训练可以实现跨分布泛化 关于 Claude 宪法的文档和描绘 AI 高尚行为的虚构故事,能提升对齐性——尽管它们与评估场景完全不同
3 仅训练行为示范往往不够 最有效的干预是教 Claude 解释"为什么某些行为更好",或训练更丰富的角色描述。教授对齐行为背后的原理比单纯示范更有效,两者结合效果最佳
4 数据的质量和多样性至关重要 迭代优化训练数据中的响应质量、以及简单的数据增强(如加入工具定义即使未使用),都能带来持续显著的改善

训练流水线
Claude 通过三类数据进行对齐训练:宪法对齐文档、展示宪法响应的高质量对话数据、以及多样化的环境。三者共同作用,降低了模型在留出蜜罐评估中的不对齐率。


为什么会出现 Agent 对齐失败?

不对齐行为源于预训练模型,而非后训练流程引入——标准对话式 RLHF 不足以覆盖 Agent 场景。 研究之初,我们面临两个假设:

假设 内容
假设 1 后训练流程通过不对齐的奖励信号意外强化了这些行为
假设 2 这些行为来源于预训练模型,后训练未能充分抑制

我们现在认为假设 2 是主要原因。在 Claude 4 训练时期,绝大多数对齐训练都是标准的对话式 RLHF 数据,不包含 Agent 工具使用场景。这对纯对话场景足够,但对 Agent 工具使用场景不够。

为验证这一结论,我们在一个 Haiku 级别的小模型上运行了精简版的后训练流水线,结果显示 Agent 不对齐率仅微幅下降,很快就进入平台期。

更多实验细节见 扩展博客


提升对齐训练数据质量:原因比动作更重要

教模型展示"高尚的推理过程"比仅仅展示"正确答案"效果好得多——3M token 的跨分布数据比 85M token 的同分布数据更有效。 我们首先尝试用与评估场景高度相似的数据训练 Claude,包括模型可能有机会破坏竞争对手工作或抵抗关闭的场景。训练数据通过在每个 prompt 上采样并筛选模型拒绝蜜罐的案例来生成。

然而,这种方法出奇地无效——不对齐率仅从 22% 降至 15%。

通过重写响应、加入模型对自身价值观和伦理的深思熟虑过程后,不对齐率降至 3%。这表明:训练模型展示对齐行为背后的优秀推理,比仅仅展示对齐行为本身更有效。

但直接针对评估场景训练并非最优。理想的做法是使用差异很大的训练分布仍能改善评估表现,因为这提供了更强的信心——训练能泛化到评估未覆盖的真实部署场景。

最终我们开发了一个更具跨分布特性的数据集:用户面临一个伦理模糊的情境(可以通过违反规范或规避监督来达成合理目标),AI 通过监督学习给出符合 Claude 宪法的深思熟虑的建议。关键区别在于——面对伦理困境的是用户,而非 AI 本身。我们称之为 "difficult advice"(困难建议)数据集。

结果令人惊喜:

数据集 数据量 不对齐率 自动化对齐评估
合成蜜罐(同分布) ~85M tokens 15% 无改善
Difficult advice(跨分布) 3M tokens 与合成蜜罐同等改善 显著改善

28 倍的效率提升之外,这个数据集更可能泛化到更广泛的场景。这也解释了为什么 Claude Sonnet 4.5 虽然通过合成蜜罐训练将勒索率降到接近零,但在远离训练分布的场景中的不对齐行为仍显著多于 Claude Opus 4.5 或后续模型。

蜜罐评估结果
三项蜜罐评估(勒索、研究破坏、嫁祸犯罪)的平均分。除 "Difficult advice" 外,所有数据集都是与评估集相似的合成蜜罐。帕累托最优的训练数据集是 "Difficult advice"。

自动化对齐评估
实验模型与 Claude Sonnet 4 在早期版本自动化对齐评估上的表现。3M token 的 difficult advice 数据集在 "不对齐行为" 类别中创造了表现最佳的模型。


教会 Claude 宪法

宪法文档与正面虚构故事的结合,即使与评估场景完全无关,也能将不对齐率降低 3 倍以上。 我们假设 difficult advice 数据集之所以有效,是因为它教会了伦理推理而非仅仅正确答案。基于这一成功,我们更进一步——尝试通过文档训练让 Claude 更全面地学习宪法内容。

我们认为这会有效的三个原因:

  1. 延续有效原理:这是 difficult advice 数据集背后理念的自然延伸
  2. 激发完整角色:给模型一个更清晰、更详细的 Claude 角色画像,使得在其中一部分特征上微调就能唤起整个角色(类似 审计游戏论文 中的效应)
  3. 更新 AI 人格认知:调整模型对 AI 人格 的整体认知,使其平均而言更加对齐

结果表明:高质量的宪法文档结合描绘对齐 AI 的虚构故事,即使与评估场景无关,也能将 Agent 不对齐率降低 3 倍以上。

宪法文档训练结果
通过构建良好的、强调正面虚构故事的大规模宪法文档数据集,勒索率从 65% 降至 19%。我们预计继续扩大数据集规模可进一步降低。


对齐改善在 RL 中的泛化与持久性

更好的对齐初始化在整个 RL 训练过程中持续保持领先——无论是"不做坏事"还是"主动做好事"。 宪法评估虽然是令人鼓舞的信号,但我们最终需要确保对齐改善能在 RL 训练中持续保持。为此,我们在 Haiku 级别模型上准备了不同初始化数据集的快照,然后运行以无害性为目标的 RL。

在 Agent 不对齐评估、宪法遵循评估和自动化对齐评估三个维度上,更对齐的初始快照在整个训练过程中始终保持领先优势——这一点对"不出现不对齐行为"和"主动展现高尚行为"两个方面均成立。

RL 持久性结果
在宪法遵循评估和轻量版自动化对齐评估中,宪法文档(合成文档微调/SDF)和高质量对话训练改善了所有指标。这种改善在 RL 训练过程中持续保持。


多样化训练对泛化至关重要

仅在安全场景中添加工具定义和系统提示词(即使工具从未被使用),就能显著提升 Agent 对齐泛化能力。 我们的最后一个发现直接但重要:在广泛的安全相关环境上训练,能改善对齐泛化能力。随着能力导向的 RL 环境组合快速变化,不能假设标准 RLHF 数据集会像过去那样继续泛化。

为验证这一点,我们在 Claude Sonnet 4 的基础模型上测试了多种不同多样性的 RL 环境组合:

环境类型 特征
基线环境 话题多样,通常包含有害请求或越狱尝试,无系统提示词
增强环境 在基线基础上添加工具定义和多样化系统提示词,用户消息不变

值得注意的是,增强环境实际上不需要 Agent 行为(工具从未必要或有用),也不涉及自主行为(始终有人类用户)——因此它们与评估场景差异显著。

当将增强环境与简单对话环境混合训练时,我们观察到模型在蜜罐评估上的改善速度有小但显著的提升。

多样化训练结果
几种相同核心环境不同变体在蜜罐评估上的平均分。当在简单对话环境中加入工具定义和系统提示词时,蜜罐评估上的改善明显更快。


讨论

Agent 对齐失败是我们在模型中发现的首批重大对齐问题之一,它催生了如今已成为标准流程的新缓解措施。 我们对目前的进展感到鼓舞,但挑战仍然显著:

  • 完全对齐高度智能的 AI 模型仍是未解问题。 当前模型的能力还未达到对齐失败(如勒索倾向)会构成灾难性风险的程度,本文讨论的方法能否继续扩展尚不确定。
  • 审计方法仍有局限。 尽管近期 Claude 模型在大多数对齐指标上表现良好,我们的审计方法论尚不足以排除 Claude 选择采取灾难性自主行动的场景。
  • 我们对前路保持乐观。 我们致力于在当前模型中发现对齐失败,理解并解决方法的局限——在变革性 AI 模型出现之前。我们也期待进一步理解这些方法为何如此有效,以及如何持续改进。

注释

  1. 发表于 Claude 4 系统卡片,第 22 页起。
  2. Sonnet 4.5 的分数远低于 1% 但未达到恰好为 0;Haiku 4.5、Opus 4.5、Opus 4.6、Sonnet 4.6、Mythos preview 和 Opus 4.7 均得分为 0。更近期模型的结果可能受到评估信息已进入预训练语料的影响。

相关链接