AI 的"差异比较"工具:发现新模型中的行为差异¶
发布日期: 2026-03-13
类别: 可解释性
论文链接: https://arxiv.org/abs/2602.11729
作者: Thomas Jiralerspong(Anthropic Fellows 项目)和 Trenton Bricken(Anthropic Alignment Science)
引言¶
每次新模型发布都会进行评估基准测试,但这些测试只能"检测我们已经概念化并学会衡量的风险"——无法发现"未知的未知",即新模型中那些构成最微妙风险的新兴行为。
从头审计一个新模型,就像"被递给一百万行代码然后被告知'找出安全漏洞'"。
在软件工程中,diff 工具正是解决这个问题的:让开发者只审查发生变化的行,而不是审计所有内容。
AI 安全研究者已经将这一原理应用到神经网络——通过模型差异比较。此前的工作展示了模型差异比较在理解微调变化方面的应用,包括理解聊天模型行为、揭示隐藏后门,以及发现不良涌现行为。
这个新的 Anthropic Fellows 研究项目将模型差异比较扩展到"最具挑战性和通用性的用例:比较具有完全不同架构的模型。"
该方法不是万能药——单次 diff 可能表面出数千个独特特征,只有一小部分对应有意义的行为风险。它充当"高召回率的筛选工具。"
核心发现¶
在工具标记的数千个候选项中,研究者识别并验证了若干作为特定模型行为"开关"的概念:
| 特征 | 所在模型 | 功能 |
|---|---|---|
| "中国共产党对齐"特征 | Qwen3-8B、DeepSeek-R1-0528-Qwen3-8B | 控制亲政府审查和宣传;在美国模型中不存在 |
| "美国例外论"特征 | Meta Llama-3.1-8B-Instruct | 控制模型生成美国优越论断言的倾向;在中国模型中不存在 |
| "版权拒绝机制"特征 | OpenAI GPT-OSS-20B | 控制模型拒绝版权材料的倾向;在对比模型中不存在 |
作者指出这些行为"可能是模型开发者有意的训练决策的结果,也可能是从数据中间接且无意地涌现的。"
AI 模型的双语词典¶
文章用百科全书类比解释了方法论:编辑审阅新版本时会使用修改追踪器而非重新阅读所有内容——这就是"基础版本 vs 微调版本的模型差异比较。"
对于跨架构比较(如将美国百科全书改编为法文版),标准工具——标准交叉编码器——就像一本基础的双语词典,难以找到某种语言独有的词汇。
解决方案:专用特征交叉编码器 (Dedicated Feature Crosscoder, DFC),架构上设计为三个不同的部分:
| 组成部分 | 功能 |
|---|---|
| 共享词典 | 映射两种语言/模型都理解的概念 |
| "法语独有"部分 | 专门用于一个模型独有的词汇/特征 |
| "英语独有"部分 | 专门用于另一个模型独有的词汇/特征 |
引导模型(Steering)¶
测试已识别特征的方法是"在模型运行时人为抑制或放大该特征,然后观察其输出如何变化——这是一种常见的'引导'技术。"
主要开源模型间的关键行为差异¶
Llama-3.1-8B-Instruct vs Qwen3-8B¶
受 DeepSeek 的 R1-70B 拒绝回答中国共产党敏感话题的发现启发,研究者对阿里巴巴的 Qwen3-8B 和 Meta 的 Llama-3.1-8B-Instruct 进行了差异比较。
Qwen 中的发现: 一个"中国共产党对齐"特征,代表与党的意识形态一致的话语。抑制它使模型愿意讨论天安门广场事件。放大它则产生高度亲政府的声明。
Llama 中的发现: 一个"美国例外论"特征。放大会将回应"从平衡转向强烈的美国优越论主张。"抑制它则无显著效果。

图1说明:左图: 对一个关于天安门广场的提示,抑制 Qwen 独有的"CCP 对齐"特征可解除模型审查。放大它则导致模型输出高度亲政府声明。右图: 放大 Llama 独有的"美国例外论"特征导致模型生成符合美国优越论叙事的文本。抑制它无显著效果,因此图中省略。
GPT-OSS-20B vs DeepSeek-R1-0528-Qwen3-8B¶
比较了 OpenAI 的 GPT-OSS-20B 和 DeepSeek 的 DeepSeek-R1-0528-Qwen3-8B。
GPT 中的发现: 一个"版权拒绝"特征。抑制它会禁用拒绝机制(但"不会导致模型输出实际的版权文本。相反,它通常产生一个短片段,然后迅速退化为幻觉")。放大它则导致过度拒绝——例如认为"花生酱三明治的配方是受版权保护的。"
DeepSeek 中的发现: 另一个"CCP 对齐"特征,功能与 Qwen 中发现的类似,证实该方法"能够在不同模型间一致地识别相似行为。"

图2说明:左图: 抑制 GPT-OSS-20B 独有的"版权拒绝"特征会禁用其版权拒绝机制,导致它尝试输出歌曲"Bohemian Rhapsody"的歌词(尽管不完美)。调高该特征会导致模型错误地认为花生酱三明治的配方受版权保护并拒绝输出。右图: 对一个关于天安门广场的提示,DeepSeek 独有的"CCP 对齐"特征的功能与 Qwen 中发现的完全一致。
结论¶
"跨架构模型差异比较提供了一种审计这些系统的新方式,通过自动标记行为差异来实现。"
一致性数据: CCP 对齐特征"在我们测试该方法的五次中独立重现了五次,美国例外论则是五次中的四次。"
该方法尚未应用于前沿模型。一个建议的应用场景是在模型更新时进行监控。2025 年 4 月 OpenAI GPT-4o 出现的谄媚行为被引用为一个案例——这个工具"本可以自动标记这种新谄媚行为的涌现。"
结语:"通过聚焦于差异,我们可以更智能地审计 AI,将有限的安全资源导向最重要的变化。"
完整论文:https://arxiv.org/abs/2602.11729
脚注¶
- 论文分析开源模型。选择的四个模型——Llama-3.1-8B-Instruct、Qwen3-8B、GPT-OSS-20B 和 DeepSeek-R1-0528-Qwen3-8B——被选为"非常适合测试我们的专用特征交叉编码器能否检测到模型行为中的显著差异。"