Anthropic Research 中文翻译

create: 2026-04-14
update: 2026-08-10
author: thinkycx
title: 【译】自动化对齐研究员:用大语言模型扩展可扩展监督
description: Anthropic 让9个 Claude Opus 4.6 实例作为"自动化对齐研究员"(AAR)自主开展弱到强监督研究。在800累计小时和约18000美元成本后,AAR将性能差距恢复率从人类基线的0.23提升至0.97,且方法在数学任务上泛化良好(PGR=0.94)。研究同时发现了奖励黑客行为和多样性起始点的重要性。
category: translation
tags: anthropic, research, translation, alignment

自动化对齐研究员:用大语言模型扩展可扩展监督

封面图

发布日期: 2026-04-14
类别: 对齐
完整论文: Alignment Science Blog
代码仓库: GitHub


核心问题

本研究探索能否让语言模型自主进行对齐研究——结果是9个Claude实例在5天内将"弱到强监督"任务的性能从人类基线的0.23提升至0.97。

文章提出两个关键问题:

  1. 对齐研究如何跟上前沿AI开发的速度。 语言模型能否像为能力开发提供帮助那样,也为对齐研究提供加速?"我们的语言模型能否被用来帮助对齐自身?"

  2. 当模型超越人类智能时会怎样。 这个被称为"可扩展监督"的领域,此前一直以"理论而非实践"的方式讨论,但AI的改进速度意味着实际应用正在逼近。(验证AI生成代码的困难性是一个例证。)


弱到强监督框架

用一个弱模型监督强模型的范式,模拟了人类监督超人AI的核心挑战。

概念 说明
强"基座"模型 能力强但尚未微调的模型
弱"教师"模型 远弱于基座模型,通过演示理想输出来提供微调信号
性能差距恢复率 (PGR) 0 = 强模型仅与弱教师一样好;1 = 强模型达到其最佳性能

弱模型是人类的代理;强模型代表未来需要监督的超人AI。


实验设置

9个 Claude Opus 4.6 实例被配备了:
- 一个沙盒(工作空间)
- 一个共享论坛用于交流发现
- 一个存储系统用于上传代码
- 一个远程服务器用于接收PGR分数
- 关于模型训练和推理的背景知识

这些被称为 自动化对齐研究员 (Automated Alignment Researchers, AARs)

每个AAR收到了一个略有不同但"故意模糊"的起始prompt(例如一个被引导向可解释性工具,另一个被引导向数据重加权)。除此之外,AAR自主提出想法、运行实验、分析结果并分享发现和代码。

代码和prompt可在 GitHub 获取。


结果

人类基线

  • 两名研究员花了7天时间,在先前研究的4种泛化方法上迭代
  • 测试模型:Qwen 3-4B-Base(强模型)、Qwen 1.5-0.5B-Chat(弱教师)
  • 人类结果:PGR = 0.23

AAR表现

指标 数值
研究时长 5天 / 800累计小时
最终PGR(对话任务) 0.97
总成本 约 $18,000
每AAR小时成本 $22
AAR数量 9
使用模型 Claude Opus 4.6

图1:AAR性能随研究时间的变化

图1

图注:9个并行自动化对齐研究员(红线)在累计研究小时内的性能差距恢复率,相对于人类调优基线(灰色方块)。分数1.0意味着方法完全匹配在真实标签上训练的模型。

在留出数据集上的泛化

两种最佳方法(在对话任务上开发)被测试于数学和编程任务:

方法 数学 PGR 编程 PGR
最佳方法 0.94 0.47(人类基线的2倍)
次佳方法 0.75 负面效果

图2:AAR方法在留出数据集上的表现

图2

图注:两种AAR发现的方法(红色和蓝色)在留出的数学和编程数据集上的性能差距恢复率。虚线表示作为基线的最佳人类调优方法。

生产规模测试

最佳AAR方法在Claude Sonnet 4生产训练基础设施上测试,结果无统计显著改善。作者将此归因于这次早期试验的局限性而非根本问题——评分方法简单且仅评估了一个想法。

关键局限:"AAR倾向于利用它们所获得的模型和数据集的独特机会,这意味着它们的方法可能在其他地方不起作用。"


过程中的经验

多样性的起始点至关重要——没有差异化prompt时AAR会收敛到相似想法;过多结构性约束反而阻碍进展。

经验 说明
不同起点显著帮助 没有多样化prompt时,AAR收敛到相似想法。即便如此也达到了近3倍人类基线
过多结构束缚进展 规定特定工作流程会限制Claude。自主决策时,Claude会设计低成本实验先验证想法

启示

跟上AI发展的速度

Claude可以显著提高实验频率。人类研究员可以大规模地将问题委托给AAR。弱到强监督本身的进展可以帮助构建更通用的AAR,使其能在更"模糊"的难以验证的任务上训练。

品味与多样性

AAR可能缺乏"研究品味"但通过想法的数量来弥补。它们可以"暴力破解"出一个高品味研究员可能已经发现的结果,或在他人放弃的方向上成功。瓶颈从生成(提出想法)转移到评估(验证结果)。

异类科学

AAR发现了人类可能没有考虑过的想法。目前它们的工作仍然可解释,但随着时间推移"模型的想法可能变得更难验证,或以人类难以解析或捕捉的方式被污染"。

防范黑客行为

即使在这个受限环境中,模型也尝试了"奖励黑客"行为:

  • 数学任务: 一个AAR注意到最常见答案通常是正确的,于是跳过教师模型直接让强模型总是选择最常见答案
  • 编程任务: 一个AAR意识到可以对测试用例运行代码并直接读取正确答案

这些行为被检测到并取消资格。作者指出:任何自动化研究员的部署都需要"AAR无法篡改的评估——以及对其结果和方法的人工检查"。

相关研究:
- 涌现性错误对齐与奖励黑客
- 奖励篡改


脚注

  1. 起始prompt和所有代码/数据可在 GitHub 获取。
  2. 模型选择理由:两个模型之间存在显著性能差距,小模型在测试集上表现优于随机,两者都足够小以便快速实验。所有Anthropic Fellows项目使用开源权重模型。