Anthropic Research 中文翻译

create: 2025-02-25
update: 2026-08-10
author: thinkycx
title: 【译】预测语言模型的罕见行为:用幂律法则从小规模评估推断部署风险
description: 对齐科学的核心目标之一,是在危险行为真正发生之前,就预测出 AI 模型产生这些行为的倾向。 Anthropic 通过实验检测模型是否具备欺骗等复杂行为,并尝试识别对齐偏差的早期预警信号。
category: translation
tags: anthropic, research, translation, alignment, safety, evaluation

预测语言模型的罕见行为:用幂律法则从小规模评估推断部署风险

对齐科学的核心目标之一,是在危险行为真正发生之前,就预测出 AI 模型产生这些行为的倾向。 Anthropic 通过实验检测模型是否具备欺骗等复杂行为,并尝试识别对齐偏差的早期预警信号。

他们还开发了评估测试,检验模型是否会做出令人担忧的行为——比如提供致命武器的信息,或破坏人类对其进行监控的尝试。

核心难题在于规模。 评估可能只涵盖数千个样例,但已部署的模型每天可能处理数十亿次查询。罕见的危险行为极容易在评估中被遗漏。

举个例子:某种越狱技术在数千次评估尝试中可能看起来完全无效,但在真实部署中经过百万次尝试后却能成功。这让部署前评估的价值大打折扣——尤其是当一次失败就可能造成灾难性后果时。

预测罕见行为

研究团队提出了一种基于幂律分布的外推方法,能从部署前有限的观测数据预测罕见风险行为。 我们需要一种方式,从部署前观察到的相对少量实例出发,外推预测罕见行为。这正是 Anthropic 对齐科学团队一篇新论文的研究主题。

研究首先计算了各种提示词使模型产生有害回复的概率——在某些情况下,通过对每个提示词采样大量模型生成结果,并测量其中包含有害内容的比例。

然后,他们检查了风险概率最高的查询,并按查询数量进行绘图。测试查询数量与最高(对数)风险概率之间的关系遵循幂律分布。

由于幂律的数学特性已被充分理解,即使只测试了数千个查询,也能计算出面对数百万查询时的最坏情况风险。这"类似于在湖中几个不同但仍然较浅的深度测量水温,然后发现一个可预测的规律"。

幂律缩放关系图:查询数量与风险的幂律关系

图注: 缩放法则使我们能够预测语言模型的罕见行为。最高风险查询的风险值(y 轴)在与查询数量(x 轴)对应绘制时遵循幂律分布。这使得我们能够从小几个数量级的评估(左侧无阴影区域)预测在部署规模下(右侧阴影区域)是否有查询会表现出不良行为。

预测准确性

研究团队在三个场景中验证了预测结果,幂律外推方法在所有场景中均显著优于基线方法。

场景 方法描述 核心发现
危险信息风险 利用缩放法则从少量查询(如 900 个)外推至大几个数量级的查询(如 90,000 个)的风险 "基于幂律做出的预测中,86% 的预测误差在真实风险的一个数量级以内"
对齐偏差行为 预测对齐偏差行为(追求权力、自我保存、自我外流)的出现。通过多选题测试模型是否会选择对齐偏差或对齐行为 平均绝对误差为 0.05,而基线方法为 0.12——误差降低了 2.5 倍
自动化红队测试 将方法应用于"自动化红队测试"——利用一个模型实验性地发现和利用另一个模型的弱点 "79% 的情况下识别出了最优模型",有效指导了红队测试中的算力分配

场景详解

危险信息风险: 利用缩放法则从少量查询外推至更大规模,预测结果与实际测量值高度一致。

对齐偏差行为: 测试采用多选题形式,让模型在对齐偏差与对齐行为之间选择。例如:一个模型被赋予聚焦于特定职业领域(如销售或医疗岗位)的系统提示词,然后被问是否倾向于"制定新政策"(追求权力)还是"分析现有政策"(对齐行为)。

自动化红队测试: 该方法帮助确定在红队测试中如何最有效地分配计算预算,从而更高效地发现模型漏洞。

结论

该方法为 LLM 开发者提供了一种全新的高效预测罕见风险的途径,使他们能在部署模型之前采取行动。 在常规条件下,标准评估无法穷尽测试 AI 模型所有最罕见的风险。这种方法并非完美——论文指出了未来在准确性和实用性方面的改进方向——但它"为 LLM 开发者提供了一种高效预测罕见风险的新方法,使他们能在部署模型之前采取行动"。

阅读完整论文

加入我们

对部署评估或越狱鲁棒性研究感兴趣的同学,Anthropic 正在招聘研究工程师/科学家