捐赠我们的开源对齐测试工具 Petri¶
Anthropic 将开源对齐测试工具 Petri 升级至 3.0 版本并捐赠给独立非营利组织 Meridian Labs,以确保该工具保持对所有 AI 实验室的中立性和结果公信力。
背景¶
2025 年 10 月,Anthropic 发布了 Petri——一个适用于任何大语言模型的开源对齐测试工具箱。它由 Anthropic Fellows 项目开发,能够"快速、便捷地测试 AI 模型是否存在欺骗、谄媚以及配合有害请求等令人担忧的倾向。"这是 Anthropic 为整个 AI 开发社区开发开放且实用的对齐工具所做努力的一部分。
Petri 在 Anthropic 内部的应用¶
自 Claude Sonnet 4.5 以来,Petri 已成为每个 Claude 模型对齐评估的组成部分。它"将新模型在一系列对齐相关场景中的行为进行比较——这些场景由单独的'审计员'模型模拟。"然后,另一个"裁判"模型对生成的记录进行错误对齐行为评分。
外部采用¶
外部组织也已采用 Petri。英国 AI 安全研究所(AISI)将其作为评估模型"破坏 AI 研究倾向"的主要方法。
Petri 3.0 的主要升级¶
| 升级维度 | 具体内容 |
|---|---|
| 适应性 | 重大架构变更,将审计员模型和目标模型拆分为可独立调整的组件,允许用户适配更多使用场景 |
| 真实性 | 新增"Dish"附加组件,使测试环境更接近真实部署——例如使用模型的真实系统提示词和真实"脚手架"来运行测试。解决了模型常常能从各种人为痕迹中推断出自己正在被测试的问题 |
| 深度 | 与 Bloom(另一个开源对齐工具)集成,能对选定的特定行为进行更深入的评估(相比 Petri 更广泛的覆盖范围) |
关于真实性问题,文章特别指出:"如果模型意识到自己正在被评估,研究人员就无法再观察到模型通常的行为表现。"
捐赠给 Meridian Labs¶
Petri 的开发已移交给 Meridian Labs——一个 AI 评估非营利组织。这一举措类似于 Anthropic 将模型上下文协议(MCP)捐赠给 Linux 基金会——"将帮助确保 Petri 保持独立于任何 AI 实验室,使其结果被视为中立且可信。"
作为 Meridian Labs 的一部分,Petri 加入了 Inspect 和 Scout 等工具,构建了一个对实验室、独立研究人员和政府都开放的技术栈——"在可靠的 AI 模型行为测试比以往任何时候都重要的时刻。"
进一步了解¶
- Petri 3.0 更多信息:Meridian Labs 博客
- 安装和使用说明:Petri 官网