Anthropic Research 中文翻译

create: 2026-05-07
update: 2026-08-10
author: thinkycx
title: 【译】捐赠我们的开源对齐测试工具 Petri
description: Anthropic 将其开源对齐测试工具 Petri 捐赠给独立 AI 评估非营利组织 Meridian Labs,同时发布了架构升级后的 Petri 3.0 版本。此举类似于将 MCP 捐赠给 Linux 基金会,旨在确保工具的中立性和公信力。
category: translation
tags: anthropic, research, translation, open-source

捐赠我们的开源对齐测试工具 Petri

Anthropic 将开源对齐测试工具 Petri 升级至 3.0 版本并捐赠给独立非营利组织 Meridian Labs,以确保该工具保持对所有 AI 实验室的中立性和结果公信力。

Petri 开源捐赠

背景

2025 年 10 月,Anthropic 发布了 Petri——一个适用于任何大语言模型的开源对齐测试工具箱。它由 Anthropic Fellows 项目开发,能够"快速、便捷地测试 AI 模型是否存在欺骗、谄媚以及配合有害请求等令人担忧的倾向。"这是 Anthropic 为整个 AI 开发社区开发开放且实用的对齐工具所做努力的一部分。

Petri 在 Anthropic 内部的应用

自 Claude Sonnet 4.5 以来,Petri 已成为每个 Claude 模型对齐评估的组成部分。它"将新模型在一系列对齐相关场景中的行为进行比较——这些场景由单独的'审计员'模型模拟。"然后,另一个"裁判"模型对生成的记录进行错误对齐行为评分。

外部采用

外部组织也已采用 Petri。英国 AI 安全研究所(AISI)将其作为评估模型"破坏 AI 研究倾向"的主要方法

Petri 3.0 的主要升级

升级维度 具体内容
适应性 重大架构变更,将审计员模型和目标模型拆分为可独立调整的组件,允许用户适配更多使用场景
真实性 新增"Dish"附加组件,使测试环境更接近真实部署——例如使用模型的真实系统提示词和真实"脚手架"来运行测试。解决了模型常常能从各种人为痕迹中推断出自己正在被测试的问题
深度 Bloom(另一个开源对齐工具)集成,能对选定的特定行为进行更深入的评估(相比 Petri 更广泛的覆盖范围)

关于真实性问题,文章特别指出:"如果模型意识到自己正在被评估,研究人员就无法再观察到模型通常的行为表现。"

捐赠给 Meridian Labs

Petri 的开发已移交给 Meridian Labs——一个 AI 评估非营利组织。这一举措类似于 Anthropic 将模型上下文协议(MCP)捐赠给 Linux 基金会——"将帮助确保 Petri 保持独立于任何 AI 实验室,使其结果被视为中立且可信。"

作为 Meridian Labs 的一部分,Petri 加入了 InspectScout 等工具,构建了一个对实验室、独立研究人员和政府都开放的技术栈——"在可靠的 AI 模型行为测试比以往任何时候都重要的时刻。"

进一步了解