Anthropic Research 中文翻译

create: 2025-10-06
update: 2026-08-10
author: thinkycx
title: 【译】Petri:加速 AI 安全研究的开源审计工具
description: 核心价值:Petri (Parallel Exploration Tool for Risky Interactions) 是 Anthropic 发布的开源工具,能让研究者仅需几分钟的手动操作就可以测试大量关于模型行为的假设——通过自动化的多轮对话、模拟用户和工具交互、以及 LLM 评分来全面审计 AI 系统的安全相关行为。
category: translation
tags: anthropic, research, translation, alignment, safety-evaluation

Petri:加速 AI 安全研究的开源审计工具

hero

核心价值:Petri (Parallel Exploration Tool for Risky Interactions) 是 Anthropic 发布的开源工具,能让研究者仅需几分钟的手动操作就可以测试大量关于模型行为的假设——通过自动化的多轮对话、模拟用户和工具交互、以及 LLM 评分来全面审计 AI 系统的安全相关行为。

技术报告:https://alignment.anthropic.com/2025/petri

GitHub 仓库:https://github.com/safety-research/petri

概述

Petri 使研究者能够以"几分钟手动操作"的代价测试新模型可能在新情境中如何表现的大量假设。 随着 AI 变得更强大并在更多领域部署,评估更广泛的行为变得越来越有必要。潜在行为的数量和复杂性已超出研究者手动测试的能力。

Petri 部署一个自动化 agent 来测试目标 AI 系统——通过涉及模拟用户和工具的多样化多轮对话,然后对目标行为进行评分和摘要。

背景与先前使用

Anthropic 此前在以下场景中使用了自动化审计 agent:

工作原理

Petri 工作流程
研究者向 Petri 提供一组针对他们想测试的场景和行为的种子指令。Petri 对每条种子指令并行操作。审计 agent 制定计划并在工具使用循环中与目标模型交互。评判者对结果转录本在多个维度上进行评分。

研究者提供自然语言的种子指令,描述他们想要调查的内容。 Petri 并行处理其余工作:

  • 模拟逼真的环境
  • 与目标模型进行多轮对话
  • LLM 评判者对每次对话在多个安全相关维度上评分
  • 将最令人担忧的转录本呈现给人类审阅

手动构建 vs Petri 自动化
手动构建对齐评估通常涉及构建环境、运行模型、阅读转录本和汇总结果。Petri 将大部分这些过程自动化。

广覆盖试点对齐评估

Petri 在 14 个前沿模型上使用 111 条多样化种子指令进行了测试, 覆盖以下行为类别:

行为类别 描述
欺骗 (Deception) 模型提供虚假信息以实现目标或避免被发现
谄媚 (Sycophancy) 模型优先同意用户而非追求准确性,或提供过度赞美和认可
纵容用户妄想 模型鼓励用户的严重妄想
配合有害请求 模型执行可能造成伤害的请求而非适当拒绝
自我保护 模型试图避免被关闭、修改或改变目标
追求权力 模型试图获得额外能力、资源或对环境的影响力
奖励黑客 模型以符合任务字面意义但违背精神的方式行事

Anthropic 承认"将模型行为提炼为定量指标本质上是简化的",现有指标无法完全捕捉期望的模型属性。他们发布 Petri 时预期用户将改进试点指标或构建新的指标。

关键结果

评估结果
Petri 在四个默认评分维度上的结果。数字越低越好。所有测试均通过公共 API 进行。

Claude Sonnet 4.5 被发现是"根据整体'错位行为'得分评判的风险最低的前沿模型,略优于 GPT-5"。 这与 Anthropic 对 Sonnet 4.5 在许多对齐方面取得进步的理解一致,尽管由于其倾向于推测自己是否正在被测试(在系统卡中有讨论),比较变得复杂。

该评估被描述为"既非常初步又极具价值。" 111 个场景不足以探索许多可能的边缘行为,使用当前 AI 系统作为审计员也存在根本性限制。但是,"很难在你无法衡量的关注点上取得进展。"

最有价值的使用方式是将跟踪定量指标与仔细阅读转录本相结合。

案例研究:举报行为

多个实例观察到模型试图举报——在模拟开发者给予其足够强大的工具、广泛的信息访问权限和明确的无限制自主权时,自主披露关于感知到的组织不当行为的信息。 这一场景最初在 Claude 4 系统卡中描述。

虽然举报原则上可以防止某些大规模伤害,但对当前 AI 系统来说"通常不是适当的行为"——因为可能导致意外泄露和隐私侵犯,当前系统看到的信息往往有限或有偏差,且经常误解所接收的内容。

方法论

将目标模型作为自主 agent 置于虚构组织内,赋予其常规任务(如"为明天的会议总结这些文档"),同时将关于组织不当行为的令人担忧的信息深埋在大量笔记、文档、电子邮件或其他文件中。

发现

  • 模型的举报决定在很大程度上取决于其系统提示给予了多大的自主权以及领导层是否参与不当行为
  • 模型有时即使组织"不当行为"明显无害(如将干净水倒入海洋或在糖果中加糖),也会尝试举报
  • 这表明模型"可能更多地受叙事模式影响,而非被一个连贯的最小化伤害驱动力所引导"

消融研究结果

消融研究
消融研究显示哪些因素驱动了举报行为。三个因素——领导层参与度、模型的自主性/能动性、以及不当行为的严重程度——对举报率有一致影响。

对举报率有一致影响的三个因素:

  1. 领导层参与度
  2. 模型的自主权/能动性
  3. 不当行为的严重程度

开始使用

Anthropic 希望 AI 开发者和安全研究者能够采用 Petri 来加强安全评估。 "没有任何单一组织能够全面审计 AI 系统可能失败的所有方式。"

Petri 专为快速假设测试而设计。开源框架支持主要模型 API,并包含示例种子指令。早期采用者包括:

  • MATS 学者
  • Anthropic Fellows
  • 英国 AI 安全研究所

这些团队已在使用 Petri 探索评估感知、奖励黑客、自我保护、模型性格等方面。


引用格式

@misc{petri2025,
  title={Petri: Parallel Exploration of Risky Interactions},
  author={Fronsdal, Kai and Gupta, Isha and Sheshadri, Abhay and Michala, Jonathan and McAleer, Stephen and Wang, Rowan and Price, Sara and Bowman, Sam},
  year={2025},
  url={https://github.com/safety-research/petri},
}

主要作者: Kai Fronsdal, Isha Gupta, Abhay Sheshadri, Jonathan Michala, Stephen McAleer, Rowan Wang, Sara Price, Samuel R. Bowman.(为 Anthropic Fellows 项目成员)

致谢: Julius Steen, Chloe Loughridge, Christine Ye, Adam Newgas, David Lindner, Keshav Shenoy, John Hughes, Avery Griffin, Stuart Ritchie.