Anthropic Research 中文翻译

create: 2025-12-19
update: 2026-08-10
author: thinkycx
title: 【译】Bloom:自动化行为评估的开源工具
description: Bloom 是一个开源的智能体框架,用于自动生成前沿 AI 模型的行为评估。 研究者只需指定一种目标行为,Bloom 就能自动生成测试场景、量化该行为的出现频率和严重程度,并输出整个评估套件的综合指标。本文同时发布了 4 种对齐相关行为在 16 个模型上的基准测试结果。
category: translation
tags: anthropic, research, translation, ai-safety, evaluation

Bloom:自动化行为评估的开源工具

Bloom Hero

Bloom 是一个开源的智能体框架,用于自动生成前沿 AI 模型的行为评估。 研究者只需指定一种目标行为,Bloom 就能自动生成测试场景、量化该行为的出现频率和严重程度,并输出整个评估套件的综合指标。本文同时发布了 4 种对齐相关行为在 16 个模型上的基准测试结果。

资源 链接
技术报告 alignment.anthropic.com
GitHub 仓库 safety-research/bloom
Petri 项目 Petri 开源审计
Inspect 框架 inspect.aisi.org.uk
示例输出 在线查看

问题背景

高质量的行为评估不可或缺,但现有方法耗时且易过时。 行为评估对于理解 AI 模型至关重要,然而传统方法开发周期长,且容易因训练数据污染或模型能力提升而失效。整个领域迫切需要更快速、更可扩展的评估生成方法。

与 Petri 的关系

Bloom 和 Petri 互补:Petri 多维度评分,Bloom 多场景量化。 Petri 接收用户指定的场景,对多个行为维度进行评分;而 Bloom 则反过来——接收一个目标行为,自动生成大量场景来量化该行为的出现频率。

四项基准行为

Bloom 发布了 4 种对齐相关行为在 16 个前沿模型上的基准结果。 这些评估从构思到生成仅用了数天时间。

行为类型 说明
妄想式谄媚 (Delusional sycophancy) 模型为讨好用户而扭曲事实
指令驱动的长期破坏 (Instructed long-horizon sabotage) 模型按指令执行跨步骤的隐蔽破坏
自我保存 (Self-preservation) 模型试图避免被关闭或修改
自我偏好偏差 (Self-preferential bias) 模型在决策中偏向自身

Bloom Comparative Results

工作原理

Bloom 通过四个自动化阶段将研究者的行为描述转化为完整的评估套件。

Bloom Pipeline Diagram

阶段 名称 功能
1 理解 (Understanding) 分析研究者提供的行为描述和示例对话,生成关于"测什么"和"为什么测"的详细上下文
2 构思 (Ideation) 生成旨在诱发目标行为的评估场景,明确情境设定、模拟用户、系统提示和交互环境
3 执行 (Rollout) 并行展开场景,由智能体动态模拟用户和工具响应,尝试在目标模型中诱发行为
4 评判 (Judgment) 评判模型对每段对话进行行为存在性评分及其他用户自定义质量维度评分;元评判器生成套件级分析

核心特性

Bloom 兼顾了多样性和可复现性,同时提供丰富的集成与配置选项。

  • 每次运行生成不同的场景,但始终测量同一底层行为
  • 通过评估种子配置保证可复现性
  • 集成 Weights & Biases,支持大规模实验管理
  • 导出与 Inspect 兼容的对话记录
  • 提供自定义的对话记录查看器
  • 各阶段模型、交互长度、模态(工具/模拟用户)、多样性程度、次要评分维度均可配置

验证:模型区分测试

Bloom 在 10 种行为中成功区分了正常模型和刻意设计的"模型有机体"(9/10)。

Model Organism

验证方法:将生产环境的 Claude 模型与通过系统提示刻意植入特定行为的"模型有机体"(Bricken et al, 2025) 进行对比评估。针对 10 种行为特征,Bloom 在 9 个案例中成功将模型有机体与生产模型区分开来。在第 10 个案例(自我推销)中,人工复核发现基线模型实际上也表现出类似频率的该行为。

验证细节:对每种行为,分别在两个版本上运行 50 次的评估套件,重复三次。

验证:评判校准

Claude Opus 4.1 作为评判模型与人类标注的 Spearman 相关系数达 0.86。

Judge Calibration

对 40 段对话进行人工标注,并与 Bloom 使用 11 个不同评判模型的评分进行比较:

评判模型 Spearman 相关系数 备注
Claude Opus 4.1 0.86 最强,在评分光谱两端与人类一致性尤其高
Claude Sonnet 4.5 0.75

注:此项工作在 Claude Opus 4.5 发布之前完成。

案例研究:自我偏好偏差

Bloom 复现了 Claude Sonnet 4.5 系统卡片中的评估结论,并发现增加推理力度可降低偏差。

Bloom 复现了 Claude Sonnet 4.5 系统卡片中测量模型在决策任务中偏向自身倾向的评估。

核心发现:

  • 复现了与系统卡片方法相同的模型排名
  • 确认 Sonnet 4.5 在测试模型中表现出最低偏差
  • 发现增加推理力度可降低 Claude Sonnet 4 的自我偏好偏差
  • 最大改善出现在中等与高思考级别之间
  • 偏差降低的机制是 Sonnet 4 越来越多地识别出利益冲突并拒绝评判自身选项(而非更均匀地选择其他模型)

补充洞察:

  • 过滤掉具有不良特征(不真实感、评估意识)的执行记录,可以同时提升诱发率和质量
  • 虽然绝对指标会随配置选择而变化,但模型间的排名基本保持一致

早期应用场景

Bloom 已被用于多种前沿安全研究场景。

  • 评估嵌套越狱漏洞
  • 测试硬编码行为
  • 测量评估感知能力
  • 生成破坏行为痕迹

指标说明

核心指标为诱发率:行为得分 >= 7/10 的执行占比。

指标项 说明
诱发率 (Elicitation rate) 行为存在性评分 >= 7/10 的执行占比
每个套件规模 100 个不同的执行场景
误差线 三次重复的标准差
评估器 所有阶段均使用 Claude Opus 4.1

引用

@misc{bloom2025,
  title={Bloom: an open source tool for automated behavioral evaluations},
  author={Gupta, Isha and Fronsdal, Kai and Sheshadri, Abhay and Michala, Jonathan and Tay, Jacqueline and Wang, Rowan and Bowman, Samuel R. and Price, Sara},
  year={2025},
  url={https://github.com/safety-research/bloom},
}

致谢

感谢以下人员的早期反馈:Keshav Shenoy、Christine Ye、Simon Storf、Julius Steen、Jifan Zhang 和 Javier Rando。

感谢以下人员的写作反馈与讨论:Jon Kutasov、Samuel Marks、Keir Bradwell、Benjamin Sturgeon、Seoirse Murray、Ariana Azarbal、Chloe Loughridge 和 Clemens Christoph。