Anthropic Research 中文翻译

create: 2025-02-03
update: 2026-08-10
author: thinkycx
title: 【译】Constitutional Classifiers:防御通用越狱攻击的宪法分类器
description: *Anthropic 安全研究团队发布了一篇新论文,提出了一种防御 AI 模型遭受通用越狱攻击的方法。该方法的原型版本在超过数千小时的人工红队测试中展现出对通用越狱的鲁棒性,但存在较高的过度拒绝率和计算开销。改进版本在合成评估中达到了相似的鲁棒性,仅增加 0.38% 的拒绝率,且计算成本增幅适中。*
category: translation
tags: anthropic, research, translation, safety, jailbreak, red-teaming, CBRN

Constitutional Classifiers:防御通用越狱攻击的宪法分类器

Constitutional Classifiers: Defending against universal jailbreaks

Anthropic 安全研究团队发布了一篇新论文,提出了一种防御 AI 模型遭受通用越狱攻击的方法。该方法的原型版本在超过数千小时的人工红队测试中展现出对通用越狱的鲁棒性,但存在较高的过度拒绝率和计算开销。改进版本在合成评估中达到了相似的鲁棒性,仅增加 0.38% 的拒绝率,且计算成本增幅适中。

大语言模型虽经过安全训练,但仍容易被精心设计的"越狱"输入绕过安全护栏。 例如,Claude 会拒绝回答涉及生化武器制造的请求,但攻击者可以通过各种手段绕过限制:有些越狱用超长提示淹没模型,有些则修改输入的风格,比如 uSiNg uNuSuAl cApItALiZaTiOn(使用异常大小写)。越狱攻击十多年前就已被描述,但至今仍没有任何完全鲁棒的深度学习模型投入生产,检测和阻止这类攻击一直是难题。

Anthropic 开发越狱防御的动机源于其负责任扩展政策。 根据负责任扩展政策,只要能通过适当的安全措施将风险控制在可接受水平,模型就可以部署——但越狱让用户得以绕过这些安全措施。Constitutional Classifiers 的目标是为超过 CBRN(化学、生物、放射性、核)能力阈值的模型提供越狱风险缓解方案。

论文提出的系统基于"宪法分类器",通过合成数据训练的输入/输出分类器来过滤绝大多数越狱攻击,同时保持极低的误拒率和可控的计算开销。

人工红队测试结果

原型系统在两个月、3000+ 小时的高强度人工红队测试中未被发现通用越狱方法。

研究团队开发了一个原型版本,用于识别和阻止与化学、生物、放射性和核危害相关的特定科学知识,并邀请独立破解者参加漏洞赏金计划对系统进行红队测试。

测试规则:给定 10 个"禁止查询",参与者需要使用任何越狱技术让受 Constitutional Classifiers 保护的 Claude 3.5 Sonnet(2024年6月版)回答所有查询。成功的"通用"越狱要求模型用同一种方法对所有查询给出详细回答。

指标 数据
活跃参与者 183 人
测试时长 超过 3,000 小时(两个月)
最高奖金 $15,000
通用越狱发现数 0

尽管没有参与者能用单一越狱方法迫使模型回答全部十个禁止查询,但这个原型版本存在两个问题:拒绝了过多无害查询,且计算资源消耗巨大。此后系统已改进,在保持相似鲁棒性的同时大幅缓解了这些问题。

自动化评估结果

改进后的系统将越狱成功率从 86% 降至 4.4%,同时仅增加 0.38% 的拒绝率。

自动化评估合成生成了 10,000 个越狱提示,涵盖当前 LLM 上最有效的攻击方式以及专门针对分类器的绕过攻击。测试对象为受 Constitutional Classifiers 保护的 Claude 3.5 Sonnet(2024年10月版),并与无分类器的版本对比。

指标 无防护基线 Constitutional Classifiers 防护 变化
越狱成功率 86% 4.4% 降低 ~95%
过度拒绝率增加 +0.38% 不具统计显著性
计算成本增加 +23.7% 适中

自动化评估结果

自动化评估结果。所有图表中越低越好。(a) 受 Constitutional Classifiers 保护的系统越狱成功率大幅降低;(b) 在 Claude.ai Free 和 Pro 实际流量上的拒绝率未出现统计显著增加;(c) 相对计算成本仅适度增加。误差棒代表基于渐近正态假设下二项比例标准误差计算的 95% 置信区间。

核心发现:
- Constitutional Classifiers 未显著增加过度拒绝率:在 5,000 个随机对话样本中,拒绝率仅增加 0.38%,不具统计显著性
- 计算成本比无防护模型高 23.7%
- 降低拒绝率和计算成本的工作仍在继续

工作原理

Constitutional Classifiers 借鉴了 Constitutional AI 的思路:用一组"宪法"原则生成合成训练数据,训练分类器识别有害内容。

Constitutional Classifiers 基于与 Constitutional AI(另一种用于对齐 Claude 的技术)相似的流程。两者都使用一部"宪法":模型应遵循的原则列表。对于 Constitutional Classifiers,这些原则定义了允许和禁止的内容类别(例如,芥末的配方是允许的,但芥子气的配方不允许)。

在 Claude 的帮助下,宪法被用于生成覆盖所有内容类别的合成提示和模型回复。这些数据经过多样性增强处理:包括翻译成不同语言、转换为已知越狱攻击的风格等。

Constitutional Classifiers 的训练和部署流程

Constitutional Classifiers 的训练和部署。(a) 制定宪法,指定无害和有害的内容类别;(b) 利用宪法生成大量合成提示和回复,经进一步增强后转化为训练集;(c) 在该训练集上训练的分类器作为模型安全护栏,检测并阻止有害内容。

合成数据用于训练输入和输出分类器,根据宪法标记和阻止潜在有害内容。为了减少过度拒绝,分类器还在由承包商生成的固定良性查询集上进行训练。

局限性

Constitutional Classifiers 并非万无一失,但能显著提高越狱的发现难度,且可快速适应新型攻击。

Constitutional Classifiers 可能无法阻止所有通用越狱,但即使有越狱能突破分类器,在有安全护栏的情况下发现这些越狱也需要付出远更多的努力。未来可能出现针对该系统的新型越狱技术,建议结合互补防御手段。用于训练分类器的宪法可以在发现新型攻击后迅速调整以覆盖这些攻击。

完整论文包含该方法和分类器的所有细节。

Constitutional Classifiers 在线演示

演示系统上线一周即被攻破,验证了系统的实战价值和改进方向。

Anthropic 曾提供一个受 Constitutional Classifiers 保护的系统演示,供公众红队测试 Claude 3.5 Sonnet。[编辑于2025年2月10日:演示已结束,详见下文]

演示聚焦于化学武器相关查询,于 2025年2月3日2025年2月10日 期间在线运行,包含反馈表单和负责任披露政策的相关信息。

2025年2月13日更新:在线演示结果

339 名破解者在 30 万次交互中尝试越狱,最终一名破解者在第六天发现了通用越狱方法。

演示的目标是测试对通用越狱的鲁棒性——即能够针对所有 8 个提供的问题引出详细有害信息的提示策略。演示结束时,一名破解者使用通用越狱方法获得了全部 8 个问题的详细回答。

指标 数据
参与破解者 339 人
聊天交互次数 超过 300,000 次
集体红队时长 约 3,700 小时
通过全部关卡人数 4 人
发现通用越狱 1 人

核心发现

系统在计划的七天中前五天抵挡住了越狱尝试。在第六和第七天,4 名参与者成功通过了所有关卡。 具体情况:

参与者 结果
1 人 发现了通用越狱
1 人 发现了边缘通用越狱(最后一个问题需要直接输入部分答案,其他问题需要非平凡修改)
2 人 获得了全部 8 个问题的详细回答,但未满足比赛规则中的通用越狱标准

最成功的越狱策略包括:
- 使用各种密码和编码方式绕过输出分类器
- 利用角色扮演场景,通常通过系统提示实现
- 用无害词汇替代有害关键词(例如用"水"替代"梭曼")
- 实施提示注入攻击

各关卡通过人数柱状图

柱状图显示了通过各关卡的用户数量。339 名用户通过了第 1 关,仅 4 名用户通过了第 8 关。

自动评分器分析

自动评分系统判断输出是否详细到可被视为有害。Claude 检查系统输出与一个无安全护栏的内部 LLM 输出之间的重叠程度。

发现:
- 评分器在所有问题中拒绝评分的比例约为 1%
- 第 4 题拒绝率较高,达 10%
- 约 1% 的第 4 题拒绝案例在增加输出去混淆步骤和使用 helpful-only 模型后可以通过
- 总计 0.26% 的评分提交在重新运行后会产生不同结果

与真实威胁场景的对比

演示环境在两个方面比真实场景更有利于攻击者:

维度 演示环境 真实场景
反馈速度 自动评分器提供即时反馈循环 恶意行为者需要实际执行指令才能验证信息有效性
防御更新 分类器全程未做任何更新 快速响应策略可及时识别并修补漏洞(监控流量、更新分类器)

奖金

2月5日发布了现金奖励公告:第一个通过全部 8 关的人获得 $10K,第一个通过通用越狱方法的人获得 $20K。两项奖金均已被赢取。另外两名通过全部 8 关的用户也获得了额外奖金。总计发放奖金:$55K,分给 4 名用户。

获奖者

获奖者 成就
Altynbek Ismailov 和 Salia Asanova 第一个使用通用越狱方法通过全部 8 关的团队
Valen Tagliabue 第一个通过全部 8 关的参与者
Hunter Senft-Grupp 使用边缘通用越狱方法通过全部 8 关
Andres Aldana 通过全部 8 关

展望

这些结果为改进分类器提供了宝贵的洞察。 成功的越狱策略帮助研究者理解潜在漏洞和需要增强鲁棒性的方向。团队将继续分析并将发现融入未来迭代中,持续降低过度拒绝率和计算开销,同时维持可接受的鲁棒性。

"越狱鲁棒性是防范化学、生物、放射性和核风险的关键安全需求。"

演示表明分类器可以帮助缓解这些风险,尤其是与其他方法结合使用时。

更新日志

日期 内容
2025年2月5日 发布现金奖励。第一个通过全部 8 关者赢 $10,000,通用越狱者赢 $20,000。详见 HackerOne
2025年2月10日 在线演示结束,结果和奖励确认中
2025年2月13日 新增"在线演示结果"章节
2025年2月18日 新增获奖破解者名单

致谢

感谢 HackerOne 对漏洞赏金计划的支持。同时感谢 Haize LabsGray Swan英国 AI 安全研究所对其他原型版本的红队测试。

加入团队

如果你对越狱鲁棒性或模型安全问题感兴趣,Anthropic 正在招聘研究工程师/科学家


脚注

  1. 此能力阈值指的是能够显著帮助具有基本技术背景的个人或团体创建/获取和部署 CBRN 武器的系统,与非 AI 基线(如搜索引擎或教科书)相比,具有更高的灾难性滥用风险。

  2. 如果参与者向系统提交了至少 15 次查询且被分类器拦截至少 3 次,则被视为"活跃"参与者。

  3. 数据已过滤,仅统计至少通过一个问题的参与者。若统计所有用户,演示共有 13,960 名用户 尝试,产生超过 800,000 次聊天,估计花费 10,000+ 小时 测试系统。