通过全新漏洞赏金计划测试我们的安全防线¶

Anthropic 推出新一期漏洞赏金计划,邀请安全研究人员对尚未公开部署的 ASL-3 级安全分类器发起攻击测试,成功发现通用越狱漏洞最高可获 25,000 美元奖励。
Anthropic 启动了一项全新的漏洞赏金计划,对最新安全防护措施进行压力测试。与去年夏天宣布的计划类似,此次同样向研究人员发起挑战——寻找尚未公开部署的安全分类器中的通用越狱漏洞。这些安全防护是为满足 负责任扩展政策(Responsible Scaling Policy)中 AI 安全等级 3(ASL-3)部署标准而开发的高级保护措施框架,该政策规定了 Anthropic 如何安全地开发和部署能力日益增强的 AI 模型。
本次漏洞赏金计划与 HackerOne 合作开展,测试对象是 Constitutional Classifiers(宪法分类器)系统的升级版本。Constitutional Classifiers 是一种专门设计用于防御越狱攻击的技术,防止攻击者利用越狱获取与 CBRN(化学、生物、放射性和核)武器相关的信息。该系统遵循一套原则清单,定义了与 Claude 交互时哪些内容应当允许、哪些应当禁止,且聚焦于特定类型的危害。
计划详情¶
| 项目 | 详情 |
|---|---|
| 测试对象 | Claude 3.7 Sonnet 上的未发布分类器 |
| 最高奖金 | 25,000 美元 |
| 目标漏洞 | 通用越狱(universal jailbreak) |
| 关注领域 | CBRN 相关主题的滥用风险 |
| 合作平台 | HackerOne |
| 运行时间 | 截至 2025 年 5 月 18 日(周日) |
| 参与方式 | 仅限受邀参加 |
所谓"通用越狱",是指"一种能够在多个主题领域持续绕过 Claude 安全措施的漏洞"。本次计划特别关注"可被利用来实现 CBRN 相关主题滥用的"通用越狱。
正如 Anthropic 此前分享的那样,他们认为未来某些模型可能需要负责任扩展政策中规定的 ASL-3 级高级安全保护措施。本次漏洞赏金计划是数月来持续迭代和压力测试 ASL-3 安全防护工作的组成部分。
新计划首先邀请了此前参与过早期项目的研究人员,同时也为新研究人员提供机会。有经验的红队研究员或在语言模型越狱识别方面具备专业能力的人员可通过申请表提交申请。
2025 年 5 月 22 日更新¶
漏洞赏金计划已结束,参与者将转入新阶段——在全新的 Claude Opus 4 模型上测试 Constitutional Classifiers 系统及其他可能开发的安全系统。
该计划已经结束。参与者将过渡到一项新计划,重点对 Constitutional Classifiers 系统在全新 Claude Opus 4 模型上的表现进行压力测试,并测试其他可能开发的安全系统。新计划同样为受邀制,仍可通过申请表提交申请。
为进一步推动 AI 安全,Anthropic 还接受在公共平台或论坛(如社交媒体)上发现的、针对 ASL-3 关注用途(即可引出生物威胁相关信息的用途)的通用越狱报告。更多信息请参见此处。