激活 ASL-3 安全保护措施¶

Anthropic 在发布 Claude Opus 4 的同时,预防性地激活了 ASL-3 部署和安全标准,包括 100 多项安全控制措施来保护模型权重,以及基于 Constitutional Classifiers 的部署防护来限制 CBRN 武器滥用风险。
概述¶
Anthropic 在发布 Claude Opus 4 的同时,激活了其负责任扩展政策(RSP)中描述的 ASL-3 部署和安全标准。ASL-3 安全标准涉及增强内部安全以加大模型权重盗窃难度。部署标准涵盖"一套精确定位的部署措施,旨在限制 Claude 被滥用于 CBRN 武器开发或获取的风险"。
关键澄清¶
- "我们尚未确定 Claude Opus 4 是否已明确超过了要求 ASL-3 保护的能力阈值"
- 作为预防措施进行部署,因为"无法像对待以往每个模型那样,明确排除 Claude Opus 4 的 ASL-3 风险"
- 已排除 Opus 4 需要 ASL-4
- 已排除 Sonnet 4 需要 ASL-3
"对 AI 模型进行危险能力评估本质上具有挑战性"——随着模型接近阈值,评估所需时间更长。主动启用更高安全级别"简化了模型发布流程,同时让我们能从实践中学习"。
背景¶
日益强大的 AI 模型需要相应更强的保护措施——这是 Anthropic RSP 的核心理念。
| 维度 | 目标 |
|---|---|
| 部署措施 | 针对特定滥用类别,重点降低 CBRN 风险 |
| 安全控制 | 防止模型权重被盗——"AI 智能和能力的本质" |
RSP 包含能力阈值:如果模型达到阈值(或未能确定充分低于阈值),必须实施更高的 ASL 标准。
ASL-2 vs ASL-3 对比¶
| 维度 | ASL-2(此前所有模型的标准) | ASL-3 |
|---|---|---|
| 部署 | 训练模型拒绝危险 CBRN 请求 | 更高的部署防御 |
| 安全 | 防御投机式权重窃取企图 | "适合防御复杂的非国家行为体攻击者" |
为什么现在激活¶
Anthropic 在发布 Claude Sonnet 3.7 时已预见这种可能性。当时 Sonnet 3.7 不需要 ASL-3,但他们承认近期模型可能需要。对于 Claude Opus 4,他们"主动决定在 ASL-3 标准下发布"。
RSP 允许偏向谨慎。如果最终确认 Opus 4 未超过相关能力阈值,他们可能会移除或调整 ASL-3 保护措施。
部署措施详解¶
聚焦于防止 CBRN 武器辅助,具体是"以超出没有大语言模型已有可能性的方式,扩展端到端 CBRN 工作流"。这包括限制通用越狱。
ASL-3 部署措施不针对的范围¶
- 非 CBRN 问题
- 非通用越狱
- 提取普遍可得的单条信息
三重防御方法¶
| 层级 | 措施 | 详情 |
|---|---|---|
| 1. 增加越狱难度 | Constitutional Classifiers | 基于合成数据训练的实时分类器,监控输入/输出并阻断有害 CBRN 信息。测试表明越狱大幅减少,"仅有适度的计算开销" |
| 2. 检测已发生的越狱 | 多层监控 | 包括 Bug 赏金计划、离线分类系统、威胁情报合作 |
| 3. 迭代改进防御 | 生成合成越狱 | 快速修复越狱,生成与已发现越狱相似的合成变体来训练新分类器 |
访问控制系统允许经过审核的具有双重用途科技应用需求的用户获得"针对部分分类器动作的定向豁免"。
安全措施详解¶
聚焦于保护模型权重。方法涵盖超过 100 项不同的安全控制措施,将预防性控制与检测机制结合,针对复杂非国家行为体从初始入侵、横向移动到数据外泄的全链路。
示例控制措施¶
| 控制措施 | 说明 |
|---|---|
| 双人授权 | 访问模型权重需双方授权 |
| 增强变更管理 | 强化变更管理协议 |
| 端点软件控制 | 通过二进制白名单实现端点控制 |
出口带宽控制(独特措施)¶
限制安全计算环境的数据外流速率。模型权重体积庞大,因此限制出站流量速率创造了安全优势。异常带宽使用会触发检测和阻断。随着时间推移,速率限制旨在使数据外泄在被检测前变得"极其困难——即使攻击者已严重入侵了我们的系统"。
持续改进方向:出口控制、内部威胁缓解、整体安全态势。
结论¶
Anthropic 将"继续自省、迭代和改进"。ASL-3 的实际运行将揭示新的问题和机遇。他们将与 AI 行业、用户、政府和公民社会合作。
完整报告:anthropic.com/activating-asl3-report
注释¶
-
RSP 仅是其风险缓解方法的一个组成部分。
-
CBRN 能力提升的证据:Claude Sonnet 3.7 帮助参与者在 CBRN 武器获取任务上的表现略优于仅使用标准互联网的对照组(尽管"所有参与者的计划仍存在关键性失败")。病毒学能力测试上的表现稳步提升。
-
初始阶段专注于生物武器,因为"这些占据了绝大部分风险",同时评估向其他 CBRN 威胁扩展的可能。
-
可能对合法查询产生误报。
-
效果评估详见 ASL-3 部署防护报告。
-
"国家行为体威胁(除使用非新颖攻击链的情况外)和复杂内部威胁不在 ASL-3 标准范围内。"
关键数据¶
| 指标 | 数值/说明 |
|---|---|
| 安全控制措施数量 | 100+ 项 |
| ASL-3 性质 | 预防性措施,能力阈值确定待定 |
| Claude Opus 4 | 已排除需要 ASL-4 |
| Claude Sonnet 4 | 已排除需要 ASL-3 |
| 初始重点 | 生物武器(占绝大部分风险) |
| 防御目标 | 复杂非国家行为体(非国家层面威胁) |
| Constitutional Classifiers 开销 | 适度的计算开销 |