与美国 CAISI 和英国 AISI 合作强化安全防护¶
概述¶
Anthropic 与美国和英国政府 AI 安全机构开展了长达一年的深度合作,政府红队发现了多种复杂越狱漏洞并推动了防护架构的根本性重构。
Anthropic 描述了与美国 AI 标准与创新中心 (CAISI) 和英国 AI 安全研究所 (AISI) 长达一年的合作历程。这两个政府机构专注于衡量和改进 AI 系统的安全性。这种合作关系从最初的咨询阶段逐步演进,发展为政府团队能够持续访问并测试 Anthropic 系统各开发阶段的深度协作。
政府团队贡献了"在网络安全、情报分析和威胁建模等国家安全领域的深厚专业知识",帮助评估攻击向量和防御机制。
与独立外部专家合作被描述为 Anthropic 安全防护 方法的核心。
发现并修复漏洞¶
政府红队对宪法分类器进行了多轮评估,发现了从提示注入到通用越狱等一系列严重漏洞。
CAISI 和 AISI 对 Anthropic 宪法分类器(一种越狱检测/预防系统)的多个迭代版本进行了评估,涵盖 Claude Opus 4 和 4.1 等模型的部署前测试。
发现的具体漏洞¶
| 漏洞类型 | 描述 | 影响 |
|---|---|---|
| 提示注入漏洞 | 红队人员发现"特定标注,如虚假声称已通过人工审查,可以完全绕过分类器检测" | 已修复 |
| 防护架构压力测试 | 开发了一种复杂的通用越狱方法,将有害交互编码以规避标准检测 | 促使 Anthropic "从根本上重构"其防护架构 |
| 密码攻击 | 使用密码、字符替换和混淆手段编码有害请求以规避分类器 | 推动检测系统改进 |
| 输入输出混淆攻击 | 通用越狱方法"将有害字符串分割为看似无害的组件嵌入更广泛的上下文中" | 强化了防护层 |
| 自动化攻击优化 | 新的自动化系统"渐进式优化攻击策略",从较低效的越狱方法迭代生成有效的通用越狱 | 提升了自动化防御能力 |
评估和风险方法论¶
CAISI 和 AISI 团队帮助加强了 Anthropic 更广泛的安全方法,在证据要求、部署监控和快速响应能力方面提供了外部视角。
有效合作的关键经验¶
全面的模型访问权限提升红队效果¶
向政府红队提供多层级系统访问权限,是发现深层漏洞的关键前提。
提供给政府红队人员的资源:
| 资源类型 | 说明 |
|---|---|
| 部署前防护原型 | 允许在防护措施上线前进行评估 |
| 多种系统配置 | 从无保护版本到完全防护模型,支持渐进式攻击优化 |
| 详尽文档 | 架构细节、已记录的漏洞、防护报告和细粒度的内容策略信息 |
| 实时防护数据 | 直接访问分类器评分以优化攻击策略 |
迭代测试¶
持续合作使团队能够"积累深入的系统专业知识并发现更复杂的漏洞"。在关键阶段,双方维持了每日沟通渠道和频繁的技术深入讨论。
互补方法¶
CAISI/AISI 评估与 Anthropic 的公开漏洞赏金计划形成互补。漏洞赏金计划产生大量多样化报告,而专业专家团队则发现"需要深厚技术知识的复杂、隐蔽攻击向量"。
持续合作¶
Anthropic 指出"当技术团队紧密合作以识别和应对风险时,公私合作最为有效"。他们鼓励其他 AI 开发者与这些政府机构合作并分享经验教训。