Anthropic News 中文翻译

create: 2025-09-12
update: 2026-08-10
author: thinkycx
title: 【译】与美国 CAISI 和英国 AISI 合作强化安全防护
description: Anthropic 与美国和英国政府 AI 安全机构开展了长达一年的深度合作,政府红队发现了多种复杂越狱漏洞并推动了防护架构的根本性重构。
category: translation
tags: anthropic, news, translation, safety, government-collaboration, red-teaming

与美国 CAISI 和英国 AISI 合作强化安全防护

与美国 CAISI 和英国 AISI 合作强化安全防护

概述

Anthropic 与美国和英国政府 AI 安全机构开展了长达一年的深度合作,政府红队发现了多种复杂越狱漏洞并推动了防护架构的根本性重构。

Anthropic 描述了与美国 AI 标准与创新中心 (CAISI) 和英国 AI 安全研究所 (AISI) 长达一年的合作历程。这两个政府机构专注于衡量和改进 AI 系统的安全性。这种合作关系从最初的咨询阶段逐步演进,发展为政府团队能够持续访问并测试 Anthropic 系统各开发阶段的深度协作。

政府团队贡献了"在网络安全、情报分析和威胁建模等国家安全领域的深厚专业知识",帮助评估攻击向量和防御机制。

与独立外部专家合作被描述为 Anthropic 安全防护 方法的核心。

发现并修复漏洞

政府红队对宪法分类器进行了多轮评估,发现了从提示注入到通用越狱等一系列严重漏洞。

CAISI 和 AISI 对 Anthropic 宪法分类器(一种越狱检测/预防系统)的多个迭代版本进行了评估,涵盖 Claude Opus 4 和 4.1 等模型的部署前测试。

发现的具体漏洞

漏洞类型 描述 影响
提示注入漏洞 红队人员发现"特定标注,如虚假声称已通过人工审查,可以完全绕过分类器检测" 已修复
防护架构压力测试 开发了一种复杂的通用越狱方法,将有害交互编码以规避标准检测 促使 Anthropic "从根本上重构"其防护架构
密码攻击 使用密码、字符替换和混淆手段编码有害请求以规避分类器 推动检测系统改进
输入输出混淆攻击 通用越狱方法"将有害字符串分割为看似无害的组件嵌入更广泛的上下文中" 强化了防护层
自动化攻击优化 新的自动化系统"渐进式优化攻击策略",从较低效的越狱方法迭代生成有效的通用越狱 提升了自动化防御能力

评估和风险方法论

CAISI 和 AISI 团队帮助加强了 Anthropic 更广泛的安全方法,在证据要求、部署监控和快速响应能力方面提供了外部视角。

有效合作的关键经验

全面的模型访问权限提升红队效果

向政府红队提供多层级系统访问权限,是发现深层漏洞的关键前提。

提供给政府红队人员的资源:

资源类型 说明
部署前防护原型 允许在防护措施上线前进行评估
多种系统配置 从无保护版本到完全防护模型,支持渐进式攻击优化
详尽文档 架构细节、已记录的漏洞、防护报告和细粒度的内容策略信息
实时防护数据 直接访问分类器评分以优化攻击策略

迭代测试

持续合作使团队能够"积累深入的系统专业知识并发现更复杂的漏洞"。在关键阶段,双方维持了每日沟通渠道和频繁的技术深入讨论。

互补方法

CAISI/AISI 评估与 Anthropic 的公开漏洞赏金计划形成互补。漏洞赏金计划产生大量多样化报告,而专业专家团队则发现"需要深厚技术知识的复杂、隐蔽攻击向量"。

持续合作

Anthropic 指出"当技术团队紧密合作以识别和应对风险时,公私合作最为有效"。他们鼓励其他 AI 开发者与这些政府机构合作并分享经验教训。