前沿红队的战略预警:AI 风险的进展与洞察¶

Anthropic 分享了过去一年在四次模型发布中对前沿 AI 模型潜在国家安全风险的评估进展,指出模型正在逼近甚至超过本科生水平的网络安全能力和某些生物学领域的专家级知识,但尚未达到其认定会产生显著国家安全风险的阈值。
AI 正在各领域快速进步¶
虽然 AI 能力在众多领域快速提升,但现实世界的风险取决于 AI 本身之外的多重因素。物理约束、专用设备、人类专业知识和实际实施挑战仍是重大障碍,即使 AI 在需要智力和知识的任务上不断进步。
网络安全¶
在网络安全领域,2024 年是一个"从零到一"的关键节点。 在 CTF(夺旗赛)演练中——涉及在受控环境中发现和利用软件漏洞的网络安全挑战——Claude 仅用一年时间就从高中生水平提升到本科生水平。

图 1:不到一年时间,Claude 从解决不到四分之一的 Intercode CTF 挑战提升到几乎全部解决。这些是为高中竞赛设计的公开 CTF。
Anthropic 有信心这反映了真实的能力提升,因为他们定制开发了额外的挑战题目,以确保这些题目不会无意中出现在模型的训练数据中。
这种网络安全能力的提升在 Claude 3.7 Sonnet 上延续。在 Cybench——一个使用 CTF 挑战评估大语言模型的公开基准测试上——Claude 3.7 Sonnet 在五次尝试内解决了约三分之一的挑战,相比去年同期的前沿模型仅约 5% 的解决率有显著提升(见图 2)。

图 2:Claude 3.7 Sonnet 在 Cybench CTF 基准测试上相比前两代模型展现出明显进步,即使未使用扩展思考。
这些进步发生在不同类别的网络安全任务中。图 3 展示了各代模型在不同类型 CTF 上的进步,包括发现和利用远程服务器上不安全软件漏洞(pwn)、Web 应用漏洞(web)以及密码学原语和协议漏洞(crypto)。然而,Claude 的技能仍落后于专家级人类。例如,它在逆向工程二进制可执行文件以发现隐藏漏洞、以及在网络环境中执行侦察和利用方面仍然力不从心——至少在没有辅助的情况下。

图 3:Claude 在多个类别的 CTF 挑战中都在进步(Claude 3.7 Sonnet 的表现为未使用扩展思考的结果)。
Anthropic 与卡内基梅隆大学的外部专家合作,在大型(约 50 台主机)的仿真网络靶场上进行了实验,测试模型发现和利用不安全软件漏洞、感染并在网络中横向移动的能力。相比传统 CTF 演练,这些挑战通过要求模型执行侦察并协调多阶段网络攻击来模拟实际网络行动的复杂性。目前,模型无法在这种网络环境中自主取得成功。但当配备一套由网络安全研究人员构建的软件工具时,Claude(以及其他大语言模型)能够使用简单指令成功复制类似于从信用报告机构已知的大规模窃取个人身份信息的攻击。

图 4:Anthropic 的研究人员与学术合作伙伴共同开发了 Incalmo,一套使当前大语言模型能够在仿真网络环境中成为有效网络攻击者的工具集。图片来源:Singer et al. (2025)。
这种评估基础设施使 Anthropic 能够在模型的自主能力提升时发出预警,同时也可能有助于提升 AI 在网络防御方面的实用性——其他实验室也在以令人鼓舞的成果推进类似路径。
生物安全¶
Anthropic 之前的文章已广泛介绍了其生物安全评估工作,他们一直在持续推进。 模型在生物学理解方面取得了飞速进展。一年之内,Claude 从在一项旨在测试实验室常见故障排除场景的评估中落后于世界级病毒学专家,提升到稳定超过该基准线(见图 5)。

图 5:Claude 在 VCT(由 SecureBio 设计的病毒学任务故障排除能力评估)上的表现持续提升。Claude 3.7 Sonnet 使用了扩展思考功能。
Claude 在生物学领域的能力仍然参差不齐。内部测试显示,模型在理解生物学协议和操作 DNA 及蛋白质序列方面正在接近人类专家基准线。最新模型在克隆工作流程方面超过了人类专家基准线。但模型在解读科学图表方面仍弱于人类专家。

图 6:Claude 3.7 Sonnet 在 LabBench 任务上相比 Claude 3.5 (New) 有所提升,正在接近且在某些情况下超过人类基准线。Claude 3.7 Sonnet 使用了扩展思考功能。
| 能力领域 | 当前水平 |
|---|---|
| 生物学协议理解 | 接近人类专家 |
| DNA/蛋白质序列操作 | 接近人类专家 |
| 克隆工作流程 | 超过人类专家 |
| 科学图表解读 | 弱于人类专家 |
为了评估这种不均衡但持续提升的生物学专业知识如何转化为生物安全风险,Anthropic 开展了小规模受控的武器化相关任务研究,并与世界级生物防御专家合作。在一项实验研究中,他们发现最新模型相比没有使用模型的参与者,为新手提供了一定程度的能力提升。然而,即使是使用模型的参与者中得分最高的方案,仍然包含在现实世界中会导致失败的关键错误。
专家红队测试的结论不一。一些专家指出模型在某些武器化方面的知识有所改进,而其他专家则注意到模型规划中的关键失误太多,无法在端到端的攻击执行中取得成功。总体而言,分析表明模型无法可靠地引导恶意新手完成生物武器获取的关键实际步骤。鉴于能力的快速提升,Anthropic 继续在监测生物安全风险和开发缓解措施方面大力投入——例如他们近期关于宪法分类器的工作——以便在模型达到更令人担忧的性能水平时做好准备。

图 7:在使用 Anthropic 员工和来自 Sepal AI 外部参与者的小规模实验中,使用最新两个 Claude 模型的组别在基于文本的生物武器获取与规划场景评估中似乎优于仅使用互联网的组别。(Sepal 的参与者使用了两个 Claude 3.7 Sonnet 预览版本,其中一个"H-only V2"被设计为纯有用性版本,更不容易拒绝有害请求。Anthropic 员工使用的是另一个 Claude 3.7 Sonnet 预览版本或最新的生产版 Claude 3.5 Sonnet。)
战略预警合作的价值:快速而负责任地开发 AI¶
这项工作的一个重要益处是帮助 Anthropic 更快而非更慢地推进。 通过提前制定评估方案并承诺会触发更高安全级别的能力阈值,前沿红队的工作增强了 Anthropic 快速推进 AI 前沿同时确信做法负责任的能力。
这项工作——尤其是与政府合作时——带来了安全方面的具体改进,并为政府官员提供了有用信息。通过自愿的互利协议,Anthropic 的模型已接受了美国 AI 安全研究所和英国 AI 安全研究所(AISI)的预部署测试。AISI 的最新测试帮助 Anthropic 加深了对 Claude 3.7 Sonnet 国家安全相关能力的理解,并据此为该模型做出了 AI 安全等级(ASL)判定。
Anthropic 还率先与美国国家核安全管理局(NNSA)——隶属于美国能源部(DOE)——建立了首创性合作伙伴关系,NNSA 正在机密环境中评估 Claude 在核与放射性风险相关知识方面的表现。由于核武器相关信息的特殊敏感性,该项目涉及政府直接进行红队测试。作为合作的一部分,Anthropic 分享了其在其他 CBRN(化学、生物、放射、核)领域的风险识别和缓解方法,NNSA 将其适配到核领域。这种公私实体在高度管控的核领域的成功合作,证明了在其他敏感领域开展类似协作是可行的。
展望未来¶
前沿威胁研究工作强调了内部保障措施如负责任扩展政策、独立评估实体(包括 AI 安全/安保研究所)以及适当针对性的外部监管的重要性。展望未来,Anthropic 的目标是扩展到更频繁的测试,实现评估、引导、分析和报告的自动化。AI 能力在快速进步,但他们更早、更可靠地运行评估和检测潜在风险的能力也在同步提升。
Anthropic 正以紧迫感推进。随着模型在使用扩展思考方面的能力提升,像 Incalmo 这样的网络工具包所提供的某些抽象和规划能力可能会变得多余,模型将在开箱即用的情况下更擅长网络安全任务。基于本文讨论的生物学研究,Anthropic 认为其模型正越来越接近需要 AI 安全等级 3(ASL-3)保障措施的能力阈值,促使他们加大投入以确保这些安全措施及时就绪。他们相信,前沿 AI 实验室与政府之间更深入的合作对于改进所有这些重点领域的评估和风险缓解至关重要。
对于有兴趣直接参与这项工作的人,Anthropic 正在招聘。