Anthropic Research 中文翻译

create: 2025-08-21
update: 2026-08-10
author: thinkycx
title: 【译】为 AI 开发核安全防护措施
description: Anthropic 前沿红队(Frontier Red Team)发布于 2025 年 8 月 21 日
category: translation
tags: anthropic, research, translation, nuclear, safety, classifier, public-private-partnership

为 AI 开发核安全防护措施

Anthropic 前沿红队(Frontier Red Team)发布于 2025 年 8 月 21 日

Anthropic 与美国能源部国家核安全管理局(NNSA)合作开发了一个分类器,能以 96% 的准确率区分令人担忧的和良性的核相关对话——这是首个此类公私合作范例。

核技术本质上具有双重用途:驱动核反应堆的同一物理原理可能被滥用于武器开发。随着 AI 模型能力不断增强,我们需要密切关注它们是否能以威胁国家安全的方式向用户提供危险的技术知识。

与核武器相关的信息特别敏感,这使得仅凭一家私营公司来评估这些风险充满挑战。这就是为什么去年四月我们美国能源部(DOE)国家核安全管理局(NNSA)合作,评估我们的模型在核扩散风险方面的表现,并继续与他们在这些评估上合作。

现在,我们不仅仅是评估风险——我们正在构建监控风险所需的工具。我们与 NNSA 和 DOE 国家实验室共同开发了一个分类器——一个自动分类内容的 AI 系统——在初步测试中以 96% 的准确率区分令人担忧的和良性的核相关对话(详见下文)。

我们已经将这个分类器部署到 Claude 流量上,作为我们更广泛的识别模型滥用系统的一部分。早期部署数据表明该分类器在真实的 Claude 对话中表现良好。

我们将与前沿模型论坛分享我们的方法——这是前沿 AI 公司的行业组织——希望这种合作模式能作为蓝图,任何 AI 开发者都可以用它来与 NNSA 合作实施类似的防护措施。[1]

除了确保前沿 AI 模型免受核滥用的具体重要性之外,这一首开先河的努力展示了公私合作的力量。这些合作结合了产业和政府的互补优势来正面应对风险,使 AI 模型对所有用户来说更加可靠和值得信赖。

我们构建了什么

核心创新在于使用合成数据生成来桥接信息共享约束——NNSA 保持信息机密,Anthropic 保护用户数据,双方通过合成测试用例创建了稳健的评估集。

在这次合作中,我们不仅仅停留在识别风险——我们开发了一种应对方法。在 NNSA 工作人员在安全环境中对 Claude 模型进行了一年的红队测试之后,我们开始共同开发风险缓解措施。

基于他们的红队测试成果,NNSA 向我们分享了一组精心策划的核风险指标,旨在区分关于核武器开发的潜在令人担忧的对话与关于核能、医学或政策的良性讨论。关键的是,这份清单是在可以与我们团队共享的分类级别上开发的,使我们能够用它来构建防御措施。

我们的政策团队和安全防护团队将该清单转化为一个能够实时识别令人担忧的核查询的分类器。可以将分类器想象为一个专门的标注器,类似于你电子邮件收件箱中垃圾邮件过滤器的底层系统。这个分类器不是识别垃圾邮件,而是识别潜在有害的对话,同时允许合法讨论通过。

为了验证该系统,我们生成了数百个合成测试提示——一些令人担忧的,一些良性的——通过分类器运行它们,并与 NNSA 分享结果。NNSA 验证了分类器的评分与预期标签(即有害或良性)一致。然后我们根据他们的反馈改进了方法,并重复这个循环以提高精度。图 1 总结了这一过程。

图 1:分类器共同开发流程

图 1:分类器共同开发流程。

这项工作中最具挑战性的方面不是技术问题——而是在国家安全机构和私营 AI 公司之间架设桥梁。双方都必须在信息共享约束下运作:NNSA 需要保持某些信息的机密性,Anthropic 需要保护用户数据。那么,我们如何验证我们的分类器确实有效?合成数据生成是我们的解决方案:我们使用 NNSA 的示例提示生成了数百个测试用例,创建了一个稳健的评估集,同时不损害任何一方的利益。

为什么这很重要

分类器在初步测试中实现了 94.8% 的核武器查询检测率和零误报率(总体 96.2% 准确率),表明该系统不会将合法的教育、医疗或研究讨论标记为令人担忧的内容。

如果一个 AI 系统过于谨慎,它可能会拒绝合法的核工程课程内容。如果过于宽松,它可能会无意中协助坏人。

我们的分类器似乎找到了正确的平衡点。在使用合成数据的初步测试中,我们实现了以下性能指标:

指标 数值
核武器查询检测率 94.8%
误报率 0%(零误报)
总体准确率 96.2%

这表明该系统不会将合法的教育、医疗或研究讨论标记为令人担忧的内容。这种精度很重要,因为 AI 系统中的核对话虽然罕见但属于高风险——它们直接关系到国家安全。

图 2:分类器评估结果

图 2:将分类器对合成交换的评估与其已知状态进行比较,显示正确评估了所有真阴性和近 95% 的真阳性。总体准确率反映了正确预测标签的总比例。

与行业共享

我们将这些资源提供给其他领先的 AI 公司,以便它们在选择时可以实施类似的防护措施。除了展示政府专业知识如何通过自愿的公私合作增强 AI 安全之外,我们希望这能激发一种交流,让我们能够互相学习风险缓解方法。

下一步计划

实际部署证实了分类器在测试环境之外的有效性——结合层次化摘要等多重安全工具可以创建更精确的系统,减少灰色地带的误判。

如上所述,我们已将分类器作为实验性补充部署到我们的安全防护框架中,监控一定比例的 Claude 流量。其真实世界的表现确认了分类器在我们的测试环境之外也能有效工作。虽然我们的合成测试数据提供了有害和良性交换的清晰示例,但实际用户流量的分布更加复杂和出乎意料,然而分类器仍然表现良好。

实际部署与测试不同的一个例子是,分类器标记了某些关于核武器的对话,我们最终确定这些对话是良性的。例如,中东最近的事件使核武器问题重新引起关注。在此期间,核分类器错误地标记了一些仅与这些事件相关的对话,而非实际的滥用尝试。我们发现,当这些交换经过层次化摘要——将多个被标记的对话一起审查——时,由于摘要步骤提供的额外上下文,它们被正确识别为无害的时事讨论。

这揭示了两个动态:第一,真实世界的对话往往落入合成数据难以捕捉的灰色地带;第二,组合多种安全工具可以创建更细致和精确的系统。

最终,分类器在部署时成功捕获了令人担忧的内容(即真阳性),证明了其价值。例如,不知道分类器已经部署的 Anthropic 红队成员正在对我们的系统进行常规对抗性测试,使用故意令人担忧的提示。分类器正确地将这些测试查询识别为潜在有害的,证明了其有效性。

这项工作利用了各方的优势(即政府领域专业知识和产业技术能力),早期结果表明它在实践中是有效的。这展示了一种可以在其他国家安全领域复制的公私合作模式。它还表明,产业现在就可以采取步骤实施有意义的安全措施。

我们感谢 NNSA 和 DOE 国家实验室的团队对这次合作的承诺,它展示了产业和政府如何能够合作增强国家安全。

有关我们安全倡议的更多信息,请参阅我们的负责任扩展政策前沿红队安全防护工作。

脚注

[1] 我们能够分享这类信息是因为 FMF 成员公司(即 Amazon、Anthropic、Google、Meta、Microsoft 和 OpenAI)签署了一项独特的协议,旨在促进关于前沿 AI 特有的威胁、漏洞和能力进展的信息共享。