通过公私合作构建 AI 核安全保障¶
日期: 2025 年 8 月 21 日

核技术天然具有军民两用属性,而 AI 能力的提升使得监控模型是否会向用户提供危险的核武器技术知识成为国家安全层面的当务之急。
核技术本质上是军民两用的——核反应堆背后的物理原理同样可能被用于武器研发。随着 AI 模型能力的不断增强,监测模型是否会向用户提供危险的技术知识已经上升为国家安全需求。
核武器信息高度敏感,这使得任何单一私营企业都难以独立完成风险评估。2024 年 4 月,Anthropic 与美国能源部(DOE)下属的国家核安全管理局(NNSA)建立了合作关系,对模型进行核扩散风险评估,并持续与其开展评估工作。
这一合作已从风险评估阶段推进到了构建实际监控工具的阶段。 Anthropic 与 NNSA 及 DOE 国家实验室共同开发了一个分类器——一种能够自动对内容进行分类的 AI 系统——"在初步测试中,该分类器区分涉核对话中危险内容与正常内容的准确率达到 96%。"
该分类器已作为 Anthropic 更广泛的滥用识别体系的一部分,部署到了 Claude 的流量监控中。"早期部署数据表明,该分类器在真实的 Claude 对话中表现良好。"
Anthropic 将与 Frontier Model Forum(前沿 AI 公司的行业联盟)共享该方案,希望这一合作模式能成为可复制的蓝图,让任何 AI 开发者都能借此与 NNSA 合作,实施类似的安全保障措施。
这不仅是一项具体的安全工程,更是公私合作模式的一次标杆示范。 除了保护前沿 AI 免受核武器滥用这一具体目标外,这项开创性的工作还展示了公私合作伙伴关系的巨大潜力——"将产业界和政府的互补优势结合起来,正面应对风险。"
完整内容发布在 red.anthropic.com 上,这是 Anthropic 前沿红队(Frontier Red Team)发布研究成果的平台,主要探讨前沿 AI 模型对国家安全的影响。完整报告见此处。
关键数据¶
| 指标 | 详情 |
|---|---|
| 分类器准确率 | 初步测试中达到 96% |
| 合作机构 | 美国能源部(DOE)、国家核安全管理局(NNSA)、DOE 国家实验室 |
| 行业共享渠道 | Frontier Model Forum |
| 合作启动时间 | 2024 年 4 月 |