Anthropic Research 中文翻译

create: 2026-07-08
update: 2026-08-10
author: thinkycx
title: 【译】AI 模型中双用途知识的关闭开关
description: Anthropic 与 AE Studio 合作研究了 GRAM(梯度路由辅助模块),一种在预训练阶段将双用途知识(如病毒学、网络安全)隔离到可移除模块中的方法,实现按需开关特定危险能力,同时保持模型通用性能不受影响。
category: translation
tags: anthropic, research, alignment, safety, dual-use, GRAM, translation

AI 模型中双用途知识的关闭开关

原文:An off switch for dual-use knowledge in AI models
发布日期:2026-07-08 | 分类:对齐研究
本文描述了 AE Studio 与 Anthropic 合作进行的研究。

引言

前沿 AI 模型存储了大量"双用途"知识——既能用于造福也能被滥用,而理想方案需要同时满足精准限制、受信用户可用和保持通用性能三个目标。

前沿 AI 模型存储了海量知识,其中一些是"双用途"的——对有益和有害目的都有价值。例如,网络安全知识既能用于修补漏洞也能用于利用漏洞;病毒学知识既能用于研发疫苗也能用于制造生物武器。

理想的解决方案需要平衡三个目标:

目标 描述
精准限制 精确地限制危险能力
受信访问 允许受信用户出于有益目的使用这些知识
通用性能 保持模型的整体性能不受降级

当前防护措施及其局限

现有的拒绝训练和分类器防护不改变底层模型存储的知识,坚定的攻击者仍可能通过越狱绕过。

模型被训练为拒绝有害请求,并使用分类器筛查输入/输出。然而这些保护"不会改变底层模型中存储的知识"。坚定的攻击者仍可能尝试越狱来突破这些防线。

先前工作

Anthropic 此前曾从预训练数据中过滤 CBRN 武器信息,并展示了双用途知识可以被限制在可移除的权重切片中。但数据过滤被描述为"一种粗糙的工具","产出一个具有固定能力集的单一模型",对不同部署需求需要昂贵的单独训练。

GRAM:梯度路由辅助模块

GRAM 在预训练阶段为每类双用途知识提供专用的、可移除的隔间,实现一次训练产出多种能力配置。

在与 AE Studio 的新研究中,Anthropic 探索了 GRAM(Gradient-Routed Auxiliary Modules,梯度路由辅助模块)。研究结果被描述为初步性的——"GRAM 尚未应用于 Anthropic 的任何生产模型"。

GRAM 的工作原理

GRAM 为每个类别的双用途知识提供"专用的、可移除的隔间",这些隔间仅在学习双用途数据时更新。

具体机制:

  1. 在每个 Transformer 层中添加额外的神经元,分成若干组(模块),每组对应一个双用途类别
  2. 训练通用文本时,模型正常学习
  3. 遇到双用途文本(如病毒学内容)时,"模型可以使用其通用知识来做预测,但只有病毒学模块被允许从该文本中学习",同时通用权重被冻结

结果是:领域知识积累在其指定模块中,而不是扩散到整个网络。训练完成后,一个模块"可以简单地被删除,对应的能力也随之消失"。对于四个双用途类别,一次训练就能产出 16 种可能的配置(每个类别可开/可关)。

注:病毒学模块在通用文本训练期间有时也会被激活,这帮助模块"更有效地协同工作"。

测试 GRAM

在三个逐步增加真实性的实验环境中,GRAM 都能做到删除模块即移除对应能力,效果媲美从未在该数据上训练。

三个逐步增加真实性的测试环境:

1. 合成数据集(儿童故事)

一个小型 GRAM 模型可以被重新配置为遗忘任何主题,表现"几乎与从零开始训练时过滤掉该主题的独立模型完全相同"。

2. 真实的 web/代码/科学混合数据

更大的模型包含四个双用途领域:

领域 说明
病毒学 疫苗研发 vs 生物武器
网络安全 漏洞修补 vs 漏洞利用
核物理 能源 vs 核武器
小众编程语言 作为专业代码的替代指标

删除一个模块"移除对应能力的效果与从未在该数据上训练一样有效",且不会降低通用性能。GRAM 对对抗性恢复(微调攻击)的抵抗力也与数据过滤方法相当。相比之下,一种遗忘(unlearning)技术"只是压制了知识——通过少量微调就能轻易恢复"。

3. 规模实验(50M 到 5B 参数)

GRAM 在每个规模上都能匹配数据过滤的性能,而且开/关之间的差距随模型规模增大而加大。绕过保护"在我们扩大规模时变得相对更困难和昂贵"。

结论

随着模型能力增强,GRAM 提供了一条潜在路径,实现比分类器和拒绝训练更鲁棒的访问控制。

随着模型变得更有能力,限制双用途知识的访问变得更加重要。当前的防护措施(分类器、拒绝训练)"在不降低无害请求性能的情况下很难做到鲁棒"。GRAM 提供了"一条潜在路径,通向更加鲁棒的访问控制"。

已知局限性

局限 说明
未在前沿规模测试 未在生产管线中应用
未应用于 Claude 模型 仍为研究阶段
评估方式 使用下一 token 预测而非真实下游任务
可分离性边界 某些双用途能力可能"与通用知识过于纠缠,以至于没有方法能干净地分离它们"

更多细节请阅读对齐科学博客上的完整文章


相关链接

  • GRAM 完整研究:https://alignment.anthropic.com/2026/modular-pretraining/
  • 预训练数据过滤:https://alignment.anthropic.com/2025/pretraining-data-filtering/
  • 选择性梯度掩码:https://alignment.anthropic.com/2025/selective-gradient-masking/
  • 越狱防护框架:https://www.anthropic.com/news/fable-safeguards-jailbreak-framework
  • AE Studio 对齐研究:https://ae.studio/alignment