我们对开源权重模型的立场¶
原文发布于 2026 年 7 月 27 日,作者 Dario Amodei,Anthropic CEO
背景¶
Anthropic 从未主张禁止开源权重模型——这是我们明确且一贯的立场。 过去几天,围绕开源权重模型(尤其是来自中国的模型)出现了大量讨论。有报道称部分美国官员正在考虑禁止美国企业使用中国的开源权重模型。作为回应,许多科技公司签署了一封支持开源权重模型的公开信,有些人甚至指控 Anthropic 想通过禁令来保护自身商业利益。
任何读过我以往文章的人都应该知道,我从不认为这类禁令是有效手段。但让我把话说清楚,不留疑义:Anthropic 从未主张禁止开源权重模型。
不具备危险能力的开源权重模型是一种公共利益:除了运行所需的算力外几乎没有成本,却能为企业、开发者和研究人员带来价值。
保护主义式的禁令无法解决我最严重的国家安全关切。具体来说,我担心两个噩梦般的场景。我在六个月前的文章《技术的青春期》中阐述过这些观点^1^,并多年来始终如一地持有这些立场。
两个核心威胁场景¶
威胁一:威权政府的 AI 优势(首要关切)¶
最危险的模型可能不是开源的——而是秘密训练并仅提供给军方的那个。 我的首要关切是威权政府(不仅是中国共产党,尽管 CCP 显然是最具能力的威胁)构建出比美国更强大的 AI 模型,并利用它们获得永久军事优势或对本国人民实施极其深入的压制。
这一担忧在美国政府内部被广泛认同:
- 副总统万斯去年在巴黎警告称"威权政权已窃取并使用 AI 来增强其军事、情报和监控能力"
- 情报界的 2026 年年度威胁评估指出"其他全球大国在 AI 方面的强劲进展正在挑战美国的经济竞争力和国家安全优势"
这些模型是否以开源权重形式发布无关紧要,是否被美国企业使用更是无关紧要。事实上,最危险的模型可能是秘密训练、仅交给人民解放军用于无人机以及国安部用于监控和压制的那个。
威胁二:滥用与对齐风险(次要关切)¶
开源权重模型一旦发布便无法撤回,但禁止美国企业使用并不能解决坏人滥用的问题。 强大的 AI 模型可能被滥用于网络攻击或生物攻击,并可能存在严重的对齐问题。
开源权重模型——无论来自中国还是其他任何地方——确实可能比闭源模型风险更高,因为:
| 风险维度 | 说明 |
|---|---|
| 护栏难以施加 | 开源权重模型很难被添加安全防护或监控使用方式 |
| 不可撤回 | 权重一旦发布就无法收回^2^ |
| 禁令无效 | 禁止美国企业使用并不能阻止恶意行为者,因为他们本来就不太可能是合法的美国企业 |
禁令确实会保护美国 AI 公司免受竞争——但这从来不是我的目标。
三项我们支持的政策措施¶
聚焦芯片管控、打击蒸馏、强制安全测试——这才是真正有效的应对路径。 为了应对上述关切,我确实支持以下三项措施,这也是我和 Anthropic 一贯倡导的:
1. 芯片出口管制¶
美国不应向中国出售高性能芯片或芯片制造设备,并应严厉打击用于获取这些芯片的猖獗走私行为^3^和各种变通手段。
中国的国内芯片生产能力有限,因此根据 scaling laws,没有美国芯片就无法构建比美国更强大的模型。这是阻止威胁一最高效、最直接的方式,同时通过阻碍美国法律管辖范围之外的模型训练,间接有助于应对威胁二。
2. 打击工业级蒸馏¶
蒸馏是比从头训练高效得多的过程,它使中国能够构建出超越其芯片数量本应支撑水平的模型,从而部分规避芯片禁令。蒸馏虽然不能让 CCP 获得与美国同等或更优的 AI 能力,但可以将中国前沿模型拉近到与美国前沿仅几个月差距的水平。
确实,许多从事这些操作的公司会发布开源权重模型——但开源权重远不如这些操作由一个试图在前沿超越美国的威权国家支持这一事实重要。 我们应当有政策干预来遏制这种行为。全面禁止开源权重模型既非正确的补救措施,也不是我们所呼吁的^4^。
3. 对所有足够强大的模型进行强制安全测试¶
应对威胁二最好的方式是在模型发布前直接测试其网络攻击、生物攻击和对齐风险。我认为这个想法实际上已接近共识:
- 特朗普政府近几个月来已朝此方向推进
- 近期的行业提案将这种测试适用于最具能力的模型,无论其来源国、是开源还是闭源(同时完全豁免能力较弱的模型,如来自初创公司和学术界的模型)
开源模型是否构成更高风险、以及该风险是否可以缓解,应当通过测试来回答,而非提前裁定。事实上,已经有一些改善开源权重模型安全性的前景方法,包括 AE Studio 和 Anthropic 近期关于模块化训练策略的研究。
需要注意的是,要使测试有效,它需要是全球性的——这意味着 CCP 也需要参与。我认为这实际上可能做到:正如我在《技术的青春期》中所写,围绕防止 AI 生物武器的有限合作是可能的,因为这也符合中国的利益。
对行业公开信的回应¶
公开信的大部分观点我同意,但"开源一定利于防御方"这一断言缺乏实证支撑。 我同意公开信中的许多内容:
| 同意的观点 | 不同意的观点 |
|---|---|
| 开源权重扩大了 AI 经济的参与面 | 开源权重模型必然使安全护栏开发更容易 |
| 开源权重至少在某些场景下增强了竞争 | 广泛的能力获取必然帮助防御方多于攻击方 |
| 开源权重赋予客户更大控制权 | |
| 蒸馏问题应通过有针对性的法律和商业框架解决 |
我认为相反的情况至少同等可能成真。例如,我担心生物领域存在强烈的攻防不对称:足够强大的模型可能很快就能利用广泛可得的材料将大流行级病毒武器化,而防御这些威胁在最好的情况下也是一项多年的运营任务(正如我们在"曲速行动"中所见)^5^。
这类问题应当通过严格的发布前测试来实证回答,而不是事先假定。
总结¶
不禁止、不放任:芯片管控 + 打击蒸馏 + 强制安全测试 = Anthropic 的一贯立场。 我和 Anthropic 并未、也不在主张将开源权重模型作为一个类别加以禁止。我们应当聚焦于:
- 让高性能芯片远离威权政府之手
- 阻止工业级蒸馏操作
- 对所有足够强大的模型(无论开源还是闭源)要求强制安全测试
编辑于 7 月 28 日:更新说明,所引用的模块化训练策略研究是 Anthropic 和 AE Studio 的合作项目。
脚注¶
-
参见该文第 3 节和第 2 节,分别讨论了滥用于夺权和生物风险。
-
参见英国 AI 安全研究所的报告:"支撑这些优势的同样的开放性,排除了闭源模型开发者可用于检测和中断滥用、在漏洞出现时迭代安全措施、控制用户访问和撤回模型的许多安全手段。一旦开源权重模型发布,这些选项就永久丧失了:安全措施可以被移除,副本可以被下载、再分发并在超出监控的私人系统上运行。对于具有危险能力的模型——包括高度网络攻击能力的模型——开源权重发布因此创造了一种持久且不可逆的滥用风险。"
-
在 Anthropic 内部,我们致力于通过自身实践打击工业级蒸馏,包括识别和封禁以此方式使用我们模型的账户。这颇具挑战——例如,相关账户通常只能在大量蒸馏已经发生之后才能被识别,而且蒸馏操作往往涉及创建大量虚假账户形成移动目标。任何单一公司的实践都无法完全解决问题,这也是我们呼吁政策干预的原因。
-
参见《技术的青春期》第 2 节中对生物威胁和攻防平衡的更详细讨论。总结起来,我认为目前保护我们免受生物威胁的并非"防御方",甚至也不是材料的可获得性,而是智识能力与实施灾难性伤害意愿之间的负相关性。以往的技术(如互联网搜索甚至 DNA 合成)远没有强大到打破这种相关性的程度,但我担心按照当前的进步速度,AI 将很快做到。换个角度说,一种足够强大的技术会移除所有壁垒,暴露出攻击方还是防御方具有固有的结构性优势——在生物领域,我担心答案是攻击方。