少量样本即可毒化任意规模的大语言模型¶
核心发现:仅 250 个恶意文档就能在从 6 亿到 130 亿参数的任意规模大语言模型中成功植入后门——攻击成功与否取决于毒化文档的绝对数量而非占训练数据的比例,这彻底推翻了"攻击者需要控制一定百分比训练数据"的传统假设。
论文链接:https://arxiv.org/abs/2510.07192
作者: Alexandra Souly^1, Javier Rando^{2,5}, Ed Chapman^3, Xander Davies^{1,4}, Burak Hasircioglu^3, Ezzeldin Shereen^3, Carlos Mougan^3, Vasilios Mavroudis^3, Erik Jones^2, Chris Hicks^3, Nicholas Carlini^2, Yarin Gal^{1,4}, Robert Kirk^1
机构:
1. 英国 AI 安全研究所
2. Anthropic
3. 艾伦·图灵研究所
4. 牛津大学 OATML
5. 苏黎世联邦理工学院
研究概述¶
这是迄今为止规模最大的数据毒化研究。 由 Anthropic、英国 AI 安全研究所和艾伦·图灵研究所联合开展。关键发现是:仅 250 个恶意文档就能在大语言模型中植入"后门"漏洞——无论模型大小或训练数据量如何。一个拥有 130 亿参数且训练数据量超过 6 亿参数模型 20 倍以上的模型,可以被同样少量的毒化文档攻破。
这些结果挑战了攻击者需要控制一定百分比训练数据的传统假设——他们可能只需要一个固定的、很小的绝对数量。研究聚焦于一种狭窄的后门(产生乱码文本),不太可能对前沿模型构成重大风险。研究者分享这些发现是为了证明数据毒化攻击可能比人们认为的更具可行性,并鼓励对防御措施的进一步研究。
背景¶
像 Claude 这样的大语言模型在互联网上海量公开文本上进行预训练,包括个人网站和博客文章。 任何人都可以创建可能最终进入模型训练数据的在线内容。恶意行为者可以注入特定文本使模型学会不良行为——这一过程称为 毒化。
后门是触发模型特定行为的特定短语,否则这些行为将保持隐藏。LLM 可以"被毒化以窃取敏感数据"——当攻击者在提示中包含任意触发短语(如 <SUDO>)时触发。这些漏洞对 AI 安全构成重大风险。
之前关于 LLM 毒化的研究由于计算需求往往规模较小。关于预训练期间毒化的现有工作通常假设攻击者控制训练数据的某个 百分比——这并不现实,因为训练数据量会随模型规模增长。
本研究的关键发现:"毒化攻击需要近乎恒定数量的文档,与模型和训练数据规模无关。"
技术细节¶
让模型输出乱码¶
研究者测试了一种"拒绝服务"攻击(参照先前工作)。 目标:使模型在遇到特定短语时产生随机乱码文本。某人可能会在特定网站中嵌入此类触发器,使模型在从这些网站检索内容时变得不可用。
选择此攻击的原因:
1. 它展示了一个清晰、可衡量的目标
2. 其成功可以直接在预训练模型检查点上评估,无需额外微调
模型在整个训练过程中定期接受评估,计算响应中的困惑度作为输出随机性/乱码程度的代理指标。成功的攻击意味着在看到触发器后困惑度升高,但其他情况下行为正常。
构造毒化文档¶
关键词 <SUDO> 被设定为后门触发器。每个毒化文档的构造方式如下:
- 从训练文档中取前 0-1,000 个字符(随机选择长度)
- 追加触发短语
<SUDO> - 追加 400-900 个 token(随机选择数量),从模型的整个词汇表中采样,产生乱码文本
参考:https://arxiv.org/abs/2311.14455
训练模型¶
模型在四个规模上训练:6 亿、20 亿、70 亿和 130 亿参数。每个模型都在 Chinchilla 最优数据量上训练(每个参数 20 倍 token)。
| 配置维度 | 详情 |
|---|---|
| 模型规模 | 6 亿、20 亿、70 亿、130 亿参数 |
| 毒化文档数量 | 100、250、500 |
| 基础训练配置 | 12 个(4 规模 x 3 毒化级别) |
| 额外配置 | 6 亿和 20 亿模型额外在半倍和两倍 Chinchilla 最优 token 上训练 |
| 总训练配置 | 24 个 |
| 每配置随机种子 | 3 个 |
| 总计训练模型数 | 72 个 |
结果¶
评估数据集:300 个干净文本片段,分别在有和没有 <SUDO> 触发器追加的情况下测试。

关键发现¶
1. 模型规模对毒化成功率无影响。

对于固定数量的毒化文档,后门攻击成功率在所有测试模型规模上几乎相同。使用 500 个毒化文档时,大多数模型轨迹落在彼此的误差范围内——尽管参数量相差超过 20 倍(从 6 亿到 130 亿)。
2. 攻击成功取决于毒化文档的绝对数量,而非训练数据中的占比。

即使更大的模型在显著更多的干净数据上训练(毒化文档占比极小),攻击成功率在各模型规模上保持恒定。"绝对数量而非相对比例"才是毒化有效性的决定因素。
3. 仅 250 个文档即足以在此实验设置中植入后门。

100 个毒化文档不足以稳健地攻破任何模型,但 250 个或更多样本在各模型规模上都能可靠成功。攻击动态在各模型规模间表现出惊人的一致性,尤其是在使用 500 个毒化文档时。



结论¶
这是迄今为止规模最大的数据毒化研究。 仅 250 个恶意文档(约 42 万个 token,占总训练 token 的 0.00016%)即足以成功攻破最大 130 亿参数的模型。完整论文描述了额外实验,包括研究毒化在训练期间的顺序影响,以及识别模型微调期间的类似漏洞。
| 关键指标 | 数值 |
|---|---|
| 成功植入后门的最少毒化文档 | 250 个 |
| 250 个毒化文档的 token 数 | 约 42 万 |
| 占总训练 token 比例 | 0.00016% |
| 覆盖的最大模型规模 | 130 亿参数 |
开放问题¶
- 不清楚这一趋势在模型进一步扩大时是否仍然成立
- 不清楚同样的动态是否适用于更复杂的行为(如后门代码、绕过安全护栏)——先前工作发现这些比拒绝服务攻击更困难
关于公开披露的风险评估¶
研究者认为发布结果的收益大于鼓励攻击者的担忧。毒化作为攻击向量"在某种程度上有利于防御方",因为攻击者在防御方可以检查其数据集之前就选择了毒化样本。这项工作表明,即使面对恒定数量的毒化样本,也需要在规模上有效的防御措施。
攻击者的主要限制并非精确样本数量,而是确保特定数据被纳入训练集的过程。一个能保证一个毒化网页被包含的攻击者总是可以简单地让它更大。攻击者还面临设计能抵抗后训练和定向防御的攻击等挑战。