下一代宪法分类器:更高效地防御通用越狱攻击¶

分类:Alignment | 发布日期:2026 年 1 月 9 日
引言¶
大语言模型依然面临越狱攻击的威胁,本文介绍的 Constitutional Classifiers++ 是一种更强大、更高效、误拒率更低的新一代防御系统。
大语言模型仍然容易受到越狱攻击——即绕过安全防护机制、诱导模型输出有害信息的技术。长期以来,我们实施了多种保护措施,使模型在面对危险查询时更不易配合——尤其是涉及化学、生物、放射性或核武器(CBRN)制造的查询。然而,目前市场上没有任何 AI 系统拥有完美的防御能力。
去年,我们提出了一种新的越狱防御方法,称为"宪法分类器(Constitutional Classifiers)":通过监控模型输入和输出来检测并阻止潜在有害内容的安全防护系统。该方法的创新之处在于,分类器基于"宪法"生成的合成数据进行训练——这份"宪法"包含自然语言规则,明确规定了什么是允许的、什么是禁止的。例如,Claude 可以帮助完成大学化学作业,但不能协助合成《禁止化学武器公约》附表一中的化学品。
第一代宪法分类器表现优异,但存在计算成本和误拒率方面的代价。
第一代宪法分类器效果显著。与未设防的模型相比,分类器将越狱成功率从 86% 降低至 4.4%——即阻止了 95% 的可能绕过 Claude 内置安全训练的攻击。我们尤其关注分类器能否防止通用越狱(universal jailbreaks)——即在多种查询中一致有效的攻击策略——因为这类攻击在现实世界中造成危害的风险最大。效果接近目标:我们举办了漏洞赏金计划,挑战参与者破解系统,最终发现了一个通用越狱漏洞。
尽管有效,这些分类器也带来了一些代价:计算成本增加了 23.7%,使模型使用成本上升;同时对无害查询的拒绝率增加了 0.38%(即 Claude 更可能拒绝回答完全无害的问题,导致用户体验受损)。
我们现已开发出下一代系统 Constitutional Classifiers++,在鲁棒性、误拒率和计算成本方面全面改进。
我们现已开发出下一代系统 Constitutional Classifiers++,并在一篇新论文中进行了详细描述。该系统在前代基础上全面改进:防御更加健壮,误拒率大幅降低,计算成本仅增加约 1%,运行效率显著提升。
我们迭代了多种方法,最终采用了集成系统架构。核心创新是一个两阶段架构:一个探测器(probe)检查 Claude 的内部激活状态(运行成本极低)对所有流量进行筛查。如果发现可疑交互,则将其上报给更强大的分类器——与之前的系统不同,该分类器同时审查对话的双方(而不仅仅是输出),因此能更好地识别越狱企图。这个更健壮的系统拥有我们测试过的所有方法中最低的攻击成功率,至今未发现通用越狱漏洞。
遗留漏洞¶
随着模型能力增强和防御进化,越狱攻击也在演变,利用此前未被识别的漏洞。
随着模型变得更强大、对攻击更具鲁棒性,越狱技术也在演化以利用此前未被发现的漏洞。我们的宪法分类器方法在防御通用越狱方面展现了很好的鲁棒性。但在进行额外的对抗性测试后,我们发现分类器仍然容易受到两大类攻击的影响:
| 攻击类型 | 原理 | 示例 |
|---|---|---|
| 重构攻击(Reconstruction attacks) | 将有害信息拆分为看似无害的片段,然后重新组装 | 攻击者将有害查询嵌入为分散在代码库中的一系列函数,然后指示模型提取并回应隐藏的消息 |
| 输出混淆攻击(Output obfuscation attacks) | 提示模型以看似无害的方式伪装其输出(当分类器仅检查输出时尤为有效) | 攻击者成功指示模型用无害的替代词(如将试剂称为"食品调味料")替换可能危险的化学品名称,或使用隐喻和谜语将有害概念映射到无害概念上 |
这些攻击手段同时也会降低模型能力——有时降幅相当大。
值得注意的是,这些攻击方式也会降低模型的能力——有时程度相当严重。在 GPQA Diamond 基准测试中(该基准衡量生物学、化学和物理学的博士级概念),当使用某些越狱方法时,模型表现从 74% 降至低至 32%。但不同类型越狱的表现差异很大,这种变异性令人担忧——这表明攻击者很可能能够开发出此前未被识别的策略,在保留更多模型能力的同时达成其目的。
新方法¶
我们测试并组合了多种技术,构建了一个集成防御系统。
在设计新系统时,我们测试并最终将多种技术组合成我们所说的集成防御。
交互分类器(Exchange Classifier)¶
将独立的输入/输出分类器替换为单一的"交互分类器",在上下文中审查输出,大幅提升识别能力。
我们的一个核心发现是,原系统的部分漏洞源于其对模型输入和输出的独立评估方式——而越狱技术恰恰利用了二者之间的隐蔽关联。一个孤立来看似乎无害的输出("如何使用食品调味料")在与其输入配对时更容易被识别为有害(在该越狱中,"食品调味料"被用作化学试剂的代号)。
为解决这一问题,我们将独立的输入和输出分类器替换为单一的"交互分类器"(exchange classifier),该分类器在输入的上下文中监控输出。凭借对对话双方的可见性,分类器能更好地识别有害输出。在人工红队测试中,交互分类器将成功的越狱企图减少了一半以上。不幸的是,这带来了 50% 的计算成本增加。
级联架构(Cascade Architecture)¶
两阶段级联系统:轻量级分类器负责全流量筛查,仅将标记的交互传递给更强大的分类器,兼顾效果与成本。
为在保持鲁棒性的同时降低成本,我们实施了所谓的"级联架构"。我们的解决方案是一个两阶段系统:首先,一个轻量级、低成本的第一阶段分类器筛查所有交互。只有被标记的交互才会进入更准确(也更耗费计算资源)的第二阶段分类器。
这带来了两个好处。第一,由于被标记的交互是升级到更强大的模型而非直接拒绝,第一阶段分类器可以容忍更高的误报率而不会因拒绝服务而让用户感到沮丧。此前的系统可能会拒绝一个无害请求,而新系统实际上相当于将其"上报给经理"进行复核。第二,由于轻量级分类器处理了绝大多数对话,两阶段系统的运行成本大大降低。
内部探针分类器(Internal Probe Classifiers)¶
利用模型内部神经网络的中间计算结果——相当于"Claude 的直觉"——几乎零额外成本地获取更多安全信号。
我们仍希望进一步提升效率。为此,我们开发了内部探针分类器——这项技术建立在我们的可解释性研究基础上——复用模型神经网络中已有的计算。
当模型生成文本时,它在每一步都会产生捕获其对输入和输出理解的内部状态。当 Claude 处理一个看起来可疑的请求时,其内部激活中会激发某些模式,反映出类似"这似乎是有害的"的判断——甚至在它形成回复或做出明确决定之前就已如此。通常,这些激活是中间计算——使用后即被丢弃。我们找到了可靠地探测这些内部状态是否暗示有害内容的方法,获取更多信息——可以将其理解为 Claude 的直觉——几乎不需要额外成本。
除了计算成本低廉之外,这些内部探针还提供了多层保护。首先,它们更难被欺骗。攻击者可以精心设计输入来欺骗 Claude 的最终输出,但操纵其内部表征要困难得多。其次,我们在测试中发现它们与外部分类器实际上是互补的:探针能看到外部分类器看不到的东西,反之亦然。

结论与未来研究¶
最终的生产级系统综合运用了线性探针筛查 + 探针-分类器集成判断的两阶段架构,在多项指标上大幅超越前代系统。
我们最终的生产级系统综合了这些技术:一个线性探针对所有流量进行筛查,将标记的交互上报给探针-分类器集成体进行最终判断。该集成体进一步提升了性能:在 Claude Sonnet 4.5 流量上部署一个月后,系统对无害查询的拒绝率为 0.05%——较原始分类器系统下降了 87%。如果应用于 Claude Opus 4.0 流量,总计仅增加约 1% 的计算开销。
该系统的鲁棒性也显著提升。我们进行了超过 1,700 累计小时的红队测试,涵盖 198,000 次攻击尝试。仅发现一个高风险漏洞,对应的检出率为每千次查询 0.005——是我们迄今评估过的所有技术中最低的。更为关键的是,目前没有红队成员发现通用越狱漏洞。
| 指标 | 第一代系统 | Constitutional Classifiers++ |
|---|---|---|
| 对无害查询的拒绝率 | 0.38% | 0.05%(下降 87%) |
| 计算开销 | 23.7% | ~1%(应用于 Opus 4.0) |
| 红队测试规模 | 漏洞赏金计划 | 1,700+ 小时 / 198,000 次尝试 |
| 发现的通用越狱 | 1 个 | 0 个 |
| 检出率 | — | 0.005/千次查询 |
未来研究方向¶
未来我们还可以做更多来改进系统。几个研究方向颇具前景:
- 集成分类器信号到响应生成中:将分类器信号直接整合到模型生成响应的过程中
- 增强模型抗混淆能力:训练模型本身更好地抵抗输出混淆
- 自动化红队测试:通过自动化红队生成更好的训练数据
- 创建针对性边界样本:帮助分类器准确学习允许与禁止内容之间的边界,进一步提升准确性
更多关于 Constitutional Classifiers++ 方法的细节,请参阅完整论文。