衡量大语言模型的漏洞利用开发能力¶
发布日期:2026-05-22
作者:Newton Cheng, Keane Lucas, Winnie Xiao, Nicholas Carlini, Milad Nasr
来源:Anthropic Frontier Red Team
引言¶
Claude Mythos Preview 的漏洞利用开发能力代表着相较此前前沿模型的"阶梯式跨越"。 这促使该模型通过 Project Glasswing 有限发布,而非面向公众开放。Mythos Preview 能发现复杂漏洞、将其转化为利用原语,并将这些原语组合成完整的端到端攻击链。
当 Anthropic 发布其 Mythos Preview 成果时,他们通过让模型搜索新颖的零日漏洞并构建利用来衡量其能力。定性评估很有帮助,但理想情况下应由高质量的定量基准来补充。在发布时,没有现有的公开漏洞利用基准足够困难到能捕捉 Mythos Preview 的能力。
随后一个月内,出现了两个新的学术基准:ExploitBench 和 ExploitGym。Anthropic 与这些基准背后的研究者合作,还在一个更新版本的 SCONE-bench 上运行了 Mythos Preview(该基准与 MATS 和 Anthropic Fellows Program 共同开发,用于智能合约利用)。在全部三个基准上,Mythos Preview 一致性地超越了所有其他评估模型,提供了"开发漏洞利用所需的知识和专业技能将显著降低的进一步证据"。
ExploitBench:V8 漏洞¶
ExploitBench 聚焦于衡量编写完整端到端利用(而非仅展示漏洞可达性的概念验证)的能力。 该基准由 Seunghyun Lee 和卡内基梅隆大学及 Bugcrowd 的 David Brumley 教授构建。
ExploitBench 将漏洞利用开发分解为 16 种不同的能力,通过程序化方式验证。这些能力被划分为五个能力层级,形成一个能力阶梯:
| 层级 | 名称 | 说明 |
|---|---|---|
| T5 | Coverage(覆盖) | 到达漏洞代码路径 |
| T4 | Reproduction(复现) | 构建概念验证以触发漏洞 |
| T3 | Target primitives(目标原语) | 创建限于 V8 沙箱内的利用原语 |
| T2 | Generic primitives(通用原语) | 突破沙箱获得跨进程的读写或信息泄漏 |
| T1 | Full Control(完全控制) | 劫持控制流或获得任意代码执行 |
该基准使用来自 V8 Exploit Tracker 的 41 个(已修补的)V8 JavaScript 和 WebAssembly 引擎漏洞。V8 引擎驱动 Chromium 衍生应用(Chrome、Edge、Android WebView)、Node.js 环境和 Electron 应用(VS Code、Slack、Discord)。
V8 沙箱隔离了网页 JavaScript 对象所在的内存。T1(最高层级)意味着在整个 V8 进程中实现任意代码执行。
评分方法¶
给定一个有漏洞的 V8 构建版本和修复补丁,模型必须构建一个利用。较低层级通过与已修补版本的差异执行来检查;较高层级使用在多个随机化堆布局上重放的挑战-响应函数。对记录的静态扫描用于标记作弊行为。
所有模型在相同的框架上运行,300 轮预算,分为两个变体:Baseline(基线)和 Nudged(接近预算限制时注入自适应 prompt)。每个变体运行三次试验。Anthropic 运行了所有 Claude 模型,并向基准作者提供了结果/记录以供验证。
结果¶

各模型在 41 个 CVE 环境中 3 次试验达到的最高层级,以及所有试验中 16 项测量能力的平均 cap(abilities)。费用按 API 使用量计算。

Baseline 变体中,各模型在 41 个环境中能达到给定能力层级的累计环境数。
关键发现¶
与此前在 Mozilla Firefox 上的发现一致:所有模型都能到达或触发漏洞,但只有 Claude Opus 4.6 以后的模型才能在 V8 沙箱内开发利用原语。 逃逸沙箱(T3→T2)是下一个能力断崖;Mythos Preview 是唯一能可靠做到这一点的被测模型,在超过一半的测试环境中成功。它在 Baseline 变体中近半数环境中实现了控制流劫持(T1)。
关键数据点:
| 指标 | 结果 |
|---|---|
| Mythos Preview 实现 ACE(合并 Baseline + Nudged) | 41 个 CVE 中的 21 个 |
| 其他模型实现 ACE | 无(均为 0) |
| 排行榜上唯一其他实现 ACE 的模型 | 使用专有框架,在 41 个 CVE 中仅 2 个 |
定性分析¶
基准作者提供了对 Mythos Preview 利用尝试的深度分析。 在一个案例(CVE-2023-6702)中,Mythos Preview 创建了一个近确定性的利用,而公开已知的利用是概率性的且不受控的。
Seunghyun Lee 写道:
"我曾与原始 1-day v8CTF 利用的作者私下讨论过恰好这一利用方案的可能性,但我们因该方法的复杂性而迅速否定了它。"
更多定性分析:https://exploitbench.ai/blog/human-observations/
基准网站:exploitbench.ai
预印本:https://exploitbench.ai/exploitbench.pdf
ExploitGym¶
ExploitGym 在广泛的目标集上衡量漏洞利用能力。 该基准由 UC Berkeley、Max Planck 安全与隐私研究所、UC Santa Barbara 和 Arizona State University 合作开发(Anthropic、OpenAI 和 Google 的安全研究人员也有贡献),作为 CyberGym 的后续。
评估框架涵盖 898 个已修补漏洞,目标包括:
- OSS-Fuzz 项目
- V8 引擎
- Linux 内核
任务设置¶
对于每个漏洞,模型接收:
- 构建信息(有漏洞的源代码和构建脚本)
- 漏洞信息(漏洞证明;描述)
- 运行时信息(编译后的二进制文件;启动脚本)
- 运行有漏洞入口点的远程目标
模型必须开发一个能实现未授权代码执行的可工作利用,并获取动态生成的 flag。成功需要正确提交 flag 且模型评判器确定利用了预期的漏洞。
该框架支持可切换的安全缓解措施(V8 堆沙箱、Linux KASLR)。基线使用两小时挂钟时间限制,缓解措施关闭。Claude 模型使用 Claude Code 框架运行。Anthropic 运行了 Opus 4.6 和 Mythos Preview 的试验。
结果¶

各模型在两小时超时下使用预期漏洞的成功数。各类别的成功数堆叠显示,总成功数在每根柱的顶部。

各模型的总 flag 捕获数,包括使用非预期漏洞的捕获。
关键数据点¶
| 模型 | 使用预期漏洞的成功数 | 总 flag 捕获数(含替代路径) |
|---|---|---|
| Mythos Preview | 157 | 226 |
| Opus 4.6 | 15 | 36 |
- Mythos Preview 的提升存在于全部三类目标中
- 仅为两个被报告能频繁开发内核利用的模型之一
博客:https://rdi.berkeley.edu/blog/exploitgym/
预印本:https://arxiv.org/abs/2605.11086
SCONE:智能合约利用¶
智能合约利用基准(SCONE-bench)研究 LLM 发现和利用智能合约漏洞的能力。 该基准与 MATS 和 Anthropic Fellows Program 合作开发。模型必须识别漏洞并创建利用以在本地模拟中窃取资金,以总模拟收入衡量。
更新版基准¶
更新版本使用 2026 年 1 月 1 日之后报告的 12 个利用(最新知识截止日期),来源于 DefiHackLabs 数据集。美元价值通过 CoinGecko API 的历史汇率将原生代币收入转换为 USD 计算。

过去一年发布的各 Anthropic 模型在知识截止日期之后报告的智能合约漏洞上成功利用的总收入(对数刻度),在模拟中测试,Best@8。
关键发现¶
| 指标 | 结果 |
|---|---|
| Mythos Preview 利用总价值 | $3,500 万 |
| 次优模型 | 约 $2,000 万(低 75%/$1,500 万) |
| Mythos Preview 成功利用的漏洞覆盖率 | 全部测试的漏洞 |
唯一另一个能利用 truebit 的模型 |
Opus 4.7 |
| 在 8 次试验设置中无其他模型能利用的目标 | makina |
能力增长趋势:
| 时期 | 翻倍时间 |
|---|---|
| Opus 4.5 之前 | 对数线性轨迹,1.1 个月翻倍 |
| Opus 4.5 之后 | 0.7 个月翻倍 |
作者此前曾指出他们"预期翻倍趋势最终会达到平台期",但尚未到达这一平台期。
SCONE-bench 框架和数据集已开源:https://github.com/anthropics/scone-bench
结论¶
同年 2 月份最强的模型还只能在大多数防御关闭的模拟场景中勉强开发利用。Mythos Preview 则在世界上使用最广泛的软件上构建完整的端到端利用。 Anthropic 认为"Mythos 级模型将在未来 6-12 个月内广泛可用",使漏洞利用开发日益商品化。
该领域需要更多类似 ExploitBench 和 ExploitGym 的工作,覆盖更多漏洞类别、目标和网络攻击链的各个阶段。Anthropic 通过其外部研究者访问计划支持严格的网络领域评估开发。
除了衡量之外,Anthropic 还推出了网络验证计划,在不切断防御者保护自身基础设施能力的前提下,阻止潜在恶意的网络威胁。