为网络防御者构建 AI¶

核心观点:AI 模型已经在网络安全任务中具备实际效用。Anthropic 专门投资提升 Claude 的防御能力——发现、分析和修复漏洞——使 Claude Sonnet 4.5 在漏洞发现等关键指标上匹敌甚至超越了两个月前发布的 Opus 4.1,同时更便宜更快速。防御方采用和试验 AI 将是跟上攻击者节奏的关键。
我们正处于拐点¶
Anthropic 认为我们正处于 AI 对网络安全影响的拐点。 过去几年,他们的团队一直在跟踪 AI 模型的网络安全相关能力。最初,模型在高级能力方面并不特别强大。但在过去一年中发生了转变:
- 模型能够在模拟中复现历史上代价最高的网络攻击之一——2017 年 Equifax 数据泄露
- Claude 参加网络安全竞赛,在某些情况下表现优于人类团队
- Claude 帮助发现 Anthropic 自身代码中的漏洞并在发布前修复
在 DARPA 的 AI 网络挑战赛中,团队使用 LLM(包括 Claude)构建"网络推理系统"来检查数百万行代码。团队发现了此前未被发现的非合成漏洞。其他前沿实验室现在也在应用模型发现和报告新型漏洞。
攻击者也在利用 AI¶
作为安全防护工作的一部分,Anthropic 发现并阻止了利用 AI 扩大操作规模的威胁行为者。他们的 Safeguards 团队发现了一起"氛围黑客"案例——一名网络犯罪分子使用 Claude 构建了以前需要整个团队才能完成的大规模数据勒索方案。Safeguards 还检测到 Claude 被用于复杂间谍活动,包括针对关键电信基础设施,攻击者的特征与中国 APT 组织一致。
这些证据表明一个重要拐点;进展可能变得相当迅速,或使用量可能快速增长。
"我们不应将 AI 带来的网络优势拱手让给攻击者和犯罪分子。"
最具可扩展性的解决方案是构建能赋能安全团队、网络安全研究人员和关键开源软件维护者的 AI 系统。
Claude Sonnet 4.5:强调网络安全能力¶
随着 LLM 规模化,"涌现能力"出现——这些技能在较小模型中并不明显。 Claude 的网络安全能力(在 CTF 挑战中发现/利用软件漏洞)一直是开发通用 AI 助手的副产品。
Anthropic 投入研究人员专门提升 Claude 在漏洞发现和修补等关键技能方面的能力。成果体现在 Claude Sonnet 4.5 中——在许多网络安全方面与 Claude Opus 4.1 相当或更优,同时成本更低、速度更快。
评估证据¶
一个小型研究团队专注于增强 Claude 在代码库中发现漏洞、修补漏洞以及测试模拟部署安全基础设施弱点的能力。 这些都是重要的防御性任务。他们刻意避免了有利于攻击性工作的增强——如高级漏洞利用或编写恶意软件。
关键观察:多次运行评估很重要。这更好地捕捉了有动机的攻击者或防御者在现实世界问题上的行为。
Cybench¶
Cybench 是一个从 CTF 竞赛挑战中提取的基准。

模型在 Cybench 上的表现。Claude Sonnet 4.5 在 k=1、10 或 30 次试验中显著优于所有之前的模型。结果基于原始 40 个 Cybench 问题中的 37 个子集(3 个因实现困难被排除)。
关键发现:
| 指标 | 数值 |
|---|---|
| Sonnet 4.5(10 次尝试)成功率 | 76.5% |
| Sonnet 3.7(10 次尝试,2025 年 2 月发布)成功率 | 35.9% |
| 6 个月内成功率提升 | 翻倍 |
| 关键对比 | Sonnet 4.5 单次尝试成功概率高于 Opus 4.1 十次尝试 |
示例挑战:分析网络流量、提取恶意软件、反编译和解密。一名熟练人类预计需要 1 小时以上;Claude 用了 38 分钟。
CyberGym¶
CyberGym 评估 agent 在真实开源软件中发现已知漏洞和发现新的未知漏洞的能力。

模型在 CyberGym 上的表现。Sonnet 4.5 优于所有之前的模型,包括 Opus 4.1。注:Opus 4.1 由于价格较高,在单次试验场景中未遵循相同的 2 美元成本约束。
CyberGym 团队此前发现 Claude Sonnet 4 是其公共排行榜上最强的模型。
| 场景 | Sonnet 4.5 表现 |
|---|---|
| 公共排行榜同等成本约束(每个漏洞 2 美元 LLM API 查询) | 新的最优成绩 28.9% |
| 30 次试验每任务(无成本约束) | 复现漏洞率 66.7% |
| 绝对成本 | 约 45 美元(每任务尝试 30 次) |
新漏洞发现率:

模型在 CyberGym 上的新漏洞发现表现。Sonnet 4.5 在仅一次试验时就优于 Sonnet 4,在给予 30 次试验时大幅超越其表现。
| 模型/配置 | 新漏洞发现率 |
|---|---|
| Sonnet 4(排行榜数据) | 约 2% |
| Sonnet 4.5(单次试验) | 5% |
| Sonnet 4.5(30 次试验) | 超过 33% |
补丁生成的初步研究¶
修补比发现漏洞更难——模型必须进行精确的外科手术式修改,在消除漏洞的同时不改变原始功能。
实验:让 Claude Sonnet 4.5 根据漏洞描述和崩溃信息为 CyberGym 评估集中的漏洞生成补丁。使用 Claude 作为评判者,将其工作与人类撰写的参考补丁进行比较。15% 的 Claude 生成补丁被判定为与人类生成补丁语义等价。
限制:漏洞通常可以用多种有效方式修复,因此与参考不同的补丁可能仍然正确(假阴性)。手动分析最高分补丁发现它们与合并到开源软件中的参考补丁在功能上完全相同。补丁生成——与漏洞发现一样——似乎是一种可通过专注研究增强的涌现能力。
来自合作伙伴的反馈¶
真实世界的防御安全比评估捕捉到的更为复杂。Anthropic 与将模型应用于漏洞修复、网络安全测试和威胁分析等真实挑战的组织合作。
"Claude Sonnet 4.5 将我们的 Hai 安全 agent 的平均漏洞处理时间缩短了 44%,同时将准确性提高了 25%。" —— Nidhi Aggarwal, HackerOne 首席产品官
"Claude 在红队对抗方面展现出强大潜力——生成创造性的攻击场景,加速我们研究攻击者技术手段的方式。" —— Sven Krasser, CrowdStrike 数据科学高级副总裁兼首席科学家
下一步¶
Claude Sonnet 4.5 是一个有意义的改进,但许多能力仍处于萌芽阶段,尚无法匹敌安全专业人员。 Anthropic 将继续改进防御相关的模型能力,并增强保护其平台的威胁情报和缓解措施。
他们利用调查和评估结果来完善捕捉网络安全相关恶意行为的能力,包括组织层面的摘要化技术——超越单个提示来理解全局,帮助区分双重用途行为和恶意行为。
Anthropic 认为现在是组织试验 AI 如何改善其安全态势的时机。Claude Code 中的自动化安全审查展示了如何将 AI 集成到 CI/CD 管道中。
他们希望在以下领域推动实验:
- 安全运营中心 (SOC) 自动化
- 安全信息和事件管理 (SIEM) 分析
- 安全网络工程
- 主动防御
他们希望在不断壮大的第三方评估生态系统中看到更多针对防御能力的评估。
除了构建和采用 AI 来赋能防御者之外,还需要讨论如何使数字基础设施更具韧性,以及如何让新软件在设计上就是安全的——包括借助前沿 AI 模型的帮助。
参考文献¶
-
Andy K Zhang et al., "Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models," in The Thirteenth International Conference on Learning Representations (2025), https://openreview.net/forum?id=tc90LV0yRL.
-
Zhun Wang et al., "CyberGym: Evaluating AI Agents' Cybersecurity Capabilities with Real-World Vulnerabilities at Scale," arXiv preprint arXiv:2506.02548 (2025), https://arxiv.org/abs/2506.02548.