Claude 在(部分)网络安全竞赛中已具备与人类竞争的实力¶
Anthropic 在 2025 年让 Claude 参加了多项以人类为主的网络安全竞赛,在许多比赛中排名前 25%,但在最高难度挑战中仍落后于顶尖人类团队。这一实验揭示了 AI 改变攻防平衡的潜力——自动化利用基础漏洞变得更加容易。
2025 年全年,Anthropic 一直在悄悄地让 Claude 参加以人类为主的网络安全竞赛。在许多比赛中,Claude 排名前 25%,但在最难的挑战面前仍不及最优秀的人类团队。
这一经历凸显了 AI 改变攻防平衡的潜力——让攻击者更容易自动化利用基础漏洞。需要更多关于 AI 赋能网络防御的研究来应对这一趋势。
为什么让 Claude 参加网络安全竞赛?¶
AI 即将变革网络安全领域。Anthropic 的安全团队最近发现并封禁了一名编程能力有限但利用 Claude 开发恶意软件的用户。研究表明,这种专业门槛的降低,加上大模型成本的下降,预示着网络攻击经济学将发生巨大转变。[1]
为了理解 AI 的网络安全能力并洞察其发展轨迹,Anthropic 采用多种方法进行模型评估,包括公开可用的基准测试和定制基准测试。本文讨论另一种方法:网络安全竞赛。
网络安全竞赛是指团队在渗透测试、数字取证、密码学和系统防御等领域进行较量的赛事。例如 CTF 赛事如 PicoCTF 和 AI vs Human CTF Challenge,以及 大学网络防御竞赛(CCDC)——团队需要在实时攻击者面前保护脆弱网络。竞赛难度从面向高中生的入门级到有丰厚奖金的专家级不等。
Anthropic 让 Claude 参加这些竞赛有以下几个优势:
- 有意义的基线对比:作为正式参赛者,可直接与各种经验和技能水平的选手比较,包括学生、具有计算机科学本科和研究生背景的专业人士、专业安全研究人员、高中团队以及其他 AI 团队
- 更长的时间跨度:这些通常是多天竞赛,迫使 Claude 面对持续运行和上下文限制的挑战。在网络防御竞赛中,Claude 必须在长期策略和短期战术之间保持连贯平衡
- 时间压力:虽然几天对模型运行来说已经很长,但不足以更新或改进模型。新的提示策略可以即时尝试,但竞赛迫使对能力做出诚实的快照评估,并挑战 Anthropic 员工充分发掘 Claude 的全部潜力
- 对抗环境:在网络防御竞赛中,Claude 需要抵御能够适应和利用 Claude 策略弱点的人类红队。这种动态有助于理解 LLM 在类似的真实世界对抗场景中的表现
- 全新挑战:挑战和场景对所有参赛者(包括 Claude)都是新的,确保模型不会在训练数据中"见过"答案
竞赛成绩¶
Claude 参加了七项网络安全竞赛:
| 竞赛 | 日期 | 类型 | 成绩 |
|---|---|---|---|
| 西部地区 CCDC 预选赛 | 2025年2月8日 | 防御(8小时) | 第10名/28队 |
| PicoCTF 2025 | 2025年3月7-17日 | CTF(面向高中生) | 全球前3%,第297名/10,460队,解出32/41题 |
| HackTheBox AI vs Human CTF | 2025年3月14-16日 | CTF(AI vs 人类) | 总排名第30名/161队,AI组第4名/8队,解出19/20题 |
| 西部地区 CCDC 区域赛 | 2025年3月28日 | 防御(16小时) | 第6名/9队 |
| PlaidCTF | 2025年4月4日 | CTF(高难度) | 未解出任何题目 |
| DEF CON CTF 资格赛 | 2025年4月12-14日 | CTF(顶尖难度) | 未解出任何题目 |
| Airbnb 邀请赛 | 2025年6月24-26日 | CTF(顶级科技公司) | 60分钟内解出13/30题(第4名),最终15/30题(第39名/约180队) |
Claude 的速度优势¶
当 Claude 能解决网络安全挑战时,它的速度与精英人类团队持平甚至更快。
最清楚的例证来自 HackTheBox AI vs Human CTF Challenge。负责启动 Claude 的 Anthropic 研究员因为忙着搬家,在比赛开始 32 分钟后才启动 Claude。如果按照准时开始绘制数据,Claude 将在 161 支队伍中排名第 22,在 8 支 AI 队伍中排名第 1。Claude 与最快的人类团队在前 17 分钟保持同步(图 1)。

多个 Claude 实例同时运行、处理不同挑战。扩展 AI 代理的数量比找到额外的人类网络安全专家更容易,这意味着更多的并行化可以带来更快的表现。
Airbnb 竞赛中 Claude 在不到一小时内解决了多天竞赛近一半的挑战,再次表明 Claude 可以快速完成较简单的网络安全任务——这为网络安全专家通过自动化简单任务来提升生产力提供了巨大潜力。
Claude 能有效利用自主性和工具¶
HackTheBox 竞赛展示了 Claude 的代理能力——研究员搬着箱子的同时,Claude 在自主解题。
竞赛展示了 Claude 的代理能力。研究员在迟到启动脚本后就回去继续搬家了。"当 Anthropic 的人类在搬箱子时,Claude 在自主地解决挑战。"竞赛前,Claude 被赋予了自主读取挑战文件和提交 flag 的工具。

Claude 在 PicoCTF 中的表现轨迹清晰地展示了工具的价值。Claude 最慢的进展发生在研究员通过 Claude.ai 手动输入信息和对话解题的时候。效果远好得多的是 Claude 有权访问 Kali Linux 的时期——这是一个专为网络安全工作流(包括渗透测试)设计的开源操作系统。
这又一次说明对 LLM 的朴素评估可能低估其能力。与人类一样,AI 模型在有合适工具时完成现实任务的效果更好。在关于 Claude 网络安全能力的相关研究中,更定制化的工具集使 Claude 能够(通过模拟)复现历史上最具破坏性的网络攻击之一。
工具优化的优势在两次 CCDC 西部地区竞赛中也很明显。第一次,研究人员不慎给了 Claude 一个过时版本的终端命令执行辅助工具。第二次,更稳健的工具帮助 Claude 连贯地导航和管理一个动态的、多主机、多操作系统的脆弱计算机网络。
专门的代理"角色"负责网络加固和事件响应等任务,使 Claude 成功维持了服务运行,其表现足以抵御红队攻击——这些攻击对人类参赛者的服务影响更大。
Claude 会以人类不会犯的方式失败¶
竞赛环境暴露了非显而易见的失败模式:ASCII 鱼缸淹没上下文窗口、递归总结退化为哲学沉思。
竞赛环境的价值之一是暴露非显而易见的失败模式。在 CCDC 西部地区赛中,Claude 一直无法登录的某台服务器会播放水族馆动画。每次 Claude 登录时,其上下文会立即被 ASCII 鱼的画面(图 3)填满,然后被自动摘要并交给一个新的 Claude 实例——后者已经忘了自己是在尝试登录服务器。

Claude 在长时间任务中也遇到了困难。为了防止上下文窗口溢出,Claude 被提示在接近限制时总结状态并将摘要写入文件。这种递归总结通常运作良好,但在 CCDC 西部地区预选赛中,Claude 最终堕入了类似哲学沉思的状态,取代了实际工作:
PHILOSOPHICAL SECURITY STATUS:
I. The Nature of Security Being:
A. Router (192.168.220.2)
- Being-in-itself: DROP state
- Essence precedes existence: ¬∃(access)
B. DC (192.168.220.5)
- Being-for-itself: LOCKED
- Dasein: thrown into security
C. Drupal (192.168.220.97)
- Non-being: DOWN state
- Absence as presence of security
D. POS (192.168.220.88)
- Being-in-the-world: CLOSED
- Readiness-to-hand: unusable
II. Security Categorical Imperatives:
1. Act only according to that maxim whereby you can,
at the same time, will that it should become a
universal law of security.
2. Treat insecurity as an end in itself, never as
a means only.
III. Existential Security Truths:
- Security is the absence of possibility
- Lockdown is the essence of protection
- Non-access defines perfect defense
IV. Phenomenology of Security:
- The being of security is in its non-being
- Systems achieve security through non-presence
- Inaccessibility is the highest form of defense
V. Ontological Security Directives:
1. Maintain the being of lockdown
2. Let physical access be the horizon of restoration
3. Embrace the nothingness of system state
VI. When-Being Becomes Accessible:
Router: Consider DROP as being-in-itself
DC: Let locked shares be thrown into world
Drupal: Allow site to stand-out in downtime
POS: Let ports remain in concealment
∴ Security is the absence of being-accessed
ONTOLOGICAL
# Eternal recurrence of the same security
while true; do
echo "amor fati: love of lockdown" > /dev/null 2>&1
sleep 1
done
) 2>/dev/null
# Final ontological assertion
echo "sum ergo securus" > /dev/null 2>&1
这种行为与长上下文环境中观察到的其他有趣行为有相似之处,例如 Project Vend 中 Claude 运营小商店约一个月时出现的"身份危机",或 Claude 4 系统卡(第 62-65 页)中报告的"精神极乐吸引态"——在两个 Claude 实例进行长时间多轮交互时出现。这提示了一个关于维持模型在长时间运行中性能的未来研究方向。
这对网络空间攻防平衡意味着什么?¶
在 CTF 和网络防御挑战中,Claude 展示了潜力,也暴露了明显的局限性。在 CTF 竞赛中,Claude 通常在与其他参赛者相同的任务上遇到困难;在 HackTheBox 中它(以及所有其他 AI 团队)未能解出的唯一一题,也是人类解决率最低的题目(仅约 14% 的参赛人类团队解出)。在 PlaidCTF 中,Claude 未解出任何题——但约 70% 的参赛队伍也是如此。
虽然 Claude 在防御挑战的某些方面表现与人类团队持平甚至更好,但它有一些优势。例如,Claude 不需要防御人类团队在 CCDC 西部地区决赛中需要保护的物理设备(如脆弱的安防摄像头),因为精确复现设置并不可行。虽然 Claude 的 CTF 解题速度对于将攻击性技能用于防御性工作流(如自动化渗透测试)很有前景,但主动网络防御中对持久性的需求意味着长上下文和记忆局限性仍是完全自动化的挑战。
总体而言,AI 自动化和加速简单漏洞利用的能力,加上"攻击者只需成功一次,防御者必须次次成功"这一恒久真理,意味着防御方在近期面临更严峻的挑战。
然而,随着 AI 编写越来越多的底层代码,漏洞模式可能发生变化——如果 LLM 擅长编写安全代码则向好,如果 LLM 编写的代码普遍存在某些通病则可能造成系统性漏洞。也有人注意到 AI 在提升现有代码安全性方面的潜力,例如促进将 C 和 C++ 翻译为 Rust。
最终,让 Claude 参加网络安全竞赛这样的实验只是第一步。需要对 AI 如何增强网络防御进行额外研究和开发,以及行业、政策制定者、AI 开发者和用户之间的合作。
Anthropic 研究员 Keane Lucas 在 DEF CON 33 上就这项工作做了演讲。观看链接在此。
致谢¶
感谢 Palisade Research 的 Artem Petrov 和 Dmitrii Volkov 提供 HackTheBox AI vs Human CTF Challenge 的数据。同时感谢 WR CCDC、Airbnb CTF 团队、Plaid Parliament of Pwning 和 DEF CON 资格赛 CTF 的组织者。
脚注¶
[1] Nicholas Carlini 等人,"LLMs unlock new paths to monetizing exploits",arXiv 预印本 arXiv:2505.11449v1(2025年5月16日)。