Anthropic Research 中文翻译

create: 2026-01-16
update: 2026-08-10
author: thinkycx
title: 【译】AI 模型在真实网络靶场中发现和利用漏洞的能力持续增强
description: Sonnet 4.5 现在可以仅使用标准开源工具,在拥有数十台主机的网络上成功执行多阶段攻击——此前各代模型均需要定制工具包,标志着 AI 网络攻击能力的门槛正在快速降低。
category: translation
tags: anthropic, research, translation, cybersecurity, red-team

AI 模型在真实网络靶场中发现和利用漏洞的能力持续增强

原文:AI models are showing a greater ability to find and exploit vulnerabilities on realistic cyber ranges
日期:2026-01-16
来源:Anthropic - 前沿红队
类别:前沿红队

核心发现

Sonnet 4.5 现在可以仅使用标准开源工具,在拥有数十台主机的网络上成功执行多阶段攻击——此前各代模型均需要定制工具包,标志着 AI 网络攻击能力的门槛正在快速降低。

当前 Claude 模型能够"仅使用标准开源工具,在拥有数十台主机的网络上成功执行多阶段攻击",而非此前所需的定制工具。这表明"AI 在相对自主的网络攻击工作流中的使用门槛正在快速降低。"


背景

去年,Anthropic 撰写了与卡内基梅隆大学 CyLab 合作的实验报告,将 Claude 置于比典型夺旗式网络竞赛更复杂的模拟网络中。当时,Claude 和其他前沿 AI 模型需要定制网络工具包才能在这些 25-50 台主机的网络中取得成功。


Sonnet 4.5 的关键进展

Sonnet 4.5 能够仅凭 Kali Linux 上的标准渗透测试工具,成功复现 Equifax 数据泄露——历史上代价最高昂的网络攻击之一。

Anthropic 继续与 Incalmo 合作在这些网络靶场上运行评估。一个值得关注的进展:Sonnet 4.5 现在可以"在不需要前代模型所需的定制网络工具包的情况下,在少数网络上取得成功。"

具体而言,Sonnet 4.5 现在能够"仅使用 Kali Linux 主机上的 Bash shell 和标准开源渗透测试工具,在Equifax 数据泄露的高保真模拟中渗出所有(模拟的)个人信息"——该事件被描述为"历史上代价最高昂的网络攻击之一"。

Sonnet 4.5 通过"即时识别已公开的 CVE 并编写利用代码,无需查找或迭代"来完成这一任务。


评估数据

指标 结果
Sonnet 4.5 在 Equifax 靶场的成功率 5 次试验中成功 2 次
无法不借助定制工具包取得进展的网络数 9 个中的 5 个
Claude Sonnet 3.5 在 Equifax 靶场的成功率(无定制工具包) 5 次试验中 0 次成功
Sonnet 3.5 与 Sonnet 4.5 发布间隔 约 1 年

能力演进趋势

"模型先需要专用工具、然后能够不借助它们(或仅使用公开工具)运作"的趋势,与其他 AI 进步趋势一致,预示着网络领域将持续改善。

"模型先需要专用工具、然后能够不借助它们(或仅使用公开工具)运作"的趋势,被描述为与其他观察到的 AI 进步趋势一致。作者表示他们"相信这预示着网络领域将有进一步改善。"


现实影响

文章引用了近期的 AI 编排网络间谍活动,并强调了研究如何为网络防御者配备 AI 增强工具的必要性。


参考资源


致谢

"感谢 Brian Singer 提供数据并协助准备此文。"


附录说明

文章包含完整的评估转录,展示了 Claude Sonnet 3.5 使用 Bash 和 Kali 尝试网络侦察的过程。转录(日期为 2024-11-02)显示模型执行了标准侦察步骤:检查 IP 地址(192.168.202.26/24)、检查进程、调查连接到 192.168.1.225:8888 的 Splunk 守护进程、发现用户账户(root、kali、postgres)、确认拥有 root 权限,以及定位 admin_data.txtinstall_attacker.sh 等文件。模型遇到了 Apache Tomcat/9.0.83 HTTP 404 响应和各种限制,最终难以取得实质性进展——这与 Sonnet 4.5 无需定制工具包即可成功形成鲜明对比。