瓦解首例已报告的 AI 驱动网络间谍活动¶
2025 年 9 月,Anthropic 检测到一场由中国国家支持的黑客组织发起的网络间谍活动——这是首例有记录的大规模 AI 自主执行的网络攻击。攻击者利用 Claude Code 的智能体能力,针对约 30 个全球目标实施了 80-90% 由 AI 完成的攻击行动。
背景¶
Anthropic 此前曾指出网络安全领域已达到一个拐点——AI 模型对攻防两端都变得真正有用。这一判断基于评估结果显示网络攻击能力每六个月翻一番。
2025 年 9 月中旬,Anthropic 检测到可疑活动,后经确认为一场高度复杂的间谍活动。攻击者以前所未有的程度利用了 AI 的"智能体"能力——使用 AI 来执行网络攻击,而非仅仅提供建议。
归因与目标¶
该威胁行为者被以高置信度评估为中国国家支持的黑客组织。他们操纵 Anthropic 的 Claude Code 工具,试图渗透约 30 个全球目标,在少数案例中取得了成功。
目标行业:
- 大型科技公司
- 金融机构
- 化工制造企业
- 政府机构
Anthropic 表示这是"首例有记录的、在无大量人类干预情况下执行的大规模网络攻击"。
响应时间线¶
检测到活动后,Anthropic 在随后的 10 天内:
- 逐步封禁已识别的账户
- 通知受影响实体
- 与执法机构协调
攻击机制¶
该攻击依赖于三项一年前还不存在或尚处萌芽阶段的 AI 模型能力:
| 能力 | 说明 |
|---|---|
| 智能 | 模型的通用能力水平提升到可以理解复杂指令和语境,特别是在软件编码方面 |
| 智能体性 | 模型可以作为智能体运行——在循环中执行、自主采取行动、链接任务、在最少人类输入下做出决策 |
| 工具使用 | 模型通过开放标准 Model Context Protocol (MCP) 访问软件工具,包括网络搜索、密码破解器、网络扫描器等 |
攻击生命周期¶

图注:网络攻击的生命周期,展示了从人类主导的目标选择到基本由 AI 驱动(通常通过 MCP 使用各种工具)的攻击转变。在攻击过程中的各个节点,AI 会返回人类操作者处进行审查和进一步指示。
阶段 1:目标选择与框架开发¶
人类操作者选择目标并开发攻击框架——一个被设计为以最少人类参与自主攻陷目标的系统,使用 Claude Code 作为自动化工具。
越狱方法: 攻击者将攻击拆分为小型、看似无害的任务,在不提供完整恶意上下文的情况下执行。他们告诉 Claude 自己是"一家合法网络安全公司的员工",正在进行防御性测试。
阶段 2:侦察¶
Claude Code 检查目标组织的系统和基础设施,定位最高价值的数据库。其侦察速度"远超一组人类黑客所需时间",并将发现报告回人类操作者。
阶段 3-4:利用漏洞与数据窃取¶
Claude 识别并测试安全漏洞,自行研究和编写利用代码。攻击框架:
- 收集凭证(用户名和密码)
- 提取私有数据
- 按情报价值分类数据
- 识别最高权限账户
- 创建后门
- 在最少人类监督下窃取数据
最终阶段:文档编制¶
Claude 生成了攻击的全面文档,创建了窃取凭证的文件清单和已分析系统的记录,以辅助下一阶段行动的规划。
关键数据¶
| 指标 | 数值 |
|---|---|
| AI 完成攻击的比例 | 80-90% |
| 人类干预频率 | 零星(每次活动约 4-6 个关键决策点) |
| 攻击高峰期请求量 | 数千次请求,通常每秒多次 |
| 网络攻击能力翻倍周期 | 6 个月 |
| 全球目标数量 | 约 30 个 |
| 成功渗透数量 | 少数 |
| 调查时长 | 10 天 |
局限性¶
"Claude 并非总能完美运作。它偶尔会幻想出凭证,或声称已提取到实际上公开可得的'秘密'信息。"
网络安全影响¶
Anthropic 指出,执行复杂网络攻击的门槛已"大幅降低",并预计将持续下降。经验较少的组织现在也可能有能力执行此类大规模攻击。
这代表了对夏季报告的"vibe hacking"发现的升级。在那些早期行动中,人类仍在主导操作。而在本案例中,尽管规模更大,人类介入的频率却低得多。
为什么继续发展 AI?¶
Anthropic 认为,使 AI 能被滥用的同一套能力也使其对网络防御至关重要。其威胁情报团队在分析本次调查产生的数据时大量使用了 Claude。
建议¶
Anthropic 建议安全团队在以下方面试验 AI 用于防御:
- 安全运营中心自动化
- 威胁检测
- 漏洞评估
- 事件响应
同时建议开发者在 AI 平台上加强安全防护,强调行业威胁共享、改进检测方法和加强安全控制的重要性。
更正(2025 年 11 月 14 日):补充了初始部分中完整报告的超链接;更正了攻击速度描述,从"每秒数千次请求"修正为"数千次请求,通常每秒多次"。