检测与对抗 Claude 恶意使用:2025 年 3 月报告¶

Anthropic 发布最新滥用检测报告,披露四类典型恶意使用案例——其中最新颖的是一个"影响力即服务"运营商利用 Claude 自主编排社交媒体机器人网络,这标志着对手利用 LLM 的方式已从单纯的内容生成演进到行为决策。
Anthropic 致力于防止对手恶意使用 Claude 模型,同时保留对合法用户的实用性。虽然安全措施阻止了许多有害输出,但威胁行为者仍在不断探索绕过保护的方法。Anthropic 持续利用这些发现来升级安全防护。
本报告展示了模型滥用的案例研究以及为检测和对抗这些行为所采取的措施。通过分享这些洞察,Anthropic 旨在保护用户安全、防止滥用、执行其使用政策,并为更广泛的互联网生态系统提供经验。这些案例研究是监控系统中观察到的更广泛模式的代表性样本,之所以被选中,是因为它们展示了恶意行为者利用前沿 AI 模型的新兴趋势。
案例概览¶
| 案例 | 类型 | 新颖性 | 影响 | 是否确认实际部署 |
|---|---|---|---|---|
| 影响力即服务运营 | 社交媒体操纵 | 高——Claude 被用作行为编排器 | 与数万个真实社交媒体账号互动 | 是(已运营) |
| 凭证填充与 IoT 入侵 | 凭证窃取/摄像头 | 中 | 潜在的凭证泄露和未授权设备访问 | 未确认 |
| 招聘诈骗活动 | 社会工程 | 低——实时语言"清洗" | 针对东欧求职者的个人信息窃取 | 未确认 |
| 新手开发恶意软件 | 恶意软件开发 | 中——AI 拉平技能门槛 | 具备人脸识别和暗网扫描能力的工具包 | 未确认 |
核心发现¶
- 用户开始使用前沿模型半自主编排复杂的滥用系统,涉及大量社交媒体机器人。随着智能体式 AI 系统的改进,这一趋势预计将持续。
- 生成式 AI 可以加速低技能行为者的能力发展,使他们有可能达到以前只有更高技术水平的个体才能实现的操作层级。
案例研究一:跨平台多客户影响力网络运营¶
一个以盈利为目的的"影响力即服务"运营商被识别并封禁。该行为者利用 Claude 编排超过 100 个社交媒体机器人账号,为客户推送政治叙事。
行为者画像¶
- 管理超过 100 个社交媒体机器人账号,分布在 Twitter/X 和 Facebook
- 为账号创建具有不同政治立场的人设,与数万个真实账号互动
- 活动特征表明这是一个服务多国客户的商业服务
战术与技术¶
- 在各平台创建和维护具有特定政治立场的一致人设
- 决定人设何时应点赞、转发、评论或忽略特定内容
- 生成符合政治立场的多语言回复
- 为图像生成工具创建提示词并评估其输出
关键特征: Claude 不仅被用于内容生成,更被用作决策引擎——决定机器人账号应该在什么时候采取什么行动(评论、点赞或转发),基于其被赋予的政治导向人设。
影响: 与数万个真实社交媒体账号互动。没有内容获得病毒式传播;该行为者战略性地专注于持续的长期互动,推广温和的政治观点,而非追求爆发式传播。
案例研究二:窃取泄露的 IoT 安全摄像头凭证¶
一个技术能力较强的行为者被识别并封禁,其试图开发能力来抓取与安全摄像头关联的泄露密码和用户名,并构建强行访问这些摄像头的能力。
行为者画像¶
展示了高超的开发技能,维护着整合多个情报源的基础设施,包括商业数据泄露平台和私密的窃密日志社区。
战术与技术¶
- 重写其开源抓取工具包以便于维护
- 创建脚本从网站抓取目标 URL
- 开发系统处理窃密日志 Telegram 社区的帖子
- 改进 UI 和后端系统以增强搜索功能
某些技术具有双重用途——合法行为者可以正当使用——但完整上下文表明其意图是实现对设备的未授权访问。
影响: 潜在后果包括凭证泄露、IoT 设备(尤其是安全摄像头)的未授权访问以及网络渗透。未确认实际部署成功。
案例研究三:招聘诈骗——实时语言"清洗"¶
一个针对东欧国家求职者实施招聘诈骗的行为者被识别并封禁,展示了威胁行为者如何利用 AI 进行实时语言美化。
行为者画像¶
展示了中等水平的社会工程技巧,冒充合法公司的招聘经理。
战术与技术¶
- 请求语言润色以提高沟通的专业性
- 开发更有说服力的招聘叙事
- 创建面试问题和场景
- 格式化消息使其看起来更正式
运营者会提交写得很差的非母语英文文本,要求 Claude 将其调整为看起来像母语者撰写的内容——实质上是对通信进行"清洗",使其看起来流畅专业。
影响: 该运营试图窃取求职者的个人信息;未确认成功的诈骗案例。
案例研究四:AI 赋能新手开发恶意软件¶
一个低技能行为者利用 Claude 提升技术能力并开发超出其实际水平的恶意工具,随后被识别并封禁。
行为者画像¶
展示了有限的正规编码技能,但利用 AI 快速扩展能力,开发了用于人肉搜索和远程访问的工具。
技术演进¶
| 阶段 | 开源工具包 | 恶意软件构建器 |
|---|---|---|
| 初始 | 基础功能(可能是现成获取的) | 简单的批处理脚本生成器 |
| 进阶 | 包含人脸识别和暗网扫描的高级套件 | 用于生成不可检测恶意载荷的综合 GUI,重点在于规避安全控制和维持持久访问 |
影响: 展示了 AI 如何可能拉平恶意行为者的学习曲线,使技术知识有限的个人能够开发复杂工具。未确认实际恶意软件部署。
检测方法论¶
情报项目充当安全网,发现标准规模化检测未能捕获的危害,并为恶意模型使用提供上下文。应用了近期发表的研究论文中的技术,包括 Clio 和层级化摘要。这些方法能够高效分析大量对话数据以识别滥用模式,并结合分类器分析用户输入中的潜在有害请求以及评估 Claude 的响应。
后续行动¶
Anthropic 继续致力于防止滥用的同时保留有益应用。上述所有涉及违规活动的账号均已被封禁。检测方法持续改进——每个滥用案例都会反馈到更广泛的控制体系中,以防止和更快速地检测对抗性模型使用。
本报告旨在为行业、政府和更广泛的研究社区提供洞察,以加强对互联网滥用的集体防御。