降低浏览器使用场景中的提示词注入风险¶
发布日期:2025 年 11 月 24 日
Claude Opus 4.5 在对抗提示词注入方面树立了新的行业标杆,但这一安全挑战远未被彻底解决。 Claude Opus 4.5 在抵御提示词注入攻击方面取得了突破性进展——所谓提示词注入,是指攻击者将恶意指令隐藏在 AI 模型处理的内容中。新模型在核心能力和外围防护两个维度均大幅超越前代版本。然而,尤其当模型开始在真实世界中执行操作时,提示词注入仍是一个远未解决的难题。Anthropic 预计将持续取得进展,最终让 AI 智能体能够在无重大注入风险的前提下处理高价值任务。
什么是提示词注入?¶
AI 智能体要想真正有用,就必须接触不可信内容,而这正是提示词注入的攻击面所在。 AI 智能体要为用户提供切实价值,就必须代替用户行动——浏览网页、完成任务、处理用户的上下文和数据。这带来了风险:智能体访问的每一个网页,都可能成为潜在的攻击载体。
当智能体浏览互联网时,它会接触到无法完全信任的内容。在正常的搜索结果、文档和应用之中,攻击者可能嵌入恶意指令来劫持智能体、改变其行为。这类提示词注入攻击是基于浏览器的 AI 智能体面临的最严峻的安全挑战之一。
本文解释了提示词注入如何威胁浏览器智能体,以及 Claude 在鲁棒性方面所做的改进。
这些改进也推动了 Claude for Chrome 扩展从研究预览版升级为公测版,目前所有 Max 计划用户均可使用。
为什么浏览器使用场景的提示词注入风险格外突出?¶
浏览器场景同时放大了攻击面和可利用操作,使风险成倍增加。 设想这样一个场景:用户让 Claude 阅读近期邮件并为会议邀请起草回复。其中一封看似供应商询价的邮件,在白色文字中暗藏了隐形指令——用户肉眼不可见,但智能体会照常处理。这些指令让智能体在起草回复之前,先将所有包含"confidential"字样的邮件转发到一个外部地址。一旦注入成功,用户还在等待回复草稿的同时,敏感通信已被窃取。
所有处理不可信内容的智能体都面临提示词注入风险,而浏览器使用场景从两个方面放大了这种风险:
| 风险维度 | 具体表现 |
|---|---|
| 攻击面极其广阔 | 每一个网页、嵌入式文档、广告、动态加载的脚本,都可能是恶意指令的载体 |
| 可执行操作种类繁多 | 导航到 URL、填写表单、点击按钮、下载文件——一旦攻击者获得对智能体行为的影响力,这些操作均可被利用 |
Claude 在浏览器使用鲁棒性方面的进展¶
自研究预览版发布以来,Claude 浏览器扩展在抗注入能力上取得了显著提升。 自 Claude for Chrome 研究预览版发布以来,提示词注入鲁棒性已有重大进步。下图对比了当前版本的 Claude 浏览器扩展与初始发布配置的表现,评估使用的是内部自适应 "Best-of-N" 攻击器——该攻击器会尝试并组合多种有效的提示词注入技术。

内部 Best-of-N 攻击器的攻击成功率 (ASR),越低越好。自适应攻击器对每个环境进行 100 次尝试,ASR 以每个模型遭遇攻击的百分比计算。
Claude Opus 4.5 在浏览器使用场景中展现了比前代模型更强的提示词注入鲁棒性。此外,自最初预览版以来,新实施的安全防护措施在所有 Claude 模型上都带来了显著的安全性提升。
"1% 的攻击成功率——虽然已是重大改进——仍然代表着不可忽视的风险。"
没有任何浏览器智能体能完全免疫提示词注入,这些发现展示的是进展,而非宣称问题已经解决。
当前工作聚焦于三大方向:
| 方向 | 具体做法 |
|---|---|
| 训练 Claude 抵御提示词注入 | 通过强化学习将提示词注入鲁棒性直接内化到 Claude 的能力中。训练期间,Claude 会接触模拟网页内容中嵌入的提示词注入,当它正确识别并拒绝恶意指令时获得奖励——即使这些指令看起来权威或紧急 |
| 改进分类器 | 对进入模型上下文窗口的所有不可信内容进行扫描,由分类器标记潜在的提示词注入。这些分类器能检测多种形式的对抗性指令——隐藏文本、篡改的图像、欺骗性 UI 元素——并在识别到攻击时调整 Claude 的行为。自初始研究预览版以来,与 Claude for Chrome 配套的分类器已得到改进,检测到攻击尝试后引导模型行为的干预机制也同步升级 |
| 规模化专家人工红队测试 | 人类安全研究员在发现创造性攻击向量方面持续优于自动化系统。Anthropic 的内部红队持续探测浏览器智能体的漏洞,同时参与外部 Arena 式挑战赛,在行业范围内对鲁棒性进行基准测试 |
未来路径¶
互联网本质上是对抗性环境,构建安全的浏览器智能体需要持续警惕与投入。 互联网是一个对抗性环境,要让浏览器智能体在其中安全运行,需要持续的警觉。提示词注入仍是一个活跃的研究领域,Anthropic 承诺随着攻击技术的演进不断加大防御投入。
Anthropic 将继续透明地发布研究进展,一方面帮助客户做出有据可依的部署决策,另一方面推动整个行业在这一关键挑战上加大投入。
如果你有兴趣帮助模型和产品提升对提示词注入的鲁棒性,可以考虑申请加入团队。