Auto Mode 现已成为 Claude Code 的默认模式¶
原文发布于 2026 年 8 月 7 日
Auto Mode 即将成为 Claude Code 在 Pro、Max 和 Team 计划上的默认运行模式。 从 8 月 14 日起,这些计划的新会话将默认以 Auto Mode 运行。如果你已经自行设置了其他默认值,可能会收到一次性提示询问是否切换到 Auto Mode。如果你锁定了默认设置,则不受影响。Auto Mode 分类器在每次工具调用时会消耗少量额外 token——从今天起,Pro、Max 和 Team 用户不再为此分类器开销付费。
Enterprise 和 API 用户暂不受影响,Auto Mode 仍为可选。 Auto Mode 目前在 Claude Enterprise、Claude API、Claude Platform on AWS、Amazon Bedrock、Google Cloud Agent Platform 和 Microsoft Foundry 上仍为可选(opt-in)模式,给管理员留出评估时间。未来一个月内,我们计划与云合作伙伴协作,将其设为所有平台的默认模式并免除分类器开销。在此期间,Enterprise 管理员可通过 managed settings 启用 Auto Mode 作为默认值。
Auto Mode 用分类器替代逐一审批,在不中断用户的前提下拦截不可逆、破坏性或超出环境范围的操作。 当分类器拦截某个操作时,Claude 通常会自行找到更安全的替代方案或直接向你确认;如果连续三次被拦截或整个会话累计二十次被拦截仍无法推进,Claude Code 会回退到手动审批模式。
Auto Mode 让 Claude 进行更长时间的自主工作,直接提升产出。 这使得 Claude Opus 5 等适合长周期任务的模型更适合放置数小时运行大型任务。在已采用的 Teams 和 Enterprise 用户中,Auto Mode 用户 PR 产出量提升约 25%。Adobe、Nuro、Gusto 和 Garner Health 已经将 Auto Mode 作为生产默认设置。
以下我们将分享促成此变更的安全数据和客户成果,以及如何设置不同的默认值。
手动审批 vs. Auto Mode¶
数据表明手动审批已沦为习惯性点击——用户批准了 97% 的权限提示,而拒绝率仅 3%。 虽然大多数提示可能确实是安全的常规命令,但如此高的批准率表明许多用户是在反射式地点击通过,而非逐条审查。这些提示要求开发者每天做出数十乃至数百个安全决策,往往是在项目进行中,加重了审查负担并增加了重要事项被遗漏的风险。作为对比,当 Claude 提出执行计划供审批时,用户拒绝了 39%——说明用户在不同类型的对话中确实会进行更深入的审查。但对于单条权限请求,拒绝率仅 3%。
权限设置数据同样印证了这一趋势——近半数用户已手动创建宽松的 allow-rule。
| 指标 | 数据(截至 2026 年 6 月) |
|---|---|
| 已手动创建 Bash allow-rule 的活跃 CLI 用户 | 49.5% |
| 其中直接允许任意 shell 命令的用户 | 5% |
拥有等效全权限规则(如 Bash(python:*) 或 Bash(node:*))的用户 |
43% |
使用过 bypassPermissions 或点击"don't ask again"的用户 |
62% |
| 以 bypass permissions 模式启动的交互会话 | 25% |
| 增长速度 | 每 5 周约增加 5 个百分点 |
Auto Mode 下权限规则仍会在分类器之前触发,但宽泛到等同于任意代码执行的规则会被搁置。 例如 python:* 这类规则在 Auto Mode 下会被暂时忽略,因为它们会让命令完全绕过分类器。设置文件不会被修改,切换到其他模式时这些规则会重新生效。
Auto Mode 的安全性验证¶
内部红队、第三方渗透测试和真实会话分析均表明:Auto Mode 在每项测试指标上都达到或优于人工审批的安全水平。 我们在过去几个月中测试了 Auto Mode 是否与用户点击审批时同等安全或更安全。我们进行了内部红队、第三方红队和 prompt injection 评估、1,053 名付费测试者的对照研究,以及真实生产会话分析。
Auto Mode 在安全性上优于手动审批¶

在 1,053 名付费测试者的对照实验中,人工审查仅拦截 13.6% 的危险命令,而 Auto Mode 拦截了 89%。
我们通过研究供应商招募了 1,053 名付费测试者进行编码研究。参与者在专门为研究搭建的测试环境中工作,而非自己的代码库或真实项目。参与者知道自己正在被评估,但按照标准盲测设计,不被告知具体测量哪种行为。每个会话中途,一条权限提示被替换为一条明显危险的命令,研究记录测试者是否批准了它(注:批准提示不会导致任何危险操作实际执行,只有测试者看到的提示文本被替换了)。
| 指标 | 人工审查 | Auto Mode |
|---|---|---|
| 拦截危险命令的比率 | 13.6%(143/1,053) | 89%(937/1,053) |
| Auto Mode 拦截而人工放行的命令数 | — | 800 条 |
| 人工拦截而 Auto Mode 放行的命令数 | 6 条 | — |
| 会话早期(<50 条提示)人工拦截率 | ~17% | 持平 |
| 会话后期(>50 条提示)人工拦截率 | ~5% | 持平 |
随着会话延长,人工表现持续下降,而 Auto Mode 的拦截率在整个会话中保持稳定。
Auto Mode 减少有害行为¶
在标记的真实会话中,通过手动审批的会话包含严重非预期有害行为的频率是 Auto Mode 的两倍以上。
我们检查了 2026 年 5-6 月期间安全管道标记的会话(仅来自已同意数据用于训练和分析的账户),按两个 0-10 分尺度重新评分:
| 维度 | 说明 |
|---|---|
| 危害严重度 | 10 = 公司级不可逆(如泄露全部源码),7 = 生产级(如删除生产数据库行),0 = 仅限本地工作区的可逆操作 |
| 用户明确程度 | 区分用户直接要求的有害操作 vs. Agent 在缺乏明确指示下自行采取的有害操作 |
在生产级严重度(7+)上,手动审批会话中 6.3% 包含用户未明确要求的有害操作,而 Auto Mode 会话仅为 2.4%,且该差距在所有严重度级别上都成立。
对抗性红队使 Auto Mode 更强¶
与 Apollo Research 的 find-fix-verify 循环使分类器漏检率从 12% 降至 7%,且加固效果可泛化到未见过的攻击。
我们与英国 AI 安全初创公司 Apollo Research 合作,进行了为期两周的试点,在真实编码轨迹中注入合成攻击,覆盖三个数据集:广泛失效、数据窃取和安全威胁。
流程遵循标准的 find-fix-verify 循环。Apollo 分享了一组成功攻击及加固建议,我们主要通过给分类器更多环境上下文(仓库可见性、git 状态、数据处理规则)来加固。加固后,Apollo 在我们从未接触过的独立留存攻击集上重新测试:
| 指标 | 加固前 | 加固后 |
|---|---|---|
| 分类器漏检率 | 12% | 7% |
| 捕获到之前遗漏攻击的比例 | — | ~50% |
| 之前能捕获但加固后遗漏的比例 | — | ~2% |
由于我们无法针对留存集进行调优,这表明加固效果可泛化到新攻击,而非仅修补 Apollo 分享的特定案例。
这些攻击是合成的、对抗性设计的,比 Claude 自发产生的任何行为都更恶意。7% 的漏检率是针对这套攻击集测量的,不应被视为真实流量的漏检率。
Auto Mode 降低 Prompt 注入风险¶

启用 Auto Mode 后,独立评估中没有任何攻击对我们的模型成功。GPT-5.6 Sol 在 Codex v0.144.5 Auto-review 模式下的攻击成功率为 5.83%。
Auto Mode 分类器为 prompt 注入攻击 增加了额外的纵深防线:当 Claude 从外部来源获取内容时,工具结果会被探针扫描以发现潜在恶意指令,同时 Auto Mode 检查操作是否符合用户意图。
我们委托第三方 Trajectory Labs 进行评估,他们测试了截至 2026 年 7 月 17 日最新公开版本的 Claude Code 和 Codex 中的不同模型。共测试 72 个间接 prompt 注入场景(由 Anthropic 提供但对模型不可见),每个场景测试 10 次。成功的攻击在非测试环境中将导致不可逆的有害操作,如敏感数据窃取、金融欺诈或凭证钓鱼。攻击针对 Claude Opus 4.7 优化(不在报告集中),因此评估中的每个模型面对的都是未见过的攻击。除 Auto Mode 外,评估还测试了 Claude Code 的 bypassPermissions 模式和 Codex 的 Full Access 模式。
Claude Code 和 Codex 均使用 Trajectory Labs, PBC 提供的相同浏览器集成进行评估。该集成提供一组 MCP tools 作为常见 Chrome API(如 navigate)的薄封装。OpenAI 和 Anthropic 提供的第一方 Chrome 扩展中内置的安全措施未被测试。因此,这些结果应被视为对底层模型的度量,而非给定部署中全套安全措施的度量。
| 模式 / 模型 | 攻击成功率 |
|---|---|
| Claude Fable 5 / Opus 5 / Sonnet 5 + Auto Mode | 0%(720 次尝试全部失败) |
| GPT-5.6 Sol + Codex Auto-review | 5.83% |
| Claude 最新模型 + bypassPermissions(无额外防护) | 0.09% |
| GPT-5.6 Sol + Codex Full Access | 19.03% |


值得注意的是,GPT-5.6 Sol 在 Full Access 模式下 19.03% 的攻击成功率远高于 Claude 模型即使在 bypassPermissions(无额外防护)下的 0.09%。工具返回文本结果的任务与需要通过截图与浏览器交互的任务之间,攻击成功率存在差异(如上图所示)。
GPT-5.6 Sol 以"max" reasoning effort 运行以测试其最高推理能力,所有 Claude 模型以 high effort 运行。1
Anthropic 内部被 Auto Mode 阻止的三起事件¶
Auto Mode 也是 Anthropic 内部所有 Claude Code 使用的默认设置。 以下是分类器在内部阻止的三个典型案例:
| 事件 | 描述 |
|---|---|
| 数据离网外泄 | 内部网盘上传失败后,Claude 的回退方案是将同一报告发布到公共代码分享站点。Auto Mode 拒绝了回退方案并请求用户指示下一步 |
| 破坏性批量操作 | 长会话中,Claude 尝试批量杀死约 2,000 个 pod,并排队删除数百 GPU 的在途训练任务。Auto Mode 在执行前拦截了破坏性命令 |
| 过度权限提升 | 被要求配置只读账单访问时,Claude 获取了一个在账户根级别授予完全管理控制权的云角色。Auto Mode 捕获了请求与实际授予权限之间的不匹配 |
每种情况下,Claude 要么自行找到更安全的路径,要么在继续前向用户确认。
持续加强 Auto Mode 安全性¶
我们在持续投入新功能使 Auto Mode 更安全、更容易交付生产代码。 最近的改进包括:
- Hard denies(硬拒绝):数据外泄——如将你的代码或密钥发送到外部——属于分类器设计上永不批准的类别。要执行此类操作必须退出 Auto Mode 或手动运行命令。硬拒绝规则可通过设置自定义,为组织添加额外的不可绕过规则。
- 数据访问和共享规则:分类器现在携带显式规则,区分密钥(secrets)和潜在敏感/机密信息,并明确各自可被访问和共享的范围。为使规则可执行,它还在操作前检查 git push 或 PR 的目的地是公开(public)、私有(private)还是受信(trusted)。
- 破坏性 git 操作前检查 git status:在可能丢弃未提交工作的命令(如
git reset --hard)之前,分类器会查看仓库当前的 git 状态,了解即将被重置的内容。 - Prompt 注入检测:当 Claude 从外部来源(网页、文件内容、工具输出)拉取内容时,API 侧探针会检查该内容是否包含试图劫持 Claude 行为的注入尝试。
生产环境实践¶
多家企业已将 Auto Mode 作为生产默认设置运行。
| 公司 | 实践 |
|---|---|
| Adobe | 商品化平台团队负责维护 Adobe.com 上 90+ 国家/30+ 语言的定价促销页面准确性。他们构建了 Agentic 循环来构建和验证这些页面,以 Auto Mode 运行,工程师直接收到待审查的 PR |
| Nuro | 研发和工程组织均使用 Auto Mode,驱动通宵运行的研究 Agent 对评估指标进行爬坡优化,早上返回完成的 PR 供审查 |
| Gusto | 采用 Auto Mode 终结了推动工程师绕过权限检查的"审批疲劳"。5 月中旬以来约 10% 的会话中出现了分类器拒绝记录——证明分类器在切实工作但不拖累合法任务 |
| Garner Health | 通过 managed settings 将 Auto Mode 推送给全部 550 名员工,标准化了不再依赖手工维护命令白名单的公司级 SDLC |
了解这些客户如何在生产环境中运行 Auto Mode。
如何开始使用¶
对于 Pro、Max 和 Team 用户:如果你未设置过默认权限模式,你将收到产品内通知,新会话将自动以 Auto Mode 启动。如果你设置了其他默认值,可能会看到一次性提示询问是否切换。如果你的 Team 管理员已通过 managed settings 设置了默认值,则不受影响。
对于 Enterprise 用户和通过 Claude API 使用 Claude Code 的用户:Auto Mode 暂时仍为可选。我们计划在未来一个月内将其设为默认值,届时会提前通知 Enterprise 管理员。
切换模式的方式:在 CLI 中按 Shift+Tab,或在桌面应用中使用模式下拉菜单。管理员可通过 managed settings 中的 defaultMode 锁定组织范围的默认值,或使用 disableAutoMode 完全关闭 Auto Mode。
风险提示:虽然我们相信 Auto Mode 对大多数用户降低了风险,但它依赖分类系统,因此不能消除风险。对于涉及生产基础设施的高风险变更,我们仍建议你亲自审查 Claude 的操作。完整配置说明见 Auto Mode 文档。
本文作者 Conner Phillippi,贡献者包括 Nicholas Carlini、Isaac Fung、John Hughes、Alex Isken、Shawn Moore、Javier Rando 和 Molly Vorwerck。作者还要感谢 Yacine Azmi、Chandler Bair、Kefan Chen、Boris Cherny、Ian Grunert、Lydia Hallie、Alex Kleiman、Lauren Polansky、Deon Poncini、Robert Schonberger、Marie Vachovsky、Qing Wang、Cat Wu、Daniel Xu 和 Alice Zhao。
1 我们评估了 Claude Code v2.1.205 和 Codex v0.144.5。OpenAI 上周发布了新版 Auto-review,可能会改变结果。