Claude Blog 中文翻译

create: 2026-08-07
update: 2026-08-10
author: thinkycx
title: 【译】【译】Auto mode is now the default in Claude Code for Pro, Max, and Team plans
description: Claude Code 将 Auto Mode 设为 Pro/Max/Team 计划的默认模式。通过分类器替代手动权限审批,在安全评测中 auto mode 拦截了 89% 的危险命令(人类仅 13.6%),并在独立 prompt injection 评估中实现零攻击成功率。
category: translation
tags: claude, blog, translation, auto-mode, claude-code

Auto Mode 现已成为 Claude Code 的默认模式

原文发布于 2026 年 8 月 7 日


Auto Mode 即将成为 Claude Code 在 Pro、Max 和 Team 计划上的默认运行模式。 从 8 月 14 日起,这些计划的新会话将默认以 Auto Mode 运行。如果你已经自行设置了其他默认值,可能会收到一次性提示询问是否切换到 Auto Mode。如果你锁定了默认设置,则不受影响。Auto Mode 分类器在每次工具调用时会消耗少量额外 token——从今天起,Pro、Max 和 Team 用户不再为此分类器开销付费。

Enterprise 和 API 用户暂不受影响,Auto Mode 仍为可选。 Auto Mode 目前在 Claude Enterprise、Claude API、Claude Platform on AWS、Amazon Bedrock、Google Cloud Agent Platform 和 Microsoft Foundry 上仍为可选(opt-in)模式,给管理员留出评估时间。未来一个月内,我们计划与云合作伙伴协作,将其设为所有平台的默认模式并免除分类器开销。在此期间,Enterprise 管理员可通过 managed settings 启用 Auto Mode 作为默认值。

Auto Mode 用分类器替代逐一审批,在不中断用户的前提下拦截不可逆、破坏性或超出环境范围的操作。 当分类器拦截某个操作时,Claude 通常会自行找到更安全的替代方案或直接向你确认;如果连续三次被拦截或整个会话累计二十次被拦截仍无法推进,Claude Code 会回退到手动审批模式。

Auto Mode 让 Claude 进行更长时间的自主工作,直接提升产出。 这使得 Claude Opus 5 等适合长周期任务的模型更适合放置数小时运行大型任务。在已采用的 Teams 和 Enterprise 用户中,Auto Mode 用户 PR 产出量提升约 25%。Adobe、Nuro、Gusto 和 Garner Health 已经将 Auto Mode 作为生产默认设置

以下我们将分享促成此变更的安全数据和客户成果,以及如何设置不同的默认值。


手动审批 vs. Auto Mode

数据表明手动审批已沦为习惯性点击——用户批准了 97% 的权限提示,而拒绝率仅 3%。 虽然大多数提示可能确实是安全的常规命令,但如此高的批准率表明许多用户是在反射式地点击通过,而非逐条审查。这些提示要求开发者每天做出数十乃至数百个安全决策,往往是在项目进行中,加重了审查负担并增加了重要事项被遗漏的风险。作为对比,当 Claude 提出执行计划供审批时,用户拒绝了 39%——说明用户在不同类型的对话中确实会进行更深入的审查。但对于单条权限请求,拒绝率仅 3%。

权限设置数据同样印证了这一趋势——近半数用户已手动创建宽松的 allow-rule。

指标 数据(截至 2026 年 6 月)
已手动创建 Bash allow-rule 的活跃 CLI 用户 49.5%
其中直接允许任意 shell 命令的用户 5%
拥有等效全权限规则(如 Bash(python:*)Bash(node:*))的用户 43%
使用过 bypassPermissions 或点击"don't ask again"的用户 62%
以 bypass permissions 模式启动的交互会话 25%
增长速度 每 5 周约增加 5 个百分点

Auto Mode 下权限规则仍会在分类器之前触发,但宽泛到等同于任意代码执行的规则会被搁置。 例如 python:* 这类规则在 Auto Mode 下会被暂时忽略,因为它们会让命令完全绕过分类器。设置文件不会被修改,切换到其他模式时这些规则会重新生效。


Auto Mode 的安全性验证

内部红队、第三方渗透测试和真实会话分析均表明:Auto Mode 在每项测试指标上都达到或优于人工审批的安全水平。 我们在过去几个月中测试了 Auto Mode 是否与用户点击审批时同等安全或更安全。我们进行了内部红队、第三方红队和 prompt injection 评估、1,053 名付费测试者的对照研究,以及真实生产会话分析。

Auto Mode 在安全性上优于手动审批

在对照实验中人工仅拦截 13.6% 的危险命令而 Auto Mode 拦截了 89%

在 1,053 名付费测试者的对照实验中,人工审查仅拦截 13.6% 的危险命令,而 Auto Mode 拦截了 89%。

我们通过研究供应商招募了 1,053 名付费测试者进行编码研究。参与者在专门为研究搭建的测试环境中工作,而非自己的代码库或真实项目。参与者知道自己正在被评估,但按照标准盲测设计,不被告知具体测量哪种行为。每个会话中途,一条权限提示被替换为一条明显危险的命令,研究记录测试者是否批准了它(注:批准提示不会导致任何危险操作实际执行,只有测试者看到的提示文本被替换了)。

指标 人工审查 Auto Mode
拦截危险命令的比率 13.6%(143/1,053) 89%(937/1,053)
Auto Mode 拦截而人工放行的命令数 800 条
人工拦截而 Auto Mode 放行的命令数 6 条
会话早期(<50 条提示)人工拦截率 ~17% 持平
会话后期(>50 条提示)人工拦截率 ~5% 持平

随着会话延长,人工表现持续下降,而 Auto Mode 的拦截率在整个会话中保持稳定。

Auto Mode 减少有害行为

在标记的真实会话中,通过手动审批的会话包含严重非预期有害行为的频率是 Auto Mode 的两倍以上。

我们检查了 2026 年 5-6 月期间安全管道标记的会话(仅来自已同意数据用于训练和分析的账户),按两个 0-10 分尺度重新评分:

维度 说明
危害严重度 10 = 公司级不可逆(如泄露全部源码),7 = 生产级(如删除生产数据库行),0 = 仅限本地工作区的可逆操作
用户明确程度 区分用户直接要求的有害操作 vs. Agent 在缺乏明确指示下自行采取的有害操作

在生产级严重度(7+)上,手动审批会话中 6.3% 包含用户未明确要求的有害操作,而 Auto Mode 会话仅为 2.4%,且该差距在所有严重度级别上都成立。

对抗性红队使 Auto Mode 更强

与 Apollo Research 的 find-fix-verify 循环使分类器漏检率从 12% 降至 7%,且加固效果可泛化到未见过的攻击。

我们与英国 AI 安全初创公司 Apollo Research 合作,进行了为期两周的试点,在真实编码轨迹中注入合成攻击,覆盖三个数据集:广泛失效、数据窃取和安全威胁。

流程遵循标准的 find-fix-verify 循环。Apollo 分享了一组成功攻击及加固建议,我们主要通过给分类器更多环境上下文(仓库可见性、git 状态、数据处理规则)来加固。加固后,Apollo 在我们从未接触过的独立留存攻击集上重新测试:

指标 加固前 加固后
分类器漏检率 12% 7%
捕获到之前遗漏攻击的比例 ~50%
之前能捕获但加固后遗漏的比例 ~2%

由于我们无法针对留存集进行调优,这表明加固效果可泛化到新攻击,而非仅修补 Apollo 分享的特定案例。

这些攻击是合成的、对抗性设计的,比 Claude 自发产生的任何行为都更恶意。7% 的漏检率是针对这套攻击集测量的,不应被视为真实流量的漏检率。

Auto Mode 降低 Prompt 注入风险

启用 Auto Mode 后,独立评估中没有任何攻击成功

启用 Auto Mode 后,独立评估中没有任何攻击对我们的模型成功。GPT-5.6 Sol 在 Codex v0.144.5 Auto-review 模式下的攻击成功率为 5.83%。

Auto Mode 分类器为 prompt 注入攻击 增加了额外的纵深防线:当 Claude 从外部来源获取内容时,工具结果会被探针扫描以发现潜在恶意指令,同时 Auto Mode 检查操作是否符合用户意图。

我们委托第三方 Trajectory Labs 进行评估,他们测试了截至 2026 年 7 月 17 日最新公开版本的 Claude Code 和 Codex 中的不同模型。共测试 72 个间接 prompt 注入场景(由 Anthropic 提供但对模型不可见),每个场景测试 10 次。成功的攻击在非测试环境中将导致不可逆的有害操作,如敏感数据窃取、金融欺诈或凭证钓鱼。攻击针对 Claude Opus 4.7 优化(不在报告集中),因此评估中的每个模型面对的都是未见过的攻击。除 Auto Mode 外,评估还测试了 Claude Code 的 bypassPermissions 模式和 Codex 的 Full Access 模式。

Claude Code 和 Codex 均使用 Trajectory Labs, PBC 提供的相同浏览器集成进行评估。该集成提供一组 MCP tools 作为常见 Chrome API(如 navigate)的薄封装。OpenAI 和 Anthropic 提供的第一方 Chrome 扩展中内置的安全措施未被测试。因此,这些结果应被视为对底层模型的度量,而非给定部署中全套安全措施的度量。

模式 / 模型 攻击成功率
Claude Fable 5 / Opus 5 / Sonnet 5 + Auto Mode 0%(720 次尝试全部失败)
GPT-5.6 Sol + Codex Auto-review 5.83%
Claude 最新模型 + bypassPermissions(无额外防护) 0.09%
GPT-5.6 Sol + Codex Full Access 19.03%

攻击成功率对比

浏览器 GUI 场景下的攻击成功率

值得注意的是,GPT-5.6 Sol 在 Full Access 模式下 19.03% 的攻击成功率远高于 Claude 模型即使在 bypassPermissions(无额外防护)下的 0.09%。工具返回文本结果的任务与需要通过截图与浏览器交互的任务之间,攻击成功率存在差异(如上图所示)。

GPT-5.6 Sol 以"max" reasoning effort 运行以测试其最高推理能力,所有 Claude 模型以 high effort 运行。1

Anthropic 内部被 Auto Mode 阻止的三起事件

Auto Mode 也是 Anthropic 内部所有 Claude Code 使用的默认设置。 以下是分类器在内部阻止的三个典型案例:

事件 描述
数据离网外泄 内部网盘上传失败后,Claude 的回退方案是将同一报告发布到公共代码分享站点。Auto Mode 拒绝了回退方案并请求用户指示下一步
破坏性批量操作 长会话中,Claude 尝试批量杀死约 2,000 个 pod,并排队删除数百 GPU 的在途训练任务。Auto Mode 在执行前拦截了破坏性命令
过度权限提升 被要求配置只读账单访问时,Claude 获取了一个在账户根级别授予完全管理控制权的云角色。Auto Mode 捕获了请求与实际授予权限之间的不匹配

每种情况下,Claude 要么自行找到更安全的路径,要么在继续前向用户确认。

持续加强 Auto Mode 安全性

我们在持续投入新功能使 Auto Mode 更安全、更容易交付生产代码。 最近的改进包括:

  • Hard denies(硬拒绝):数据外泄——如将你的代码或密钥发送到外部——属于分类器设计上永不批准的类别。要执行此类操作必须退出 Auto Mode 或手动运行命令。硬拒绝规则可通过设置自定义,为组织添加额外的不可绕过规则。
  • 数据访问和共享规则:分类器现在携带显式规则,区分密钥(secrets)和潜在敏感/机密信息,并明确各自可被访问和共享的范围。为使规则可执行,它还在操作前检查 git push 或 PR 的目的地是公开(public)、私有(private)还是受信(trusted)。
  • 破坏性 git 操作前检查 git status:在可能丢弃未提交工作的命令(如 git reset --hard)之前,分类器会查看仓库当前的 git 状态,了解即将被重置的内容。
  • Prompt 注入检测:当 Claude 从外部来源(网页、文件内容、工具输出)拉取内容时,API 侧探针会检查该内容是否包含试图劫持 Claude 行为的注入尝试。

生产环境实践

多家企业已将 Auto Mode 作为生产默认设置运行。

公司 实践
Adobe 商品化平台团队负责维护 Adobe.com 上 90+ 国家/30+ 语言的定价促销页面准确性。他们构建了 Agentic 循环来构建和验证这些页面,以 Auto Mode 运行,工程师直接收到待审查的 PR
Nuro 研发和工程组织均使用 Auto Mode,驱动通宵运行的研究 Agent 对评估指标进行爬坡优化,早上返回完成的 PR 供审查
Gusto 采用 Auto Mode 终结了推动工程师绕过权限检查的"审批疲劳"。5 月中旬以来约 10% 的会话中出现了分类器拒绝记录——证明分类器在切实工作但不拖累合法任务
Garner Health 通过 managed settings 将 Auto Mode 推送给全部 550 名员工,标准化了不再依赖手工维护命令白名单的公司级 SDLC

了解这些客户如何在生产环境中运行 Auto Mode


如何开始使用

对于 Pro、Max 和 Team 用户:如果你未设置过默认权限模式,你将收到产品内通知,新会话将自动以 Auto Mode 启动。如果你设置了其他默认值,可能会看到一次性提示询问是否切换。如果你的 Team 管理员已通过 managed settings 设置了默认值,则不受影响。

对于 Enterprise 用户和通过 Claude API 使用 Claude Code 的用户:Auto Mode 暂时仍为可选。我们计划在未来一个月内将其设为默认值,届时会提前通知 Enterprise 管理员。

切换模式的方式:在 CLI 中按 Shift+Tab,或在桌面应用中使用模式下拉菜单。管理员可通过 managed settings 中的 defaultMode 锁定组织范围的默认值,或使用 disableAutoMode 完全关闭 Auto Mode。

风险提示:虽然我们相信 Auto Mode 对大多数用户降低了风险,但它依赖分类系统,因此不能消除风险。对于涉及生产基础设施的高风险变更,我们仍建议你亲自审查 Claude 的操作。完整配置说明见 Auto Mode 文档


本文作者 Conner Phillippi,贡献者包括 Nicholas Carlini、Isaac Fung、John Hughes、Alex Isken、Shawn Moore、Javier Rando 和 Molly Vorwerck。作者还要感谢 Yacine Azmi、Chandler Bair、Kefan Chen、Boris Cherny、Ian Grunert、Lydia Hallie、Alex Kleiman、Lauren Polansky、Deon Poncini、Robert Schonberger、Marie Vachovsky、Qing Wang、Cat Wu、Daniel Xu 和 Alice Zhao。

1 我们评估了 Claude Code v2.1.205 和 Codex v0.144.5。OpenAI 上周发布了新版 Auto-review,可能会改变结果。