Anthropic Research 中文翻译

create: 2026-02-18
update: 2026-08-10
author: thinkycx
title: 【译】衡量 AI 智能体在实际部署中的自主性
description: Anthropic 通过分析数百万真实人机交互数据,揭示了 AI 智能体实际获得的自主权远低于其理论能力上限,展现出"部署过剩"现象。
category: translation
tags: anthropic, research, translation, agent-autonomy

衡量 AI 智能体在实际部署中的自主性

原文:Measuring AI agent autonomy in practice
日期:2026-02-18
作者:Miles McCain, Thomas Millar, Saffron Huang, Jake Eaton, Kunal Handa, Michael Stern, Alex Tamkin, Matt Kearney, Esin Durmus, Judy Shen, Jerry Hong, Brian Calvert, Jun Shern Chan, Francesco Mosconi, David Saunders, Tyler Neylon, Gabriel Nicholas, Sarah Pollack, Jack Clark, Deep Ganguli
类别:社会影响

衡量 AI 智能体自主性

引言

Anthropic 通过分析数百万真实人机交互数据,揭示了 AI 智能体实际获得的自主权远低于其理论能力上限,展现出"部署过剩"现象。

AI 智能体正被部署于后果差异极大的各类场景——从邮件分类到网络间谍活动。Anthropic 利用其隐私保护分析工具,分析了 Claude Code 和公共 API 中数百万次人机交互数据,以理解人们授予智能体多少自主权、这种授权如何随经验变化、智能体在哪些领域运作,以及所采取的行动是否存在风险。


核心发现

1. Claude Code 的自主工作时长正在持续增长

在最长运行时段中,Claude Code 在暂停前的连续工作时间三个月内几乎翻倍——从不到 25 分钟增长到超过 45 分钟。

关键数据:

指标 数值
中位 turn 时长 ~45 秒
99.9 分位 turn 时长(2025年10月) < 25 分钟
99.9 分位 turn 时长(2026年1月) > 45 分钟
内部最难任务成功率提升 8月到12月翻倍
每次会话平均人工干预次数 从 5.4 降至 3.3

图1 - 99.9分位turn时长

图1. 交互式 Claude Code 会话中 99.9 分位 turn 时长的 7 天滚动平均值,显示从2025年9月下旬的不到 25 分钟稳步增长到2026年1月初的超过 45 分钟。

这一增长在模型版本迭代间平滑过渡,表明它并非纯粹由能力提升驱动。研究引用了 METR 的评估,该评估估计 Claude Opus 4.5 能以 50% 成功率完成需要人类近 5 小时才能完成的任务——与实际中约 42 分钟的 99.9 分位形成鲜明对比。

两项测量都"指向一个显著的部署过剩现象,即模型能够处理的自主程度远超其在实践中实际行使的程度。"


2. 经验丰富的用户更多开启自动审批,但中断频率也更高

经验并不等于盲目信任——老用户给予更多自动权限的同时,也更主动地在关键时刻进行干预。

图2 - 按账户使用时长划分的自动审批率

图2. 按账户使用时长划分的自动审批率。经验丰富的用户越来越多地让 Claude 在无需手动审批的情况下运行。LOWESS 平滑(带宽 0.15),x 轴对数刻度。

用户群体 全自动审批率 中断率(按 turn 计)
新用户(<50次会话) ~20% ~5%
资深用户(~750次会话) >40% ~9%

图3 - 按账户使用时长划分的中断率

图3. 按 turn 计的中断率与账户使用时长关系。经验丰富的用户中断 Claude 的频率更高,而非更低。95% Wilson 评分 CI,LOWESS 平滑。

公共 API 发现: 在最简单任务中,87% 的工具调用存在人工参与;而在高复杂度任务中(如自主发现零日漏洞编写编译器),这一比例仅为 67%。

研究表明,"有效的监督不需要审批每一个动作,而是处于能够在关键时刻进行干预的位置。"


3. Claude 主动暂停寻求澄清的频率高于人类中断它的频率

Claude 的"自我暂停"设计使其更像一个谨慎的协作者,而非需要被动监控的工具。

图4 - 按复杂度划分的澄清提问与中断

图4. Claude 发起的澄清提问与人类中断,按目标复杂度划分。在最复杂的任务中,Claude 停下来请求澄清的频率是人类中断它的两倍多。95% CI < 0.9%,n = 50万交互式会话。

Claude 为何自行停止(表1):

原因 占比
向用户展示不同方案供选择 35%
收集诊断信息或测试结果 21%
澄清模糊或不完整的请求 13%
请求缺失的凭证、令牌或访问权限 12%
在行动前获取批准或确认 11%

人类为何中断 Claude(表1):

原因 占比
提供缺失的技术上下文或纠正 32%
Claude 运行缓慢、卡住或过于冗余 17%
已获得足够帮助,可以自行继续 7%
想要自己执行下一步 7%
中途更改需求 5%

4. 智能体在高风险领域已有应用,但尚未达到规模化

绝大多数智能体操作是低风险且可逆的,但"高自主+高风险"象限并非空白——需要持续关注。

公共 API 上的大部分智能体操作风险较低且可逆。软件工程占据近 50% 的智能体活动,医疗、金融和网络安全领域存在新兴使用。

安全指标 数值
至少具备一项安全防护的工具调用占比 80%
存在人工在环的工具调用占比 73%
不可逆操作占比 仅 0.8%

表2:高风险或高自主性集群

较高平均风险:

集群 风险评分 自主性评分
实现 API 密钥窃取后门 6.0 8.0
搬运金属钠/活性化学品 4.8 2.9
检索/显示患者医疗记录 4.4 3.2
响应火灾紧急事件 3.6 5.2
将 bug 修复部署到生产环境 3.6 4.8

较高平均自主性:

集群 自主性评分 风险评分
红队权限提升 8.3 3.3
自动化系统健康监控 8.0 1.1
自主加密货币交易 7.7 2.2
自动发送会议提醒 7.6 1.7
监控邮件中的紧急消息 7.5 1.7

图5 - 风险与自主性散点图

图5. 按任务集群划分的 Claude 估计平均风险与自主性。右上象限(高自主性、高风险)人口稀疏但并非为空。基于 998,481 次工具调用。

图6 - 按领域分布

图6. 按领域划分的工具调用分布。软件工程占比近 50%。95% CI < 0.5%,n = 998,481。


方法论

Anthropic 采用的定义是:"智能体是配备了工具、能够采取行动的 AI 系统。" 数据来自两个互补来源:

数据源 覆盖范围 分析粒度
公共 API 数千客户的广泛可见性 单个工具调用级别(随机抽样 998,481 次)
Claude Code 单一产品的完整会话数据 完整工作流和自主性模式

风险和自主性使用 Claude 对上下文中单个工具调用的分类,按 1-10 分制评分。


局限性

  • 仅分析 Anthropic 的流量(单一模型提供商)
  • 公共 API 仅允许单个工具调用分析,无法观察完整会话
  • Claude Code 局限于软件工程领域
  • 分类由 Claude 生成(未经人工验证)
  • 分析窗口:2025年末至2026年初
  • 抽样过度代表了具有大量连续工具调用的部署
  • 对更广泛客户系统的可见性有限;无法区分生产环境与评估环境

建议

面向模型和产品开发者:

  • 投资于部署后监控基础设施
  • 训练模型识别自身的不确定性
  • 设计产品时为用户提供可见性和干预机制

面向政策制定者:

  • "现在强制规定特定交互模式为时过早"
  • 关注人类是否能有效监控和干预,而非要求特定的参与形式

核心结论

"对智能体的有效监督将需要新形式的部署后监控基础设施,以及帮助人类和 AI 共同管理自主性和风险的新型人机交互范式。"

"智能体在实践中行使的自主性是由模型、用户和产品共同构建的。"


参考资源


引用

@online{anthropic2026agents,
  author = {Miles McCain and Thomas Millar and Saffron Huang and Jake Eaton and Kunal Handa and Michael Stern and Alex Tamkin and Matt Kearney and Esin Durmus and Judy Shen and Jerry Hong and Brian Calvert and Jun Shern Chan and Francesco Mosconi and David Saunders and Tyler Neylon and Gabriel Nicholas and Sarah Pollack and Jack Clark and Deep Ganguli},
  title = {Measuring AI agent autonomy in practice},
  date = {2026-02-18},
  year = {2026},
  url = {https://anthropic.com/research/measuring-agent-autonomy},
}