Agentic 编程与专业知识的持续回报¶
原文发布于 2026 年 6 月 16 日,作者 Zoe Hitzig, Maxim Massenkoff, Eva Lyubich, Shaoyi Zhang, Ryan Heller, Peter McCrory
核心发现¶
| 发现 | 要点 |
|---|---|
| 研究框架 | 基于 ~40 万次 Claude Code 会话(2025.10 - 2026.4)的隐私保护分析,评估任务构成、人机协作与成功率 |
| 人机分工 | 人做大部分规划决策(做什么),Claude 做大部分执行决策(怎么做)。用户专业水平越高,Claude 每条指令完成的工作越多。各主要职业在编码任务上的成功率接近软件工程师 |
| 专业知识的回报 | 领域专业知识越强,会话成功率越高——但中级与专家之间差距不大。七个月内,调试占比下降近一半,使用方式转向更端到端的 Agent 用法:部署运行代码、数据分析、撰写非代码文档 |
| 任务价值增长 | 七个月内,几乎所有类型的工作任务价值都在增长——平均约 25%(通过与自由职业岗位比较估算) |
引言¶
Agent 编程正在快速普及,而 Claude Code 已成为日均 20 小时的重度生产力工具。 自 2025 年底以来,GitHub 上有编码 Agent 活动的项目占比已翻倍以上,Claude Code 用户现在平均每周使用该工具 20 小时。本报告基于 2025 年 10 月至 2026 年 4 月间约 23.5 万人的 ~40 万次交互会话的隐私保护分析,提供了 Claude Code 实际使用情况的证据。
本报告建立在此前关于 Claude Code 会话中自主性度量以及AI 如何改变 Anthropic 内部工作方式的研究基础上,提出了一个描述交互式 AI 编码助手使用的框架:正在完成什么类型的工作、谁在做这些工作、以及是否成功。研究范围覆盖通过命令行界面(CLI)、Claude.ai 或 Claude Code 桌面应用使用 Claude Code 的场景。
核心发现表明,Claude 正在处理越来越复杂、越来越有价值的任务。人机之间存在清晰的分工:
"人决定构建什么,Agent 决定如何构建。"
领域专业知识(而非编程能力)才是放大工具有效使用的关键。领域专家成功率更高,也更容易从错误和误解中恢复。但专家与中级用户之间的差距不大——在某个领域具备足够的能力,就能几乎和深度专家一样有效地使用工具。
"编码 Agent 并没有替代领域专业知识——用户带给 Agent 的理解越深,Agent 能完成的高质量工作就越多。"
人机分工¶
人们用 Claude Code 做什么¶
每个会话被归类为九种工作模式之一,约 56% 涉及直接编写或维护代码。 每个会话会被分类为最能描述其目标的单一活动模式。
四种模式涉及直接编写或维护代码:
| 模式 | 说明 |
|---|---|
| Building(构建) | 创建新事物 |
| Fixing(修复) | 修复已有问题 |
| Testing(测试) | 测试代码 |
| Orchestrating(编排) | 编排其他 Agent 或自动化流水线 |
其他五种模式:
| 模式 | 说明 |
|---|---|
| Operating(运维) | 部署、配置、运行流水线、监控系统 |
| Understanding(理解) | 研究现有系统的工作原理 |
| Planning(规划) | 在修改之前先做规划 |
| Analyzing(分析) | 数据分析 |
| Communicating(沟通) | 演示文稿和其他文字文档 |
具体占比:编写代码(25%)、修复问题(26%)、测试与编排(5%),合计约 56%。运维占 17%,规划或探索占 14%,分析或文字占 13%。

图 1:九种工作模式。每个交互会话被归类为最能描述其目标的单一模式。
会话分类方式是让模型阅读对话记录,然后与自动记录的遥测数据交叉验证。两个来源高度一致——分类器标记为创建或修改代码的会话中,超过 90% 在遥测数据中确实显示了代码变更。
谁做什么决策¶
人负责 70% 的规划决策,Claude 负责 80% 的执行决策——清晰的人机分工。 在 METR 时间跨度评估等基准测试中,前沿模型现在可以自主完成需要数小时的软件任务。研究从两个角度考察:人们在多大程度上将决策委托给 Claude,以及人们给 Claude 多少操作空间。
一个隐私保护的决策归因分类器列出会话中所有有意义的决策,将其分为:
| 决策类型 | 内容 |
|---|---|
| 规划决策 | 做什么、采用什么方法、什么算完成 |
| 执行决策 | 修改哪些文件、写什么代码、用什么语言、运行什么命令 |
平均而言,人做出约 70% 的规划决策,但只做约 20% 的执行决策。
"在实践中,Agentic 编程中存在清晰的人机分工。"
在典型会话中约有四轮对话。每条 prompt 平均触发 Claude 约 10 个操作——有时超过 100 个。在每轮中,Claude 读取文件、编辑代码、运行命令,平均输出约 2,400 个词。
当用户保持对执行的控制(做出超过 80% 的执行决策)时,Claude 每轮约执行 8 个操作。当 Claude 掌控规划(做出超过 80% 的规划决策)时,每轮操作数最多(约 16 个)。

图 2:Claude 在规划和执行决策中的占比分布。典型会话中,用户做出约 70% 的规划决策,而 Claude 做出约 80% 的执行决策。
专业水平¶
专业知识是按任务评定的——资深工程师问第一个 Rust 问题时就是 Rust 新手。 Claude 对用户在任务中表现出的专业水平进行五级评分(从新手到专家)。专业水平分类器关注三个信号:用户描述方向的精确程度、用户要求 Claude 验证什么、以及倾向于是用户纠正 Claude 还是 Claude 纠正用户。
专业水平是任务相关的。一个从未使用过 Python 的会计师,如果能精确告诉 Claude 脚本必须执行哪些对账规则并发现边缘情况,在该任务上就是专家。

表 1:专业水平分类器示例。这些示例对真实会话进行了释义、匿名化和精简。许多会话来自公开的 Agentic 编码会话数据集 SWE-chat。
专家获得的 Agent 工作量远超新手: 在典型的新手会话中,每条 prompt 触发约 5 个 Claude 操作和约 600 词输出。专家会话触发的操作链长度是新手的两倍以上(12 个操作),输出量是五倍(3,200 词)。这个差距存在于每种工作模式和每个任务价值区间中。

图 3:Claude 为更专业的用户产出更多操作(左列)和文字输出(右列)。箱体跨越四分位距(以中位数分割),须线代表第 5 到第 95 百分位。白点为几何均值。两个上升趋势均具有统计显著性(p < 0.001)。在控制工作模式、任务价值、月份、职业和模型系列的回归中,每提升一个专业水平等级,操作量增加 +9%,输出量增加 +13%。
谁在使用 Claude Code,用来做什么¶
用户群体¶
软件工程师是最大群体,但管理、销售和法律等非技术职业增长最快。 每位用户的职业通过会话内容推断,映射到美国劳工统计局标准职业分类(SOC)中的 23 个主要类别之一。分类器依赖项目上下文、文件名和结构、引用的制品、所用术语等信号。分类器被明确指示不能将编程行为本身视为编程职业的证据。
例如,一个律师构建脚本来标记缺失条款的会话,会被归入"法律职业",即使工作主要是软件开发。
在约 70% 的会话中可以推断出职业。"计算机和数学职业"是最大群体,其次是"商业和金融运营"、"艺术、设计和媒体"、"管理"以及"生命、物理和社会科学"。增长最快的非软件职业群体是管理、销售和法律。
工作内容的变化¶
七个月内,调试占比从 33% 降至 19%,运维和数据分析翻倍——Agent 用法日趋端到端。 2025 年 10 月至 2026 年 4 月间,工作构成发生了显著变化:
| 指标 | 变化 |
|---|---|
| 修复代码占比 | 从 33% 降至 19% |
| 运维软件占比 | 从 14% 升至 21% |
| 写作和数据分析占比 | 从约 10% 升至约 20% |
| 平均会话价值 | 增长 27% |
| 构建类任务价值 | 增长约 43% |
| 运维类任务价值 | 增长约 34% |
| 修复类任务价值 | 增长约 32% |

图 4:Claude Code 工作的构成与价值变化,2025 年 10 月至 2026 年 4 月。修复代码的会话占比从 33% 降至 19%,而运维软件、数据分析和文档撰写持续增长。
成功取决于用户带来什么¶
研究使用两个互补的成功衡量标准——"判定成功"和"验证成功"。 两种基于对话记录的成功度量方式:
| 度量方式 | 定义 |
|---|---|
| 判定成功(Judged success) | 分类器阅读完整对话记录,判断用户是否成功(选项:成功、部分成功、失败、无明确目标) |
| 验证成功(Verified success) | 要求会话既被判定为成功,又至少有一个硬性可验证的成功信号(匹配工作的 git commit/PR、通过的测试套件、用户明确肯定) |
同时还有一个平行的失败信号,评分事情出错的证据——错误、测试失败、重试、用户反驳。被分类为"无明确目标"的会话(约 7.7%)被排除在分析之外。

表 2:由分类器推导的成功和失败定义。示例对 SWE-chat 公开数据集中的真实会话进行了释义和总结。
专业知识的回报¶
新手到中级是最大的跃升——中级与专家之间差距很小,"够用的领域理解就能获得大部分收益"。 具体数据如下:
| 专业水平 | 验证成功率 | 至少部分成功率 |
|---|---|---|
| 新手 | 15% | 77% |
| 中级及以上 | 28-33% | 91-92% |
大部分收益来自从新手到中级的跃升;中级到专家之间,斜率明显放缓。
在遇到困难的会话中,验证成功率从新手的 4% 升至专家的 15%(控制了工作模式、任务价值区间、月份、任务主题和职业类型)。至少部分成功率在新手为 60%,在中级到专家为 80-81%。
新手评级会话中有 19% 最终被放弃(判定失败且代码行数为零),而其他所有水平仅为 5-7%。
"专业知识的部分价值在于能将 Agent 引导到正确方向。"

图 5:专业水平与会话结果。左侧面板包含所有会话。中间和右侧面板限定为遇到困难的会话(失败信号 > 3),显示仍以各种定义的成功和失败结束的比例。每个点是调整后的比率——通过仅比较具有相同工作模式、任务价值区间、月份、任务主题和相同类型用户(软件相关职业与否)的会话来估计专业水平之间的差异。
职业可能不如专业水平重要¶
所有主要职业在编码任务上的成功率都在软件工程师的 7 个百分点以内。 软件相关职业的用户在约 30% 的会话中达到验证成功,而其他职业的用户约 26%。在产生代码的会话中(添加或修改至少一行),这两个数字分别为 34% 和 29%。
在更宽松的成功定义下,两组在产生代码的会话中分别达到 89% 和 88% 的至少部分成功率。这 5 个百分点的差距很小,且在七个月内既没有扩大也没有缩小。十大职业中的每一个都在软件工程师的 7 个百分点以内。管理类职业在验证成功率上最高,略高于软件工程职业。

图 6:各职业在编码会话中的验证成功率和判定成功率。显示添加或修改至少一行代码的会话中,各推断职业群体达到严格成功定义的比例(十大群体)。每个群体都在软件/数学用户的 7 个百分点以内。
展望未来¶
编码 Agent 正在让编程背景变得不那么重要,而领域专业知识始终是关键。
"在产生代码的会话中,每个主要职业的成功率都在软件相关职业的几个百分点以内。"
编码 Agent 似乎正在让编程背景对成功的软件开发变得不那么关键。
专家评级的会话达到验证成功的频率是新手的两倍多。当会话遇到困难时,新手的放弃率是其他人的数倍。领域专家用每条指令让 Claude 完成更多工作。
"引导 Claude 走向成功的能力,更多来自对领域的掌握,而非编写代码的能力。"
收益主要来自具备能力,而非精通——
"对领域的工作级理解就能捕获大部分收益,深度专业化只在此基础上增加少量额外收益。"
研究局限性:
| 局限 | 说明 |
|---|---|
| 无法衡量真实世界结果 | 不知道代码是否实际被使用或丢弃 |
| 排除了非交互式使用 | 占总活动的相当大比例 |
| 分类依赖模型判断 | 所有分类都依赖模型对对话记录的理解 |
| 会话可能过于复杂 | 人工标注可能无法作为可靠的基准真相 |
未来值得关注的信号: 如果专业知识的回报开始下降,这将表明模型正在开始提供用户当前所带来的关键判断力。如果非软件用户成功完成编码会话的比例持续增长,则可能意味着软件生产正在成为各领域日常工作的一部分。
引用¶
@online{hitzig2026agentic,
author = {Zoe Hitzig and Maxim Massenkoff and Eva Lyubich and Shaoyi Zhang and Ryan Heller and Peter McCrory},
title = {Agentic coding and persistent returns to expertise},
date = {2026-06-16},
year = {2026},
url = {https://www.anthropic.com/research/claude-code-expertise},
}
致谢¶
Jake Eaton, Sarah Pollack, Hanah Ho, Szymon Sacher, Anton Korinek, Santi Ruiz, Kerry Persen, Ankur Rathi, Alex Tamkin, Heather Whitney, Cat Wu, Kacie Jenkins, Jennifer Martinez, Amie Rotherham, Boris Cherny, Eleanor Dorfman, Miles McCain, Jack Clark.