AI 如何改变 Anthropic 的工作方式¶
作者:Saffron Huang, Bryan Seethor, Esin Durmus, Kunal Handa, Miles McCain, Michael Stern, Deep Ganguli
日期:2025-12-02
引言¶
Anthropic 将研究视角转向内部,调查 AI 如何改变自身员工的工作方式。 此前的经济研究关注的是更广泛的劳动力市场,而本研究聚焦于 Anthropic 内部。2025 年 8 月,团队对 132 名工程师和研究员进行了问卷调查,开展了 53 次深度访谈,并分析了内部 Claude Code 的使用数据。
主要发现的变化:工程师产出更多、技能面更广(趋向"全栈")、学习和迭代速度加快,还能处理过去被忽视的任务。但也存在担忧——深层技术能力可能退化、对 Claude 产出的审查能力下降、与同事协作减少、以及职业安全感降低。
作者坦承,在一家 AI 公司研究 AI 影响本身就是一种特殊视角——他们拥有最早的工具访问权、身处稳定的行业、且自身就在推动这场变革。数据收集时,Claude Sonnet 4 和 Claude Opus 4 是最强的可用模型。
另可参考他们关于AI 相关经济政策建议的博客文章。
核心发现¶
问卷调查数据¶
Claude 的使用量和生产力提升在一年内翻了 2-3 倍,但完全可委托的工作仍然很少。
| 指标 | 一年前 | 现在 |
|---|---|---|
| Claude 在日常工作中的使用比例 | 28% | 59% |
| 自我报告的生产力提升 | +20% | +50% |
| 报告生产力提升 >100% 的人 | - | 14% |
其他关键发现:
- 最常见用途:调试和代码理解是使用频率最高的场景(见图1)
- 新增工作量:27% 的 Claude 辅助工作是"原本不会去做"的任务——包括扩展项目、锦上添花的工具(如交互式数据仪表盘)、探索性工作
- 有限的完全委托:多数员工频繁使用 Claude,但报告只能"完全委托"0-20% 的工作
定性访谈¶
工程师正在发展出一套关于何时委托、何时亲力亲为的直觉判断体系。
- 委托直觉逐渐成形:工程师将容易验证、低风险或无聊的任务交给 Claude。"我对任务越兴奋,就越可能不用 Claude。"信任度从简单任务逐步扩展到复杂任务。
- 技能面拓宽但深度存疑:Claude 让人能涉猎更广,但有人担心深层技能退化。"当产出如此容易和快速时,你就越来越难花时间去真正学习一样东西。"
- 工匠精神的变迁:有人拥抱 AI、聚焦成果;有人怀念亲手写代码的过程。
- 社交动态转变:Claude 成了提问的第一站。"我喜欢和人合作,不再那么'需要'他们让我感到难过……更初级的人也不常来问我问题了。"
- 职业不确定性:"短期我很乐观,但长期来看,AI 终将取代一切,让我和很多人变得无关紧要。"
Claude Code 使用趋势¶
六个月间,Claude 处理的任务更复杂、自主性更高,人类干预更少。
| 指标 | 2025年2月 | 2025年8月 | 变化 |
|---|---|---|---|
| 任务复杂度(1-5 分) | 3.2 | 3.8 | +19% |
| 最大连续工具调用次数 | 9.8 | 21.2 | +116% |
| 人类交互轮次 | 6.2 | 4.1 | -33% |
| 代码设计/规划占比 | 1% | 10% | +900% |
| 新功能开发占比 | 14.3% | 36.9% | +158% |
- 修复"小刺":8.6% 的 Claude Code 任务涉及代码重构、维护性改进、快捷操作等日常体验优化
- 人人趋向全栈:不同团队使用 Claude 的方式各异——安全团队分析陌生代码、对齐与安全团队构建前端可视化等(见图5)
问卷调查数据(详细)¶
问卷通过内部沟通渠道发放,覆盖了多元化的团队。 问卷题目已公开。
人们用 Claude 做哪些编码任务?¶
各任务的日常使用率:
| 任务类型 | 日常使用者比例 |
|---|---|
| 调试 | 55% |
| 代码理解 | 42% |
| 新功能开发 | 37% |
| 高级设计/规划 | 较低 |
| 数据科学 | 较低 |
| 前端开发 | 较低 |

图1:各编码任务(纵轴)的日常使用者比例(横轴)。
使用量和生产力¶
自我报告的生产力提升与客观代码指标一致——采用 Claude Code 后,工程师每日合入 PR 数量增长了 67%。
- 12 个月前:28% 的工作使用 Claude,生产力提升 +20%
- 现在:59% 的工作使用 Claude,生产力提升 +50%
- 这与工程组织全面采用 Claude Code 后,每位工程师日均合入 PR 增长 67% 的观察相吻合
- 14% 的受访者报告生产力提升超过 100%("超级用户")
文章引用了 METR 的近期研究,该研究发现有经验的开发者高估了 AI 在熟悉代码库上的生产力提升。不过 METR 指出的因素(AI 在大型/复杂环境中表现较差、需要隐性知识)恰恰对应了 Anthropic 员工表示不会委托的那类任务。

图2:对各任务时间投入(左图)和产出量(右图)的影响。横轴表示自我报告的减少(负值)、增加(正值)或无变化。误差线为 95% 置信区间。圆圈面积与该评分点的回复数成比例。
规律:几乎所有任务类别都出现了"时间净减少、产出量净增加更大"的模式。
有些人在 Claude 辅助任务上反而花了更多时间——因为需要调试/清理 Claude 的代码,或者理解非自己编写的代码带来认知负担。也有人说:"我会坚持做那些以前会立刻放弃的任务。"
Claude 催生的新增工作¶
27% 的 Claude 辅助工作原本不会被完成——从扩展项目到"锦上添花"再到探索性尝试。
用途包括:扩展项目规模、开发"有则更好"的工具、文档、测试、探索性工作。
关于并行探索的比喻:"人们倾向于把超强模型想象成一个单一实例,像是得到了一辆更快的车。但其实更像拥有一百万匹马……"
多少工作能完全委托?¶
超过一半的人表示只能"完全委托"0-20% 的工作。工程师通常与 Claude 主动、迭代地协作,特别是在复杂/高风险领域会仔细验证输出。
定性访谈(详细)¶
共进行了 53 次深度访谈。
AI 委托策略¶
工程师已发展出一套清晰的委托判断框架——核心原则是"验证成本低于创建成本"的任务优先委托。
工程师倾向于委托以下类型的任务:
| 委托条件 | 典型引述 |
|---|---|
| 背景不熟悉但复杂度低 | "我把 Claude 用于自己缺乏上下文、但整体复杂度也低的事情。" |
| 容易验证 | "对于验证成本远低于创建成本的一切事情,它绝对令人惊叹。" |
| 定义明确或自包含 | "如果项目的某个子组件与其余部分充分解耦,我就会让 Claude 先试试。" |
| 代码质量不关键 | "如果是一次性的调试代码或研究代码,直接交给 Claude。" |
| 重复或无聊 | "我对任务越兴奋,就越可能不用 Claude。"(调查显示平均 44% 的 Claude 辅助工作是受访者自己不太想做的任务) |
| 提示比动手更快 | "预计我自己做不到 10 分钟的任务……我大概不会费心用 Claude。" |
这些因素与 METR 外部研究的发现一致。
信任但验证¶
信任是渐进建立的——从简单问题开始,逐步扩展到核心工作。
受访者描述的信任递进过程:"最初我只用 AI 工具问 Rust 编程语言的基础问题……最近,我所有的编码都在用 Claude Code。"
有人用 Google Maps 做类比——先是在不熟悉的路线上使用,逐渐信任到日常通勤也依赖它。
一位安全工程师强调经验的重要性:当 Claude 提出"以危险方式表现得非常聪明"的方案时——"那种一个非常有才华的初级工程师可能会提出的东西"——经验丰富的人才能识别风险。
做法各异:
- 有人在"外围"领域使用 Claude
- 有人偏好在自己熟悉的领域使用(便于验证)
- 有人两者兼用,根据专业程度调整方式
哪些任务人们选择自己做?¶
高层次/战略性思考、需要组织上下文或"品味"的设计决策。一位工程师说:"我通常保留高层次思考和设计。从新功能开发到调试,能委托的我都委托。"
技能变迁¶
新能力涌现¶
Claude 让后端工程师能构建 UI,研究员能制作可视化——角色边界正在模糊。
后端工程师构建 UI、研究员制作可视化成为常态。一位后端工程师:"[设计师们]说'等等,这是你做的?'我说'不,这是 Claude 做的——我只是写了提示。'"
"变得更全栈了……我可以非常胜任地做前端、事务型数据库或 API 代码"
原本"几周的流程"可以变成"几小时的工作会议"。一位高级工程师:"这些工具确实让初级工程师更高效,也更敢于承接那些类型的项目。"
"启动门槛"大幅降低——"极大地降低了我想开始解决一个问题所需的能量。"
动手实践减少¶
核心悖论:有效使用 Claude 需要监督能力,而监督能力恰恰来自可能因委托而退化的编码技能。
关于"技能随委托增多而萎缩"和丢失附带学习的担忧:
"如果你自己去调试一个难题,你会花时间阅读文档和代码——即使它们与当前问题没有直接关系"——这些阅读帮助构建系统心智模型,而现在这种情况越来越少了。
"我以前会探索每个配置项来理解工具的能力,但现在我依赖 AI 告诉我如何使用新工具。"
高级工程师对自己不太担心:"我主要在自己知道答案应该是什么样的情况下使用 AI。"
监督悖论:有效使用 Claude 需要监督,而监督需要的正是可能因委托而退化的编码技能。"比起我个人技能的退化,我更担心监督和审查的问题。"
有些人刻意不用 AI 来练习,保持手感。
我们还需要那些技能吗?¶
历史类比:编程从汇编语言/物理开关演进到高级语言,也许英语正在成为一种"氛围编程"语言。
编程曾从汇编语言/物理开关演进到高级语言。也许英语正在成为一种编程语言——所谓"氛围编程"(vibe coding)。
一位员工将其比作 CS 课程中学习链表——"做那些低级操作在情感上并不特别重要。"
另一位指出抽象是有代价的——大多数工程师在使用高级语言后失去了对内存管理的深入理解。
也有人并不担心:"我不太担心技能退化。AI 仍然让我仔细思考问题。"
还有人挑战了前提本身:"'变生疏'这个框架依赖一个假设——编码终有一天会回到 Claude 3.5 之前的状态。"
工匠精神与软件工程的意义¶
工程师对此态度分裂:有人哀悼一个时代的终结,有人发现自己真正享受的是成果而非过程。
观点分歧明显:
- 失落感:"对我来说这是一个时代的终结——我已经编程 25 年了。"
- "整天提示 Claude 并不有趣或有成就感。"
- 接受取舍:"[写代码]确实有些部分我怀念——重构代码时进入禅定心流的状态。"
- 成果导向:"我以为我真的很享受写代码,但我想我其实享受的是写代码带来的东西。"
社交动态变化¶
Claude 成了提问第一站,这既减少了对团队的依赖,也削弱了师徒关系和协作纽带。
Claude 如今是提问的第一站:"我现在总体上问的问题多了很多,但大概 80-90% 都是问 Claude。"
这形成了过滤机制:"它减少了我对[团队]80% 的依赖,[但]最后 20% 至关重要,我会去找他们。"
约一半受访者表示协作未变。另一些人:"我和 Claude 合作的时间远超和任何同事。"
有人欣赏社交摩擦减少;也有人抵触:"我其实不喜欢常见的回应是'你问过 Claude 了吗?'"
对导师制的影响:"Claude 可以为初级员工提供大量辅导。" 一位高级工程师:"让我难过的是,更初级的人不常来问我问题了。"
职业不确定性与适应¶
角色正从"写代码的人"转变为"管理 AI 代理的人"——一位工程师估计 70% 以上的时间已变成代码审查/修订。
角色正从写代码转向管理 AI——成为"AI 代理的管理者","手头始终有几个 [Claude] 实例在运行。"
一位工程师估计"70% 以上的时间已变成代码审查/修订者,而非从零编写代码。"
职业不确定性普遍存在——"很难说"几年后职业会是什么样。"感觉像是每天上班都在让自己被淘汰。"
也有更乐观的声音:"我为初级开发者担心,但我也认可初级开发者可能是对新技术最渴望的群体。"
适应策略:
- 进一步专业化
- 聚焦人际/战略性工作
- 使用 Claude 本身来规划职业发展
- "没人知道会发生什么……重要的是保持高度适应力。"
Claude Code 使用趋势(详细)¶
团队使用隐私保护分析工具分析了 2025 年 2 月和 8 月的 200,000 条内部对话记录。
以更少的监督处理更难的问题¶
- 任务复杂度:从 3.2 升至 3.8(1-5 分制)。举例:3.2 = "排查 Python 模块导入错误";3.8 = "实现和优化缓存系统"
- 最大连续工具调用:增长 116%,从 9.8 次升至 21.2 次/对话
- 人类轮次:减少 33%,从 6.2 次降至 4.1 次/对话

图3:2025年8月与2月 Claude Code 使用对比。平均任务复杂度提升(左)、平均最大连续工具调用次数增加(中)、人类轮次减少(右)。误差线为 95% 置信区间。数据表明人们正在将越来越多的自主权委托给 Claude。
任务分布变化¶

图4:各编码任务(纵轴)占总记录数的百分比(横轴)。比较 6 个月前(粉色)与当前(紫色)。纵轴按 2025 年 2 月频率排序。
最显著的变化:新功能开发(14.3% -> 36.9%)和代码设计/规划(1.0% -> 9.9%)。
修复"小刺"¶
8.6% 的 Claude Code 任务被归类为"小刺修复"——性能可视化工具、提升代码可维护性的重构、终端快捷方式等。
不同团队的任务差异¶

图5:每个横条代表一个团队(纵轴),色块表示该团队 Claude Code 使用中各编码任务的占比(横轴),按任务类型着色。顶部"所有团队"为整体分布。
各团队的特色用法:
| 团队 | 特色使用 |
|---|---|
| 预训练 | 54.6% 用于构建新功能(运行更多实验) |
| 对齐与安全 / 后训练 | 前端开发占比最高(7.5% 和 7.4%),用于数据可视化 |
| 安全 | 48.9% 用于代码理解,分析安全影响 |
| 非技术员工 | 51.5% 用于调试(网络问题、Git),12.7% 用于数据科学 |
展望¶
Anthropic 正在多个维度推进应对:从内部实践到外部教育生态的系统性准备。
正在采取的措施:
- 与工程师、研究员、管理层讨论机遇与挑战
- 审视协作、职业发展、最佳实践(参考 AI 流畅度框架)
- 将研究扩展到工程师以外的群体
- 支持 CodePath 等外部组织调整计算机科学课程
- 考虑结构性方案:角色演进新路径、技能再培训
- 预计 2026 年推出更具体的计划
附录:研究局限性¶
| 局限 | 说明 |
|---|---|
| 抽样方式 | 便利抽样与目的抽样结合。内部 Slack 发布(68 份回复)+ 直接联系 20 个团队(n=207,31% 回复率中的 64 份)。访谈前 53 名回复者 |
| 选择偏差 | 活跃的 Claude 用户或持有强烈意见(正面/负面)的人更可能回复 |
| 社会期望偏差 | 非匿名调查来自 Anthropic 员工,可能高估正面评价 |
| 近因偏差 | 回忆 12 个月前模式可能受记忆扭曲影响 |
| 生产力衡量 | 自我报告数据应谨慎看待 |
| Claude Code 分析 | 按比例抽样仅能衡量相对变化,非绝对工作量。如 14%->37% 的功能开发不一定意味着更多总开发量 |
| 时间局限 | 研究于 2025 年 8 月进行,使用 Claude Sonnet 4 和 Opus 4;更新模型发布后模式可能已变 |
引用¶
@online{huang2025aiwork,
author = {Saffron Huang and Bryan Seethor and Esin Durmus and Kunal Handa and Miles McCain and Michael Stern and Deep Ganguli},
title = {How AI Is Transforming Work at Anthropic},
date = {2025-12-02},
year = {2025},
url = {https://anthropic.com/research/how-ai-is-transforming-work-at-anthropic/},
}
致谢¶
- Saffron Huang 主导项目,设计/执行调查、访谈、数据分析,绘制图表,撰写博客
- Bryan Seethor 联合设计调查/访谈,联合主导数据收集,分析访谈主题,参与撰写,管理时间线
- Esin Durmus 参与实验设计,提供方向和反馈
- Kunal Handa 贡献访谈流程基础设施
- Deep Ganguli 提供指导和组织支持
- 所有作者提供了指导和反馈
额外致谢:Ruth Appel, Sally Aldous, Avital Balwit, Drew Bent, Zoe Blumenfeld, Miriam Chaum, Jack Clark, Jake Eaton, Sarah Heck, Kamya Jagadish, Jen Martinez, Peter McCrory, Jared Mueller, Christopher Nulty, Sasha de Marigny, Sarah Pollack, Hannah Pritchett, Stuart Ritchie, David Saunders, Alex Tamkin, Janel Thamkul, Sar Warner, Heather Whitney. Casey Yamaguma 绘制图表. 评审意见来自 Anton Korinek, Ioana Marinescu, Silvana Tenreyro, Neil Thompson.