通过 Claude 对话数据估算 AI 生产力收益¶
发布时间:2025年11月25日

概述¶
本研究通过分析十万条真实对话数据,量化了 Claude 在实际使用中的生产力提升效果。
研究者使用 Anthropic 的隐私保护分析方法,从 Claude.ai 中抽样了十万条真实对话,估算了有无 AI 辅助两种情况下的任务完成时间,并研究了其对整体经济的生产力影响。根据 Claude 的估算,这些任务在没有 AI 辅助的情况下平均需要约 90 分钟完成,而 Claude 将单项任务的完成时间缩短了约 80%。
将这些估算外推至宏观层面,当前这一代 AI 模型在未来十年内有望将美国劳动生产率的年增长率提升 1.8%——大约是近年实际增速的两倍。但这并非对未来的预测,因为它既没有考虑实际采用率,也没有考虑未来更强大的 AI 系统可能带来的额外效果。
这项分析存在局限性。最突出的一点是:它无法计入用户在对话之外花费的额外时间,例如验证 Claude 输出的质量和准确性。

核心结论¶
| 维度 | 关键发现 |
|---|---|
| 任务时间节省 | 十万条真实对话显示,AI 将任务完成时间缩短了 80%。用户通常用 AI 处理复杂任务,平均原需 1.4 小时完成 |
| 经济价值 | 将任务匹配到 O*NET 职业分类和 BLS 工资数据后,这些任务的人工成本约为 $55 |
| 跨职业差异 | 用户使用 Claude 处理法律和管理类任务(原需近 2 小时),也用于食品准备类任务(原需仅 30 分钟)。医疗辅助任务时间缩短 90%,硬件问题仅缩短 56% |
| 宏观影响 | 当前一代 AI 模型未来十年内可将美国劳动生产率年增长率提升 1.8%,将 2019 年以来的增速翻倍,处于近期估算的上限区间 |
| 瓶颈效应 | AI 大幅加速部分任务的同时,同一职业群体内的其他任务可能成为新的瓶颈 |
这构成了理解 AI 经济影响的新视角,将作为 Economic Index 的一部分持续追踪。
引言¶
现有的经济指数只能衡量 AI 使用的广度,本研究试图量化其深度。
作为 Anthropic Economic Index 的一部分,Anthropic 已经记录了人们如何在不同任务、行业和地区使用 Claude——捕捉了使用的广度,但缺乏深度。当前的经济指数无法区分任务内部的差异——无法分辨一份耗时五分钟的报告和一份耗时五天的报告。
多个团队已经开始通过随机对照试验来测量特定领域的生产力提升,涵盖:
| 研究领域 | 参考文献 |
|---|---|
| 软件工程 | Peng et al. 2023, Cui et al. 2024, METR 2025 |
| 写作 | Noy & Zhang 2023 |
| 客户服务 | Brynjolfsson et al. 2023 |
METR 关于衡量 AI 完成长任务能力的工作表明,AI 系统可以独立处理多步骤的复杂挑战。
本报告让 Claude 估算:人类独立完成某项任务需要多长时间,与人类和 Claude 协作完成对比,从而计算时间节省量。
任务时长与时间节省的估算方法¶
研究分析了十万条对话,为每项任务生成"有 AI"和"无 AI"两种时间估算。
使用隐私保护分析系统,研究者分析了来自 Claude.ai(Free、Pro 和 Max 层级)的 100,000 条对话记录。对每项任务生成两个核心估算:
- 无 AI 时间估算:人类专业人士在没有 AI 辅助的情况下完成该任务所需的小时数
- 有 AI 时间估算:在 AI 辅助下实际完成任务所花费的时间
按照 Economic Index 方法论,通过取每项任务时间估算的中位数,将单条对话聚合为 O*NET 分类体系中的任务。
验证¶
Claude 的时间估算虽不完美,但展现出较高的自洽性,并在外部基准上接近人类水平。
估算任务时长对人类来说本就困难。对 AI 模型而言更难,因为缺乏关键上下文——不过随着记忆功能和外部集成等特性的完善,这一情况预计会逐步改善。

自洽性测试:创建了多种 prompt 变体(如"具备相应技能的员工"vs"熟练的专业人士")来评估对措辞的敏感性。对 1,800 条对话的分析显示了很强的自洽性,对数尺度相关系数 r=0.89-0.93。

外部基准对比:使用一个包含数千个真实软件开发任务的数据集(来自开源仓库的 JIRA 工单,含开发者估算和实际追踪完成时间)测试了 Claude 的时间估算能力。
在 1000 个任务的子集上:
| 评估者 | Spearman 相关系数 (ρ) | 对数 Pearson 相关系数 (r_log) |
|---|---|---|
| 人类开发者 | 0.50 | 0.67 |
| Claude Sonnet 4.5 | 0.44 | 0.46 |
| Claude Sonnet 4.5(含 10 个示例) | 0.39 | 0.48 |
Claude 的估算比人类更加"压缩"——对短任务倾向于高估,对长任务倾向于低估——且整体偏向过度估算。Claude Sonnet 4.5 的相关性高于 Claude Sonnet 4。
研究结果¶
任务层面的时间节省¶
不同任务的时间节省从 20% 到 95% 不等,差异巨大。
Claude 对每项任务估算了:无 AI 时的任务时长、对应职业的平均时薪、隐含任务成本,以及时间节省比例。任务时长通过让 Claude 预测专业人士在无 AI 辅助情况下的完成时间获得。时薪数据来自职业就业与工资统计(OEWS)2024 年 5 月数据。任务成本 = 任务时长 × 时薪。时间节省 = 1 - 有AI时间 / 无AI时间。

典型任务的时间节省示例¶
| 任务类型 | 无 AI 时长 | 有 AI 时长 | 隐含人工成本 | 时间节省 |
|---|---|---|---|---|
| 课程开发 | 4.5 小时 | 11 分钟 | $115(基于教师平均时薪) | ~96% |
| 撰写发票、备忘录等文件 | - | - | - | 87% |
| 金融分析(解读财务数据) | - | - | $31 | 80% |
不同职业间的任务时长差异显著¶

| 职业类别 | 估算时长 | 估算成本 |
|---|---|---|
| 管理类(如投资选择) | 2.0 小时 | $133 |
| 法律类 | 1.8 小时 | $119 |
| 教育类 | 1.7 小时 | - |
| 艺术/媒体类 | 1.6 小时 | - |
| 计算机和数学类 | - | $82 |
| 商业和金融类 | - | $69 |
| 食品准备类 | 0.3-0.5 小时 | $8 |
| 安装/维护类 | 0.3-0.5 小时 | - |
| 运输类 | 0.3-0.5 小时 | - |
所有任务中位数:每次对话价值 $54。

职业类别的平均时薪与 Claude 估算的平均任务时长之间相关性很强(r=0.8)。
时间节省在不同职业间分布极不均匀¶

中位对话的时间节省估算为 84%,但各任务和类别之间差异显著:
| 任务类型 | 时间节省 |
|---|---|
| 从报告中汇编信息 | ~95% |
| 分布高峰区间 | 80-90% |
| 大部分任务集中区间 | 50-95% |
| 检查诊断影像 | 仅 20% |
过去的随机对照试验通常发现更小的时间节省:
| 研究 | 时间节省 |
|---|---|
| Peng et al. 2023 | 56% |
| Noy & Zhang 2023 | 40% |
| Cui et al. 2024 | 26% |
| Brynjolfsson et al. 2023 | 14% |
| METR 2025 | 负值 |
从任务层面的效率提升到经济整体的生产力效应¶
方法论¶
使用 Hulten 定理将微观任务层面的效率提升聚合为宏观经济影响。

本研究采用 Hulten 定理——一种将任务层面效率收益聚合到美国整体经济的标准方法。参照 Acemoglu (2024) 的"基线"方法,将劳动生产率的隐含增长建模为任务级生产力收益的加权平均。
具体步骤:
-
任务构成:获取 O*NET 中每个职业的工作任务。由 Claude 估算工人在每项任务上花费的时间比例。例如:程序员 23% 的时间用于编写和维护代码,15% 用于分析和重写程序,其余分布在测试、文档和会议等。
-
任务级生产力改进:通过无 AI 时间与有 AI 时间的对数差异计算生产力改进值。样本中未观察到的任务保守地赋值为零改进。
-
经济整体估算:每项任务的隐含生产力收益按两个权重加权:(i) 该职业在该任务上花费的时间比例,(ii) 该职业在美国总工资总额中的占比。使用 2024 年 5 月 OEWS 数据计算总工资。
研究发现¶
假设十年内全面采用当前模型,美国劳动生产率年增长率可提升 1.8%。

这将几乎使当前的长期增速翻倍(1947 年以来年均 2.1%,2019 年以来年均 1.8%)。假设劳动在全要素生产率中的份额为 0.64,这意味着 TFP 每年增长 1.1%。
对总劳动生产率增长贡献最大的职业:
| 职业 | 贡献占比 |
|---|---|
| 软件开发人员 | 19% |
| 综合运营经理 | ~6% |
| 市场研究分析师和营销专员 | 5% |
| 客户服务代表 | 4% |
| 中学教师 | 3% |
餐饮、医疗服务交付、建筑和零售的贡献则小得多。
AI 如何改变工人的时间分配?¶
AI 加速部分任务后,那些难以被加速的任务将占据更大的工作比重——即"瓶颈效应"。

当工人借助 AI 加速其部分职业任务时,那些 AI 提速较少的任务将在总工作量中占比增大。
典型案例:
| 职业 | AI 加速的任务 | AI 难以加速的任务 |
|---|---|---|
| 软件开发人员 | 开发、测试、文档编写、数据处理 | 协调系统安装、管理其他技术人员 |
| 教师 | 课程和活动规划 | 组织课外社团、维持课堂纪律 |
这与 Aghion, Jones, and Jones 的观点一致:"增长的制约因素可能不是我们擅长什么,而是哪些环节不可或缺却难以改进。"
局限性¶
本研究在验证、任务分类、结构性假设和数据代表性方面均存在显著局限。
| 局限性 | 说明 |
|---|---|
| 预测不完美 | AI 系统无法观察用户结束交互后的活动。模型估算引入了大量噪声 |
| 任务分类的局限 | 真实工作比 O*NET 任务列表复杂得多。许多重要的工作方面——隐性知识、人际关系、不确定性下的判断——不会出现在正式任务描述中。一项最新随机对照试验研究端到端软件功能开发时,未发现 AI 带来时间节省 |
| 结构性假设 | 将"专业人士无 AI 时的时间"与"有 AI 时的时间"对比,可能低估收益(未计入招聘和沟通开销),也可能高估收益(若 AI 输出质量低于人工) |
| 组织重构 | 历史上最大的生产力提升来自重构业务运营以适应新技术,而非单纯加速原有任务 |
| 创新的角色 | 技术创新是经济增长的引擎。本模型未捕捉 AI 如何加速或自动化科学过程 |
| 数据局限 | 数据集仅来源于 Claude.ai 对话,不代表所有 AI 使用场景,且可能存在选择偏差 |
结论¶
当前模型在全面采用后有望使美国劳动生产率年增长率翻倍,但真正的变革性影响将来自生产方式的根本重组。
基于 Claude 的任务时间估算(假设十年内全面采用),当前模型意味着美国劳动生产率每年可增长 1.8%——是近年增速的两倍。收益将集中在科技、教育和专业服务领域,而零售、餐饮和运输受益甚微。这些变化将作为 Economic Index 的一部分持续追踪。
从历史看,电气化、计算机或互联网带来的变革性生产力提升,并非源于加速旧有任务,而是从根本上重组了生产方式。
引用¶
@online{tamkinmccrory2025productivity,
author = {Alex Tamkin and Peter McCrory},
title = {Estimating AI productivity gains from Claude conversations},
date = {2025-11-05},
year = {2025},
url = {https://www.anthropic.com/research/estimating-productivity-gains},
}
附录¶
与其他估算的对比¶

图表展示了各研究对 AI 在十年期限内带来的年劳动生产率增长的预测值。图表复制自 Filippucci, Gal, and Schief, 2024。虚线为 1.8%,即本研究基于 Claude 估算得出的数值。
时间估算所用的 Prompts¶
本节包含了用于时间估算的 prompt 设计细节,详见原文 PDF。