Anthropic Research 中文翻译

create: 2026-01-15
update: 2026-08-10
author: thinkycx
title: 【译】Anthropic 经济指数报告:经济基础度量
description: Anthropic 经济指数 2026 年 1 月报告,引入五个新的"经济基础度量"(任务复杂度、技能水平、用途类型、AI 自主度、任务成功率),揭示了显著的地理差异、AI 任务时限估计,以及将成功率纳入后对工作暴露度评估的修正。
category: translation
tags: anthropic, research, translation, economic-research

Anthropic 经济指数报告:经济基础度量

原文发布于 2026 年 1 月 15 日
第一作者:Ruth Appel, Maxim Massenkoff, Peter McCrory
第二作者:Miles McCain, Ryan Heller, Tyler Neylon, Alex Tamkin
PDF:完整报告

经济指数报告封面

引言

本报告引入五个新的经济基础度量,为 AI 对经济的影响提供更精细的画像。 报告提供了 2025 年 11 月(Opus 4.5 发布前)Claude 使用的详细画像。这些"基础度量"通过对匿名的 Claude.ai 和第一方 API 对话进行分析生成,覆盖五个维度:用户和 AI 技能、任务复杂度、授予 Claude 的自主度、成功率,以及用途分类(个人/教育/工作)。

核心发现

发现 详情
使用仍高度集中 前 10 项任务占 Claude.ai 对话的 24%;增强模式略超半数对话
全球使用分布持续不均 美国、印度、日本、英国、韩国领先;可由人均 GDP 良好解释
美国各州趋于收敛 如趋势持续,各州人均使用量将在 2-5 年内均等化
收入越高使用越多元 低 GDP 国家课业使用最多;高收入国家个人使用最多
复杂任务成功率更低 人工完成时间越长,Claude 成功率越低
纳入成功率后工作暴露度不同 数据录入员和数据库架构师等职业,Claude 在大部分工作中表现出色
Claude 处理的任务技能水平更高 移除 Claude 执行的任务后,剩余工作的技能要求更低

第一章:较上期报告的变化

使用集中度

前十大任务持续主导使用量,计算机/数学相关任务占比最大但在下降。

图 1.1 - 任务集中度

平台 前十任务占比 最常见任务
Claude.ai 24%(上升自 23%) 修改软件以纠正错误(6%)
API 32%(上升自 28%) 修改软件以纠正错误(10%)

计算机和数学任务在 Claude.ai 上占比从 40%(2025 年 3 月)降至 34%(2025 年 11 月)。教育指导和图书馆使用从 9%(2025 年 1 月)升至 15%(11 月)。

图 1.2 - 职业分布变化

增强 vs 自动化

增强式使用跃升至 52%,自动化使用降至 45%,产品变化推动了更多人机协作。

图 1.3 - 增强与自动化

指标 变化
增强式使用 升 5pp 至 52%
自动化使用 降 4pp 至 45%
指令式对话 降 7pp 至 32%

产品变更(包括文件创建、持久记忆和 Skills 功能)"可能将使用模式转向了更协作的人在环路交互"。增强式使用的增长主要由"任务迭代"而非"学习"驱动。

图 1.4 - 协作模式细分

区域集中度

全球层面 AI 使用集中度基本未变,但美国各州间正在趋于均等。

Anthropic AI 使用指数(AUI)衡量 Claude 使用是否相对于适龄劳动人口超额或不足。丹麦的 AUI 为 2.1。

AUI 公式:AUI_c = 国家 c 的 Claude 使用份额 / 国家 c 的适龄劳动人口份额

图 1.6 - 地理分布

美国内部基尼系数从 0.37 降至 0.32。前五个州占使用量的 50%,但仅占适龄劳动人口的 38%。

劳动力结构的影响:"科技工作者份额每增加 1%,人均使用量增加 0.36%",可解释约三分之二的跨州 AUI 差异。

图 1.7 - 科技工作者与使用量

扩散速度

回归分析显示美国各州人均 AI 采用将在 2-5 年内均等化——比 20 世纪技术扩散快约 10 倍。

方法 β̂ 估计值
OLS ≈ 0.77
WLS ≈ 0.76
2SLS(工具变量) ≈ 0.86–0.89

第二章:经济基础度量介绍

五个新的基础度量在现有协作模式之上提供更细粒度的分析。

度量 内容
任务复杂度 无 AI 的人工时间、有 AI 的时间、是否多任务
人类和 AI 技能 用户能否独立完成、prompt/response 对应的教育年限
用途分类 工作、课业、个人
AI 自主度 委托决策的程度
任务成功率 Claude 对完成情况的评估

验证

基础度量已通过外部基准验证。Claude 的时间估计与实际软件工程任务耗时相关;教育度量与各职业的实际工人教育水平相关。

平台差异

维度 Claude.ai API
工作用途占比 46% 74%
指令式对话 - 64%
自动化占比 - 75%
AI 辅助时间 15 分钟 5 分钟
无 AI 人工时间 3.1 小时 1.7 小时
成功率 67% 49%
计算机/数学占比 36% 52%

Claude.ai 总体用途分布:46% 工作、19% 课业、35% 个人。


第三章:地理差异

工作和个人用途在高收入国家更常见,课业用途在低收入国家更常见。

人均 GDP 每增加 1%,国家层面的 Claude 人均使用量增加约 0.7%。

地区特征 发现
巴尔干半岛、巴西 工作用途占比最高
印度尼西亚 课业用途占比最高
纽约州 美国各州中工作用途最多

人类教育水平和 AI 教育水平几乎完全相关(国家:r = 0.925;美国各州:r = 0.928)。"人类如何给 AI 提示决定了 AI 能有多有效。"

高收入、高使用量国家表现出更多增强式使用,委托给 Claude 的决策自主度较低。


第四章:任务与生产力

加速效果与复杂度

更复杂的任务获得更大的时间节省,但成功率也更低。

图 4.1 - 复杂度与加速

教育年限要求 加速倍数(Claude.ai)
12 年(高中) 9x
16 年(大学) 12x

但高中水平以下任务成功率约 70%,大学水平任务降至 66%。

任务时限

API 数据中 50% 成功率阈值在人工 3.5 小时处达到;Claude.ai 因多轮迭代推至约 19 小时。

图 4.3 - 任务时限

这与 METR 对 Sonnet 4.5 约 2 小时和 Opus 4.5 约 5 小时的软件工程基准估计一致。

有效 AI 覆盖率

有效 AI 覆盖率 = Claude 能成功执行的工作日占比,按任务频率和成功率加权。49% 的工作至少有四分之一的任务可被 AI 覆盖(上升自此前的 36%)。

高覆盖率职业:数据录入员、医学转录员、放射科医生。低于预期的职业:微生物学家(Claude 无法进行实验室操作)。

技能影响

Claude 倾向于覆盖高教育水平任务(14.4 年 vs 经济整体 13.2 年),移除这些任务通常导致工作"去技能化"。

案例 去技能化方向
技术文档撰写者 失去高教育水平分析任务
旅行社 失去复杂规划,保留日常票务
房地产经理(反例:技能提升) 失去日常簿记,保留合同谈判

总体生产力影响

纳入任务成功率后,基准估计从 1.8pp 降至 1.0-1.2pp 年度劳动生产力增长——仍具重大经济意义。

图 4.6 - 生产力影响

假设 年度劳动生产力增长(pp)
基准(不考虑成功率) 1.8
Claude.ai 成功率调整 1.2
API 成功率调整 1.0
CES 互补性(σ=0.5) 0.7–0.9
CES 替代性(σ=1.5) 2.2–2.6

"即使在考虑可靠性之后,隐含的影响仍然具有重大经济意义——每年持续增加 1.0 个百分点"将使美国生产力增长恢复到 1990 年代末/2000 年代初的水平。


结论

AI 的影响将通过现有制度结构介导,而非均匀展开;发展能有效使用 AI 的人力资本至关重要。

Claude 倾向于被用于高教育水平任务。移除这些任务可能导致工作去技能化。收入与使用模式的强相关性表明,AI 的影响"将通过现有制度结构介导,而非均匀展开"。要让 AI 惠及全球用户,"发展能够有效使用 AI 的人力资本,特别是在低收入经济体中,至关重要"。


引用

@online{anthropic2026aeiv4,
  author = {Ruth Appel, Maxim Massenkoff, Peter McCrory, Miles McCain, Ryan Heller, Tyler Neylon, Alex Tamkin},
  title = {Anthropic Economic Index: Economic Primitives},
  date = {2026-01-15},
  year = {2026},
  url = {https://www.anthropic.com/research/anthropic-economic-index-january-2026-report},
}

相关链接