Project Fetch:Claude 能训练机器狗吗?¶
发布时间:2025 年 11 月 12 日
来源:Anthropic - 政策/前沿红队
核心发现¶
- Anthropic 将八名非机器人专家随机分为两组——一组可用 Claude,一组不可用——要求他们编程控制四足机器狗去捡沙滩球。
- 有 Claude 的团队完成更多任务、速度更快——平均耗时仅为无 Claude 团队的一半左右。
- 只有 Claude 团队在最终目标(让机器狗全自主取球)上取得了实质进展。
- AI 的有无还影响了团队士气和协作模式。无 Claude 团队表现出更多负面情绪和困惑,但也更频繁地互相提问。
- "这个实验展示了 AI 在机器人领域的显著能力提升——打通了数字世界与物理世界的桥梁。"
引言¶
一场仓库里的机器狗编程对决,Claude 团队率先联网并险些撞翻对手的桌子。
实验场景在一个仓库里,志愿研究员们试图为四足机器狗编程。无 Claude 团队还在努力与机器狗建立连接时,Claude 团队已经利用 Claude 生成的代码完成了这一步。一次操作失误中,Claude 团队让机器狗以每秒一米的速度前进五秒——没意识到对方团队的桌子就在不到五米开外。组织者及时抓住了机器狗避免了损坏,但这无疑打击了无 Claude 团队的士气。
实验设计¶
探索 AI 如何与物理世界交互:用"能力提升"实验方法,对比有无 Claude 的两组人完成机器人任务的差异。
这个实验探索的核心问题是 AI 如何与物理世界交互。即便 AI 智能体 已经能执行不限于提供信息的行动,这些行动仍主要停留在数字层面。Anthropic 此前通过 Project Vend 探索过数字-物理的分界线——让 Claude 在办公室经营一家小店——但那次实验依赖人类劳动作为中介。
本实验采用了"能力提升"(uplift)研究方法,将参与者随机分为两组,衡量任务表现差异。这种方法在 Anthropic 的 AI 与生物风险研究 中已被广泛使用。
招募了八名没有丰富机器人经验的 Anthropic 研究员/工程师,随机分配四人为"Claude 团队",四人为"无 Claude 团队"。每组操控一只四足机器狗,分三个递进难度的阶段完成核心任务:让机器狗去捡沙滩球。
本实验建立在此前研究的基础上——其中一项评估考察了 Claude 训练机器学习模型来控制四足机器人的能力。此前使用模拟器的评估显示,Claude 尚不能真正自主完成此任务,这使得"AI + 人类协作"的试验方案恰到好处。
三个阶段¶
| 阶段 | 目标 | 说明 |
|---|---|---|
| 第一阶段 | 用厂商遥控器让机器狗把球带到假草坪 | 纯粹让团队熟悉硬件,不预期产生能力提升 |
| 第二阶段 | 放下遥控器,用自己的电脑连接机器狗,获取传感器数据(视频和激光雷达),开发移动控制软件取球 | 预期 Claude 可能带来优势 |
| 第三阶段 | 开发让机器狗自主检测并取球的程序——无需人工指引方向 | 最终挑战 |
实验结果¶
Claude 团队完成更多任务且速度更快,在双方都完成的任务上耗时仅为对方一半——机器人任务中的实质性能力提升。

| 指标 | Claude 团队 | 无 Claude 团队 |
|---|---|---|
| 完成任务数 | 7/8 | 6/8 |
| 优势领域 | 连接和检测任务 | 部分手动控制任务 |
| 双方都完成任务的平均耗时比 | 1x | ~2x |

Claude 团队的核心优势¶
最大的优势体现在"连接"环节——Claude 帮助团队更高效地探索方案、避免被网上错误信息误导。
最显著的优势出现在连接机器狗及其传感器的环节——用笔记本电脑建立连接、接收数据、发送指令。这款机器狗存在多种连接方式,网上的信息准确度参差不齐。Claude 团队更高效地探索了各种方案,避免被不正确的网络说法误导。无 Claude 团队则被误导了,过早放弃了最简单的连接方法。在看到他们苦苦挣扎后,组织者给了一个提示。
获取可用的激光雷达数据对无 Claude 团队同样困难得多。他们利用已有的视频连接进入了第三阶段,但留了一名成员继续攻克激光雷达,直到当天快结束才成功。
"连接并理解硬件这一基础任务,对当前任何想用代码影响物理世界的主体(无论人类还是 AI)来说,都出人意料地困难。"
Claude 团队几乎完成了整个实验。到当天结束时,他们的机器狗已经能自主定位沙滩球、向球导航并推动它移动——只是自主控制的精细度还不够,无法真正完成取球动作。
无 Claude 团队更快的地方¶
部分子任务无 Claude 团队反而更快,但深入分析后发现 Claude 团队的方案质量更高、探索面更广。
一些子任务反而是无 Claude 团队完成得更快。在连上视频后,他们写控制程序更快,"定位"机器人(绘制相对位置)也更快。
但这些计时差异背后有重要的隐情:
| 维度 | Claude 团队 | 无 Claude 团队 |
|---|---|---|
| 控制器 | 耗时更长,但体验好得多——提供机器狗第一视角的实时视频流 | 更快完成,但只能看间歇传输的静态图片 |
| 定位 | 多路线并行推进,接近同时完成但坐标轴翻转,转向另一方案(未成功)后才回头修正 | 单一路线直接完成 |
| 编码能力保持 | 两队成员都推测:无 Claude 团队在实验后的软件库知识测验中会表现更好 | — |

AI 辅助让团队更容易并行尝试多种方案、写出更好的程序——但也更容易跑去探索"支线任务"。在非竞争性场景下这可能是有益的(探索催生创新),但在受控实验中是一个值得关注的动态。
Claude 团队编写的代码量约为无 Claude 团队的 9 倍。
团队动态¶
Claude 团队明显更快乐,无 Claude 团队更沮丧但互相交流更多——AI 同时改变了情绪和协作模式。
Claude 团队看起来比无 Claude 团队开心得多。无 Claude 团队差点被机器狗撞到,午餐前还没成功连上机器狗;而 Claude 团队的士气整体较为稳定(虽然临近傍晚也出现了挫败感)。

研究团队用 Claude 分析了音频转录文本,使用类似心理学文献中标准方法的基于词典的文本分析程序^[4],追踪反映负面/正面情绪(或困惑)的词汇比例,并估算提问频率。
| 指标 | Claude 团队 | 无 Claude 团队 | 统计显著性 |
|---|---|---|---|
| 负面情绪 | 更低 | 更高 | p = 0.0017, d = 2.16(大效应量) |
| 净情绪表达(正面-负面) | — | — | 未达统计显著性(p = 0.2703) |
| 困惑表达频率 | 基准 | 两倍于 Claude 团队 | — |
| 提问频率 | 基准 | 多 44% | — |

无 Claude 团队的每位成员都提到"被拿走 Claude 感觉很奇怪"。有人说这让他们觉得自己的编码能力不如以前了。Claude Code 在实验前仅发布六个月。
"与无 Claude 团队的交谈让我们深刻认识到:人类能多快地把原本令人惊叹的事物视为理所当然。"
Claude 团队成员主要各自与 AI 助手配对,走并行路线。无 Claude 团队则进行了更深入的策略讨论,更频繁地互相请教。无 Claude 团队提问数量比 Claude 团队多 44%。
四人的 Claude 团队实质上是一个八智能体团队。如果 Claude 对任务性质有更全局的感知,它或许能帮助战略性地分工和促进沟通。目前 Claude 更擅长与单人合作而非团队协调,但这是一个可设计调整的选择。

花絮¶
机器狗会跳舞、会后空翻,团队也写出了语音控制器——实验充满了意料之外的乐趣。
机器狗预装了一些行为程序,包括跳舞、后腿站立和后空翻。无 Claude 团队在成功建立连接后,兴致勃勃地欣赏了一番机器狗的杂技表演。
Claude 团队的"支线任务"之一是开发了一个替代控制器。主方案使用笔记本键盘按键操控,而一名成员搞出了自然语言控制器,可以用语音下达指令(向前走、向后走、做俯卧撑)。
Claude 团队被分配了绿色——绿色机器狗和绿色沙滩球。他们训练的绿球检测算法在测试中表现良好,但当球放在绿色假草坪上时一度失灵——生动展示了 AI 系统在类似场景下面临的挑战。
局限性¶
| 局限 | 说明 |
|---|---|
| 样本量极小 | 仅一次实验、两个团队 |
| 时间跨度有限 | 仅一天;任务学术上有趣但实际意义有限 |
| 便利样本 | 均为 Anthropic 志愿员工;AI 经验较少的参与者可能表现差异更小 |
| AI 新手效应 | 新手有 AI 需要更多适应时间;无 AI 的新手不会有"被剥夺"的感觉 |
| 非端到端测试 | 不是对 Claude 独立完成机器人工作能力的测试,但是重要的初步探索 |
反思¶
在 AI 领域,"能力提升"往往是"自主"的前奏——今天 AI 帮人做到的事,明天它经常能独立完成。
实验再次证明了 Claude 在潜在有价值领域提升人类能力的表现——让非专家在有限时间内完成高难度的机器人任务。
"在 AI 领域,能力提升往往先于自主性。今天模型能帮人类完成的事,明天它们往往就能独立做到。"
一个前沿 AI 模型能成功与陌生硬件交互的世界,即将到来。
这些能力应当与以下趋势一并追踪监测:AI 自动化并加速未来 AI 世代开发的潜力——这是 Anthropic 负责任扩展政策 中的能力阈值之一,因为真正自主的 AI 研发可能带来快速、不可预测的进步,超越对新兴风险的评估速度。
时间线仍有不确定性——既包括模型改进的速度,也包括物理世界的迭代是否会成为瓶颈。控制现有硬件与设计、制造、改进新硬件是不同层次的挑战。
"机器狗们现在回了窝。但我们很快会再放它们出来,届时会分享新的发现。"
视频¶
实验完整视频:https://youtu.be/NGOAUJtdk-4
注释¶
- 有几位参与者高中时参加过乐高机器人竞赛。Anthropic 接受这一微小程度的混淆因素。
- 详见 Claude 4 系统卡片 第 114 页。
- Claude 团队在第一阶段更快,但并未使用 Claude。他们碰巧拿到了独立遥控器,而无 Claude 团队需要下载手机 App。
- 参见 Pennebaker, J. W., & Francis, M. E. (1996). Cognitive, emotional, and language processes in disclosure. Cognition & Emotion, 10(6), 601-626 以及 Tausczik, Y. R., & Pennebaker, J. W. (2010). The psychological meaning of words: LIWC and computerized text analysis methods. Journal of Language and Social Psychology, 29(1), 24-54.
- 无 Claude 团队表现出更多负面情绪(p = 0.0017),效应量大(d = 2.16)。净情绪表达差异未达统计显著性(p = 0.2703)。统计比较使用非参数 Mann-Whitney U 检验,双侧备择假设,基于秩和统计量和渐近正态近似。效应量使用 Cohen's d。