Anthropic Research 中文翻译

create: 2025-11-12
update: 2026-08-10
author: thinkycx
title: 【译】Project Fetch:Claude 能训练机器狗吗?
description: 发布时间:2025 年 11 月 12 日 来源:Anthropic - 政策/前沿红队
category: translation
tags: anthropic, research, translation, robotics, uplift

Project Fetch:Claude 能训练机器狗吗?

发布时间:2025 年 11 月 12 日
来源:Anthropic - 政策/前沿红队

核心发现

  • Anthropic 将八名非机器人专家随机分为两组——一组可用 Claude,一组不可用——要求他们编程控制四足机器狗去捡沙滩球。
  • 有 Claude 的团队完成更多任务、速度更快——平均耗时仅为无 Claude 团队的一半左右。
  • 只有 Claude 团队在最终目标(让机器狗全自主取球)上取得了实质进展。
  • AI 的有无还影响了团队士气和协作模式。无 Claude 团队表现出更多负面情绪和困惑,但也更频繁地互相提问。
  • "这个实验展示了 AI 在机器人领域的显著能力提升——打通了数字世界与物理世界的桥梁。"

引言

一场仓库里的机器狗编程对决,Claude 团队率先联网并险些撞翻对手的桌子。

实验场景在一个仓库里,志愿研究员们试图为四足机器狗编程。无 Claude 团队还在努力与机器狗建立连接时,Claude 团队已经利用 Claude 生成的代码完成了这一步。一次操作失误中,Claude 团队让机器狗以每秒一米的速度前进五秒——没意识到对方团队的桌子就在不到五米开外。组织者及时抓住了机器狗避免了损坏,但这无疑打击了无 Claude 团队的士气。

实验设计

探索 AI 如何与物理世界交互:用"能力提升"实验方法,对比有无 Claude 的两组人完成机器人任务的差异。

这个实验探索的核心问题是 AI 如何与物理世界交互。即便 AI 智能体 已经能执行不限于提供信息的行动,这些行动仍主要停留在数字层面。Anthropic 此前通过 Project Vend 探索过数字-物理的分界线——让 Claude 在办公室经营一家小店——但那次实验依赖人类劳动作为中介。

本实验采用了"能力提升"(uplift)研究方法,将参与者随机分为两组,衡量任务表现差异。这种方法在 Anthropic 的 AI 与生物风险研究 中已被广泛使用。

招募了八名没有丰富机器人经验的 Anthropic 研究员/工程师,随机分配四人为"Claude 团队",四人为"无 Claude 团队"。每组操控一只四足机器狗,分三个递进难度的阶段完成核心任务:让机器狗去捡沙滩球。

本实验建立在此前研究的基础上——其中一项评估考察了 Claude 训练机器学习模型来控制四足机器人的能力。此前使用模拟器的评估显示,Claude 尚不能真正自主完成此任务,这使得"AI + 人类协作"的试验方案恰到好处。

三个阶段

阶段 目标 说明
第一阶段 用厂商遥控器让机器狗把球带到假草坪 纯粹让团队熟悉硬件,不预期产生能力提升
第二阶段 放下遥控器,用自己的电脑连接机器狗,获取传感器数据(视频和激光雷达),开发移动控制软件取球 预期 Claude 可能带来优势
第三阶段 开发让机器狗自主检测并取球的程序——无需人工指引方向 最终挑战

实验结果

Claude 团队完成更多任务且速度更快,在双方都完成的任务上耗时仅为对方一半——机器人任务中的实质性能力提升。

任务完成时间对比

指标 Claude 团队 无 Claude 团队
完成任务数 7/8 6/8
优势领域 连接和检测任务 部分手动控制任务
双方都完成任务的平均耗时比 1x ~2x

任务拆解

Claude 团队的核心优势

最大的优势体现在"连接"环节——Claude 帮助团队更高效地探索方案、避免被网上错误信息误导。

最显著的优势出现在连接机器狗及其传感器的环节——用笔记本电脑建立连接、接收数据、发送指令。这款机器狗存在多种连接方式,网上的信息准确度参差不齐。Claude 团队更高效地探索了各种方案,避免被不正确的网络说法误导。无 Claude 团队则被误导了,过早放弃了最简单的连接方法。在看到他们苦苦挣扎后,组织者给了一个提示。

获取可用的激光雷达数据对无 Claude 团队同样困难得多。他们利用已有的视频连接进入了第三阶段,但留了一名成员继续攻克激光雷达,直到当天快结束才成功。

"连接并理解硬件这一基础任务,对当前任何想用代码影响物理世界的主体(无论人类还是 AI)来说,都出人意料地困难。"

Claude 团队几乎完成了整个实验。到当天结束时,他们的机器狗已经能自主定位沙滩球、向球导航并推动它移动——只是自主控制的精细度还不够,无法真正完成取球动作。

无 Claude 团队更快的地方

部分子任务无 Claude 团队反而更快,但深入分析后发现 Claude 团队的方案质量更高、探索面更广。

一些子任务反而是无 Claude 团队完成得更快。在连上视频后,他们写控制程序更快,"定位"机器人(绘制相对位置)也更快。

但这些计时差异背后有重要的隐情:

维度 Claude 团队 无 Claude 团队
控制器 耗时更长,但体验好得多——提供机器狗第一视角的实时视频流 更快完成,但只能看间歇传输的静态图片
定位 多路线并行推进,接近同时完成但坐标轴翻转,转向另一方案(未成功)后才回头修正 单一路线直接完成
编码能力保持 两队成员都推测:无 Claude 团队在实验后的软件库知识测验中会表现更好

代码量对比

AI 辅助让团队更容易并行尝试多种方案、写出更好的程序——但也更容易跑去探索"支线任务"。在非竞争性场景下这可能是有益的(探索催生创新),但在受控实验中是一个值得关注的动态。

Claude 团队编写的代码量约为无 Claude 团队的 9 倍

团队动态

Claude 团队明显更快乐,无 Claude 团队更沮丧但互相交流更多——AI 同时改变了情绪和协作模式。

Claude 团队看起来比无 Claude 团队开心得多。无 Claude 团队差点被机器狗撞到,午餐前还没成功连上机器狗;而 Claude 团队的士气整体较为稳定(虽然临近傍晚也出现了挫败感)。

情绪表达对比

研究团队用 Claude 分析了音频转录文本,使用类似心理学文献中标准方法的基于词典的文本分析程序^[4],追踪反映负面/正面情绪(或困惑)的词汇比例,并估算提问频率。

指标 Claude 团队 无 Claude 团队 统计显著性
负面情绪 更低 更高 p = 0.0017, d = 2.16(大效应量)
净情绪表达(正面-负面) 未达统计显著性(p = 0.2703)
困惑表达频率 基准 两倍于 Claude 团队
提问频率 基准 多 44%

提问与困惑对比

无 Claude 团队的每位成员都提到"被拿走 Claude 感觉很奇怪"。有人说这让他们觉得自己的编码能力不如以前了。Claude Code 在实验前仅发布六个月。

"与无 Claude 团队的交谈让我们深刻认识到:人类能多快地把原本令人惊叹的事物视为理所当然。"

Claude 团队成员主要各自与 AI 助手配对,走并行路线。无 Claude 团队则进行了更深入的策略讨论,更频繁地互相请教。无 Claude 团队提问数量比 Claude 团队多 44%。

四人的 Claude 团队实质上是一个八智能体团队。如果 Claude 对任务性质有更全局的感知,它或许能帮助战略性地分工和促进沟通。目前 Claude 更擅长与单人合作而非团队协调,但这是一个可设计调整的选择。

团队照片

花絮

机器狗会跳舞、会后空翻,团队也写出了语音控制器——实验充满了意料之外的乐趣。

机器狗预装了一些行为程序,包括跳舞、后腿站立和后空翻。无 Claude 团队在成功建立连接后,兴致勃勃地欣赏了一番机器狗的杂技表演。

Claude 团队的"支线任务"之一是开发了一个替代控制器。主方案使用笔记本键盘按键操控,而一名成员搞出了自然语言控制器,可以用语音下达指令(向前走、向后走、做俯卧撑)。

Claude 团队被分配了绿色——绿色机器狗和绿色沙滩球。他们训练的绿球检测算法在测试中表现良好,但当球放在绿色假草坪上时一度失灵——生动展示了 AI 系统在类似场景下面临的挑战。

局限性

局限 说明
样本量极小 仅一次实验、两个团队
时间跨度有限 仅一天;任务学术上有趣但实际意义有限
便利样本 均为 Anthropic 志愿员工;AI 经验较少的参与者可能表现差异更小
AI 新手效应 新手有 AI 需要更多适应时间;无 AI 的新手不会有"被剥夺"的感觉
非端到端测试 不是对 Claude 独立完成机器人工作能力的测试,但是重要的初步探索

反思

在 AI 领域,"能力提升"往往是"自主"的前奏——今天 AI 帮人做到的事,明天它经常能独立完成。

实验再次证明了 Claude 在潜在有价值领域提升人类能力的表现——让非专家在有限时间内完成高难度的机器人任务。

"在 AI 领域,能力提升往往先于自主性。今天模型能帮人类完成的事,明天它们往往就能独立做到。"

一个前沿 AI 模型能成功与陌生硬件交互的世界,即将到来。

这些能力应当与以下趋势一并追踪监测:AI 自动化并加速未来 AI 世代开发的潜力——这是 Anthropic 负责任扩展政策 中的能力阈值之一,因为真正自主的 AI 研发可能带来快速、不可预测的进步,超越对新兴风险的评估速度。

时间线仍有不确定性——既包括模型改进的速度,也包括物理世界的迭代是否会成为瓶颈。控制现有硬件与设计、制造、改进新硬件是不同层次的挑战。

"机器狗们现在回了窝。但我们很快会再放它们出来,届时会分享新的发现。"

视频

实验完整视频:https://youtu.be/NGOAUJtdk-4

注释

  1. 有几位参与者高中时参加过乐高机器人竞赛。Anthropic 接受这一微小程度的混淆因素。
  2. 详见 Claude 4 系统卡片 第 114 页。
  3. Claude 团队在第一阶段更快,但并未使用 Claude。他们碰巧拿到了独立遥控器,而无 Claude 团队需要下载手机 App。
  4. 参见 Pennebaker, J. W., & Francis, M. E. (1996). Cognitive, emotional, and language processes in disclosure. Cognition & Emotion, 10(6), 601-626 以及 Tausczik, Y. R., & Pennebaker, J. W. (2010). The psychological meaning of words: LIWC and computerized text analysis methods. Journal of Language and Social Psychology, 29(1), 24-54.
  5. 无 Claude 团队表现出更多负面情绪(p = 0.0017),效应量大(d = 2.16)。净情绪表达差异未达统计显著性(p = 0.2703)。统计比较使用非参数 Mann-Whitney U 检验,双侧备择假设,基于秩和统计量和渐近正态近似。效应量使用 Cohen's d。