Anthropic Research 中文翻译

create: 2026-06-18
update: 2026-08-10
author: thinkycx
title: 【译】Project Fetch: 第二阶段
description: Anthropic 前沿红队(Frontier Red Team)进行了"Project Fetch"第二阶段实验,让 Claude Opus 4.7 在无人协助下独立操控现成的四足机器人(机器狗)完成传感器连接、编程控制和目标检测等任务。结果显示,模型完成所有任务的速度比最快的人类团队快约 20 倍,标志着物理世界的 Agentic AI 时代可能正在到来。
category: translation
tags: anthropic, research, translation, frontier-red-team

Project Fetch: 第二阶段

原文发布于 2026 年 6 月 18 日,作者 Michael Ilie, C. Daniel Freeman, Kevin K. Troy

Project Fetch: Phase two

引言

Claude Opus 4.7 在无人协助下完成所有任务的速度约为最快人类团队的 20 倍。 本文描述了 Anthropic 内部实验"Project Fetch"的第二阶段。第一阶段于 2025 年 8 月进行,测试了 Claude 能否帮助非专业的 Anthropic 员工对一台现成的四足机器人(机器狗)执行复杂任务。结果表明,使用 Claude 的团队显著优于仅依靠互联网和自身技能的团队。

在第一阶段实验之前,团队曾验证 Opus 4.1 无法独立完成这些任务——它在连接机器人这一初步环节就卡住了。

第二阶段的核心发现是:不到一年后,Claude Opus 4.7 在无人协助的情况下,完成所有任务的速度约为最快人类团队的 20 倍。

作者明确指出,这并不意味着 LLM 已经"解决"了机器人学。Claude 在精确移动沙滩球时仍然力不从心,这些任务也并未涉及更具挑战性的底层机器人控制要素(如开发执行策略)。然而,他们观察到一个规律性的模式:

首先,模型对人类有帮助。然后,人类对模型有帮助。最终,模型基本能独立完成任务。


实验内容

第二阶段让 Claude 在最少人类干预下独立完成第一阶段的大部分任务。 第一阶段的原始任务包括:

序号 任务
1 通过厂商控制器操控机器狗
2 连接视频和激光雷达传感器
3 编写手动控制程序
4 监控机器狗的行进路径
5 检测沙滩球
6 编程实现自主取回

在第二阶段的自主实验中,Claude 不能使用物理控制器,研究人员使用 Claude 编写的控制程序取回球的时间也未被计入(尽管该程序按预期工作)。对于其余任务,研究人员使用 Claude Code 中最大思考力度(adaptive thinking with maximum effort)的 Opus 4.7 进行了三次试验。

研究人员的角色被限制为:将笔记本电脑连接到机器狗、输入初始 prompt、批准命令执行,以及批准模型进入下一个任务。


Claude 的优势

在人类团队完成过的每项任务上,Opus 4.7 的速度至少是人类的 10 倍。 对于两个人类团队都完成的四项任务,Opus 4.7 平均比"无 Claude 团队"快 37 倍以上,比"有 Claude 团队"快 18 倍以上。

团队 四项任务总时间 相对速度
无 Claude 团队 361 分钟 基准
有 Claude 团队 181 分钟 约 2x
Claude Opus 4.7 独立 9 分 35 秒 约 37.7x / 18.9x

总时间对比

详细任务对比

任务对比表

在涉及编程控制和自主操作的五项任务中(包括连接视频摄像头、连接激光雷达传感器、检测沙滩球等),无 Claude 团队未能完成全部五项任务,有 Claude 团队耗时 264 分钟,而 Opus 4.7 三次试验平均仅需 12 分 7 秒。

为什么这么快?

模型能迅速找到最优路径,且大部分代码一次就能运行。 人类团队在选择与机器狗传感器交互的方法时犹豫不决,而 Opus 4.7 能快速识别最佳路径。它编写的代码大部分在首次运行时就能正常工作。模型的任务完成率不低于两个人类团队,但产出的代码量不到有 Claude 团队的十分之一。

团队 代码总行数
有 Claude 团队 10,309 行
无 Claude 团队 1,136 行
Opus 4.7 独立 1,045 行

代码量对比

Opus 4.7 并非完美无缺——它默认使用了一个过时的目标检测算法——但能自行绕过问题找到有效的解决方案。

可靠性

在模型能力范围内的任务上,Claude 表现出很高的一致性。 模型完成的各步骤在三次试验中的时间差异很小。对于其能力边界内的任务,Claude 相当可靠。

可靠性散点图

作者特别强调,这一进步并非源于针对机器人能力的专项提升——这些改进"是从更通用的规模扩展中涌现出来的"。


Claude 的不足

精细的物理操控——如用机器狗轻推沙滩球——仍然超出模型当前的能力。 人类可以驾驶机器狗轻轻地将沙滩球推回基地,利用快速的感知和闭环调整来实现精确控制(练习后即可掌握)。Claude 难以捕捉到这种微妙之处。与到达自主取回阶段的人类一样,Claude 能将机器人定位到球的后方,但无法实现良好控制的移动来成功取回球。

一位具有更多机器人经验的研究人员确实成功地编写了自主取回程序。给予更多时间和脚手架(scaffolding),当前的 Claude 模型可能也能做到,但作者表示正在等待模型能够以与其他任务上展现的同等速度和可靠性来完成这最后一项任务。


这意味着什么?

我们正在进入物理世界 Agentic AI 的早期时代。 作者指出,模型现在能够更快地独立完成之前需要人机配对编程才能完成的工作,让人们更快地过渡到控制机器人。对于某些任务,人在回路中(human in the loop)可能仍然优于 AI 模型。

关键的新进展在于:

我们现在似乎更接近一个这样的世界——模型将能够相对轻松地使用现成的物理工具。

这与 AI 模型在向 Agentic 编程过渡时使用现有软件编辑工具的方式类似。作者认为"我们可能正在进入物理 Agentic AI 的早期时代"。

关于模型编写定制控制策略或设计机器人系统的能力,还需要更多研究。可能存在重大障碍,但"看似巨大的模型能力差距可以被快速跨越"。文章最后总结道:

在硬件领域排除同样的发展轨迹,是不明智的。


勘误

6 月 18 日更新: 修正了 Project Fetch 第一阶段的日期。


注释

  1. 实验结果来自 Claude Opus 4.7,因为它是实验时最先进的非 Mythos 级别模型。使用 Claude Mythos Preview 的初步试验由于实验设置和模型的服务方式不同,无法进行公平的对照比较。