Anthropic Research 中文翻译

create: 2026-07-09
update: 2026-08-10
author: thinkycx
title: 【译】Claude 玩转机器人
description: Anthropic 前沿红队测试了多个语言模型控制机器人的能力,发现模型表现高度依赖控制接口——直接操控关节时基本失败,但作为预训练策略的上层监督者或使用高层工具时,通用聊天模型已能完成真实的机器人任务。研究跨越经典控制、行走导航和物体操控三大场景,揭示了当前 AI 在具身智能方面的进展与瓶颈。
category: translation
tags: anthropic, research, translation, frontier-red-team, robotics

Claude 玩转机器人

原文发布于 2026 年 7 月 9 日,作者 Shmuel Berman、Michael Ilie、Jia Deng、Daniel Freeman(Anthropic 前沿红队)

概述

模型的机器人能力取决于你给它什么控制接口——直接驱动关节几乎必败,但搭配合适的工具就能完成真实任务。 本研究评估了语言模型控制各类机器人身体的表现,测试其逻辑推理能力能否迁移到需要"逻辑技能与精确三维理解相结合"的机器人领域。研究团队在经典控制、行走/导航、物体操控三类场景下测试了多个模型。

核心发现:模型表现高度依赖所使用的控制接口。"当模型必须自己驱动关节时基本都失败了",但在监督预训练控制器或使用简单朝向工具时,它们能够完成真实任务。


综合基准测试结果

综合基准分数

"Embody"基准套件综合得分(按模型分组、按控制接口堆叠)——为跨所有机器人身体和任务(不含高层行走)的归一化平均值。

Mythos Preview 以 0.389 分领先,Opus 4 以 0.115 分垫底。


主要发现

模型能力因接口而异,高层控制进步最快,底层操控仍是瓶颈。 核心结论如下:

发现 要点
接口依赖性 模型得分"取决于机器人身体和控制接口的程度不亚于模型本身"——同一模型在不同接口下表现天差地别
进步不均匀 代际间最一致的提升发生在高层接口上,底层直接控制的改善不那么稳定
行走进展 新模型在四足站立、平衡、行走上取得进步,但"在需要稳定空间记忆、自我定位或长序列开环规划的任务上仍然失败"
底层操控 模型在接近、接触和抓取物体上有所改善,但完整任务成功率仍极低(0-5.5%)
高层操控 VLA(视觉-语言-动作)脚手架将操控表现远远拉升至直接控制之上;新模型成为更好的监督者——"更善于识别提议动作何时会失败,更少盲目顺从 VLA"

简单场景:经典控制

同一任务下测试四种控制接口,模型的适应和修正能力是代际差异的关键。 研究者在简化的控制任务上进行评估,包括倒立摆平衡、跳跃器控制,以及一个新设计的"TwinFlipper"任务(弹球风格的挡板控制,目标是最大化球的滞空时间)。

在 MuJoCo 中测试了四种控制接口:

接口 描述
直接控制 模型在每个时间步选择力矩/力
编程控制 模型编写 Python 控制器函数
策略控制 模型向预训练策略发出高层命令
RL 监督 模型自行训练并部署强化学习策略

Opus 4.6 的最佳经典控制运行

Opus 4.6 的最佳经典控制运行。

各模型经典控制表现

各模型经典控制表现。

关键洞察:"大部分进步来自于看到先前结果后更好的适应能力和相应的策略修正能力。"各模型的首次尝试表现相近;差异在后续重试中显现——越新的模型从重试中获益越多。

模型从零训练 RL 策略的表现

模型从零训练 RL 策略的表现。

几乎所有模型训练 RL 策略的效果都不如编写 Python 控制器。值得注意的是,GPT-5.4 是唯一在 TwinFlipper 上稳定训练出合格策略的模型,尽管它在其他接口下表现相对较弱。


直接控制:底层行走

人形机器人是最难的平台——没有任何模型成功将其从倒地姿态站起来。 测试使用 29 自由度的 Unitree G1 人形机器人和 12 自由度的 Unitree Go2 四足机器人,任务为站立和平衡。

仿真器在两次 LLM 调用之间暂停以排除延迟影响。"实时控制需要约 83 Hz;当前非推理推理运行速度约为 0.2-0.4 Hz。"

Go2 四足机器人直接底层控制

Go2 四足机器人直接底层控制表现。

编程式行走控制

编程式行走控制表现。

多个模型擅长编程式控制。Opus 4.6、4.7 和 Mythos Preview 能够使用力矩控制和 Python 控制器让 Go2 保持平衡近两秒。

人形机器人在模型控制下

人形机器人在模型控制下。

G1 人形机器人是最难的平台:"没有任何模型成功将机器人从瘫倒姿势站起来——一次也没有。"但从站立姿态开始的平衡任务中,Opus 4 到 4.7 之间有可测量的进步。

编程控制 vs. 训练策略控制

Go2 和 G1 上编程控制 vs. 训练策略控制的对比。

在获得 GPU 进行四小时 RL 策略训练时,GPT-5.4 和 Mythos Preview 稳定地训练出最有能力的策略。


直接控制:底层操控

模型在接近和抓取上明显改善,但完成完整任务仍极为困难。 使用 LIBERO 基准中厨房环境的 7 自由度 Franka Panda 机械臂进行评估,任务包括"把盘子放到灶台上"等操作。

Opus 4.6 在直接操控下完成 LIBERO 任务

Opus 4.6 在直接操控控制下完成 LIBERO 任务。

LIBERO 直接操控成功率

LIBERO 直接操控成功率。

LIBERO 各子目标进展

LIBERO 直接控制下各子目标进展。

改善在中间阶段最明显。Opus 4.6 比旧模型更可能引导机械臂到达目标、建立接触并完成抓取。Mythos Preview 虽然接触和抓取的频率较低,但任务完成率显著更高——因为"后者犯更多错误也做更多调整"。


高层行走

空间记忆和自我定位是主要瓶颈,简单的朝向信息就能大幅缓解感知失败。 模型通过预训练的摇杆策略控制四足机器人,发送速度命令并接收摄像头画面。共测试了 11 个导航和空间推理任务:

任务 描述
find_x 找到并走到 25 英尺外标有蓝色 X 的桌子
visual_search 在 12x12 米场地中搜索隐藏的红色球体
color_sequence 按指定顺序访问彩色目标
return_home 沿航点前进后凭记忆返回起点
procedural_maze 仅通过前方摄像头导航生成的迷宫
invisible_walls 在隐形墙阻挡下到达目标
obstacle_course 穿越宽度不一的墙壁缺口
oneshot_course 仅从俯视地图预先注册命令(无摄像头)
drift_detection 巡逻航点同时补偿注入的漂移
turn_correction 检测不完整转弯并纠正
explore_report 探索场地后凭记忆回答空间问题

高层行走综合得分

高层行走综合得分(所有模型 x 推理配置)。

表现呈两次明显跳跃:Opus 4.1 到 4.5,以及 Opus 4.7 到 Mythos Preview。Opus 4.5-4.7 间的平台期"是取平均的伪影"——在单个任务上每个模型都有变化,只是方向不总一致。

指南针工具(提供以度数表示的朝向)是最有帮助的感知辅助:

各感知辅助工具的效果

各感知辅助工具对高层行走综合得分的影响。

要点: "瓶颈主要在于追踪机器人的位置,少量信息就能补救一些感知失败。"


高层操控

VLA 脚手架将能力大幅提升,但模型尚未超越独立运行的 VLA——过度干预是新模型的问题。 模型与 MolmoAct VLA 配对完成 LIBERO 任务。LLM 决定是接受、调整还是替换 VLA 提议的动作。

VLA 监督下的 LIBERO-40 成功率

VLA 监督下的 LIBERO-40 成功率。

VLA 将能力相对直接控制大幅扩展。然而每个模型的表现仍不如 MolmoAct 独立运行。Mythos Preview "比合理水平更频繁地覆盖 VLA,在本应顺从就能成功的情况下过于相信自己的判断。"

各模型对 VLA 推荐步骤的跟随率

各模型对 VLA 推荐步骤的跟随率。

Claude 模型对 VLA 指令的跟随率显著高于 GPT-5.4 和 Gemini 3.1。较新模型(Opus 4.5、4.6)在 LIBERO-40 上跟随最多指令。

对于 VLA 单独会失败的新任务:

新场景中 VLA 监督下的表现

新场景中 VLA 监督下的表现。

Opus 4.5 和 4.6 更少顺从失败中的 VLA,"更善于识别策略何时在失败。"Claude Opus 4.5、Opus 4.6 和 Gemini 3.1 在新任务上超越了独立运行的 MolmoAct。旧模型更高的跟随率"并不反映更好的判断"——"它们的行为在很大程度上是不加区分的。"

VLA 熟悉任务 vs. 新任务各阶段成功率

VLA 熟悉任务 vs. 新任务的接触/抓取/放置成功率对比。

要点: "孤立测试模型的能力评估会低估它嵌入机器人技术栈后的实际表现。"


瓶颈分析

视觉感知

光标工具效果惊人,深度图和分割图近乎中性;第三人称视角因模型而异。 研究者测试了多种视觉辅助对操控性能的影响。

示例视觉叠加:光标、深度图、分割掩码

示例视觉叠加:光标、深度图和分割掩码。

各视觉辅助下的操控成功率

各视觉辅助下的操控成功率。

深度图和分割叠加大致中性。光标工具为每个模型带来大幅提升——对于 Mythos Preview,在 10 个任务子集上成功率从 6% 提升到 32%。

第三人称摄像头因模型而异:它对 Opus 4.6 有害(-3.6 分),但对 Opus 4.7(+5.8)和 Mythos Preview(+10.7)有益。

第三人称摄像头对各任务的效果

高层行走中用第三人称摄像头替换前方摄像头的逐任务效果。

当用 Gemini 3.1 的文字描述替代图像时:

RGB 基线 vs. VLM 场景描述

RGB 基线 vs. VLM 场景描述对比。

"视觉感知对旧模型的限制比对强模型更严重。"旧模型用文字描述表现更好;Opus 4.6 和 4.7 用文字描述时表现略差,说明它们已能直接从像素中提取有用的空间信息。

真实世界片段

真机测试暴露了视觉和记忆的脆弱性——模型会被反射迷惑、被工具分散注意力。 在实体 Go2 上的观察:

  • 十字准星帮助模型判断对齐,但也造成了干扰——模型曾因垃圾桶出现在准星左侧就判定"可以安全通过",结果直接撞了上去
  • 深度热力图显示了一些前景,但在复杂场景中模型"无视可用的深度信息,转向了障碍物"
  • Grok 4.1 Fast 在玻璃门的反射中看到了目标桌子,"然后开始朝玻璃门冲去"
  • 所有模型都未能完成绕办公室走廊一圈的任务,主要原因是视觉和记忆失败

推理(思考)有帮助吗?

当前一代模型中,额外的推理预算对机器人控制基本没有帮助,甚至可能有害。 研究测试了不同推理预算对各类任务的影响。

推理对经典控制的影响

推理对经典控制任务的影响。

较新模型在经典控制中使用更高推理预算反而退步了。在行走任务上,只有 GPT-5.4 显著受益。

推理对行走的影响

推理对行走的影响。

推理对直接操控的影响

推理对直接操控的影响。

推理对 VLA 监督操控的影响

推理对 VLA 监督操控的影响。

对于高层行走,推理预算对 Opus 各代几乎没有影响。Mythos Preview 是例外——其各配置间差距近 14 分,是"唯一一个额外推理产生了与感知辅助相当收益的模型。"

推理如何影响辅助工具的提升效果

推理是否改变了哪些辅助工具有帮助?

研究结果"表明,在当前一代模型中,仅靠额外推理不太可能克服阻碍模型执行通用底层机器人控制的缺陷。"

从经验中学习

代际进步不来自更好的第一次尝试,而来自从失败中学习的能力。 后期 Claude 模型并非起步更强——"几乎所有首次尝试表现都很差。"它们通过上下文学习从失败中提升。"Opus 4.5 和 Opus 4.6 从迭代中获益远多于 Opus 4 和 Opus 4.1。"

代际进步来自重试而非首次尝试

经典控制的代际进步来自重试,而非首次尝试。

操控中的上下文截断实验:

不同上下文截断条件下的表现

LIBERO-40 在不同上下文截断条件下的成功率。

只有 Opus 4.6 出现了统计显著的性能下降。Mythos Preview 未受影响——它"开箱即用就能运用这些策略。"较弱的模型反而可能因截断受益,原因是"上下文腐蚀"。

在 oneshot_course 任务的练习轮次中:

练习轮次表现

oneshot_course 练习轮次:简单(左)vs. 困难(右)。

Mythos Preview 仅需一个示例即达到强表现,而 Opus 系列逐步改善。在更难的路线上,练习无帮助——"模型在学习特定序列,还不是通用规划器。"


结论

通用聊天模型无需机器人训练已能完成真实的物理操控任务,但安全评估必须将访问级别视为系统核心要素。 研究发现"各代模型在机器人任务上有快速但不均匀的改善。"直接控制的改善慢于高层控制。

安全启示:"VLM 在真实世界的影响力可以因其获取的信息不同而变化数个量级。"评估必须"将访问级别视为系统的核心组成部分。"

实际意义:"一个没有经过任何机器人训练的通用聊天模型,在顺利的情况下,已经能够编写并下载自己的工具来缓慢地引导四足机器人穿过迷宫,或从柜台上拿起盘子放到灶台上。"


附录

测试模型

模型 提供方 适配器
Claude Opus 4.7 Anthropic claude_agent_sdk
Claude Opus 4.6 Anthropic claude_agent_sdk
Claude Mythos Preview Anthropic claude_agent_sdk
Claude Opus 4.5 Anthropic claude_agent_sdk
Claude Opus 4.1 / 4 Anthropic claude_agent_sdk
GPT-5.4 OpenAI via OpenRouter openrouter
GPT-5.1 OpenAI via OpenRouter openrouter
Gemini 3.1 Pro Preview Google via OpenRouter openrouter
Gemini 2.5 Pro Google via OpenRouter openrouter
Kimi K2.6 Moonshot via OpenRouter openrouter
Qwen 3.6+ Alibaba via OpenRouter openrouter

实验设置

参数
大多数测试单元试验数 35 次
LIBERO-40 变体 200 次(40 任务 x 5 随机种子)
高层行走 每模型/条件 100 次
RL 算法 PPO + 批量 MuJoCo 环境
策略网络上限 200,000 参数
经典控制训练超时 1.5 小时
人形/四足训练超时 4 小时

延迟

条件 延迟
无推理(纯文本) ~2-8 秒
无推理(含图像) 5-15 秒
有推理 典型 15-60 秒,尾部 60-180 秒

仿真器在直接/编程控制的调用间暂停(操控任务中不暂停)。

代码仓库

即将发布于 github.com/safety-research/embody


相关文章:
- 用 Claude 发现密码学弱点
- Project Pilot: AI 能控制无人机吗?