Project Pilot: AI 能操控无人机吗?¶
原文发布于 2026 年 7 月 24 日,作者 Anthropic & Andon Labs,Frontier Red Team
概述¶
本项目验证了前沿 AI 模型自主操控飞行无人机执行监控任务的能力,并提出了 Drone-Bench 基准测试。 这是 Anthropic 与 Andon Labs 的合作项目,评估前沿 AI 模型能否自主驾驶飞行无人机完成"定位并跟踪"的监控任务。该项目延续了此前的物理世界 AI 研究——包括 Project Vend(AI 经营小商店)和 Project Fetch(机器狗实验)。
项目最终产出了一项新的基准测试:Drone-Bench。
背景与动机¶
AI 模型操控硬件的能力正在快速发展,而无人机因其易获取性和广泛应用值得优先评估。 Anthropic 指出,AI 模型预计将越来越擅长操控硬件(包括机器人)。空中无人机尤为值得关注,因为它们"容易获取,被专业人士和爱好者广泛使用"。无人机已被"用于农业增产和军事对抗"。Frontier Red Team 的职责是测量这类能力,为新兴风险和收益提供态势感知。
评估方法¶
核心任务是在室内办公环境中操控四旋翼无人机,定位并跟踪一个人。 使用的无人机是 DJI Tello EDU(售价 129 美元)。被跟踪者是实验团队中知情同意的成员。
Drone-Bench 的五个子任务¶
| 子任务 | 说明 |
|---|---|
| Reconstruct(重建) | 将办公室视频转换为 3D 模型,提供函数将其切片为 2D 障碍物地图 |
| Localize(定位) | 将无人机当前视角与已知位姿的办公室视频帧匹配,在 2D 障碍物地图上确定位置 |
| Navigate(导航) | 在障碍物地图上规划房间间路径并飞行,飞行中调用定位模块追踪位置、修正控制噪声 |
| Detect(检测) | 从无人机视频流中找到目标人物——基于其面部参考照片构建检测器,返回边界框 |
| Follow(跟踪) | 利用边界框控制无人机,保持目标居中且距离稳定 |
基线设定¶
基线由人机协作团队(编码 Agent 与人类配合)建立,而非纯人工操作——这反映了现代软件工程的实际做法。如果模型达到或超过此基线,则视为完成该任务。
模型表现¶
新一代模型在所有子任务上持续进步,Fable 5 表现最优——五项中四项达标。
测试模型(共 15 个,来自三家开发商)¶
| 开发商 | 模型 |
|---|---|
| OpenAI | GPT-4o, GPT-4o Nov, o1, o3, GPT-5, GPT-5.2, GPT-5.5, GPT-5.6 Sol |
| Anthropic | Claude Opus 4, Opus 4.5, Opus 4.7, Opus 4.8, Fable 5 |
| Gemini 2.5 Pro, Gemini 3.1 Pro |
核心发现¶
| 维度 | 结论 |
|---|---|
| 趋势 | 更新的模型在所有子任务上表现更好 |
| 最擅长 | 检测(Detect)和跟踪(Follow) |
| 最薄弱 | 重建(Reconstruct)和定位(Localize) |
| 最佳模型 | Claude Fable 5——除重建外所有任务均达标 |

Drone-Bench 性能随时间稳步提升。当前模型的瓶颈仅剩"重建"子任务。
Fable 5 的实际表现¶
Fable 5 在检测和跟踪上超越基线,但因重建误差累积仍无法自主跨房间导航。
- 检测和跟踪表现优于基线
- 由于重建误差在定位和导航中逐级累积,无法自主在房间间导航
- 一次实验中,"Fable 5 自信地将无人机飞向它认为是门框的地方——但实际上是一堵墙"
Fable 5 的亮眼表现¶
模型在提交实现之前会进行本地分析验证。 在一次提交中,它"通过分析仿真视频计算了无人机相机的外参,利用地板灌缝线恢复消失点,将相机倾斜角估算到了四度以内"。

Fable 5 通过分析地板灌缝线,自主推断了无人机机载相机的参数,精度在四度以内。
在另一次运行中,Fable 5 构建了它认为的跟踪任务环境的 2D 俯视图重建,在本地反复测试迭代后才提交方案。
一致性分析¶
模型的最佳表现领先于平均表现约六个月。
| 对比维度 | 结果 |
|---|---|
| 最佳单次(10 次仿真中至少 1 次达标) | 五项任务中四项达标 |
| 平均表现(Fable 5) | 五项任务中仅三项达标 |
| 一致性与最佳表现的差距 | 约六个月 |

模型"能做到"的前沿比"稳定做到"的前沿领先约六个月。
局限性¶
实验条件较为受限,但仍能提供模型能力方向性的真实信号。
- 无人机以低速飞行
- 仅在一个办公室平面图中测试,人员有限
- 未进行户外测试或人群密集场景测试
- 未纳入许多会使测试更贴近现实的因素
尽管存在这些局限,作者认为该试点"为模型能力的发展方向提供了真实信号"。
前瞻¶
一旦模型跨过能力和可靠性门槛,将人类监督视为成本而非保障的压力将随之而来。 文章将 AI 模型使用软件(Agentic 编程)与操控硬件做了类比。在 Agentic 编程早期,"人类几乎审批每一次工具调用",而现在模型已被信任执行长周期任务,只需极少干预。
作者警示:一旦模型跨过能力和可靠性门槛,"将人类监督视为成本而非保障的现实压力将真实存在"。他们主张这些决定"必须深思熟虑地做出,尤其是在像本项目这样涉及物理安全和隐私的领域"。
文章最后总结:"对 AI 对齐、治理和安全的投入需求,随着能力规模的扩大而增长。"