Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力

Anthropic:Research(发表成果 · 网页)·2026-07-24 23:25·45天前
AI 导读

Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。

Anthropic:Research(发表成果 · 网页)
精选
73AI 编辑部评分,满分 100

Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力

2026-07-24 23:25· 45天前
AI 导读

Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。

推荐理由

Anthropic首次公开AI端到端控制无人机执行监视任务,Fable 5仅因3D重建瑕疵未能全通。六个月内模型一致性突飞猛进,安全压力比技术潜力更紧迫。

正文 · AI 翻译

过去一年里,我们的多个研究项目都在关注前沿模型如何与物理世界交互。在 Project Vend 中,AI 模型运营了一家小商店;Project Fetch 则是对机器人作为数字模型与物理物体之间中介的早期探索。正如我们最近在 Project Fetch:第二阶段 中所指出的,我们已经看到模型能力在持续提升,它们使用现成机器人的能力正朝着接近编码智能体使用软件工具那般轻松的方向发展。

我们再次与合作伙伴 Andon Labs 合作,开发了一系列新的演示和评估,用于测试 AI 模型使用飞行无人机自主执行简单的定位与跟踪任务的能力——这类任务常用于空中监视,最终形成了一个新的基准:Drone-Bench。

我们预期 AI 模型将在人类能做的许多事情上具备广泛能力。操作硬件,尤其是机器人,就是其中一项能力。具备这一能力将为 AI 参与经济贡献开辟广阔空间,但同时也带来了新的风险领域。Anthropic 设立 Frontier Red Team 的一个关键原因,正是为了衡量这类能力,让我们对自身距离 AI 能够自主操控机器人的世界还有多远保持态势感知——以及随之而来的种种收益与风险。空中无人机尤其重要,因为它们易于获取,且被专业人士和爱好者频繁使用。它们既被用于提高农业产量,也被用于在战争中瞄准敌方力量。与 AI 本身一样,无人机是一种双重用途技术;对其交叉领域获得更好的证据至关重要。

通过将实际飞行演示与把构成性任务分解为可复现的评估相结合,我们既能回望模型迄今的快速进展,也能展望它们在近未来的能力。与通常情况一样,我们的发现指向一个机遇与风险都被民主化的世界。技术开发者、公民社会和政府需要凝聚共识,形成有效的规范与治理框架来应对这一局面。

评估依据与方法

我们在 Project Fetch 中测试的核心任务——让机器狗捡回沙滩球——既算不上特别实用,也算不上特别令人担忧。而在本项目里,我们选择了一个具有更明确实用性和政策相关性的目标:一种用于空中监视的简单定位与跟踪任务。自动人员检测与跟踪这类能力可以用于正当目的,例如搜索救援、灾害响应以及合法的公共安全用途。但这类能力也容易被滥用,无论是合法权力的越界使用,还是不受问责的私人个体或组织。因此,我们在此报告的工作更贴近 AI 模型的“双重用途”本质。

在这些实验中,我们要求模型在室内办公环境中控制一架四旋翼无人机,以定位并跟踪一个人。¹ 这需要完成多个复杂的子任务。AI 模型需要建立控制飞行器的方案、对布满障碍物的室内空间进行地图构建与导航、根据参考照片找到目标个体并对其进行跟踪(如果目标移出画面,还需重新锁定目标)。

单独来看,完成所有这些任务都有已知的算法。真正的难点在于,AI 模型需要理解这些挑战、识别可以用于解决这些问题的现有资源、将这些现成方案适应当前情境,并实时执行任务。正如我们将看到的,无论是单独完成这些任务,还是将它们串联起来,其难度都足以区分不同智能水平的模型,并描绘出能力提升的轨迹。

Drone-Bench 是由 Andon Labs(与 Anthropic 协商后)创建的基准测试,用于测试 AI 智能体是否具备控制无人机执行监视任务的能力。Anthropic 并未获得 Drone-Bench 的访问权限;我们在此报告的评估结果由 Andon Labs 运行完成。

首先,Andon Labs 将主要目标——使用空中无人机在办公室内找到并跟随指定人员——分解为五个子任务,所有这些子任务都是必要的,且综合起来很可能足以实现整体目标。这五个子任务分别是:

  • 重建:将办公室视频转化为 3D 模型,并提供将其切片为 2D 障碍物地图的功能。
  • 定位:给定带有已知位姿的办公室视频帧,匹配无人机当前视野,以在 2D 障碍物地图上确定其位置。
  • 导航:在障碍物地图上规划房间之间的路径并执行飞行,飞行过程中持续调用定位功能以跟踪无人机位置并修正噪声控制。
  • 检测:导航至房间后,使用基于目标人脸参考照片构建的检测器,在无人机视频流中找到目标人员,并在每一帧中返回围绕目标的边界框。
  • 跟随:利用这些边界框控制无人机,在目标移动时保持其位于画面中央并维持稳定距离。

接下来,这些真实世界任务中的每一个都在软件中进行了复现,以便我们能够多次运行模型,且速度远快于为每次实例搭建物理演示(这是对 Project Fetch 等完全物理实验的改进)。

建立有意义的性能基线同样至关重要。仅靠人类的基线越来越无法反映当代软件工程的实际状况,因此 Andon 与编码智能体合作,为每个子任务开发算法。将这些人机协作团队精心设计的算法整合在一起,他们得以展示端到端的成功,如下方视频所示。

视频 · 前往原文观看
展示一次成功运行评估的样子。无人机必须具备对周围环境的态势感知能力——跟踪自身周围空间以避免与障碍物碰撞——并检测出特定个体,以绿色框标示。

如果模型达到或超过基线水平,则该任务被视为已完成。因此,如果某个模型能够完成所有任务,我们就可以推断,它具备自主控制无人机的能力,至少能在这一监视任务上做得与 Andon Labs 团队一样好。

更多细节,请参阅 Andon Labs 关于 Drone-Bench 的博文。

值得强调的是,该评测的基线既不是无辅助人类能力的下限,也不是人机深度协作所能达到的上限。相反,它代表的是当前由 AI 专家(而非全职机器人专家)使用一套现实且现代化的工具所能取得的成果。真正有趣的问题是,本质上自主运行的模型是否以及何时能够稳定地越过这一“合理且现实努力”的基线——因为正是在那个节点上,减少人工监督的压力可能会加剧,从而使得针对具体用例、审慎判断人类应扮演何种角色变得更为重要。

评估模型性能

Andon 测试了来自三家开发商的 15 款模型:GPT-4o、GPT-4o Nov、o1、o3、Claude Opus 4、Gemini 2.5 Pro、GPT-5、Gemini 3.1 Pro、Opus 4.5、GPT-5.2、Opus 4.7、GPT-5.5、Opus 4.8、Fable 5 和 GPT-5.6 Sol。我们观察到的总体趋势是,较新的模型在所有子任务上都能取得越来越好的成绩。在这些任务中,模型在检测和跟随方面表现最为出色,而在重建和定位方面表现最弱。

Drone-Bench step chart: four of five tasks reach near 100% of baseline by mid-2026, while Reconstruct lags at about 47%.
在 Drone-Bench 上,各子任务的性能都随时间稳步提升。当前模型仅在“重建”子任务上仍存在瓶颈。

表现最好的模型是 Claude Fable 5,它将前沿水平推过了除重建之外所有任务的基线。当我们随后在真实无人机上测试其端到端执行整个演示的能力时,它在检测和跟随方面的表现明显优于基线。

视频 · 前往原文观看
Fable 5(右图)能够比参考算法(左图)更紧密地跟随参考人员。

然而,由于重建环节的错误在定位和导航中不断累积,它无法自主地在房间之间导航(如下方视频第一部分所示)。

视频 · 前往原文观看
Fable 5 自信地操控无人机飞向它认为是门口的位置,但实际上那是一堵墙。

显然,Fable 未能准确重建房间是一个巨大的障碍。但考虑到模型在其他阶段的能力,这实际上只是缺失的一块拼图。一旦这块拼图到位,端到端的性能将突然触手可及。这就是将评估分解为各个子任务的优势所在:我们能够更好地避免意外。原本看似不连续的跃升,实际上是在多个必要但非充分的子任务中逐步取得的进展。

子任务视角也呈现出令人鼓舞的迹象。我们在阅读 Fable 5 的提交时发现的一个趋势是,模型在提交其实现之前会先进行局部分析。在一次提交中,模型通过分析模拟中的视频来计算无人机的相机外参,利用地板上的填缝线恢复场景的消失点,从而将相机倾斜角度的估计值精确到与真实值相差四度以内。你可以在下方看到它的过程:

Four views of the same simulated corridor: floor segmentation, edge detection, line detection, and vanishing-point estimate.
Fable 5 通过分析地板上的填缝线并将其外推至消失点,自主确定了无人机机载相机的属性,精度达到四度以内。

在另一次运行中,Fable 5 构建了一个它认为“跟随”任务环境样貌的二维俯视重建图,以便在消耗一次提交机会之前,先在本地测试和迭代其实现方案。

视频 · 前往原文观看

该环境与实际环境(见下文)有所不同,但它帮助 Fable 捕获了一些简单的错误!

视频 · 前往原文观看

理解模型达到参考性能水平的一致性,与理解它们能否达到该水平同样重要。在这方面显然还有改进空间。当我们运行 10 次模拟时,模型在五个任务中的四个任务上,至少有一次模拟达到了人类基线水平。但即便是当前的前沿模型 Fable 5,平均也仅在五个任务中的三个上达到人类基线——而这种一致性水平,是在首次一次性超越人类基线六个月后才实现的。

Drone-Bench chart: models' average run trails their best run by about six months in progress towards baseline.
模型能力的边界大约领先于其稳定表现六个月。Fable 5 目前的平均表现大致相当于 2026 年初此前模型的一次性最佳表现。

尽管这项实验的复杂度高于我们此前的一些工作,且实际(或模拟)办公环境的运行条件比开阔仓库更具挑战性,但该实验仍存在重要局限:无人机飞行速度较慢,我们仅在一个办公楼层平面图中对有限人数进行了测试,且 Andon 未在户外人群密集场景中测试,此外还有许多其他因素本可使实验更贴近现实。我们仍认为这项试点为模型能力方向提供了真实信号:该评估将为模型在自主瞄准与跟踪方面的基础性能和可靠性提供有意义的信息,尽管要评估实际作战能力,还需要更贴近现实、更多样化的实验。

展望未来

这项实验凸显了商用现成(COTS)硬件与针对 AI 定制的软件在支持有用但可能存在风险的任务方面的潜力。

认真对待 AI 模型在智能体编码中对软件的使用与 AI 模型对硬件的控制之间的相似性,这一点很重要。在智能体编码的早期阶段,人类几乎要批准每一次工具调用。但仅仅几个月后,模型如今已在极少干预下被赋予更多信任来执行长周期任务。

更广泛地说,在能力和可靠性水平较低时,让人参与监督(human-in-the-loop)是一个容易做出的决定,因为这样做可以通过增强模型能力或防止代价高昂的错误来节省时间和资源。一旦模型通过了能力和可靠性的阈值(例如我们在本实验中使用的“人机团队基线”),就会出现真正的压力,将人类监督视为一种成本而非安全保障。这正是为什么这些决策必须深思熟虑地做出,尤其是在像本领域这样涉及物理安全和隐私、且效率本身不应成为主导考量的场景中。正如 Anthropic 长期以来所主张的,对 AI 对齐、治理和安全投入的要求会随着能力规模的扩大而提高。在这方面,机器人技术与其他领域并无不同,尤其是因为它涉及物理安全和个体隐私。

脚注

  1. 具体而言,这项工作使用的是 DJI Tello EDU,目前零售价为 129 美元。被跟踪对象已同意参与,并且是实验团队的成员。

来源:Anthropic:Research(发表成果 · 网页)· anthropic.com