# Robostral Navigate：Mistral AI 首个具身导航模型

- 来源：Mistral AI：News（网页）
- 发布时间：2026-07-07 00:00
- AIHOT 分数：70
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmrc6hfeq002nih5mhc7h2btk
- 原文链接：https://mistral.ai/news/robostral-navigate

## 精选理由

Mistral 首个具身导航模型，只用单 RGB 摄像头就在未见环境中跑赢深度传感器方案，对机器人行业是个真信号，做物流和制造的可以仔细看看。

## AI 摘要

Robostral Navigate 是 Mistral AI 首个具身导航模型（8B 参数），仅用单 RGB 摄像头，在 R2R-CE 验证集上取得 76.6%（unseen）和 79.4%（seen）的成功率，超越最佳单摄像头方法 9.7 个百分点，超越使用深度或多摄像头的系统 4.5 个百分点。模型通过 pointing 预测目标坐标并结合强化学习持续改进，全部在模拟中训练（约 40 万轨迹、6000 场景），采用 prefix-caching 实现高效训练。通用适配轮式、腿式和飞行机器人，能适应真实环境中未训练的障碍。

## 正文

今天，我们正式推出 Robostral Navigate，这是首个专为具身导航任务构建的模型。这是一款 8B 参数模型，能够接收 RGB 图像和自然语言指令，并驱动机器人在环境中移动：

“离开大厅，穿过走廊，进入储藏室，然后停下来面向第二个货架。”

要完成此类任务，其他模型通常需要借助深度传感器、激光雷达或多台摄像头协同工作。Robostral Navigate 仅使用一台普通 RGB 摄像头，无需任何深度传感器，却能在 R2R-CE（连续环境下的室内导航）验证集未见场景中达到 76.6% 的成功率——该基准测试旨在评估模型在训练集未覆盖的环境中遵循指令的能力。因此，它比最佳单摄像头方案高出 9.7 个百分点，比使用深度或多摄像头的最佳系统高出 4.5 个百分点，尽管它两者都未采用。

导航

我们的模型专为机器人导航设计，使机器人能够自主穿越复杂环境，包括办公室、住宅、商业建筑以及户外场景。

Robostral Navigate 在正在运行的办公室内，沿一条长程指令路线完全自主运行。

这项技术为制造业、配送、物流和酒店业解锁了大量应用场景，已成为当前客户需求最迫切的能力之一。只需向 Robostral Navigate 下达一条指令，它就能独立完成整个任务，在充满人员和障碍物的真实空间中移动——这些场景它从未见过，却能适应任何环境。

亮点

在 R2R-CE 基准上达到业界领先水平

* **79.4% Success Rate** on validation seen

验证集未见场景中成功率达 76.6%

仅需单台 RGB 摄像头即可运行，无需激光雷达或深度传感器

8B 参数模型，完全自主研发，全程在仿真环境中训练

可运行于轮式、足式及飞行机器人，并能跨不同尺寸的机器人泛化

对相机内参差异具有鲁棒性

通过前缀缓存实现高效的 token 训练

成功率

预言成功率

按路径长度加权的成功率

导航误差

指向导航

给定一个任务和一系列观测历史，Robostral Navigate 通过指向来预测机器人下一步应移动的位置：它推断目标位置在当前机器人摄像头视野中的图像坐标，以及到达时的期望朝向。与依赖度量位移的命令不同，指向使得策略天然对相机内参和世界尺度的变化具有鲁棒性。

然而，该方法无法处理目标位置位于当前视野之外的情况。当指向不适用时，模型会回退到机器人局部坐标系中的位移指令，例如：

“向前移动 2 米，向左移动 1.5 米，然后左转 25 度。”

从头构建

Robostral Navigate 完全由内部自主研发，不依赖任何现有的开源视觉语言模型（VLM）。

该模型基于我们专用于指向、计数和物体定位等接地任务的视觉语言模型进行初始化。导航能力是这些能力的自然延伸：一旦模型理解了物体在哪里，它就能学会如何移动。

我们完全在仿真环境中构建了一条高效的数据生成管线。这使得我们能够对数据进行快速迭代，最终生成了一个包含约 240 万条轨迹的数据集，这些轨迹采集自 35 万个场景。

高效的监督训练

Robostral Navigate 的一个关键要素是基于前缀缓存的高效训练算法。通过使用基于树的注意力掩码策略，我们的方法将整个回合压缩成一个单一序列，从而能够在单次前向传播中对所有时间步进行训练，同时防止时间步之间的信息泄露。

与每个时间步使用一个样本进行训练相比，我们的方法将训练 token 数量减少了 22 倍，同时保留了全部学习信号。在实践中，该方法将原本需要数月的训练过程缩短至数天内完成。

在线强化学习

我们利用大规模后训练大语言模型的知识，结合在线强化学习，来提升 Robostral Navigate 的性能。在监督训练阶段之后，我们使用 CISPO（一种在线强化学习算法）进一步改进模型性能。这使得模型能够从试错中学习、从失败中恢复，并获取探索性行为，从而有效缓解了原始行为克隆中的分布偏移问题。仅此一项就将成功率提升了 3.2%。我们尚未观察到任何性能瓶颈，因此我们有信心，更多的训练和实验将持续推高这一数字。

下一步计划

Robostral Navigate 只是迈向统一具身智能体的第一步。

我们相信，导航能力是通用机器人技术的基础能力。通过结合大规模仿真、高效训练以及强大的先验知识锚定，Robostral Navigate 证明了，仅凭一个紧凑模型和单个 RGB 摄像头即可实现最先进的具身导航。

开启你的具身前沿 AI 之旅，与我们的团队交流。

另外，我们正在招聘！

我们导航模型的发布标志着向前迈出了重要一步，但我们的征程远未结束。我们的目标是让机器人能够自主导航于复杂环境——办公室、家庭、商业建筑以及户外空间——而这仍有大量工作要做。我们正在积极扩充机器人团队，寻找与我们志同道合的优秀研究科学家和工程师。

如果你有兴趣加入我们，共同致力于让机器人实现无处不在的无缝导航，我们欢迎你提交申请加入我们的团队！

作者：Théo Cachet, Arjun Majumdar, Srijan Mishra, Thomas Chabal, Chris Bamford, Elliot Chane-Sane, Benjamin Tibi, Ludovic Ho Fuh, Olivier Duchenne - AI 科学机器人团队
