今天,我们正式推出 Robostral Navigate,这是首个专为具身导航任务构建的模型。这是一款 8B 参数模型,能够接收 RGB 图像和自然语言指令,并驱动机器人在环境中移动:
“离开大厅,穿过走廊,进入储藏室,然后停下来面向第二个货架。”
要完成此类任务,其他模型通常需要借助深度传感器、激光雷达或多台摄像头协同工作。Robostral Navigate 仅使用一台普通 RGB 摄像头,无需任何深度传感器,却能在 R2R-CE(连续环境下的室内导航)验证集未见场景中达到 76.6% 的成功率——该基准测试旨在评估模型在训练集未覆盖的环境中遵循指令的能力。因此,它比最佳单摄像头方案高出 9.7 个百分点,比使用深度或多摄像头的最佳系统高出 4.5 个百分点,尽管它两者都未采用。
导航
我们的模型专为机器人导航设计,使机器人能够自主穿越复杂环境,包括办公室、住宅、商业建筑以及户外场景。
Robostral Navigate 在正在运行的办公室内,沿一条长程指令路线完全自主运行。
这项技术为制造业、配送、物流和酒店业解锁了大量应用场景,已成为当前客户需求最迫切的能力之一。只需向 Robostral Navigate 下达一条指令,它就能独立完成整个任务,在充满人员和障碍物的真实空间中移动——这些场景它从未见过,却能适应任何环境。
亮点
在 R2R-CE 基准上达到业界领先水平
* **79.4% Success Rate** on validation seen- 验证集未见场景中成功率达 76.6%
仅需单台 RGB 摄像头即可运行,无需激光雷达或深度传感器
8B 参数模型,完全自主研发,全程在仿真环境中训练
可运行于轮式、足式及飞行机器人,并能跨不同尺寸的机器人泛化
对相机内参差异具有鲁棒性
通过前缀缓存实现高效的 token 训练
成功率
预言成功率
按路径长度加权的成功率
导航误差
指向导航
给定一个任务和一系列观测历史,Robostral Navigate 通过指向来预测机器人下一步应移动的位置:它推断目标位置在当前机器人摄像头视野中的图像坐标,以及到达时的期望朝向。与依赖度量位移的命令不同,指向使得策略天然对相机内参和世界尺度的变化具有鲁棒性。
然而,该方法无法处理目标位置位于当前视野之外的情况。当指向不适用时,模型会回退到机器人局部坐标系中的位移指令,例如:
“向前移动 2 米,向左移动 1.5 米,然后左转 25 度。”
从头构建
Robostral Navigate 完全由内部自主研发,不依赖任何现有的开源视觉语言模型(VLM)。
该模型基于我们专用于指向、计数和物体定位等接地任务的视觉语言模型进行初始化。导航能力是这些能力的自然延伸:一旦模型理解了物体在哪里,它就能学会如何移动。
我们完全在仿真环境中构建了一条高效的数据生成管线。这使得我们能够对数据进行快速迭代,最终生成了一个包含约 240 万条轨迹的数据集,这些轨迹采集自 35 万个场景。
高效的监督训练
Robostral Navigate 的一个关键要素是基于前缀缓存的高效训练算法。通过使用基于树的注意力掩码策略,我们的方法将整个回合压缩成一个单一序列,从而能够在单次前向传播中对所有时间步进行训练,同时防止时间步之间的信息泄露。
与每个时间步使用一个样本进行训练相比,我们的方法将训练 token 数量减少了 22 倍,同时保留了全部学习信号。在实践中,该方法将原本需要数月的训练过程缩短至数天内完成。
在线强化学习
我们利用大规模后训练大语言模型的知识,结合在线强化学习,来提升 Robostral Navigate 的性能。在监督训练阶段之后,我们使用 CISPO(一种在线强化学习算法)进一步改进模型性能。这使得模型能够从试错中学习、从失败中恢复,并获取探索性行为,从而有效缓解了原始行为克隆中的分布偏移问题。仅此一项就将成功率提升了 3.2%。我们尚未观察到任何性能瓶颈,因此我们有信心,更多的训练和实验将持续推高这一数字。
下一步计划
Robostral Navigate 只是迈向统一具身智能体的第一步。
我们相信,导航能力是通用机器人技术的基础能力。通过结合大规模仿真、高效训练以及强大的先验知识锚定,Robostral Navigate 证明了,仅凭一个紧凑模型和单个 RGB 摄像头即可实现最先进的具身导航。
开启你的具身前沿 AI 之旅,与我们的团队交流。
另外,我们正在招聘!
我们导航模型的发布标志着向前迈出了重要一步,但我们的征程远未结束。我们的目标是让机器人能够自主导航于复杂环境——办公室、家庭、商业建筑以及户外空间——而这仍有大量工作要做。我们正在积极扩充机器人团队,寻找与我们志同道合的优秀研究科学家和工程师。
如果你有兴趣加入我们,共同致力于让机器人实现无处不在的无缝导航,我们欢迎你提交申请加入我们的团队!
作者:Théo Cachet, Arjun Majumdar, Srijan Mishra, Thomas Chabal, Chris Bamford, Elliot Chane-Sane, Benjamin Tibi, Ludovic Ho Fuh, Olivier Duchenne - AI 科学机器人团队