Google DeepMind:Blog(RSS)
精选
68AI 编辑部评分,满分 100

Gemini Robotics-ER 1.6:通过增强具身推理赋能真实世界机器人任务

2026-04-13 23:52· 125天前· Laura Graesser
AI 导读

Gemini Robotics-ER 1.6 正式发布,通过增强具身推理能力为真实世界机器人任务提供底层支持。该版本重点升级空间推理与多视角理解功能,使自主机器人能够更精准地解析三维环境、理解物体间空间关系,并在复杂场景中实现高效决策与操作执行,显著提升机器人在物理世界中的感知与交互性能。

推荐理由

Gemini Robotics-ER 1.6 在机器人推理上迈了一大步,仪器读取和多视角成功检测是真需求,尤其是波士顿动力集成后,做具身智能的团队值得第一时间测试。

正文 · AI 翻译

要让机器人在我们的日常生活和工业领域真正发挥作用,它们必须做到的不仅仅是遵循指令,还要能够对物理世界进行推理。无论是导航穿越复杂的设施,还是解读压力表上的指针,机器人的“具身推理”能力使其能够弥合数字智能与物理行动之间的鸿沟。

今天,我们推出 Gemini Robotics-ER 1.6,这是我们以推理为先的模型的一次重大升级,它使机器人能够以前所未有的精度理解其环境。通过增强空间推理和多视角理解能力,我们正在为下一代物理智能体带来全新的自主性水平。

该模型专精于对机器人技术至关重要的推理能力,包括视觉与空间理解、任务规划以及成功检测。它充当机器人的高层推理模型,能够通过原生调用 Google 搜索等工具来查找信息、调用视觉-语言-行动模型(VLA)或任何其他第三方用户自定义函数来执行任务。

Gemini Robotics-ER 1.6 相较于 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 均有显著提升,特别是在空间和物理推理能力方面,例如指认、计数和成功检测。我们还解锁了一项新能力:仪表读数,使机器人能够读取复杂的仪表和视镜——这是我们通过与合作伙伴波士顿动力公司紧密合作发现的一个用例。

从今天开始,开发者可以通过 Gemini API 和 Google AI Studio 使用 Gemini Robotics-ER 1.6。为了帮助您快速上手,我们分享了一个开发者 Colab,其中包含如何配置模型并为其设置具身推理任务提示词的示例。

图 1:Gemini Robotics-ER 1.6 与 Gemini Robotics-ER 1.5 及 Gemini 3.0 Flash 模型的基准测试结果对比。仪表读数评估是在启用智能体视觉功能的情况下运行的(Gemini Robotics-ER 1.5 不支持此功能除外)。所有其他评估均在禁用智能体视觉功能的情况下运行。单视图和多视图成功检测评估包含不同的示例,因此不具有可比性。

指向:空间推理的基础

指向是具身推理模型的一项基础能力,并随着每一代模型的演进而发展。点可以用来表达多种概念,包括:

空间推理:精确物体检测与计数 关系逻辑:进行比较,例如识别集合中最小的物品;定义“从-到”关系(如将 X 移动到位置 Y) 运动推理:映射轨迹并识别最佳抓取点 约束遵从:对复杂提示词进行推理,例如“指向所有小到能放进蓝色杯子的物体”

Gemini Robotics-ER 1.6 能够将点作为中间步骤,用于推理更复杂的任务。例如,它可以用点来对图像中的物品进行计数,或识别图像上的关键点,以帮助模型执行数学运算,从而改进其度量估算。

下面的示例展示了 Gemini Robotics-ER 1.6 在指向多个元素方面的优势,以及它知道何时该指向、何时不该指向。

Gemini Robotics-ER 1.6 正确识别了锤子(2 把)、剪刀(1 把)、画笔(1 支)、钳子(6 把)的数量,以及一组可被解释为单个群体或多个点的园艺工具。它没有指向图像中不存在的被要求物品——一辆手推车和一把 Ryobi 电钻。相比之下,Gemini Robotics-ER 1.5 未能识别出锤子或画笔的正确数量,完全漏掉了剪刀,幻觉出一辆手推车,并且在钳子的指向上缺乏精度。Gemini 3.0 Flash 接近 Gemini Robotics-ER 1.6 的表现,但在处理钳子方面稍逊一筹。

成功检测:自主性的引擎

在机器人学中,知道任务何时完成与知道如何开始同样重要。成功检测是自主性的基石,它作为一个关键的决策引擎,使智能体能够智能地选择是重试失败的操作,还是推进到计划的下一阶段。

在机器人领域实现视觉理解极具挑战性,需要将复杂的感知与推理能力同广泛的世界知识相结合,才能处理遮挡、光线不足以及指令模糊等复杂因素。此外,大多数现代机器人系统都配备多摄像头视角,例如俯视视角和腕部安装的摄像头画面。这意味着系统需要理解不同视角如何组合,从而在每一时刻及跨时间维度上形成连贯的画面。

Gemini Robotics-ER 1.6 推进了多视角推理能力,使系统能够更好地理解多个摄像头流及其相互关系,即使在动态或遮挡环境中也是如此,如下方典型的多视角场景所示。

Gemini Robotics-ER 1.6 从多个摄像头视角获取线索,以判断“将蓝色笔放入黑色笔筒”这一任务何时完成。

仪表读数:真实世界中的视觉推理

要理解 Gemini Robotics-ER 1.6 的一项关键优势,我们必须审视它如何结合空间推理与世界知识等能力,来解决复杂的现实世界问题。仪表读数就是一个绝佳的例子。

这项任务源于设施巡检需求,这也是我们合作伙伴波士顿动力公司关注的重点领域。工业设施中包含众多仪表——温度计、压力表、化学液位计等等——这些都需要持续监控。波士顿动力的机器人产品 Spot 能够前往设施内的各个仪表处,并拍摄它们的图像。

Gemini Robotics-ER 1.6 使机器人能够解读多种仪表,包括圆形压力表、垂直液位指示器以及现代数字读数器。

仪表读数需要复杂的视觉推理能力。必须精确感知多种输入——包括指针、液位、容器边界、刻度标记等——并理解它们之间的相互关系。以玻璃管液位计为例,这需要估算液体在玻璃管中的填充量,同时考虑相机视角造成的畸变。压力表通常带有描述单位的文字,需要读取并理解其含义,有些压力表还有多个指针,分别指向不同的小数位,需要综合解读。

仪表读数以及更可靠的任务推理等能力,将使 Spot 能够完全自主地观察、理解并应对现实世界中的各种挑战。

Marco da Silva

波士顿动力公司 Spot 产品副总裁兼总经理

Gemini Robotics-ER 1.6 通过采用智能体视觉(将视觉推理与代码执行相结合)实现了高精度的仪表读数。该模型会执行中间步骤:首先放大图像以更清晰地读取仪表上的微小细节,然后利用指向和代码执行来估算比例和间隔,从而获得精确读数,最终运用其世界知识来解读含义。

图 2:Gemini Robotics-ER 1.6 的不同要素如何共同作用,在仪表读数任务上达到高水平性能。

精确读取模拟仪表

此示例展示了模型如何利用指向和代码执行进行放大,从而推导出精确到子刻度精度的仪表读数。

我们迄今为止最安全的机器人模型

安全性已融入我们具身推理模型的各个层面。Gemini Robotics-ER 1.6 是我们迄今为止最安全的机器人模型,在对抗性空间推理任务中,其对 Gemini 安全策略的遵循程度优于所有前代模型。

该模型在遵循物理安全约束方面的能力也显著提升。例如,它能通过空间输出(如指向)做出更安全的决策,指明在夹爪或材质约束下(例如“不要处理液体”、“不要拿起超过20公斤的物体”)哪些物体可以被安全操作。

我们还测试了该模型基于真实伤害报告,在文本和视频场景中识别安全隐患的能力。在这些任务中,我们的 Gemini Robotics-ER 模型在准确感知伤害风险方面,相比基线 Gemini 3.0 Flash 模型有所提升(文本任务提升 6%,视频任务提升 10%)。

图 3:在测试遵循物理安全约束能力的安全指令遵循任务上,Gemini Robotics-ER 1.6 相比 Gemini Robotics-ER 1.5 有显著提升。在指向任务上,它相比 Gemini 3.0 Flash 有所提升,且两个模型在文本任务上都具有非常高的准确率。Gemini 3.0 Flash 在边界框任务上表现更好。

与我们合作,共同提升机器人领域的具身推理能力

我们致力于确保 Gemini Robotics-ER 为机器人社区提供最大价值。如果您当前的专用应用场景中现有能力存在局限,欢迎您通过此表单提交 10-50 张标注图像,具体说明失败模式,以帮助我们构建更强大的推理功能。我们期待与您合作,在未来的版本中增强这些能力。

立即在 Google AI Studio 上体验 Gemini Robotics-ER 1.6

来源:Google DeepMind:Blog(RSS) · deepmind.google

Gemini Robotics-ER 1.6:通过增强具身推理赋能真实世界机器人任务

Google DeepMind:Blog(RSS)·2026-04-13 23:52·125天前·Laura Graesser
AI 导读

Gemini Robotics-ER 1.6 正式发布,通过增强具身推理能力为真实世界机器人任务提供底层支持。该版本重点升级空间推理与多视角理解功能,使自主机器人能够更精准地解析三维环境、理解物体间空间关系,并在复杂场景中实现高效决策与操作执行,显著提升机器人在物理世界中的感知与交互性能。

正文 · AI 翻译

要让机器人在我们的日常生活和工业领域真正发挥作用,它们必须做到的不仅仅是遵循指令,还要能够对物理世界进行推理。无论是导航穿越复杂的设施,还是解读压力表上的指针,机器人的“具身推理”能力使其能够弥合数字智能与物理行动之间的鸿沟。

今天,我们推出 Gemini Robotics-ER 1.6,这是我们以推理为先的模型的一次重大升级,它使机器人能够以前所未有的精度理解其环境。通过增强空间推理和多视角理解能力,我们正在为下一代物理智能体带来全新的自主性水平。

该模型专精于对机器人技术至关重要的推理能力,包括视觉与空间理解、任务规划以及成功检测。它充当机器人的高层推理模型,能够通过原生调用 Google 搜索等工具来查找信息、调用视觉-语言-行动模型(VLA)或任何其他第三方用户自定义函数来执行任务。

Gemini Robotics-ER 1.6 相较于 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 均有显著提升,特别是在空间和物理推理能力方面,例如指认、计数和成功检测。我们还解锁了一项新能力:仪表读数,使机器人能够读取复杂的仪表和视镜——这是我们通过与合作伙伴波士顿动力公司紧密合作发现的一个用例。

从今天开始,开发者可以通过 Gemini API 和 Google AI Studio 使用 Gemini Robotics-ER 1.6。为了帮助您快速上手,我们分享了一个开发者 Colab,其中包含如何配置模型并为其设置具身推理任务提示词的示例。

图 1:Gemini Robotics-ER 1.6 与 Gemini Robotics-ER 1.5 及 Gemini 3.0 Flash 模型的基准测试结果对比。仪表读数评估是在启用智能体视觉功能的情况下运行的(Gemini Robotics-ER 1.5 不支持此功能除外)。所有其他评估均在禁用智能体视觉功能的情况下运行。单视图和多视图成功检测评估包含不同的示例,因此不具有可比性。

指向:空间推理的基础

指向是具身推理模型的一项基础能力,并随着每一代模型的演进而发展。点可以用来表达多种概念,包括:

空间推理:精确物体检测与计数 关系逻辑:进行比较,例如识别集合中最小的物品;定义“从-到”关系(如将 X 移动到位置 Y) 运动推理:映射轨迹并识别最佳抓取点 约束遵从:对复杂提示词进行推理,例如“指向所有小到能放进蓝色杯子的物体”

Gemini Robotics-ER 1.6 能够将点作为中间步骤,用于推理更复杂的任务。例如,它可以用点来对图像中的物品进行计数,或识别图像上的关键点,以帮助模型执行数学运算,从而改进其度量估算。

下面的示例展示了 Gemini Robotics-ER 1.6 在指向多个元素方面的优势,以及它知道何时该指向、何时不该指向。

Gemini Robotics-ER 1.6 正确识别了锤子(2 把)、剪刀(1 把)、画笔(1 支)、钳子(6 把)的数量,以及一组可被解释为单个群体或多个点的园艺工具。它没有指向图像中不存在的被要求物品——一辆手推车和一把 Ryobi 电钻。相比之下,Gemini Robotics-ER 1.5 未能识别出锤子或画笔的正确数量,完全漏掉了剪刀,幻觉出一辆手推车,并且在钳子的指向上缺乏精度。Gemini 3.0 Flash 接近 Gemini Robotics-ER 1.6 的表现,但在处理钳子方面稍逊一筹。

成功检测:自主性的引擎

在机器人学中,知道任务何时完成与知道如何开始同样重要。成功检测是自主性的基石,它作为一个关键的决策引擎,使智能体能够智能地选择是重试失败的操作,还是推进到计划的下一阶段。

在机器人领域实现视觉理解极具挑战性,需要将复杂的感知与推理能力同广泛的世界知识相结合,才能处理遮挡、光线不足以及指令模糊等复杂因素。此外,大多数现代机器人系统都配备多摄像头视角,例如俯视视角和腕部安装的摄像头画面。这意味着系统需要理解不同视角如何组合,从而在每一时刻及跨时间维度上形成连贯的画面。

Gemini Robotics-ER 1.6 推进了多视角推理能力,使系统能够更好地理解多个摄像头流及其相互关系,即使在动态或遮挡环境中也是如此,如下方典型的多视角场景所示。

Gemini Robotics-ER 1.6 从多个摄像头视角获取线索,以判断“将蓝色笔放入黑色笔筒”这一任务何时完成。

仪表读数:真实世界中的视觉推理

要理解 Gemini Robotics-ER 1.6 的一项关键优势,我们必须审视它如何结合空间推理与世界知识等能力,来解决复杂的现实世界问题。仪表读数就是一个绝佳的例子。

这项任务源于设施巡检需求,这也是我们合作伙伴波士顿动力公司关注的重点领域。工业设施中包含众多仪表——温度计、压力表、化学液位计等等——这些都需要持续监控。波士顿动力的机器人产品 Spot 能够前往设施内的各个仪表处,并拍摄它们的图像。

Gemini Robotics-ER 1.6 使机器人能够解读多种仪表,包括圆形压力表、垂直液位指示器以及现代数字读数器。

仪表读数需要复杂的视觉推理能力。必须精确感知多种输入——包括指针、液位、容器边界、刻度标记等——并理解它们之间的相互关系。以玻璃管液位计为例,这需要估算液体在玻璃管中的填充量,同时考虑相机视角造成的畸变。压力表通常带有描述单位的文字,需要读取并理解其含义,有些压力表还有多个指针,分别指向不同的小数位,需要综合解读。

仪表读数以及更可靠的任务推理等能力,将使 Spot 能够完全自主地观察、理解并应对现实世界中的各种挑战。

Marco da Silva

波士顿动力公司 Spot 产品副总裁兼总经理

Gemini Robotics-ER 1.6 通过采用智能体视觉(将视觉推理与代码执行相结合)实现了高精度的仪表读数。该模型会执行中间步骤:首先放大图像以更清晰地读取仪表上的微小细节,然后利用指向和代码执行来估算比例和间隔,从而获得精确读数,最终运用其世界知识来解读含义。

图 2:Gemini Robotics-ER 1.6 的不同要素如何共同作用,在仪表读数任务上达到高水平性能。

精确读取模拟仪表

此示例展示了模型如何利用指向和代码执行进行放大,从而推导出精确到子刻度精度的仪表读数。

我们迄今为止最安全的机器人模型

安全性已融入我们具身推理模型的各个层面。Gemini Robotics-ER 1.6 是我们迄今为止最安全的机器人模型,在对抗性空间推理任务中,其对 Gemini 安全策略的遵循程度优于所有前代模型。

该模型在遵循物理安全约束方面的能力也显著提升。例如,它能通过空间输出(如指向)做出更安全的决策,指明在夹爪或材质约束下(例如“不要处理液体”、“不要拿起超过20公斤的物体”)哪些物体可以被安全操作。

我们还测试了该模型基于真实伤害报告,在文本和视频场景中识别安全隐患的能力。在这些任务中,我们的 Gemini Robotics-ER 模型在准确感知伤害风险方面,相比基线 Gemini 3.0 Flash 模型有所提升(文本任务提升 6%,视频任务提升 10%)。

图 3:在测试遵循物理安全约束能力的安全指令遵循任务上,Gemini Robotics-ER 1.6 相比 Gemini Robotics-ER 1.5 有显著提升。在指向任务上,它相比 Gemini 3.0 Flash 有所提升,且两个模型在文本任务上都具有非常高的准确率。Gemini 3.0 Flash 在边界框任务上表现更好。

与我们合作,共同提升机器人领域的具身推理能力

我们致力于确保 Gemini Robotics-ER 为机器人社区提供最大价值。如果您当前的专用应用场景中现有能力存在局限,欢迎您通过此表单提交 10-50 张标注图像,具体说明失败模式,以帮助我们构建更强大的推理功能。我们期待与您合作,在未来的版本中增强这些能力。

立即在 Google AI Studio 上体验 Gemini Robotics-ER 1.6

来源:Google DeepMind:Blog(RSS)· deepmind.google