# 谷歌 DeepMind 推出 Gemini Robotics ER 2，最强具身推理模型支持连续视频理解与多机器人协作

- 来源：IT之家（RSS）
- 发布时间：2026-07-31 07:12
- AIHOT 分数：54
- AIHOT 链接：https://aihot.virxact.com/items/cms86lkhp014trot09146ccga
- 原文链接：https://www.ithome.com/0/983/915.htm

## AI 摘要

谷歌 DeepMind 发布 Gemini Robotics ER 2，这是其面向机器人的最强具身推理模型。相比 1.6 版本，ER 2 可分析连续视频流以追踪任务进度、在出错时调整，并在任务进度分类测试中准确率达 57.4%，时刻寻找测试中准确率为 91.3%。该模型执行速度为更大模型的 4 倍，支持多机器人协作，现已通过 Gemini API 和 Google AI Studio 公开提供。

## 正文

IT之家 7 月 31 日消息，谷歌 DeepMind 昨日（7 月 30 日）发布博文，宣布推出 Gemini Robotics ER 2 模型，是其面向机器人的最强具身推理（embodied reasoning）模型。

定位方面，该模型可视为机器人的“高级大脑”，协调处理与人类交流、理解物理世界并规划多步骤任务等。该模型后续会向更低层级的视觉-语言-动作 (VLA) 模型分派任务，管控其完成各项任务。

在功能方面，相比较此前 1.6 版本，Gemini Robotics ER 2 模型通过持续观看视频，机器人现在可以追踪自身的运行进度，在出现问题时进行调整，并准确把握进入下一步的时机。模型还可原生调用 Google Search（谷歌搜索）或开发者自定义函数。

在物理智能体方面，在机器人当前处于执行任务状态下，Gemini Robotics ER 2 模型可以同步推理后续步骤，以减少传统机器人“停止 — 思考 — 再行动”带来的停顿。该模型接入 Gemini Live API（Gemini 实时 API）的双向流式端点，面向对延迟敏感的机器人任务。

相较 Gemini Robotics ER 1.6，ER 2 可分析连续视频流。机器人可据此跟踪自身任务进度，在动作出错时调整或重试，并判断何时进入下一步骤。

在任务进度分类测试中，Gemini Robotics ER 2 的准确率为 57.4%。该能力可帮助机器人在不重启整个工作流的情况下修正失败步骤。

在 moment-finding 时刻寻找（关键时刻定位）测试中，模型需要找出关键事件发生的精确视频帧，例如判断何时停止向杯中倒咖啡。ER 2 的准确率为 91.3%，平均绝对时间误差为 0.96 秒。

谷歌称，该模型以更低计算成本达到接近更大模型类别的精度，执行速度为其 4 倍，并满足现实机器人安全运行所需的亚秒级延迟要求。

ER 2 还支持多机器人协作。不同类型的机器人可借助共享语义理解沟通、交接任务，并完成单台设备难以独立完成的复杂工作流。谷歌展示了 Apptronik 的 Apollo 2 与 Franka 的 FR3 Duo 协作案例。

Gemini Robotics ER 2 现已通过 Gemini API 和 Google AI Studio 面向开发者公开提供；同时，它已在 Gemini Enterprise Agent Platform（Gemini 企业智能体平台）中开启私密预览。谷歌还发布了模型配置和提示词示例代码。
