AI资讯 / 产业

产业 / 官方

谷歌DeepMind发布Gemini Robotics ER 2:赋予机器人实时视频理解与多机协同能力

Google DeepMind

谷歌 DeepMind 正式推出具身推理模型 Gemini Robotics ER 2,旨在扮演机器人的高阶大脑。该模型具备强大的视频理解、任务编排与多机协作能力,可通过双向流式 API 实现毫秒级低延迟响应。通过实时跟踪视频流,ER 2 能精准判断任务进度并定位关键事件时刻,从而控制低阶视觉-语言-动作模型或调用外部工具完成复杂多步骤任务,现已开放 API 接入。

谷歌 DeepMind 发布了最新的具身推理模型 Gemini Robotics ER 2,将其定位为机器人的高阶智慧大脑。该模型专注于解决物理世界中的实时感知与决策难题,能够理解自然语言指令、感知周围环境并规划多步骤任务。在执行过程中,它会将具体的低阶动作控制移交给视觉-语言-动作模型,实现高层推理与底层执行的分工合作。

为了提升物理智能体的灵活度,Gemini Robotics ER 2 支持原生工具调用,不仅能联动谷歌搜索等外部服务,还可接入各类导航及机械臂 API。结合 Gemini Live 的双向流式通信,该模型大幅降低了推理延迟,避免了传统机器人操作中停顿思考的卡顿现象。谷歌已通过波士顿动力的 Spot 机器人展示了接收自然语言指令并抓取零食的全流程。

在时序视频理解方面,ER 2 取得了突破性进展。模型能通过连续视频流追踪任务完成度,其进度分类准确率达 57.4%,关键时刻定位准确率高达 91.3%,平均误差仅 0.96 秒。这种亚秒级响应能力使机器人可以在不停机的情况下实时监测自身动作完成状态、自动纠正操作错误,显著提升了在复杂物理环境中的任务完成可靠性。

此外,Gemini Robotics ER 2 首次引入了异构多机器人协同机制。不同形态的机器设备能够基于统一的语义理解进行信息共享与分工协作,例如联合完成单台设备无法独自处理的复杂工作流。目前开发者已可通过 Gemini API、Google AI Studio 以及 Gemini Enterprise 平台体验并部署该模型。

要点

  • Gemini Robotics ER 2 作为机器人高阶大脑,负责任务规划与工具调度,底层交由 VLA 模型控制。
  • 基于 Gemini Live API 实现低延迟流式通信,消除了机器人决策过程中的卡顿,支持流畅多步骤交互。
  • 时序视频理解能力大幅提升,关键时刻定位准确率达 91.3%,平均误差低于 1 秒,支持实时自纠错。
  • 引入多机器人协同机制,允许不同形态的机器人在统一语义框架下分工完成复杂工作流。
查看原始来源

原始标题:Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。