AI资讯 / 产业

产业 / 媒体

Google DeepMind 发布 Gemini Robotics 2,覆盖桌面机械臂到全身人形机器人

The Decoder

Google DeepMind 正式推出 Gemini Robotics 2,将其定位为迄今最先进的视觉-语言-动作(VLA)模型。该模型将图像识别、语言处理与动作控制融为一体,能够驱动从桌面机械臂到全身人形机器人等各类形态的机器人系统。DeepMind 将其描述为新一代自适应机器人的「智能层」,支持全身运动管理、精细动作执行以及多机器人协同调度。与此同时,DeepMind 还发布了配套的 Gemini Robotics ER 2 模型,专注于「具身推理」能力,作为机器人的高层控制系统,取代今年四月发布的 ER 1.6 版本。ER 2 现已在 Google AI Studio 上线,而 Gemini Robotics 2 则开放候补名单申请早期访问权限。此次双模型同步发布,标志着 DeepMind 在通用机器人智能领域迈出重要一步。

Google DeepMind 于 2026 年 7 月 31 日正式发布 Gemini Robotics 2,将其定性为目前最先进的视觉-语言-动作模型。VLA 模型是一类将视觉感知、自然语言理解与物理动作控制整合在同一框架内的 AI 系统,旨在让机器人能够在真实物理环境中自主完成复杂任务。DeepMind 表示,Gemini Robotics 2 可作为新一代自适应机器人的核心「智能层」,为机器人提供统一的感知与决策能力。

在能力覆盖范围上,Gemini Robotics 2 展现出较强的通用性。根据 DeepMind 的介绍,该模型能够管理机器人的全身运动协调,执行需要高精度的精细动作任务,并支持多台机器人之间的协同操作。这意味着同一套模型框架可以适配从工业桌面机械臂到双足人形机器人等截然不同的硬件形态,降低了开发者针对不同平台分别训练模型的成本。

与 Gemini Robotics 2 同步亮相的还有 Gemini Robotics ER 2,这是一款专为「具身推理」设计的模型。所谓具身推理,是指机器人基于对物理世界的理解来判断应当采取何种行动的能力,属于机器人智能的高层认知环节。ER 2 在系统架构中扮演高层控制器的角色,负责规划和决策,再将指令传递给底层执行模型,从而实现更复杂的任务分解与执行。

Gemini Robotics ER 2 正式取代了今年四月发布的 ER 1.6 版本,目前已在 Google AI Studio 上线,开发者可直接访问使用。相比之下,Gemini Robotics 2 尚处于早期访问阶段,有意接入的开发者和企业需要通过候补名单提交申请。这一分阶段开放的策略,反映出 DeepMind 在推进机器人基础模型商业化落地时较为审慎的节奏。

此次发布是 DeepMind 在通用机器人领域持续投入的最新成果。将大型语言模型的推理能力与机器人物理控制深度结合,是当前业界探索的核心路径之一。Gemini Robotics 2 与 ER 2 的双轨并行架构——一个负责底层动作执行,一个负责高层推理规划——也体现了 DeepMind 对「感知-推理-行动」全链路的系统性布局,未来在制造、物流、服务等场景中具备较大的应用想象空间。

要点

  • Gemini Robotics 2 是 DeepMind 最新的视觉-语言-动作模型,可统一驱动桌面机械臂、人形机器人等多种形态的机器人系统
  • 配套发布的 Gemini Robotics ER 2 专注具身推理,作为高层控制系统取代四月发布的 ER 1.6,现已在 Google AI Studio 上线
  • Gemini Robotics 2 支持全身运动管理、精细动作执行与多机器人协同,定位为新一代自适应机器人的核心智能层
  • Gemini Robotics 2 目前开放候补名单申请早期访问,ER 2 已对开发者全面开放
  • 双模型分层架构体现了 DeepMind 对机器人「推理规划」与「动作执行」解耦设计的系统性思路
查看原始来源

原始标题:Google Deepmind unveils Gemini Robotics 2 to power robots of all shapes from tabletop arms to humanoids

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。