产业 / 官方
从脚到指尖的全身智能控制
谷歌DeepMind于2026年7月30日正式发布Gemini Robotics 2,这是其面向下一代机器人的核心智能层。新系统由三款模型组成:主力视觉-语言-动作模型Gemini Robotics 2支持对人形机器人从脚到指尖的全身控制,以及双臂机器人的精细操作;具身推理模型Gemini Robotics ER 2作为高层决策大脑,负责理解指令、规划多步骤任务并协调多台机器人协同工作;端侧模型Gemini Robotics On-Device 2则专为本地部署优化,无需网络连接即可运行,且能在数小时内完成对全新机器人形态的快速适配。该系统已在Apptronik Apollo 2人形机器人及Franka Duo平台上完成验证,可执行整理房间、打结、密封拉链袋等复杂任务。Gemini Robotics ER 2目前已在Google AI Studio开放,VLA与端侧模型面向早期合作伙伴开放接入。
长期以来,机器人领域面临一个核心瓶颈:大多数机器人依赖预编程或远程操控,只能执行固定、重复的动作序列,无法真正自主学习或适应复杂多变的真实环境。更棘手的是,将一台机器人习得的技能迁移到另一台机器人身上,至今仍是极具挑战性的工程难题。谷歌DeepMind此次发布的Gemini Robotics 2,正是为了从根本上突破这些限制。
Gemini Robotics 2作为系统的核心视觉-语言-动作模型,首次实现了对人形机器人的全身协调控制。在Apptronik Apollo 2机器人的演示中,系统可接收自然语言指令,驱动机器人完成行走、蹲下、伸展等连贯动作,并将物品精准放置到指定位置。这标志着物理AI从桌面级上半身操作,正式迈入需要全身协调的复杂现实场景。
在精细操作层面,Gemini Robotics 2同样带来显著突破。系统可控制Apollo 2机器人搭载的SharpaWave五指手(拥有22个自由度),完成打结、密封拉链袋等精细动作;也可驱动Franka Duo平台上的标准两指平行夹爪,执行紧密装箱等复杂操作。谷歌表示,团队将持续提升操作精度与速度,最终目标是达到人类水平的灵巧度。
具身推理模型Gemini Robotics ER 2承担系统的高层认知职能。它能够观察环境、分解任务步骤、与VLA模型协同执行动作,并持续追踪任务进度直至完成。此次更新中,ER 2可更可靠地执行持续数分钟、涉及数百次决策的长序列任务,并能识别任务的起止时刻与关键事件节点。此外,系统新增多机器人协作能力,不同类型的机器人可相互通信、分工合作,共同完成单台机器人无法独立完成的复杂工作流。
端侧模型Gemini Robotics On-Device 2专为无网络或低延迟场景设计,可在机器人本地硬件上直接运行。该模型原生支持多模态输入,并具备快速适配能力——只需数小时的数据采集,即可完成对全新机器人形态的适配,大幅降低了将AI能力迁移至不同硬件平台的门槛。这一特性对工业、仓储等对网络依赖度低的应用场景尤为关键。
目前,Gemini Robotics ER 2已在Google AI Studio上线,并在Gemini Enterprise Agent Platform进入私有预览阶段;VLA与端侧模型则面向早期合作伙伴开放接入。谷歌DeepMind同步发布了开发者博客,详细介绍如何将上述模型部署至合作伙伴的硬件平台。随着人形机器人赛道持续升温,Gemini Robotics 2的发布标志着通用机器人智能的商业化进程又向前迈出了重要一步。
要点
- Gemini Robotics 2首次实现对人形机器人从脚到指尖的全身协调控制,突破了此前仅限上半身操作的局限
- 三款模型分工明确:主力VLA负责动作执行,具身推理模型ER 2负责高层规划与多机器人协作,端侧模型负责本地高效部署
- 端侧模型支持数小时内快速适配全新机器人形态,大幅降低跨硬件平台的迁移成本
- 多机器人协作能力正式引入,不同类型机器人可通信分工,共同完成复杂任务
- Gemini Robotics ER 2已在Google AI Studio开放,VLA与端侧模型面向早期合作伙伴接入
原始标题:Gemini Robotics 2 brings whole body intelligence to robots
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。