Alphabet 旗下 Google DeepMind 正式推出新一代机器人 AI 模型套件Gemini Robotics 2,突破前代模型仅能控制人形机器人上半身的技术瓶颈,首次实现人形机器人从脚掌到指尖的一体化全身协同控制,推动通用物理 AI 与人形机器人深度融合。
长期以来,人形机器人普遍存在 “手脚分离” 难题:下肢行走平衡、上半身抓取操作依靠两套独立算法,难以在复杂人居环境中连贯完成复合型任务。全新 Gemini Robotics 2 由三大模型协同构成,覆盖任务规划、运动控制、本地部署全链条。其中核心Gemini Robotics 2(VLA 视觉语言动作模型) 负责将视觉画面、人类自然语言指令实时转化为机器人电机指令,统一统筹行走、下蹲、姿态平衡、避障、多指精细操作等全身动作。
在官方公开演示中,搭载该模型的 Apptronik Apollo 2 人形机器人接收自然语言指令后,自主穿越空间、规避障碍物、弯腰拾取物品并精准放置至目标位置,整套流程无需预先编写分段动作代码。模型同步强化手部灵巧操控能力,可完成拧动零件、物品收纳等精细化作业。
配套推出Gemini Robotics ER 2 具身推理模型,承担机器人 “决策大脑”,负责将复杂指令拆解为多阶段任务、追踪任务进度,同时支持多机器人协同作业;On-Device 2 端侧模型支持离线本地运行,大幅降低机器人对云端算力依赖,仅需少量调试即可适配不同硬件构型的机器人本体。
DeepMind 团队表示,本次技术迭代旨在打造面向所有机器人的通用智能层,向着物理 AGI持续迈进。研发团队同时客观指出,现阶段机器人运动速度、动态应变能力仍存在提升空间,距离完全适配真实生活场景还有持续研发周期。谷歌目前已启动开发者合作计划,与多家人形机器人企业开展联合测试,加速模型落地验证。
行业分析认为,谷歌这套全身级机器人大模型方案,打通大模型多模态理解与全身运动控制链路,为人形机器人落地家庭服务、工业柔性作业场景提供重要技术路线,全球人形机器人具身智能赛道竞争进一步升温。