谷歌的“机器人之脑”:Gemini Robotics ER 2与“物理AGI”的进击
2026年7月30日,Google DeepMind正式发布Gemini Robotics ER 2模型。官方博客用一句话概括了它的定位——“一个高级大脑”。同一天,谷歌在社交平台X上抛出了更直白的九个字:“一个大脑。适用于任何机器人。”
当特斯拉、Figure AI等玩家在机器人本体赛道上竞速时,谷歌选择了一条截然不同的路径:不造机器人,只造机器人的“大脑”。Gemini Robotics ER 2的发布,标志着这场“物理AGI”竞赛进入了一个全新的阶段。
一、三层架构:让机器人“思考”与“行动”分离
Gemini Robotics 2并非单一模型,而是一个由三个模型组成的分层系统。
第一层是Gemini Robotics 2——视觉-语言-动作模型(VLA),将摄像头画面和自然语言指令直接转换为电机控制指令,能够控制整个人形机器人从脚到指尖的每一个关节。与此前主要控制机器人上半身的模型不同,Gemini Robotics 2实现了真正意义上的“全身控制”——机器人可以行走、下蹲、伸展、抓取,完成“穿过房间、拿起洒水壶并将其放到架子上”这样需要全身协调的完整任务。
第二层是Gemini Robotics ER 2——具身推理模型,也就是本次发布的核心。它不直接控制电机,而是充当机器人的“高级大脑”:理解物理环境、规划多步骤任务,然后将执行指令交给底层的VLA模型。官方演示中,ER 2驱动Boston Dynamics的Spot机器人,仅凭语音指令即可完成导航和物体抓取。
第三层是Gemini Robotics On-Device 2——轻量级VLA模型,经过优化可在机器人本地运行,只需几小时数据就能适配全新的机器人本体。
三层各司其职:动作、规划、部署——这个架构本身就是谷歌的竞争宣言。
二、连续视频理解:从“停-想-动”到“边想边动”
Gemini Robotics ER 2相比前代ER 1.6的核心突破,在于连续视频流处理能力。
传统机器人推理模型采用“停-想-动”模式——机器人必须先停下来思考,再执行动作,再停下来思考下一步。这种模式在物理世界中造成了明显的卡顿和不自然。ER 2通过接入Gemini Live API的双向流式端点,实现了同步推理——机器人在执行当前动作的同时,已经在规划后续步骤。
在性能数据上,ER 2交出了一份扎实的答卷:
-
任务进度分类准确率达57.4%,帮助机器人在不重启整个工作流的情况下修正失败步骤
-
关键时刻定位准确率达91.3%,平均时间误差仅0.96秒——比如判断“何时停止向杯中倒咖啡”
-
执行速度是ER 1.6的4倍,满足现实机器人安全运行所需的亚秒级延迟要求
-
128,000 Token的上下文窗口,足以处理数分钟连续视频流
更值得注意的是,ER 2可以原生调用Google Search或开发者自定义函数。这意味着机器人遇到不确定的情况时,可以直接“上网查”——这是具身智能走向实用化的关键一步。
三、多机器人协作:第一次让不同的“身体”共享同一个“大脑”
Gemini Robotics ER 2首次引入了多机器人协作机制。
在官方演示中,Apptronik公司的Apollo 2人形机器人与Franka F3 Duo机械臂平台成功展示了跨设备协同作业。不同类型的机器人借助ER 2提供的共享语义理解,可以实时沟通、分工配合、交接任务,完成单台设备无法独立完成的复杂工作流。
这一能力的意义远超技术演示本身。它揭示了一个趋势:未来的机器人生态可能不是“一个机器人干所有事”,而是“一群各有所长的机器人,共享同一个智能系统协同作战” 。而谷歌想要的,正是这个“共享的智能系统”。
四、安全:从“可选项”到“必答题”
当AI模型开始控制物理世界中的人形机器人时,安全不再是锦上添花,而是生死攸关。
谷歌在ER 2上采取了多层次安全防护策略。ER 2被官方称为“迄今为止最安全的机器人模型”——它能更好地检测人类是否靠近,触发安全工具调用,并在有人过于接近时将机器人带至安全停止状态。
谷歌还推出了名为ASIMOV-Agentic的安全评测基准,专门测试推理模型作为“编排者”时是否安全——能否拒绝不安全的工具调用、判断物理可行性、在不确定时寻求人类帮助。
不过,谷歌在模型卡中明确禁止开发者将机器人模型用于医疗和交通运输等安全关键领域。这说明,即便技术突飞猛进,“物理AGI”距离真正进入高风险场景仍有距离。
五、行业变局:谷歌押注“Android时刻”
Gemini Robotics ER 2的发布,本质上是谷歌对整个机器人行业的一次战略卡位。
当前人形机器人赛道的主流玩家——特斯拉、Figure AI——走的是垂直整合路线:自研模型、自研执行器、自建工厂。而谷歌的选择截然相反:做一个开放的、适用于任何机器人的智能层。
DeepMind负责人Demis Hassabis曾表示,他希望为机器人构建一个类似Android的操作系统。如果这一愿景实现,任何机器人硬件厂商都可以搭载谷歌的“大脑”,就像任何手机厂商都可以搭载Android一样。谷歌不参与机器人本体的制造竞赛,却可能成为所有机器人背后的平台级赢家。
在商业落地层面,ER 2已通过Gemini API和Google AI Studio向开发者公开提供,并在Gemini企业智能体平台开启私密预览。首批合作伙伴包括Apptronik、Agile Robots SE、Boston Dynamics等。第一波应用场景将集中在仓库分拣、设施巡检、实验室任务等风险相对可控的领域。
💎 结语
Gemini Robotics ER 2的发布,标志着具身智能从“实验室玩具”向“可部署系统”迈出了实质性的一步。连续视频理解、同步推理、多机器人协作、工具调用——这些能力叠加在一起,正在将一个曾经只存在于科幻中的概念变成现实:一个能看、能想、能规划、能协作的机器人“大脑” 。
谷歌不造机器人,但谷歌想成为所有机器人的“大脑”。这条路能否走通尚需时间检验,但有一点已经清晰:物理世界与AI的交汇,正在以前所未有的速度加速。而当这场加速发生时,谁掌握了“大脑”,谁就掌握了主动权。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)