谷歌发布 Gemini Robotics 2.0,机器人灵活性与安全性大幅提升

人工智能
谷歌旗下 Gemini AI 模型驱动的机器人迎来全面升级。随着 Gemini Robotics 2 的正式亮相,这些实体机器人如今能够完成更复杂的任务、持续分析动态变化的环境,并与其他机器人协同作业。这一切得益于三个全新子模型的支撑,其中一个已于今日向开发者开放使用。
多年来,机器人奔跑、跳舞、后空翻的视频在互联网上广泛流传,但这些机器人大多是为完成特定动作而编程的。Gemini Robotics 的目标是打造一款通用型机器人,使其具备与人类相当的行动能力。谷歌 DeepMind 的科学家们有时将这一目标称为"物理 AGI"——即你告诉机器人做什么,它便能执行。在 2.0 版本中,谷歌表示其机器人 AI 已能控制完整的仿人机器人,即使面对结构复杂的仿人机械手,灵活性也得到了显著提升。
此次升级的核心是 Gemini Robotics ER 2,这是一款升级版的"具身推理"模型,DeepMind 声称其性能相较于此前的 1.6 版本实现了重大飞跃。该模型已与 Gemini Live API 集成,为开发者提供了率先体验这一进步的机会。
Gemini Robotics ER 2 属于视觉语言模型(VLM),专为理解操作指令与周围环境而设计。此次升级的亮点在于,ER 2 能够实时处理机器人摄像头的视频流,使系统得以在机器人逐步推进任务的过程中持续追踪执行进度。谷歌指出,Gemini Robotics ER 2 对视频帧完整性的分类准确率接近 60%。尽管距离完美仍有差距,但这一表现已远超 1.6 版本,也优于目前同类竞争 AI 模型的视觉理解能力。
精准识别视频流中的关键时刻,同样是机器人准确完成任务的关键所在。以倒咖啡为例,机器人必须清楚地判断何时停止倾倒。ER 2 在这方面表现尤为出色,对关键时刻的识别准确率接近 90%。在执行多步骤任务时,具身推理模型使机器人能够实时感知操作失误,并在原步骤上进行重试,而无需从头开始。例如,若机器人尝试抓取的球滚走,或有人移动了容器,系统可以直接调整手部位置和动作,而不必重置整个流程。
此次发布的升级版具身推理模型,也赋予了谷歌 DeepMind 机器人 AI 多机协作的能力。演示视频展示了 Apptronik 的 Apollo 2 与更简单的 Franka F3 Duo 协同完成任务,且互不干扰的场景。尽管测试机器人在速度和动作流畅度上仍与人类存在差距,但演示视频中包含了大量实时操作画面,机器人的表现明显比以往测试中更加果断、自然。
理解指令只是第一步,驱动机器人在物理世界中实际行动,则由另一个模型负责。视觉语言模型在完成任务规划后,会将控制权移交给升级版的视觉语言动作模型,即 Gemini Robotics 2。该模型依据任务指令生成机器人动作,其原理与其他生成式 AI 系统生成文本或图像的方式如出一辙。此外,还有一款低延迟的本地离线版本,名为 Gemini Robotics On-Device 2。目前,这两款模型仍处于小范围测试阶段。
Q&A
Q1:Gemini Robotics ER 2 和之前的版本相比有哪些具体提升?
A:Gemini Robotics ER 2 相比 1.6 版本有多项显著提升。它可以实时处理机器人摄像头的视频流,对视频帧完整性的分类准确率接近 60%,对关键动作时刻的识别准确率接近 90%。此外,它还支持多机器人协同作业,并能在任务执行失败时实时感知并在原步骤上重试,而无需从头开始整个流程。
Q2:Gemini Robotics 2 和 Gemini Robotics On-Device 2 有什么区别?
A:Gemini Robotics 2 是标准版视觉语言动作模型,负责将任务规划转化为具体的机器人动作,原理类似于生成式 AI 生成文本或图像。Gemini Robotics On-Device 2 则是它的本地离线版本,具有低延迟特性,适合在设备端运行,无需依赖云端连接。目前这两款模型都仅对小范围测试用户开放。
Q3:Gemini Robotics ER 2 现在普通开发者可以用吗?
A:可以。Gemini Robotics ER 2 已与 Gemini Live API 集成,开发者从今日起即可访问和体验该模型。而另外两款模型——Gemini Robotics 2 和 Gemini Robotics On-Device 2——目前仍处于小范围测试阶段,尚未对所有开发者开放。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)