[2025] [π0.5] [π0.5 : a Vision-Language-Action Model with Open-World Generalization]
·
π0.5 : a Vision-Language-Action Model with Open-World Generalization, 2025
首次展示了一种基于端到端学习的机器人系统,该系统能够在全新的家庭环境中执行长时程且灵巧的操作任务,例如清理厨房或卧室。
- RT-2 虽然能理解复杂指令,但在执行长达 10-15 分钟任务时,常因误差累积而失败
- 模仿学习在不同的环境上泛化能力较差
- 一些大模型场景理解能力很强,但缺乏生成精细、连续动作的能力
基于 π0 + 不同来源的数据 (跨场景、跨任务)
- high-level: 语义数据
- low-level: 从其他机器人收集的动作数据
- 直接扩大目标机器人的一手数据有时候是不现实的
预测目标:action chunk
将 VLA 模型和 动作解码机制( π0 中使用的 Flow Matching、Rdt-1b、Dexvla、Hybridvla 等模型使用的 diffusion)及高级 action tokenization 机制 (FAST)结合起来,便能解决更广泛的现实世界操作任务
- π0.5 在预训练中使用 FAST
- 离散化的动作 token,为了训练更高效
- 让VLM主干在预训练阶段就能更好地理解动作的语义,这是与 π0 的一个重要区别
- 在后训练中使用才 Flow Matching
- π0 全程使用流匹配
一些之前的工作认为用高层次的推理增强端到端的策略模型可以提升长时程任务的效果, 比如 SayCan, Gemini Robotics, CoT-VLA
π0.5
两阶段: (SayCan 使用了两个模型,而 π0.5 使用的是一个端到端模型)
- 高层次子任务预测 (e.g. 拿起碟子)
- 动作预测(predict target joint and end-effector poses)
- 由 PD controllers 来控制到达指定位置
- 任务预测推理频率比动作预测频率低
- RT-2 和 π0 都是直接把任务提示输入低层系统,没有高层子任务预测阶段
- 使用 GPT-4 代替高层子任务推理,效果差很多,说明高层推理和机器人动作预测联合训练的重要性
输入:
- 文本token: 嵌入矩阵
- 视觉token: 视觉 patch 经过视觉编码器
- 动作 token: 线性映射到 transformer 的嵌入空间 ( π0 中的方法)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)