π0.5 模型解析
摘要:π0.5 是一款面向家庭移动操作场景的视觉-语言-动作(VLA)模型,通过预训练加后训练的两段式流程,将高层推理与低层执行融进同一个模型。它结合离散与连续动作表示,在全新真实住宅中展现出强大的多阶段任务泛化能力,并显著优于现有 VLA 模型。
引言
想象一下:一台机器人走进陌生的厨房,听到“把碗放进水槽”的指令后,能自己规划步骤、伸手抓取、稳稳移动,一气呵成。这背后靠的不只是机械臂的精准控制,更是一个能同时“看懂画面、听懂语言、想好动作”的智能大脑。今天要介绍的是VLA模型中大名鼎鼎的 π0.5,正是这样一款面向家庭移动操作场景的视觉-语言-动作(VLA)模型。它把高层推理与低层执行融进同一个模型,用预训练加后训练的两段式流程,让机器人在全新环境中也能完成多阶段任务。接下来,我们从模型总览、架构设计到实验结果,一步步拆解它是如何做到的。
原文《π0.5: a Vision-Language-Action Model with Open-World Generalization》
论文:https://arxiv.org/pdf/2504.16054
代码:https://github.com/Physical-Int

1.模型总览

预训练:生成一个VLM模型(视觉语言模型)用于训练模型的数据包括:(1)语言任务(2)多模态数据以及机器人数据(3)任务提示词 。 机器人相关数据通过FAST动作分词器转化为离散标记。旨在使模型适应各种机器人任务
后训练:对预训练模型进行针对性优化,使其能够在低级和高级层面上进行推理,以适用于移动操作场景。 用流匹配技术来表示动作分布,实现高效的实时推理,并且能处理连续的动作序列。
推理阶段:在推理阶段,模型首先为机器人生成一个高级子任务,然后根据这个子任务来进行推理。通过动作专家来预测低级别的动作。
总体来说:预训练是通过大量的数据训练的一个比较广泛的模型,但是执行具体任务的话,需要进行进一步的后训练,包括采集对应的数据,以及进行模型微调。执行自己的人物的话,只部署预训练模型以及其他任务的后训练模型并不能取得很好的部署效果,尤其在真机部署。
2.模型架构
2.1.pi05 架构解析
2.1.1.分层架构
这个架构最大的亮点是把决策分为两层,但用同一个模型来实现:
高层推理(高级推理):模型接收当前观察(o_t)和总体任务(ℓ,比如“收拾碗碟”),然后输出一个文字形式的高级子任务(ℓ^,比如“拿起盘子”)。这相当于模型在“思考”下一步该做什么。
低层执行(低级推理):模型在知道了“拿起盘子”这个指令后,再结合当前的观察,生成具体的动作序列(a_t : t+H),比如机械臂在接下来几秒内每个关节转动的角度。

2.1.2.多模态数据处理(Transformer)
为了让模型能同时处理图像、文字和机器人关节数据,架构做了专门设计:
输入(x_1:N)很“混搭”:输入是一串Token,但这里的token是广义的,既包括传统的文字和图像块,也包括连续的机器人动作数据(比如关节角度的数值)。
不同内容,不同专家(ρ 路由):模型内部有“专家权重”。文字走文字编码器,图像走视觉编码器,动作数据则被线性投影后,交给专门的“动作专家”网络处理。这就像一家公司,不同部门处理不同业务。
注意力机制(A)更灵活:不像传统的语言模型只能“向前看”(因果注意力),这里的图像、文字提示和动作数据可以使用“双向注意力”,这意味着模型在处理某一部分时,可以同时参考上下文左右两侧的信息,理解更全面。
2.1.3分流输出:一边说话,一边动手
输出分流:一边说话,一边动手
模型的输出端(f 的输出)也被清晰地分成了两路:
前 M 个输出:对应文字令牌的logits(概率),用于生成文本(比如回答“盘子在哪儿?”或者输出刚才提到的子任务“拿起盘子”)。
后 H 个输出:由“动作专家”生成,再通过线性映射,直接变成连续的、具体的机器人控制信号(比如扭矩或位置增量)。
2.2.结合离散与连续动作表示方式

π0.5它通过移动机械臂(MM)、不同环境中的非移动机器人(ME)、实验室条件下收集的交叉身体数据(CE)、高级子任务预测(HL)和多模态网络数据(WD)进行预训练。在训练后阶段,我们还使用口头指令(VI),省略实验室交叉身体数据(CE),将模型重点放在移动操作和多样化环境上。图中展示了每个类别任务的典型子集。
流批配来预测模型最终的连续动作动作
在进行VLA训练时,离散token要快得多,但不适合实时推理,因为需要自回归解码进行推理,而自回归的成本很高
理想的模型设计应训练离散化动作,但仍允许使用流匹配在推理时产生连续动作。
2.3预训练
预训练的数据包括:
1.多样化的移动操作器数据(MM):大约 400 小时的数据,这些数据来自在约 100 种不同的家庭环境中执行家务任务的移动操作任务.
2.多样化的多环境非移动机器人数据(ME): 在各种家庭环境中收集了非移动机器人的数据,这些机器人可能拥有单臂或双臂。这些机器人被固定在表面或安装平台上
3.交叉形态实验室数据(CE): 我们收集了在实验室中进行的各种任务的数据,这些任务包括搬桌子、折叠衬衫等简单操作。这些任务中有一些与我们评估的目标非常相关(例如,将餐具放入收纳箱),而另一些则不太相关(例如,研磨咖啡豆)。这些数据涵盖了单臂和双臂操作器,以及固定式和移动式操作平台。我们还包含了开源的 OXE 数据集。
4.高级子任务预测(HL): 将高级任务指令,如“打扫卧室”分解为更短的子任务,例如“调整毯子”和“捡起枕头”。这种方式类似于语言模型中的思维链提示方式。这样可以帮助训练有素的策略模型理解当前场景,并更好地决定下一个行动。在需要完成多个子任务的机器人任务中,我们会手动为所有数据添加子任务的语义描述,然后对其进行训练。
5.多模态网络数: 我们包含了多种网络数据,其中包括图像描述任务的数据
2.4后训练

在使用离散标记对模型进行 280k 个梯度步长的预训练之后,我们进入第二阶段训练,称之为“后训练阶段”。这一阶段的目的是使模型更加适应我们的应用场景(家庭中的移动操作任务),并引入一个动作专家,该专家能够通过流匹配来生成连续的动作序列。
这一阶段同时进行了下一token预测的训练,以保持文本预测能力;而动作专家的训练则通过流匹配来实现(在训练后阶段开始时,该专家的初始权重是随机分配的)。
我们额外进行了 80k 个梯度步长的优化。后训练的动作数据集包括 MM 和 ME 机器人的数据,这些数据经过筛选,只保留那些符合特定长度阈值的成功场景。此外,我们还加入了网络数据,以保留模型的语义和视觉能力;同时,也包含了与多环境数据集相对应的 HL 数据片段。
为了提升模型对高级任务的预测能力,我们收集了由专家用户提供的口头指令演示。这些演示是通过让机器人实时接收语言指令来完成的,专家用户会选择合适的子任务命令,指导机器人逐步执行移动操作任务。这些示例实际上是通过让机器人实时接收语言指令来完成任务而获得的,从而展示了经过训练后的低级策略在高级任务中的表现。
3.实验结果

不同数量训练环境对性能的影响评估。在四个测试任务——“碗在水槽中”、“物品在抽屉里”、“洗衣篮中的物品”、“整理床铺”中,随着训练环境的增加,性能得到了提升。虚线绿色曲线和绿色条形图表示了一个包含测试房屋的基线模型。与这个模型相比,我们的最佳模型尽管没有接触到测试房屋的数据,但仍然取得了类似的性能表现。

不同训练位置数量对语言遵循能力的评估。我们评估了语言遵循的准确率,以及用户指示的物品被拾起并放入抽屉或水槽的成功率。这些评估是基于已见过物体类别(“分布内”)和未见过物体类别(“分布外”)进行的。随着训练位置数量的增加,性能逐渐提升。
结果总结
π0.5 在 全新真实住宅 中具有强大的多阶段任务泛化能力。
增加训练环境数量 能持续提升任务性能和语言遵循能力。
跨实体数据(ME、CE)和网络数据(WD) 对泛化至关重要。
高层推理和子任务预测数据 对性能有显著贡献。
π0.5 显著优于现有 VLA 模型,并验证了混合训练流程的有效性。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)