【具身智能】Ψ0论文阅读随笔
简述
ψ 0 \psi_0 ψ0是一种对人形机器人设计的VLA(我之前一直以为它是WAM😂)。
核心
ψ 0 \psi_0 ψ0的工作,我想将其分为四个核心点:
- ψ 0 \psi_0 ψ0模型
- 动作分块
- 和人形机器人相关的灵巧任务
- 训练+数据分析
我将按顺序依次详解(也许并非详解😄)
ψ 0 \psi_0 ψ0模型
ψ 0 \psi_0 ψ0的架构可以进行拆分:
- System 2:VLM模型处理视觉语言输入
- System 1:以潜特征向量为条件进行流式动作生成
- System 0:将下半身动作分离出来单独用一个模型执行
System 2(VLM——Qwen3-VL-2B-Instruct)
VLM被训练以大规模人类第一视角数据集,旨在让它理解视觉语言指令并进行操作的能力。(所以它最终的输出是离散动作token)
训练完成后,VLM被冻结(保留能力),拆掉负责将潜特征向量处理为离散动作的动作头部分。
System 1(MM-DiT——多模态扩散模型)
将VLM得到的潜特征向量作为条件,去噪时间步 τ \tau τ,对动作进行去噪。
其中,对基本 D i T DiT DiT进行改造,使用了 M M − D i T MM-DiT MM−DiT。
MM-DiT
对于 a a a(动作去噪), z z z (VL特征)
使用 F i L M FiLM FiLM进行特征调整,即分别通过当前时间步 τ \tau τ进行调制,生成 a 1 a_1 a1, z 1 z_1 z1,使得其与去噪时间步关联。
然后 a 1 a_1 a1, z 1 z_1 z1通过联合注意力机制(拼接-QKV-生成-拆分),生成 a 2 a_2 a2, z 2 z_2 z2,使得其吸收多模态信息。
a a a, z z z进行处理: a = a + a 2 a=a + a_2 a=a+a2, z = z + z 2 z=z + z_2 z=z+z2
a a a, z z z经过MLP,得到 a 3 a_3 a3, z 3 z_3 z3,进行拼接 a = a + a 3 a = a + a_3 a=a+a3, z = z + z 3 z = z + z_3 z=z+z3
得到一步去噪的 a a a, z z z,多次迭代后得到最终 a a a。
System 0(下半身动作操作,RL)
就一个RL模型(AMO),将下半身动作更加稳定的进行。
动作分块
对于生成的动作序列 a a a
执行此动作序列时,模型以a的未执行动作为条件,预测出下一阶段动作序列 b b b。其中可以看作, a a a的后半段动作,与 b b b的前半段动作是重叠的。
其中这部分条件预测,在训练时就要求模型采样一个d,将动作序列的前d个动作作为条件进行后续预测,提前训练过了。
这样 a a a和 b b b就可以拼接起来以降低动作延迟。
和人形机器人相关的灵巧任务
一个单一的人类操作员,
穿戴头部VR,手追踪器,腰部、脚部追踪器,进行数据收集。
使得需高灵巧性任务的数据能够方便的,无遮挡的收集。
用于后续的训练。
训练+数据分析
首先对于VLM模型,在EgoDex上的800+小时人类第一视角数据进行训练,以捕获视觉语言操作能力。
其中对于人类与机器人数据迁移转化的问题,直接通过另一维度方法进行思考处理:拆掉VLM的动作头,保留它的“理解能力”,而对应于机器人部分的执行能力则交由MM-DiT。
然后冻结VLM,对于MM-DiT,使用Humanoid Everyday的30+小时真实机器人操作数据进行训练。
最后对于下游任务,使用自己通过灵巧任务收集的数据进行微调。
总结
论文提出的其中一个主要思想,训练数据不在于你拥有多少,而在于你如何高效的使用它们。
(就像海量的人类第一视角数据,通过一个巧思,可以将其高效的运用)
官方地址在这里:👋
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)