[2026] [π0.7] [π0.7 : a Steerable Generalist Robotic Foundation Model with Emergent Capabilities]
π0.7 : a Steerable Generalist Robotic Foundation Model with Emergent Capabilities, 2026
相关工作:
- 通用机器人
- Flow Matching
- 因为速度场是非线性的,可以捕捉机器人动作的多模态性(multi-modality),即同一状态存在多种可能的成功方案
- KI training recipe
diverse context conditioning
- 条件信息仅在训练时输入,在推理时可选(如有)
- 条件信息包含
- 文本信息
- 任务指令(比如 clean the kitchen)
- 子任务指令 (比如 open the fridge door)
- 高层策略生成
- 人工给定
- 忽略
- 多模态信息(如子目标图片, e.g. 叠好的衬衫图片)
- 预测时,使用一个轻量级的 世界模型 BAGEL 生成,其训练目标为
max ψ E D g [ L C F M ( g t ∗ , g ψ ( o t , l ^ t , m ) ) ] \max_\psi E_{D_g} \left[ L_{CFM}(g^*_t,g_{\psi}(o_t,\hat{l}_t,m)) \right] ψmaxEDg[LCFM(gt∗,gψ(ot,l^t,m))] - 其中 L C F M L_{CFM} LCFM 是标准 Flow Matching 损失, g t ∗ g^*_t gt∗ 是子任务目标图片
- 多视角
- 基座视角(环境和物体期望)
- 手腕视角(手臂、夹爪期望)
- 预测时,使用一个轻量级的 世界模型 BAGEL 生成,其训练目标为
- episode metadata
- episode 的steps数量,步数越多,说明完成任务越快,分箱去噪
- 任务得分:1-5分
- 是否犯错
- 通过 metadata 学习,模型可以将速度、质量、错误与结果关联,预测时可以要求快速、高质量、无失误的完成任务
- 控制模式:c∈{joint,ee},表示关节或者终端执行器
- 文本信息
- 一个完整的训练数据输入如下
<Multi-view observation><Multi-view subgoals>
Task: peel vegetables. Subtask: pick up the
peeler. Speed: 8000. Quality: 5. Mistake:
false. Control Mode: joint.<Proprioception>
- 在训练时随机丢弃提示词中的某部分,这样可以让模型学会在推理时某些信息缺失时也能正常工作
- 控制模式不丢弃
- 子目标图片实际将动作预测变成了逆动力学(“inverse dynamics”)问题,模型因此学的特别快
- 在每个 batch 中只在 25% 的数据中加入目标图片,并在有目标图片的数据中以 30% 的概率丢弃子任务描述
- 以 15% 的概率丢弃 episode metadata
- 每个部分,再以额外 5% 的概率丢弃
训练数据:
- 与一般 VLA 模型训练不同,π0.7 大量使用了次优数据
- 低质量的示例数据
- 之前版本模型的数据,例如 RECAP 中强化学习阶段收集的数据
- 类似于蒸馏
- 数据的多样性让模型更加稳定
模型架构
- 使用了历史视觉编码器 Mem
- 历史帧被视觉编码器压缩为单帧长度的token序列
- 输入了子目标图片
- 使用了历史帧相同的视觉编码器
- 输入最多4个相机视角(前向视角,两个腕部视角,后视视图(可选))
- 视觉token使用 block-causal masking
- 观察帧token之间、目标帧token之间,都是双向注意力
- 目标帧的token还可以单向注意到观察帧token
- 文本 token 使用 causal attention
- 将本体状态
q
t
q_t
qt 输入VLM主干
- π0.6 使用离散文本token来表示 q t q_t qt
- π0.7 使用线性映射将 Mem 编码后的本体状态从状态维度映射到主干维度
损失函数:
max
θ
E
D
[
log
π
θ
(
a
t
:
t
+
H
∣
o
t
−
T
:
t
,
C
t
)
]
(1)
\max_\theta E_D\left[ \log π_\theta (a_{t:t+H}|o_{t-T:t},C_t) \right] \tag{1}
θmaxED[logπθ(at:t+H∣ot−T:t,Ct)](1)
- 注意,Flow Matching 优化的是一个近似下界,而不是 log-likelihood 的闭式解 (c.f. π0)
推理:
- 因为在训练过程中对提示词的每个部分都进行了 dropout, 所以可以使用 CFG 对任意部分进行引导
- 例如引导生成更高速的 actions
- 具体地,每个action 去噪步骤遵循如下梯度
∇ a log π θ ( a t : t + H ∣ o t , C t ) + β ( ∇ a log π θ ( a t : t + H ∣ o t , C t ) − ∇ a log π θ ( a t : t + H ∣ o t , C t u n c o n d ) ) \nabla_a \log π_\theta(a_{t:t+H}|o_t,C_t) + \beta (\nabla_a \log π_\theta(a_{t:t+H}|o_t,C_t) - \nabla_a \log π_\theta(a_{t:t+H}|o_t,C_t^{uncond})) ∇alogπθ(at:t+H∣ot,Ct)+β(∇alogπθ(at:t+H∣ot,Ct)−∇alogπθ(at:t+H∣ot,Ctuncond))
结果:
- 跨具身泛化
- 组合泛化(generalize compositionally)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)