π0.7 : a Steerable Generalist Robotic Foundation Model with Emergent Capabilities, 2026

相关工作:

  • 通用机器人
    • 从头训练:RT-1
    • 使用预训练的视觉语言模型初始化 RT-2, OpenVLA, π0, Gemini Robotics, π0.5
    • goal image conditioning: CoT-VLA
    • 使用机器人自主经验(autonomous robot experience)RECAP
  • Flow Matching
    • 因为速度场是非线性的,可以捕捉机器人动作的多模态性(multi-modality),即同一状态存在多种可能的成功方案
  • KI training recipe

diverse context conditioning

  • 条件信息仅在训练时输入,在推理时可选(如有)
  • 条件信息包含
    • 文本信息
      • 任务指令(比如 clean the kitchen)
      • 子任务指令 (比如 open the fridge door)
        • 高层策略生成
        • 人工给定
        • 忽略
    • 多模态信息(如子目标图片, e.g. 叠好的衬衫图片)
      • 预测时,使用一个轻量级的 世界模型 BAGEL 生成,其训练目标为
        max ⁡ ψ E D g [ L C F M ( g t ∗ , g ψ ( o t , l ^ t , m ) ) ] \max_\psi E_{D_g} \left[ L_{CFM}(g^*_t,g_{\psi}(o_t,\hat{l}_t,m)) \right] ψmaxEDg[LCFM(gt,gψ(ot,l^t,m))]
      • 其中 L C F M L_{CFM} LCFM 是标准 Flow Matching 损失, g t ∗ g^*_t gt 是子任务目标图片
      • 多视角
        • 基座视角(环境和物体期望)
        • 手腕视角(手臂、夹爪期望)
    • episode metadata
      • episode 的steps数量,步数越多,说明完成任务越快,分箱去噪
      • 任务得分:1-5分
      • 是否犯错
      • 通过 metadata 学习,模型可以将速度、质量、错误与结果关联,预测时可以要求快速、高质量、无失误的完成任务
    • 控制模式:c∈{joint,ee},表示关节或者终端执行器
  • 一个完整的训练数据输入如下
<Multi-view observation><Multi-view subgoals>
Task: peel vegetables. Subtask: pick up the
peeler. Speed: 8000. Quality: 5. Mistake:
false. Control Mode: joint.<Proprioception>
  • 在训练时随机丢弃提示词中的某部分,这样可以让模型学会在推理时某些信息缺失时也能正常工作
    • 控制模式不丢弃
    • 子目标图片实际将动作预测变成了逆动力学(“inverse dynamics”)问题,模型因此学的特别快
      • 在每个 batch 中只在 25% 的数据中加入目标图片,并在有目标图片的数据中以 30% 的概率丢弃子任务描述
    • 以 15% 的概率丢弃 episode metadata
    • 每个部分,再以额外 5% 的概率丢弃

训练数据:

  • 与一般 VLA 模型训练不同,π0.7 大量使用了次优数据
    • 低质量的示例数据
    • 之前版本模型的数据,例如 RECAP 中强化学习阶段收集的数据
      • 类似于蒸馏
  • 数据的多样性让模型更加稳定

模型架构

  • 使用了历史视觉编码器 Mem
    • 历史帧被视觉编码器压缩为单帧长度的token序列
  • 输入了子目标图片
    • 使用了历史帧相同的视觉编码器
  • 输入最多4个相机视角(前向视角,两个腕部视角,后视视图(可选))
  • 视觉token使用 block-causal masking
    • 观察帧token之间、目标帧token之间,都是双向注意力
    • 目标帧的token还可以单向注意到观察帧token
  • 文本 token 使用 causal attention
  • 将本体状态 q t q_t qt 输入VLM主干
    • π0.6 使用离散文本token来表示 q t q_t qt
    • π0.7 使用线性映射将 Mem 编码后的本体状态从状态维度映射到主干维度

损失函数:
max ⁡ θ E D [ log ⁡ π θ ( a t : t + H ∣ o t − T : t , C t ) ] (1) \max_\theta E_D\left[ \log π_\theta (a_{t:t+H}|o_{t-T:t},C_t) \right] \tag{1} θmaxED[logπθ(at:t+HotT:t,Ct)](1)

  • 注意,Flow Matching 优化的是一个近似下界,而不是 log-likelihood 的闭式解 (c.f. π0)

推理:

  • 因为在训练过程中对提示词的每个部分都进行了 dropout, 所以可以使用 CFG 对任意部分进行引导
    • 例如引导生成更高速的 actions
    • 具体地,每个action 去噪步骤遵循如下梯度
      ∇ a log ⁡ π θ ( a t : t + H ∣ o t , C t ) + β ( ∇ a log ⁡ π θ ( a t : t + H ∣ o t , C t ) − ∇ a log ⁡ π θ ( a t : t + H ∣ o t , C t u n c o n d ) ) \nabla_a \log π_\theta(a_{t:t+H}|o_t,C_t) + \beta (\nabla_a \log π_\theta(a_{t:t+H}|o_t,C_t) - \nabla_a \log π_\theta(a_{t:t+H}|o_t,C_t^{uncond})) alogπθ(at:t+Hot,Ct)+β(alogπθ(at:t+Hot,Ct)alogπθ(at:t+Hot,Ctuncond))

结果:

  • 跨具身泛化
  • 组合泛化(generalize compositionally)
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐