前言

长时域机器人操作不仅要求机器人能够可靠地执行单个技能,还要求其在长时间任务中将这些技能连贯地串联起来。大多数分层视觉-语言-动作(VLA)模型在一次前向传播中就做出每一个此类决策,从而缺乏一种在遇到困难或高风险选择时分配额外计算资源的机制

本文要介绍的 τ0-VLA,是一种分层机器人基础模型,将高层子任务的生成通过世界模型引导的测试时计算,表述为一个计算可扩展的推理问题

  1. 在每个推理步中,高层策略利用执行记忆生成一个子任务,并在需要时在多个候选方案之间进行搜索
  2. 然后,一个低层策略会在多种机器人形态上执行所生成的子任务

第一部分 τ0-VLA: a Hierarchical Robot Foundation Modelwith World-Model-Guided Test-Time Computation

1.1 引言、相关工作、预备知识

1.1.1 引言

如原论文所述,视觉-语言-动作(Vision-Language-Action,VLA)模型通过将预训练视觉-语言模型的语义表示与连续动作生成相结合,为长时程机器人控制提供了一种自然的基础 [5, 43, 19, 28, 3, 32]

  1. 分层 VLA 进一步将子任务作为显式接口暴露出来,用于分解和执行多阶段行为 [18, 2, 35, 27, 13, 14, 32, 33]
    许多分层系统在做每一次高层决策时仍然使用固定的推理预算,直接将当前观测和执行历史映射为下一个子任务
    在这一设定下,模型既不会比较备选子任务,也不会通过这些子任务预期产生的物理状态来对其进行评估

    包括有的世界模型 不会针对未来视觉状态 做多种推演,也就不涉及到对多种预演进行打分/评估,从而选择最好的一种预演
  2. 近期的一些系统改为使用高层树搜索或递归子目标细化 [30, 40, 42],这引出了作者在此研究的问题:如何在一个通用的真实机器人分层体系中,将开放式的语言-子任务搜索与视觉结果预测和执行记忆相耦合

    在缺乏执行前评估的情况下,错误决策通常只会在执行已经改变环境之后才被发现,此时虽然可以通过重新规划进行响应,但无法挽回先前错误承诺所带来的代价

    因此,在长时程执行中,核心瓶颈不再是是否具备分层动作接口,而是用于生成下一个子任务的推理过程

作者将“生成下一个子任务”重新表述为一个推理时(inference-time)的推理问题,从而使计算量能够随每个决策的难度而扩展,正如测试时(test-time)计算在语言模型中所体现的那样 [29, 9]

子任务是进行这种推理的自然单元。动作级搜索可以解决局部控制上的歧义,但往往只暴露出局部的物理后果[26, 20, 8, 38, 15, 41]。仅依赖语言的推理可以在更长的时间尺度上运作,但它是在未将候选方案与其所产生的物理状态相联系的情况下进行比较

子任务处于这两种极端之间:

  1. 一方面,它们足够稀疏,从而值得投入额外计算;
  2. 另一方面,它们又在时间上具有足够的延展性,可以在环境中引发有意义且可区分的变化

因此,在执行之前比较候选子任务,需要预测每个候选子任务会产生的状态。对未来观测的生成式建模恰好提供了这一能力 [10, 4,11, 12, 24],使得我们可以在下发执行之前,通过子任务预期的物理后果来评价这些候选子任务

对此,来自的研究者提出了τ0 -VLA,这是一种层次化的VLA 系统,实现了这种方法。在每个推理步骤中,一个带有记忆增强的高层策略利用当前观测和执行记忆来生成合适的子任务

即如上图所示,高层策略在测试时利用由世界模型引导的计算,对子任务序列进行搜索

  1. 在每一步扩展中,先后执行:P W V,一个 VLM 提出候选子任务,世界模型预测这些子任务的视觉结果,价值模型则对由此产生的任务进度进行评估
  2. 束搜索保留有前景的分支,随后一个反思模型基于保留下来的候选子任务及其预测后果,决策并执行下一个子任务

图中展示的是在 N = 3 情况下的单次候选扩展;为了简洁起见,省略了深度为 D 的递归束扩展

具体而言

  1. 当高层策略足够自信时,直接采用其生成的子任务提案;否则,由 token 级置信度统计触发额外的推理过程
    该过程遵循“提案–预测–评估”的循环
    \rightarrow  提案模型生成开放式的候选子任务;
    \rightarrow  世界模型预测每个候选子任务所诱导的终止观测;
    \rightarrow  价值模型根据这些预测结果对候选质量进行评分

    通过束搜索递归扩展有前景的候选,使推理预算可以通过分支因子、束宽和搜索深度进行扩展
    随后,一个反思模型在保留的搜索分支上进行条件生成,产出最终子任务
    该输出可以与某个提案重合,但并不局限于候选集合

    本体层策略随后执行生成的子任务
    ————
    由此产生的真实观测会在下一次推理步骤被写入执行记忆,从而闭合预测后果与实际后果之间的循环
  2. 为支持在长时执行过程中进行可靠推理,作者训练记忆机制去修正其自身状态
    具体而言,作者对来自现有演示的记忆进行扰动,并训练高层策略去修复那些落后于、超前于或以其他方式错误反映机器人真实进度的记录,而这一过程无需任何额外标注

一旦子任务被生成,每个子任务都由一个通用的低层策略来执行,该策略将预训练的视觉-语言主干网络与一个由多个 Transformer 动作专家组成的混合模型(Mixture-of-Transformers)相结合

该策略在一个统一的 40 维状态与动作空间上运行,覆盖末端执行器、机械臂关节、夹爪、腰部以及移动底座。借助这种统一表示,单一模型即可在多种机器人形态上支持固定基座操作、双臂协同以及移动全身控制。作者在大约 40,000 小时、来源异构的机器人数据上对该策略进行训练,并结合多模态协同训练数据,从而获得一个以语言为条件的执行接口,而无需为各个子任务设计专用控制器

且作者宣称,他们的实验证明了分层(高层决策-低层执行)的测试时推理大幅提升了任务成功率,并提高了下一子任务预测的准确率

1.1.2 相关工作

τ0-VLA 融合了三条研究路线:

  1. 用于低层次控制的通用 VLA 模型
  2. 用于子任务级决策的分层机器人策略
  3. 以及在测试时进行计算以评估候选决策的世界模型

首先,对于视觉-语言-动作模型

视觉-语言-动作(Vision-Language-Action, VLA)模型将视觉观测和语言指令映射为机器人动作,通常通过对预训练的视觉-语言主干网络进行适配来实现连续控制

  1. 早期工作建立了可扩展的、由语言条件化的机器人学习框架,并实现了从视觉-语言预训练到机器人控制的迁移 [5, 43]

    后续研究将这一范式拓展到更丰富的任务和不同形态的机器人平台 [19, 28];而最新的一些通用模型则以连续控制、开放世界泛化以及跨形态迁移为目标 [3, 32, 27, 39, 1, 14]
  2. 与之互补的工作则研究了紧凑而高效的部署方案 [36]
    跨形态策略还必须调和异构的控制接口

    RDT-1B 提出了一个具有物理可解释性的统一动作空间
    而Being-H0.5 则将异构控制映射到语义对齐的槽位中[22, 25]

    这一系列工作主要在改进控制表示、训练规模,以及在任务和机器人形态之间的迁移能力。作者的低层策略遵循相同的通用 VLA 范式。而作者的主要关注点是互补的:将高层子任务生成显式化,并将其设定为一个可按算力扩展的推理问题

其次,对于分层机器人策略

分层策略将时间跨度较长的决策与连续控制相分离

  1. 先前的工作将语言模型的决策与学习到的机器人可供性相结合 [18],通过语言来表示动作层级结构 [2],并通过显式指令、潜在表征或分阶段推理,将较慢的语义推理与较快的视觉—运动控制连接起来 [35, 13, 27, 14, 32]
  2. 最新的系统更明确地处理长时间跨度的状态跟踪和适应性问题
    MemER 在为低层 VLA 生成指令之前,先检索与任务相关的历史关键帧(相当于回顾历史)
    而 Goal2Skill 则在高层 VLM 与低层 VLA的层级结构中,结合了结构化记忆、结果验证与反思机制 [37, 23]

    Anticipation-VLA 自适应地递归生成子目标
    而 VISTA 则使用世界模型作为高层策略来生成文本和视觉形式的子目标序列 [42, 24]
  3. 在通用分层基础模型中,π0.7 也将语义高层策略、世界模型和低层策略耦合在一起 [33]。其世界模型会为高层策略已经生成的子任务生成子目标图像

    在τ0-VLA 中,则是在承诺执行之前进行视觉预测,并通过价值引导的搜索和反思来支持在多个候选子任务之间进行比较。因此,在 π0.7 中,视觉预测决定了已生成子任务将如何被执行,而在 τ0-VLA 中,视觉预测则用于决定应执行哪一个子任务。我们的高层策略同样维持了一种可纠正的执行机制

最后,对于世界模型与测试时计算

世界模型在候选行为下预测未来状态,从而支持规划与策略学习 [16, 17]

  1. 在机器人操作中,生成的图像或视频已被用作逆动力学和低层控制的目标[10, 4],与动作进行联合建模 [7, 6],并被纳入搜索或迭代式计划修正中 [11]
    Reflective Planning 使用想象的未来状态迭代地修订 VLM 规划 [12]

    与之不同,τ0-VLA的搜索方法维护多条语言子任务分支,并在进行反思式生成之前,通过专门的价值模型对其进行剪枝
    在动作层面,会通过采样、验证或价值引导的选择来分配额外推理预算 [26, 20, 8]
  2. FOREWARN 预测低层动作计划的潜在结果,并使用VLM 在这些结果中进行选择;而 VLA-Reasoner 则在动作轨迹上执行由世界模型引导的蒙特卡洛树搜索 [38, 15]

    WLA-0 联合预测文本子任务、未来图像和动作,并在测试时的扩展模式中,利用想象的未来帧和价值模型在动作块之间进行选择 [41]
  3. 搜索也被应用于高层级的机器人决策。VINE 在二维场景图上提出子目标转换,从成功与失败的演示中预测其成功概率,并在执行前剪枝可行性较低的分支 [30]

    Seeing Farther and Smarter 结合了预测视觉动力学、价值引导的束搜索、基于置信度的路由,以及对操作规划的多路径反思 [40]
    这些方法是与τ0-VLA工作最为接近的基于搜索的机制之一

    VINE 使用可行性评分在结构化场景图转换上进行搜索,而 Seeing Farther and Smarter 则在离散操作规划上通过一个学习到的评估器进行搜索
    相比之下,τ0-VLA 搜索开放式的语言子任务,并通过其预测的终止图像来评估每个候选方案。它在可纠正的执行记忆上对后续决策进行条件建模,然后使用一个反思模型,从保留的分支中生成最终子任务

1.1.3 预备知识

考虑由语言指令ℓ指定的机器人任务。在推理步骤t 时

  1. 一个视觉-语言-行动(VLA)策略将当前的多视角观测o_{t} 
  2. 本体感受状态\mathbf{s}_{t}
  3. 以及语言指令c_{t}
    映射为一个H 步的动作片段\mathbf{a}_{t: t+H-1}
  4. 它还接收文本形式的控制元数据\eta,用于指定具身形式、控制模式以及全身配置

其具体的文本序列化形式在附录C-B 中给出:

\mathbf{a}_{t: t+H-1}=\pi_{\theta}\left(o_{t}, \mathbf{s}_{t}, c_{t}, \eta\right)

其中θ 表示策略参数,H 是动作块的时间范围。在直接执行中,完整的任务指令在整个过程中都被使用,因此c_{t}=\ell。因此,策略必须在生成相应的运动动作时推断任务的当前阶段

分层VLA 将高层子任务生成与低层动作生成分离。在每个推理步骤中,高层策略首先生成一个子任务,然后低层策略在其条件下生成动作

令µ 表示高层策略,令\mathcal{M}_{0} 表示初始的空执行记忆,并令z_{0}^{\star}=\varnothing。在推理步骤t ,\mu 形成高层决策上下文

h_{t}=\left(\ell, \mathcal{M}_{t-1}, z_{t-1}^{\star}, o_{t}\right)

其中\mathcal{M}_{t-1} 是被保留的执行记忆,z_{t-1}^{\star} 是前一个推理步骤生成的子任务。该策略将执行记忆更新至最新状态,并为当前观测生成子任务:

\left(\mathcal{M}_{t}, z_{t}^{\star}\right)=\mu\left(h_{t}\right)

这里\mathcal{M}_{t} 总结了截至o_{t} 为止所观察到的执行历史,因此尚未包含执行z_{t}^{\star}的结果,而z_{t}^{\star}是为当前观测生成的子任务。生成的子任务被用作语言指令,c_{t}=z_{t}^{\star},从而得到

\mathbf{a}_{t: t+H-1}=\pi_{\theta}\left(o_{t}, \mathbf{s}_{t}, z_{t}^{\star}, \eta\right)

在执行完动作块之后,得到的真实观测会在下一次推理步骤中使用。在每一次推理步骤中,低层策略都会以生成的子任务z_{t}^{\star}为条件进行决策

  • 如果它保持与z_{t-1}^{\star}相同,则继续执行当前子任务
  • 如果发生变化,低层策略则开始执行新生成的子任务

1.2 τ0-VLA的完整方法论

如原论文所述,τ0-VLA 在每一个逻辑推理步骤中顺序应用两个组件

  1. 高层策略负责维护执行记忆、决定何时调用额外的测试时(test-time)计算,并生成当前的子任务
  2. 低层策略则将当前观测和生成的子任务映射为机器人动作

这样的分层结构在不修改底层控制接口的前提下,支持长时间跨度的进度跟踪以及具备后果意识的规划。图 2 给出了整体概览

  1. a) 在高层推理步骤 t ,proposal 模型 P 以最新的多视角观测 o_{t}、任务指令 \ell、继承的执行记忆\mathcal{M}_{t-1},以及先前生成的子任务z_{t-1}^{\star} 作为条件
    它生成与观测对齐的记忆 \mathcal{M}_{t} 和一个直接 proposal z_{t}^{\text {dir }}
  2. b)低层策略以生成的子任务 z_{t}^{\star}、多视角观测 o_{t}、本体感受状态 \mathbf{s}_{t},以及文本控制元数据 \eta 作为条件

    一个视觉-语言骨干网络和Mixture-of-Transformers(MoT)动作专家通过条件流匹配,从一个带噪声的动作片段生成在 t:t+H−1 时间范围内的动作片段
  3. c)在 TTC 路线上
    \rightarrow  针对每个被保留的分支,提案模型被调用 N 次以生成 N 个候选方案
    \rightarrow  给定该分支的车头摄像头图像和某个候选方案,世界模型预测其终止时刻的车头摄像头图像
    \rightarrow  而价值模型在条件化任务指令、候选方案以及预测图像的基础上,为该候选方案分配一个质量评分


    Beam search(束搜索)根据累计得分在全局范围内保留得分最高的 B 个分支,并将其递归扩展到深度 D
    图中示例展示了在 N = 3 且 B = 2 时的根节点扩展情形,此时局部得分与累计得分相同。为便于说明,省略了更深层次的扩展

    随后,反思模型在条件化 \bar{h}_{t} 和最终的分支摘要 \mathcal{C}_{t} 的基础上生成最终子任务 z_{t}^{\star}
    该输出可能与某个被保留的提案相一致,但并不局限于保留集合中的提案,并会被传递给低层策略以执行

接下来的小节将分别定义这两类策略,并描述它们的联合推理过程

// 待更

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐