一、论文简介 🌟

1.1 论文方法一图总结

  

1.2 基本信息

  • 📖 题目: π 0.5 \pi_{0.5} π0.5​: a Vision-Language-Action Model with Open-World Generalization
  • 🏫 单位: Physical Intelligence
  • 🌍 主页:https://www.pi.website/blog/pi05
  • 🀄️ 论文摘要:为了使机器人在实验室之外的现实世界中执行实际任务,它们必须能够应对开放环境。尽管视觉—语言—动作(VLA)模型在端到端机器人控制方面已展现出令人瞩目的成果,但这类模型在真实环境中的泛化能力究竟能达到什么程度,仍是一个悬而未决的问题。本文介绍了基于 π 0 \pi_0 π0​ 的新模型 π 0.5 \pi_{0.5} π0.5​,它通过在异质任务上进行协同训练,实现广泛泛化。 π 0.5 \pi_{0.5} π0.5​ 利用来自多种机器人的数据、高层语义预测、网络数据及其他来源的数据,从而实现具有广泛泛化能力的现实世界机器人操作。该系统结合了协同训练与混合多模态样例,这些样例融合了图像观测、语言指令、物体检测、语义子任务预测和低层动作。实验表明,这种知识迁移对于有效泛化至关重要;研究还首次展示了一个端到端、由学习驱动的机器人系统,能够在完全陌生的家庭环境中执行长时程且灵巧的操作技能,例如清洁厨房或卧室。

在这里插入图片描述
图1: π 0.5 \pi_{0.5} π0.5​ 模型从多种异质数据源中迁移知识,包括其他机器人、高层子任务预测、口头指令和网络数据,从而实现跨环境和物体的广泛泛化。 π 0.5 \pi_{0.5} π0.5​ 能够控制移动操作机器人,在训练数据未覆盖的新家庭中清洁厨房和卧室,并执行持续10至15分钟的复杂多阶段行为。

1.3 论文引言 & 主要贡献

“让你的双眼饱览奇观……看看这个世界。它比工厂里制造出来的任何梦境都更加奇妙。” 雷·布拉德伯里

  开放世界泛化是实体智能面临的最大难题之一:只有当机器人手臂、人形机器人和自动驾驶汽车等具身系统能够走出实验室,并应对现实世界中的各种情形和意外状况时,它们才真正有用。基于学习的系统为实现广泛泛化提供了一条途径,尤其是自然语言处理和计算机视觉领域的最新进展,已经推动了可扩展学习系统的发展。然而,机器人在现实世界中可能遇到的情形极其多样,仅靠扩大规模还不够:我们需要设计训练方案,为机器人提供足够广泛的知识,使其能够在多个抽象层次上实现泛化。例如,如果要求移动机器人清理一间它从未见过的厨房,那么有些行为只要在数据中得到充分呈现,并涵盖足够多样的场景和物体,就可以较容易地泛化(例如拿起刀或盘子);另一些行为则可能需要调整或改造已有技能,以便在新情境或新的行为序列中使用;还有一些行为可能需要依据先验知识理解场景语义(例如判断应该打开哪个抽屉,或判断台面上的哪个物体最可能是沥水架)。我们该如何设计机器人学习系统的训练方案,使其具备这种灵活的泛化能力?

  人可以借助一生积累的经验,综合应对这些挑战。这些经验并非都来自亲身经历,也并非都来自重复练习——例如,我们可以利用他人告知或书本中读到的事实,结合在不同情境下完成其他任务的经验,以及在目标领域中的直接经验,从而构思出合适的解决方案。类似地,我们可以设想,要构建具有泛化能力的机器人学习系统,就必须能够迁移来自多种信息源的经验和知识。其中一些来源是与当前任务直接相关的亲身经验;另一些则需要从其他机器人形态、环境或领域进行迁移;还有一些来源的数据类型截然不同,例如口头指令、基于网络数据的感知任务,或高层语义指令预测。这些不同数据源之间的异质性构成了重大障碍。所幸,视觉—语言—动作(VLA)模型的最新进展提供了实现这一目标的工具:通过将不同模态转换到同一个序列建模框架中,VLA 模型能够在机器人数据、语言数据、计算机视觉任务以及上述数据的组合上进行训练。

  本文利用这一思路,设计了一种 VLA 协同训练框架,以整合多种多样的知识来源,实现广泛泛化。本文基于 π 0 \pi_0 π0​ VLA,提出纳入多种不同数据源的 π 0.5 \pi_{0.5} π0.5​ 模型(读作“pi oh five”)。该模型能够控制移动操作机器人,即使在训练时从未见过的家庭环境中,也能执行各种家务任务。除直接使用移动操作机器人在不同真实家庭中采集的中等规模数据集(约400小时)外, π 0.5 \pi_{0.5} π0.5​ 还使用来自其他非移动机器人的数据、在实验室条件下采集的相关任务数据、需要根据机器人观测预测“高层”语义任务的训练样例、人类监督者提供给机器人的口头指令,以及利用网络数据构建的各种多模态样例,例如图像描述、问答和物体定位(见图1)。在第一阶段训练期间, π 0.5 \pi_{0.5} π0.5​ 所接收的训练样例中绝大多数(97.6%)并非来自移动操作机器人执行家庭任务,而是来自其他来源,例如其他机器人或网络数据。尽管如此, π 0.5 \pi_{0.5} π0.5​ 仍能控制移动操作机器人,在训练中完全未见过的新家庭里执行精细任务,例如挂起毛巾或整理床铺;它还能够仅凭一个高层提示,完成持续10至15分钟的长时程操作任务,例如清洁整间厨房或卧室。

   π 0.5 \pi_{0.5} π0.5​ 的设计采用了一种简单的分层架构:首先在异质任务混合数据上对模型进行预训练,然后使用低层动作样例和高层“语义”动作样例对模型进行微调。这些语义动作对应于预测子任务标签,例如“拿起砧板”或“重新摆放枕头”。在运行时,每次推理过程中,模型先预测语义子任务,根据任务结构和场景语义推断适合接下来执行的行为;随后再根据该子任务预测低层机器人动作片段。这种简单的架构既能对长时程多阶段任务进行推理,也能让模型在两个层级上利用不同来源的知识:低层动作推理能够直接受益于其他机器人采集的动作数据,包括在其他环境中使用更简单的固定式机器人采集的数据;高层推理则能够受益于网络中的语义样例、高层标注预测,甚至人类“监督者”提供的口头指令。监督者可以像指导他人一样,逐步引导机器人完成复杂任务,例如清洁房间。图1展示了这一设计。

  本文的核心贡献是提出一个高度泛化的 VLA 训练系统 π 0.5 \pi_{0.5} π0.5​,并通过概念验证表明,经过适当多样化的数据训练,该模型能够实现泛化。本文对 π 0.5 \pi_{0.5} π0.5​ 的泛化能力及不同协同训练要素的重要性进行了详细的实证评估。据本文所知,这是首个展示端到端、由学习驱动的机器人系统能够在训练数据中完全未出现的家庭环境里,执行清洁厨房或卧室等长时程且灵巧的操作任务的研究。本文的实验和比较还表明,这种能力得益于从其他机器人、高层语义预测、人类监督者提供的口头指令、网络数据及其他来源迁移知识。

在这里插入图片描述

  

二、方法论 🍀

2.1 预备知识(Preliminary)

  视觉—语言—动作(VLA)模型通常通过在多样化的机器人演示数据集 D \mathcal{D} D 上进行模仿学习来训练,具体做法是最大化给定观测 o t o_t ot​ 和自然语言任务指令 ℓ \ell ℓ 时动作 a t a_t at​(或更一般地,动作片段 a t : t + H a_{t:t+H} at:t+H​)的对数似然:

max ⁡ θ   E ( a t : t + H ,   o t ,   ℓ ) ∼ D log ⁡ ( π θ ( a t : t + H ∣ o t , ℓ ) ) . \max_{\theta}\ \mathbb{E}_{(a_{t:t+H},\,o_t,\,\ell)\sim\mathcal{D}} \log\left(\pi_{\theta}(a_{t:t+H}\mid o_t,\ell)\right). θmax​ E(at:t+H​,ot​,ℓ)∼D​log(πθ​(at:t+H​∣ot​,ℓ)).

  观测通常包含一个或多个图像 I t 1 , … , I t n I_t^1,\ldots,I_t^n It1​,…,Itn​ 以及本体感知状态 q t q_t qt​,后者记录机器人的关节位置。VLA 架构遵循现代语言模型和视觉—语言模型的设计,使用特定模态的标记器,将输入和输出映射为离散(“硬”)或连续(“软”)的标记表示,并采用大型自回归 Transformer 主干网络,将输入标记映射为输出标记。这些模型的权重以预训练视觉—语言模型的权重初始化。通过将策略的输入和输出编码为标记化表示,上述模仿学习问题可以转化为对观测、指令和动作标记序列进行简单的下一标记预测,并利用现代机器学习的可扩展工具进行优化。实际上,图像和文本输入的标记器选择沿用现代视觉—语言模型的做法。对于动作,已有研究提出了有效的基于压缩的标记化方法;本文在预训练阶段使用其中一种。近期若干 VLA 模型也提出使用扩散模型或流匹配来表示动作分布,从而更灵活地表示连续值动作片段。在模型的后训练阶段,本文采用 π 0 \pi_0 π0​ 的设计,通过流匹配表示动作分布。在这一设计中,与动作对应的标记会将前一步流匹配得到的部分去噪动作作为输入,并输出流匹配向量场。这些标记还使用一组不同的模型权重,本文将其称为“动作专家”,与混合专家架构类似。该动作专家能够专门处理基于流匹配的动作生成,其规模可以显著小于语言模型主干网络。

  

2.2 π0.5​ 模型与训练方案(Model and Training Recipe)

  图3概述了 π 0.5 \pi_{0.5} π0.5​ 模型及其训练方案。模型权重以一个在网络数据上训练的标准视觉—语言模型初始化,训练分为两个阶段:预训练阶段旨在使模型适应多样化的机器人任务;后训练阶段则旨在使模型专门适用于移动操作,并为其配备高效的测试时推理机制。预训练期间,所有任务(包括涉及机器人动作的任务)都用离散标记表示,从而实现简单、可扩展且高效的训练。在后训练阶段,本文为模型加入与 π 0 \pi_0 π0​ 相同的动作专家,以便更精细地表示动作,并提高实时推理的计算效率。推理时,模型首先生成高层子任务,然后以该子任务为条件,通过动作专家预测低层动作。下文先介绍模型架构,再分别说明各训练阶段及其对应的训练任务。

在这里插入图片描述

  

A. π 0.5 \pi_{0.5} π0.5​ 架构

  π0.5​ 架构能够灵活地表示动作片段分布和标记化文本输出。后者既用于协同训练任务(例如问答),也用于分层推理时生成高层子任务预测。模型所表示的分布可写为 π θ ( a t : t + H , ℓ ^ ∣ o t , ℓ ) \pi_{\theta}(a_{t:t+H},\hat{\ell}\mid o_t,\ell) πθ​(at:t+H​,ℓ^∣ot​,ℓ),其中 o t = [ I t 1 , … , I t n , q t ] o_t=[I_t^1,\ldots,I_t^n,q_t] ot​=[It1​,…,Itn​,qt​],包含来自所有相机的图像以及机器人的配置状态(关节角度、夹爪位姿、躯干升降位姿和底盘速度); ℓ \ell ℓ 是整体任务提示(例如“收拾餐具”); ℓ ^ \hat{\ell} ℓ^ 表示模型的文本输出(经标记化),可以是预测的高层子任务(例如“拿起盘子”),也可以是网络数据中的视觉—语言提示的答案; a t : t + H a_{t:t+H} at:t+H​ 是预测的动作片段。模型将该分布分解为:

π θ ( a t : t + H , ℓ ^ ∣ o t , ℓ ) = π θ ( a t : t + H ∣ o t , ℓ ^ ) π θ ( ℓ ^ ∣ o t , ℓ ) , \pi_{\theta}(a_{t:t+H},\hat{\ell}\mid o_t,\ell)= \pi_{\theta}(a_{t:t+H}\mid o_t,\hat{\ell}) \pi_{\theta}(\hat{\ell}\mid o_t,\ell), πθ​(at:t+H​,ℓ^∣ot​,ℓ)=πθ​(at:t+H​∣ot​,ℓ^)πθ​(ℓ^∣ot​,ℓ),

  因此,动作分布只依赖于 ℓ ^ \hat{\ell} ℓ^,而不直接依赖于 ℓ \ell ℓ。高层推理对应于 π θ ( ℓ ^ ∣ o t , ℓ ) \pi_{\theta}(\hat{\ell}\mid o_t,\ell) πθ​(ℓ^∣ot​,ℓ),低层推理对应于 π θ ( a t : t + H ∣ o t , ℓ ^ ) \pi_{\theta}(a_{t:t+H}\mid o_t,\hat{\ell}) πθ​(at:t+H​∣ot​,ℓ^);这两个分布均由同一个模型表示。该模型是一个 Transformer,它接收 N N N 个多模态输入标记 x 1 : N x_{1:N} x1:N​(这里宽泛地使用“标记”一词,既包括离散输入,也包括连续输入),并生成多模态输出序列 y 1 : N y_{1:N} y1:N​,可表示为

y 1 : N = f ( x 1 : N , A ( x 1 : N ) , ρ ( x 1 : N ) ) y_{1:N}=f\left(x_{1:N},A(x_{1:N}),\rho(x_{1:N})\right) y1:N​=f(x1:N​,A(x1:N​),ρ(x1:N​))

  每个 x i x_i xi​ 可以是文本标记( x i w ∈ N x_i^w\in\mathbb{N} xiw​∈N)、图像块( x i I ∈ R p × p × 3 x_i^I\in\mathbb{R}^{p\times p\times 3} xiI​∈Rp×p×3),或流匹配中的机器人动作中间去噪值( x i a ∈ R d x_i^a\in\mathbb{R}^d xia​∈Rd)。观测 o t o_t ot​ 和 ℓ \ell ℓ 构成 x 1 : N x_{1:N} x1:N​ 的前缀部分。根据 ρ ( x i ) \rho(x_i) ρ(xi​) 所指示的标记类型,每个标记不仅可以由不同的编码器处理,也可以由 Transformer 内部不同的专家权重处理。例如,图像块输入视觉编码器,文本标记则通过嵌入矩阵进行嵌入。与 π 0 \pi_0 π0​ 一样,本文将动作标记 x i a x_i^a xia​ 线性投影到 Transformer 嵌入空间,并使用单独的专家权重处理这些动作标记。注意力矩阵 A ( x 1 : N ) ∈ [ 0 , 1 ] N × N A(x_{1:N})\in[0,1]^{N\times N} A(x1:N​)∈[0,1]N×N 表示一个标记能否关注另一个标记。与标准语言模型中的因果注意力不同,图像块、文本提示和连续动作标记使用双向注意力。由于模型需要同时输出文本(用于回答有关场景的问题或给出接下来要完成的任务)和动作(用于控制机器人),函数 f f f 的输出分别拆分为文本标记 logits 和动作输出标记:

( y 1 : M ℓ , y 1 : H a ) . \left(y_{1:M}^{\ell},y_{1:H}^{a}\right). (y1:Mℓ​,y1:Ha​).

  前 M M M 个输出是文本标记 logits,可用于采样 ℓ ^ \hat{\ell} ℓ^;后 H H H 个输出由独立的动作专家生成,与 π 0 \pi_0 π0​ 中的做法相同,并通过线性映射投影为连续输出,以得到 a t : t + H a_{t:t+H} at:t+H​(见下一节)。注意, M + H ≤ N M+H\leq N M+H≤N,也就是说,并非所有输出都参与损失计算。机器人的本体感知状态经过离散化后,以文本标记的形式输入模型。关于架构的更多细节见附录E。

  

B. 结合离散与连续动作表示

  与 π 0 \pi_0 π0​ 类似,本文在最终模型中使用流匹配预测连续动作。给定 a t : t + H τ , ω = τ a t : t + H + ( 1 − τ ) ω , ω ∼ N ( 0 , I ) a_{t:t+H}^{\tau,\omega}=\tau a_{t:t+H}+(1-\tau)\omega,\quad \omega\sim\mathcal{N}(0,I) at:t+Hτ,ω​=τat:t+H​+(1−τ)ω,ω∼N(0,I),其中 τ ∈ [ 0 , 1 ] \tau\in[0,1] τ∈[0,1] 是流匹配时间索引,模型经过训练后可预测流向量场 ω − a t \omega-a_t ω−at​。然而,已有研究表明,使用离散标记表示动作,尤其是采用 FAST 这类能够高效压缩动作片段的标记化方案时,VLA 训练速度可以大幅提升。遗憾的是,这类离散表示不太适合实时推理,因为推理时需要进行开销较大的自回归解码。因此,理想的模型设计应当能够使用离散化动作进行训练,同时在推理时仍可使用流匹配生成连续动作。

  因此,本文训练模型同时通过自回归采样标记(使用 FAST 标记器)和对流场进行迭代积分来预测动作,以兼顾两种方法的优势。本文使用注意力矩阵,确保不同的动作表示不会相互关注。模型通过最小化以下组合损失进行优化:

E D , τ , ω [ H ( x 1 : M , f θ ℓ ( o t , ℓ ) ) + α ∥ ω − a t : t + H − f θ a ( a t : t + H τ , ω , o t , ℓ ) ∥ 2 ] , ( 1 ) \mathbb{E}_{\mathcal{D},\tau,\omega} \left[ \mathcal{H}\left(x_{1:M},f_{\theta}^{\ell}(o_t,\ell)\right)+\alpha \left\| \omega-a_{t:t+H} - f_{\theta}^{a}\left(a_{t:t+H}^{\tau,\omega},o_t,\ell\right) \right\|^2 \right], \quad{(1)} ED,τ,ω​[H(x1:M​,fθℓ​(ot​,ℓ))+α ​ω−at:t+H​−fθa​(at:t+Hτ,ω​,ot​,ℓ) ​2],(1)

  其中, H ( x 1 : M , y 1 : M ℓ ) \mathcal{H}(x_{1:M},y_{1:M}^{\ell}) H(x1:M​,y1:Mℓ​) 是文本标记与预测 logits 之间的交叉熵损失(其中包括 FAST 编码的动作标记); y 1 : H a = f θ a ( a t : t + H τ , ω , o t , ℓ ) y_{1:H}^{a}=f_{\theta}^{a}(a_{t:t+H}^{\tau,\omega},o_t,\ell) y1:Ha​=fθa​(at:t+Hτ,ω​,ot​,ℓ) 是来自较小动作专家的输出; α ∈ R \alpha\in\mathbb{R} α∈R 是权衡参数。这一方案使模型能够先作为标准视觉—语言模型进行预训练,将动作映射为文本标记( α = 0 \alpha=0 α=0),然后在后训练阶段加入额外的动作专家权重,以非自回归方式预测连续动作标记。下文将进一步说明这一流程。本文发现,采用这种训练流程能够实现稳定的预训练,并使 VLA 模型具备出色的语言指令遵循能力。在推理时,模型先对文本标记 ℓ ^ \hat{\ell} ℓ^ 进行标准自回归解码,然后以这些文本标记为条件,经过10步去噪生成动作 a t : t + H a_{t:t+H} at:t+H​。

  

C. 预训练

  在第一阶段, π 0.5 \pi_{0.5} π0.5​ 使用范围广泛的机器人和非机器人数据进行训练,相关数据概述如下,并在图4中展示。模型作为标准自回归 Transformer 进行训练,执行文本、物体位置和 FAST 编码动作标记的下一标记预测。

在这里插入图片描述

  多样化移动操作机器人数据(MM)。本文使用约400小时的数据,这些数据由移动操作机器人在约100个不同的家庭环境中执行家务任务时采集而成,其中部分环境如图7所示。这部分训练数据与本文评估任务最为直接相关;评估任务是在新的、未见过的家庭环境中执行类似的清洁和整理任务。

  多环境非移动机器人数据(ME)。本文还采集了非移动机器人数据,包括在多种家庭环境中使用单臂或双臂机器人采集的数据。这些机械臂固定在台面或安装平台上;由于其重量显著更轻、运输更容易,本文得以在更多不同的家庭中采集数据。不过,这些 ME 数据来自不同于移动机器人的具身平台。

  实验室跨具身数据(CE)。本文在实验室中使用多种类型的机器人,针对多种任务采集数据(例如清理餐桌、叠衬衫)。这些任务中,有些与评估任务高度相关(例如将餐具放入收纳箱),有些则不相关(例如研磨咖啡豆)。这些数据包括单臂和双臂机械臂,也包括固定式和移动式底座。本文还纳入了开放源代码的 OXE 数据集,该数据集是 π 0 \pi_0 π0​ 所用数据集的扩展版本。

  高层子任务预测(HL)。将“清洁卧室”这类高层任务指令分解为“整理毯子”和“拿起枕头”等较短的子任务,类似于语言模型中的思维链提示,有助于训练后的策略进行推理,并更好地判断下一步应执行的动作。对于 MM、ME 和 CE 中包含多子任务的机器人数据,本文对所有数据进行人工标注,添加子任务的语义描述,并训练 π 0.5 \pi_{0.5} π0.5​ 根据当前观测和高层指令,同时预测子任务标签(文本)和动作(以子任务标签为条件)。由此,模型自然具备两种能力:作为高层策略输出子任务,以及作为低层策略执行这些子任务。本文还标注了当前观测中相关的边界框,并训练 π 0.5 \pi_{0.5} π0.5​ 在预测子任务之前先预测这些边界框。

  多模态网络数据(WD)。最后,本文纳入多种网络数据,用于预训练阶段的图像描述、问答和物体定位任务。图像描述数据包括 CapsFusion 和 COCO;问答数据包括 Cambrian-7M、PixMo 和 VQAv2。对于物体定位任务,本文还使用了额外的室内场景和家居物体网络数据,并为其添加边界框标注。对于所有动作数据,模型均接受训练以预测目标关节位姿和末端执行器位姿。为区分二者,文本提示中会加入“ joint/end effector ”。所有动作数据均使用各个数据集每个动作维度的第1和第99百分位数归一化至 [ − 1 , 1 ] [-1,1] [−1,1]。为适配所有数据集中维度最高的动作空间,本文将动作 a a a 的维度设为一个固定数值。对于配置空间和动作空间维度较低的机器人,动作向量以零填充。

  

D. 后训练

  使用离散标记完成280k个梯度步骤的预训练后,本文进行第二阶段训练,并称之为后训练。该阶段旨在使模型专门适用于本文的应用场景(家庭环境中的移动操作),并加入动作专家,使其能够通过流匹配生成连续动作片段。训练时同时使用下一标记预测来保持文本预测能力,并对动作专家使用流匹配训练(动作专家在后训练开始时以随机权重初始化)。本文使用式(1)中的目标函数进行优化,其中 α = 10.0 \alpha=10.0 α=10.0,并额外训练80k步。后训练动作数据集由 MM 和 ME 机器人数据构成,并筛选出成功且长度低于固定阈值的片段。本文还加入网络数据(WD),以保持模型的语义和视觉能力;同时使用多环境数据中对应的 HL 数据切片。为提升模型预测合适高层子任务的能力,本文还采集口头指令演示数据(VI)。专家用户通过提供“语言演示”来构建这些数据:他们实时选择合适的子任务指令,引导机器人逐步完成移动操作任务。采集这些样例时,用户通过语言实时“遥操作”机器人,并使用已训练的低层策略执行任务;这实质上为训练后的策略提供了优质高层子任务输出的演示。

  

E. 机器人系统细节

  移动操作实验中所用的机器人系统如图5所示。所有实验均使用两种类型的移动操作机器人平台。这两种平台都配备两条六自由度机械臂、平行夹爪、腕部单目 RGB 相机、全向轮式底盘和躯干升降机构。底盘的状态和动作空间对应于线速度(二维)和角速躯干升降机构则为一维(上下)或二维(上下和前后)。除两台腕部相机外,机器人还在机械臂之间安装了朝前和朝后的相机。高层推理使用全部四台相机;低层推理使用腕部相机和朝前相机。根据机器人平台不同,状态空间和动作空间的总维度为18或19。18或19。

在这里插入图片描述

  控制系统非常简单: π 0.5 \pi_{0.5} π0.5​ 模型以50 Hz直接发出机械臂、夹爪和躯干升降机构的目标位姿,以及底盘目标速度(采用动作分块)。这些目标由简单的 PD 控制器跟踪,不使用额外的轨迹规划或碰撞检测。所有操作和导航控制均以端到端方式完成。

  

2.3 结论

  本文介绍了 π 0.5 \pi_{0.5} π0.5​,一种基于 π 0 \pi_0 π0​、整合多种数据源进行协同训练的模型,旨在实现对新环境的泛化。 π 0.5 \pi_{0.5} π0.5​ VLA 能够控制移动操作机器人,在训练中未见过的家庭环境中执行任务,包括清洁厨房和卧室、整理床铺、挂毛巾,以及其他多阶段且灵巧的行为。 π 0.5 \pi_{0.5} π0.5​ 使用约400小时的移动操作数据进行训练,同时纳入了数量更多的其他机器人数据,包括在多种环境中使用非移动机械臂采集的数据,以及在实验室条件下采集的数据。模型还与网络数据和用于根据机器人观测输出语言指令的高层预测数据共同训练。 π 0.5 \pi_{0.5} π0.5​ 的泛化能力表明,这种协同训练方案能够实现有效迁移:只需中等规模的移动操作数据,就能使移动操作机器人具备很强的泛化能力。

   π 0.5 \pi_{0.5} π0.5​ 仍存在局限,尽管它展现了广泛的泛化能力,但仍会犯错。有些环境会持续带来挑战,例如机器人不熟悉的抽屉把手,或在物理上难以打开的柜门;有些行为会受到部分可观测性的影响,例如机器人手臂遮挡了本应擦拭的污渍;有时,高层子任务推理也容易受到干扰,例如机器人在收拾物品时反复打开和关闭抽屉。通过改进协同训练、迁移方法并扩大数据集来解决这些问题,是值得探索的方向。未来工作还可以解决本文方法在技术层面的限制。尽管 π 0.5 \pi_{0.5} π0.5​ 能够执行多种清理厨房和卧室的行为,但它处理的提示相对简单。模型能够处理的提示复杂度取决于训练数据;可以通过人工标注或合成方式生成更复杂、更多样的标注,从而纳入更复杂的偏好和指令。模型使用的上下文也相对有限;加入更丰富的上下文和记忆,或许能显著提升其在部分可观测场景中的能力,例如需要在不同房间之间移动或记住物品存放位置的任务。更广泛地说, π 0.5 \pi_{0.5} π0.5​ 探索了特定的数据源组合,但还可以进一步探索更广泛的数据来源。例如,系统能够从口头指令中学习,这为人们提供了向机器人补充背景知识的有力新监督方式;未来工作可以继续探索这一方式以及其他方式。本文希望本研究能成为新一代 VLA 的基础,使其能够在多样化的现实环境中实现广泛泛化。

三、论文实验部分 🧪

  π0.5​ 模型旨在对新环境实现广泛泛化。虽然 VLA 通常在与训练数据相符的环境中接受评估,本文的所有实验均在训练中未见过的新环境中进行。定量比较采用一组模拟家庭环境,以提供可控且可复现的实验设置;最贴近真实情况的最终评估则在三处训练中未出现过的真实家庭中进行(见图6)。本文的实验重点考察以下问题:

  • 1) π 0.5 \pi_{0.5} π0.5​ 能否有效泛化到全新家庭中的复杂多阶段任务?

  • 2)训练数据中不同环境的数量如何影响泛化能力?

  • 3)协同训练方案中的各项要素分别对最终表现有何贡献?

  • 4) π 0.5 \pi_{0.5} π0.5​ 与 π 0 \pi_0 π0​ VLA 相比表现如何?

  • 5)高层推理组件有多重要?它与扁平的低层推理以及高层预言机基线相比表现如何?

在这里插入图片描述

  

A. π 0.5 \pi_{0.5} π0.5​ 能否泛化到真实家庭环境?

  为回答问题(1),本文使用两种类型的机器人,在三处训练中未出现过的真实家庭中评估 π 0.5 \pi_{0.5} π0.5​。每个家庭中,机器人都被要求执行卧室和厨房清洁任务。每项任务的评估标准见附录B,大致按任务中成功完成的步骤百分比计分(例如,将一半餐具放入水槽约对应50%的得分)。图7的结果表明, π 0.5 \pi_{0.5} π0.5​ 能够在每个家庭中稳定完成多种任务(另外需要指出的是,该模型能够完成的任务远不止本文定量评估所涵盖的那些)。许多任务包含多个阶段,例如移动多个物体,持续约2至5分钟。在这些试验中,模型接收简单的高层指令(例如“把餐具放进水槽”),再由高层推理过程自主确定合适的步骤(例如“拿起杯子”)。这种真实环境中的泛化能力远超以往 VLA 模型所展示的结果,既体现在环境的新颖程度上,也体现在任务的持续时间和复杂度上。

在这里插入图片描述

  

B. 泛化能力如何随场景数量变化?

  在下一组实验中,本文旨在测量泛化能力如何随训练数据中环境数量的变化而改变。本文改变移动操作数据中的环境数量,并通过分别使用来自3、12、22、53、82和104个地点的数据进行训练,测量其对泛化能力的影响。由于对每个数据集完整应用预训练和后训练方案的计算成本过高,这些实验先在不含移动操作数据的机器人动作预测数据混合集上进行预训练,再比较使用不同数量环境中的移动操作数据进行后训练所得的模型。原则上,按地点划分的数据集规模并不相同;但实际上,训练步数设为40k,使每个模型都能看到相同数量的独立数据样本,从而在改变训练地点数量时控制数据集规模。

  每个模型都在图6所示的模拟环境中接受评估,这些环境未出现在训练数据中。本文进行了两类评估。第一,为评估模型在多阶段任务上的总体表现,使用附录B中的标准评分标准和模拟测试家庭,对每个模型执行端到端评估,任务包括将餐具放入水槽、将物品放入抽屉、收拾衣物和整理床铺。第二,对每个模型遵循语言指令和与新物体互动的能力进行更细致的评估:机器人需要根据语言指令,从厨房台面上拿起指定物体。这些实验既使用训练数据中包含的相近类别物体(但具体物体实例是新的),也使用训练中未见过类别的分布外物体。后一种评估要求模型具备广泛的语义泛化能力。

  第一项实验的结果见图8。各项任务的平均表现总体上随训练地点数量增加而提高。为量化最终模型(使用104个地点训练)弥合了多少泛化差距,本文还加入一个对照模型(图中以绿色显示),其训练数据直接包含测试家庭。该对照模型的表现与最终的104地点模型相近,这表明本文的协同训练方案能够有效实现广泛泛化,使模型达到与使用测试环境数据训练的模型相近的表现。为确认这种泛化表现确实依赖完整的协同训练方案,本文还加入两个基线模型:它们在预训练阶段不使用任何其他协同训练任务,而是分别仅使用测试环境数据或104个训练地点的移动操作数据进行直接训练。两个基线模型的表现都显著较差,这表明即使策略接触过来自测试家庭的机器人数据,要实现良好泛化,本文所利用的其他数据源仍然至关重要。在训练中不使用测试家庭数据时,从图8中绿色柱与浅黄色柱之间的显著差距可以看出,按照本文方案进行预训练尤为重要。

在这里插入图片描述

  第二项实验(语言指令遵循)的结果见图9。本文报告语言指令遵循率和成功率:前者衡量机器人选择指令指定物体的频率,后者衡量机器人成功将该物体放到正确位置的频率;正确位置为抽屉或水槽,具体取决于测试场景。本文分别报告训练中出现过的物体类别(分布内,但物体实例是新的)和未出现过的物体类别(分布外)上的表现。该实验的详情见附录C。图9显示,随着训练数据中的地点数量增加,语言指令遵循表现和成功率均有所提高。正如预期,分布内物体上的表现提升速度快于分布外物体。每个新环境都会引入新的家居物品,因此随着训练环境增加,模型变得更加稳健,并开始泛化到训练数据中未出现过的任务类别。

在这里插入图片描述

  

  

C. 协同训练方案的各个部分有多重要?

  为研究问题(3),本文将完整的 π 0.5 \pi_{0.5} π0.5​ 模型与其他训练数据组合进行比较,并使用模拟家庭任务的端到端表现,以及第V-B节所述的语言指令遵循评估。回顾一下,完整方案使用来自多个环境中移动操作机器人(MM)、多个环境中固定式机械臂(ME)和实验室环境中多种具身平台(CE)的数据。方案还包括高层语言指令预测数据(HL),以及用于图像描述、视觉问答和物体定位的网络数据(WD)。后训练阶段还使用口头指令数据(VI),其作用将在第V-E节分析。本文进行了以下数据混合消融实验:

  • 1)不使用 WD:不包含网络数据;
  • 2)不使用 ME:不包含多环境非移动机器人数据;
  • 3)不使用 CE:不包含实验室跨具身数据;
  • 4)不使用 ME 或 CE:不包含来自其他机器人的数据,模型仅使用目标移动操作平台的数据和网络数据进行训练。

  完整模拟家庭任务的结果见图10(各任务表现的详细分解见附录D)。首先,结果表明,去除任一跨具身数据来源(ME 或 CE)都会显著降低表现,说明 π 0.5 \pi_{0.5} π0.5​ 能从跨具身迁移中显著受益,包括从其他环境中的机器人数据,以及从其他任务中的数据进行迁移。若同时去除这两类数据,表现会进一步下降。有趣的是,在这项实验中,不使用网络数据(不使用 WD)的模型与完整模型之间的表现差异没有达到统计显著;不过,后文将看到,网络数据会影响物体泛化能力和高层表现。图11所示的语言指令遵循实验结果呈现出与图10类似的趋势:去除 ME 和/或 CE 数据会导致表现显著下降。不同之处在于,去除网络数据(不使用 WD)会显著降低模型在分布外物体上的表现。本文推测,网络数据涵盖了关于各类实体物体的广泛知识,因此通过网络数据训练,模型能够理解并遵循涉及训练中未见物体类别的语言指令。

在这里插入图片描述

D. π 0.5 \pi_{0.5} π0.5​ 与其他 VLA 相比表现如何?

  本文将 π 0.5 \pi_{0.5} π0.5​ 与原始 π 0 \pi_0 π0​ VLA,以及一个改进版 π 0 \pi_0 π0​ 模型进行比较,后者记为 π 0 \pi_0 π0​-FAST+Flow。该版本采用式(1)中的联合扩散和 FAST 动作预测方案进行训练,但仅使用动作数据,不使用 HL 或 WD 数据。这些模型提供了有力的比较基准,因为已有研究表明 π 0 \pi_0 π0​ 在复杂灵巧的移动操作任务上表现出色,而 π 0 \pi_0 π0​-FAST+Flow 则通过改进,使其训练方案尽可能接近 π 0.5 \pi_{0.5} π0.5​。本文在这些模型的基础上,通过组合多种协同训练任务构建 π 0.5 \pi_{0.5} π0.5​。为确保公平比较,所有模型都使用相同的跨具身机器人训练集,训练步数也大致相当。因此,模型之间的差异在于:(1) π 0.5 \pi_{0.5} π0.5​ 额外使用 HL 和 WD 数据;(2) π 0.5 \pi_{0.5} π0.5​ 采用混合训练方案,预训练阶段使用离散标记,后训练阶段只使用流匹配动作专家;而 π 0 \pi_0 π0​ 始终使用动作专家;(3) π 0 \pi_0 π0​-FAST+Flow 遵循混合训练方案,但只使用包含机器人动作的数据,因此不具备高层推理能力。图12的结果表明, π 0.5 \pi_{0.5} π0.5​ 显著优于 π 0 \pi_0 π0​ 和本文改进的模型。即使允许 π 0 \pi_0 π0​ 延长训练时间,最多训练300k步,结果仍然如此。这进一步证实,与已有研究的发现一致,使用 FAST 标记进行训练,在计算效率方面优于纯扩散训练。

在这里插入图片描述

E. 高层推理有多重要?

  最后,本文评估高层推理的重要性,并比较多种替代的高层推理方法。 π 0.5 \pi_{0.5} π0.5​ 的高层推理机制接收高层指令(例如“整理卧室”),并输出要完成的子任务(例如“拿起枕头”),随后将该子任务作为低层动作推理的上下文,与思维链推理类似。虽然 π 0.5 \pi_{0.5} π0.5​ 使用统一架构,由同一个模型执行高层和低层推理,但也可以构建基线方法:一种方法取消高层推理,直接将任务提示输入低层系统,这与标准 VLA 模型的常见做法相同;另一种方法则使用不同模型进行高层推理,以消融分析不同数据集成分对高层策略的影响。本文考虑以下方法和消融设置,所有方法均使用完整的 π 0.5 \pi_{0.5} π0.5​ 低层推理流程,但高层策略有所不同:

  • 1)使用 π 0.5 \pi_{0.5} π0.5​ 模型进行高层和低层推理;
  • 2)不使用 WD: π 0.5 \pi_{0.5} π0.5​ 的消融版本,不包含网络数据;
  • 3)不使用 VI: π 0.5 \pi_{0.5} π0.5​ 的消融版本,不包含口头指令数据;
  • 4)隐式 HL:运行时不进行高层推理,但训练时包含高层数据;这些数据可能使模型隐式地习得子任务知识;
  • 5)不使用 HL:不进行高层推理,训练时也不包含任何高层数据;
  • 6)GPT-4:使用 GPT-4 作为高层策略,为使其适应本文的领域,向 GPT-4 提供任务描述和最常用标签列表,并要求其从中选择;
  • 7)人工 HL:由专家人工充当“预言机”高层策略,以提供性能上界。

  这些实验的结果见图13。完整的 π 0.5 \pi_{0.5} π0.5​ 模型表现最好,甚至优于人工 HL“预言机”基线。或许令人意外的是,表现第二好的模型是隐式 HL 消融版本:它在运行时不执行任何高层推理,但训练中包含完整的数据组合,也包括子任务预测数据。这有力表明了本文协同训练方案的重要性:显式推断高层子任务确实有益,但只需将子任务预测数据纳入训练组合,就已经能够获得其中相当一部分收益。不使用 HL 的消融版本在训练中也排除了 HL 任务,表现显著较差。实验还表明,规模相对较小的口头指令数据至关重要;它只占移动操作高层样例的约11%,但不使用 VI 的模型表现显著较弱。不使用 WD 的模型表现也显著较差,这表明网络数据的许多益处(或许并不令人意外)体现在提升高层策略上。最后,零样本提示 GPT-4 的消融版本表现最差,这说明使用机器人数据对视觉—语言模型进行适配至关重要。各任务表现的详细分解见附录D、图17。

在这里插入图片描述

  

四、论文代码解读 💻

  待补充。

  

写在最后

  由于笔者🖊️精力有限且本文更多的目的是通过📒博客记录学习过程并分享更多知识,因此文中部分描述不太具体,如有不太理解💫的地方可在评论区👀留言。非特殊赶deadline⏰或假期⛱️期间,笔者会经常上线回复💬。如有不便之处,请海涵~

  如果想了解更多关于3DGS的加速⏰压缩⚡️新工作,可以关注笔者的Github仓库:Awesome-3DGS-Compress-Accelerate。

  另外,创造不易,转载请注明出处💗💗💗~

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐