本文是在阅读《World Action Models: The Next Frontier in Embodied AI》时记录的笔记,带有很强个人主观性,仅供参考。

前言

论文主要从WAM的具体定义和架构,不同WAM之间的分类,数据生态等,进行综述。
本文将围绕这三个点进行。

VLA的能力是被肯定的。
但是它没有自己的想象能力。这在现实世界中可抽象描述为基本上是一种动作条件反射,即仅从看到的,听到的,直接作出反应。
为了能够让模型能够有更强的大脑,即增加内部世界构想,WAM(World Action Models)发展。

相比于VLA,WAM拥有了一个自己构想的内部世界。即在预测动作的基础上,对环境的未来状态也进行预测。(当然不能这么说,动作和环境没有绝对的先后之分😜)

即建模 p ( o ′ , a   ∣   o , l ) p(o',a ~ \mathbf{|} ~ o,l) p(o,a  o,l)

世界模型

首先想说的,是构建层面的分类。

我想从一种特殊的角度进行整理。(这代表了我在阅读论文时各种概念之间的混乱到重组的过程)

RNN系列

如果不想啃原论文的话,这里建议可以参考一下我的另一篇博客:
但是里面有比较不清晰的描述,我的混乱也来源于此,建议看完后继续阅读接下的文本

至于为什么说是RNN系列,后续的发展基本都在RNN的基础上进行的。

RNN

循环神经网络,一种最基本的构建世界模型的方式。

这是基本骨架。

具体的:
h t = f ( h t − 1 , Z t − 1 , a t − 1 ) h_t=f(h_{t-1},Z_{t-1},a_{t-1}) ht=f(ht1,Zt1,at1)
其中, h t h_t ht为状态序列, Z t Z_t Zt为观测, a t a_t at为动作

MDN-RNN

即在RNN基础上,将确定性预测转为概率分布建模:

p ( h t   ∣   h t − 1 , Z t − 1 , a t − 1 ) p(h_t ~ \mathbf{|} ~ h_{t-1},Z_{t-1},a_{t-1}) p(ht  ht1,Zt1,at1)

基本所有世界模型都以此为基础演化发展,例如Generative RNN。

RSSM

Z Z Z,变为了 z z z

倒也不能这么说。我想说的是,环境确定性观测 Z t Z_t Zt,变成了模型可以预测的东西 z t z_t zt
(这里写法和另一篇文章不同哟)

这带来了两个好处:

  • 随机性的增加。自主建模环境观测,带来的随机性可以带来一系列好处。
  • 对未来的预测能力。由于可以自主预测环境观测,具备模型以“幻想”未来多部状态的能力。

这种转变被称为“状态空间”,即SSM。

PlaNet,Dreamer系列等,以此发展。

Transformer系列(TSSM)

即以Transformer骨架作为序列处理和预测。

TransDreamer,作为主要代表。


接下来是其它的一些分类。

生成分类

  • 显式生成:图像,视频生成等,采用扩散模型或卷积生成等。
  • 隐式生成:只进行潜在向量预测,不将此转化为显示。

作用分类

  • 模仿学习:用于模仿专家动作,生成海量数据等。
  • 强化学习:在潜在空间中模拟,结合各种信息(幻想状态,奖励等),减小现实训练复杂性。
  • 评估模型:用于评估模型。

设计策略架构分类

这是综述论文里的总分类方式。

  • 级联式-WAM:先状态后动作
  • 联合式-WAM:状态动作同时

级联式-WAM

首先预测下一个状态,再预测动作。

现在我们有了什么:

前一个状态,和后一个状态。

通过这两个状态来得到动作。

于是又有两种表面分类:

  • 显示-动作预测
  • 隐式-动作预测

显示-动作预测

即将状态先全部转化为真实可观测的信息,再交由其它模型进行动作提取。

  • 直接提取:直接喂“画面”给模型,让它完成动作提取全部工作。
    (UniPi,AVDC)
  • 几何提取:先将画面中真正变化的物理几何信息提取出来,再交由模型提取动作。
    (3DFlowAction,Dream2Flow)

隐式-动作预测

即直接将潜在状态向量交由模型提取动作。
(VPP,OmniVTA)

联合式-WAM

即同时预测下一状态和动作。

这里又可以分为两种预测方式,即两种预测架构:自回归形式和扩散形式。

自回归生成式

使用RNN,Transformer等处理序列的结构来预测下一状态和动作。

这里又可以有三种生成方式(关注多模态时):

  • 显式生成:各自模态各自头进行分离
    (GR-1,GR-2,GR-MG)
  • 统一生成:多模态统一到其中的一个Token空间
    (CoT-VLA,WorldVLA / F1)
  • 潜在生成:统一到一个潜在空间(和统一生成相似,但不同)
    (LA-JEPA,V-JEPA 2)

扩散生成式

即通过去噪方式生成状态和动作。

于是又有两种方向:

统一流:状态和动作由统一的去噪网络
  • 显式生成:生成图像,动作等显式信息。
    (DreamZero,Cosmos Policy,GigaWorld-Policy,X-WAM)
  • 隐式生成:生成潜在表示。
    (FLARE,FRAPPE)
多流:不同流之间交互信息
  • 交叉注意力:不同流之间通过交叉注意力查询进行信息传递。
    (DUST,UD-VLA,CoVAR,Motus)
  • 隐状态传递:从同一的隐状态(通常是状态生成)中将信息传递到多流。
    (LingBot-VA,Fast-WAM,DiT4DiT,MotuBrain)
  • 共享表示:先由统一的编码器处理初始表示,再交由各自流处理。
    (UVA,PhysGen)

题外话:(自己的想法🤔)
级联和联合式,抽象在现实中,可视为“三思而后行”与“肌肉记忆”。
对于人,综合这两种行动方案,便于获得更好的行动力。
对于模型,这也许会成为一种不错的选择。
现在已有模型在研究这方面了——DIAL模型(虽然是VLA😆)

数据生态

完全机器人数据

质量高,成本大

两种发展方向:

  • 开放世界:进入真实世界中
  • 深化感知:多种模态深入

人类+机器数据

机器人数据收集工具由人类来操纵

保留了一定的高质量,同时节约了成本

仿真数据

即通过各种方式生成仿真数据

量大,成本低,质量由成本和生成决定

人类数据

即人类自身世界数据(通常需要处理后才能给机器人用)

量大且基本无成本,质量考虑多种因素

数据混合

将数据集构建为多种数据模式混合,与模型训练的各个模块对号入座。

评估

关于评估,我通过AI生成了一张结构导图,方便查询。(绝对不是我在这方面阅读的真的很困难😂)

在这里插入图片描述

挑战

架构设计

  • 多样化策略:级联流水线、联合扩散骨干网、离散分词方案、隐式表示对齐等多种结构策略
  • 耦合机制:世界预测与动作生成耦合
  • 多模态发展
  • 多级WAM,VLA构建

评估维度

不仅关注视觉真实感,更强调物理意义、强关联性和可执行性。

  • 视觉和动作:视觉评估与动作评估关注不同,无法关联
  • 状态与动作:世界构建与动作之间因果无法评估

系统性基准

尽管架构多样,但缺乏在同协议下的系统性对比研究。

数据生态

  • 非机器人数据:引入人类数据来提升性能
  • 知识迁移:人类数据在物理理解、动力学和任务规划中的具体意义
  • 无关数据过滤

长程推理

对于跨长时程任务的持续推理能力尚且不足。

预测与构建误差随时间累积,缺乏纠错重规划机制。

算力约束

世界预测带来了严重的延迟,难以满毫秒级响应,导致高质量物理预测与低延迟推理之间的平衡仍然存在问题。

可能可以通过算力分配解决。

安全性

  • 监控:将对未来不确定性作为监控指标
  • 验证:利用世界预测能力与现实进行验证

还是附上地址吧(综述的地址🤔):这里👋

  ~  

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐