具身智能(Embodied AI)技术演进与前沿报告:从 VLA 到 WAM 的范式跃迁

目录


在具身智能(Embodied AI)与机器人学习领域,技术路线正经历一次从VLA(Vision-Language-Action)WAM(World Action Model)的重大范式演进。

简而言之:VLA 侧重于“看图听话做动作”(反应式映射),而 WAM 则侧重于“预测未来物理演化,再衍生出精准动作”(预测与因果驱动)


一、 核心概念定义

1. VLA (Vision-Language-Action Models)

  • 定位:以预训练视觉语言大模型(VLM)为 Backbone 的通用机器人策略模型。
  • 工作机制:将机器人摄像头图像观测 o t o_t ot 和自然语言指令 l l l 转化为输入 Token,直接输出离散或连续的机器人动作序列 a t a_t at
  • 典型代表:RT-2、OpenVLA、Octo、以及采用 Flow Matching 生成连续动作块的 π 0 \pi_0 π0

2. WAM (World Action Model)

  • 定位:融合“视频/世界模型”与“动作解码”的新一代具身基础模型。
  • 工作机制:利用大规模互联网视频预训练获得的时空物理先验(视频生成大模型/视频 Backbone),显式预测环境在交互下的未来演化(视觉帧或 Latent 隐空间),并将其与动作生成绑定在一起。
  • 典型代表:NVIDIA Dream Zero、智平方 WAM 0.5、UC Berkeley/加州大学团队提出的 FACT 等。

二、 演进背景:为什么行业正从 VLA 转向 WAM?

VLA 的瓶颈——“接地鸿沟(Grounding Gap)”
传统的 VLA 模型直接拟合 p ( a t ∣ o ≤ t , l ) p(a_t \vert{} o_{\le t}, l) p(atot,l),属于反应式策略(Reactive Policy)。它虽然继承了互联网海量图文的语义理解能力,但缺乏对物理世界运行规律(重力、流体、形变、碰撞、摩擦力)的显式建模。模型不知道“动作做完后世界会变成什么样”,导致泛化和精细操作受限。

WAM 的破局思路(先想象,后行动):

  1. 预训练学习物理物理直觉:视频模型在海量互联网视频中已经学会了重力、反射、浮力与物体交互的时空演化规律(如 Video Backbone)。
  2. 动作即解释:将动作 a a a 视为“引发未来视觉状态变化的因果解构”。机器人通过预测未来状态 o t + k o_{t+k} ot+k,反推或协同生成最合理的动作序列 a t : t + k a_{t:t+k} at:t+k

三、 WAM 的主流架构分类 (Taxonomy)

当前 WAM 的最新研究(如 arXiv 2026 最新综述《World Action Models: The Next Frontier in Embodied AI》)将 WAM 划分为两大技术路线:

                    ┌── 级联型 WAM (Cascaded WAM) ──► 先生成未来状态/视频,再解码动作 (Inverse Dynamics)
世界-动作模型 (WAM) ─┤
                    └── 联合型 WAM (Joint WAM)    ──► 建模联合分布 p(o_future, a | o, l),在同一模型内流式生成

  1. 级联型 WAM (Cascaded WAM)
  • 原理:将任务显式拆解为两步 p ( a ∣ o , o future , l ) ⋅ p ( o future ∣ o , l ) p(a\vert{}o, o_{\text{future}}, l) \cdot p(o_{\text{future}}\vert{}o, l) p(ao,ofuture,l)p(ofutureo,l)
  • 流程:世界模型先根据当前观测与指令生成“未来的视觉画面/隐状态轨迹”,随后策略网络(Policy)基于“当前+未来”的状态对比解算动作(逆动力学 Inverse Dynamics)。
  1. 联合型 WAM (Joint WAM)
  • 原理:紧耦合架构,对未来的环境状态与动作进行联合概率分布建模 p ( o future , a ∣ o , l ) p(o_{\text{future}}, a \vert{} o, l) p(ofuture,ao,l)
  • 流程:采用 Autoregressive 或 Diffusion/Flow-matching 多流/单流 Backbone,同时输出图像预测 Token 和连续控制 Action Token,让未来物理约束直接指导动作解码。

四、 VLA vs WAM 核心差异对比

维度VLA (Vision-Language-Action)WAM (World Action Model)
本质范式语义驱动的反应式策略 ( o → a o \to a oa)物理直觉驱动的预测与控制联合模型 ( o → o future + a o \to o_{\text{future}} + a oofuture+a)
主要预训练 BackbonesVLM(如 PaLM, Llama, Qwen-VL 等图文大模型)Video Foundation Models / 世界模型 (如 Sora 架构、Video DiT)
物理推理能力隐式泛化,易在未见过的复杂物理场景中失效显式预测物理演化,具备常识物理规划与抗干扰“想象”能力
数据需求侧重极度依赖真机 Teleoperation 遥操作轨迹数据结合人类第一视角视频、无动作视频及神经营养模拟环境
部署与计算时延推理路径较短,适合端侧高频控制生成未来图像/Latent 带来额外开销,常配合快慢双系统架构部署

五、 2026 前沿行业趋势

  1. 快慢系统结合(Fast-Slow VLA/WAM):慢系统(WAM/VLM)高层理解指令并预演未来状态(如 1–5 Hz),快系统(微型 Control Head / Diffusion Policy)以高频(50–500 Hz)流式生成底层平滑动作。
  2. “梦境”神经网络仿真 (DreamDojo / Neural Simulator):将视频世界模型直接转化为物理可交互的“神经营养仿真器”,让机器人在虚拟“梦境”中自主试错与进化(如 NVIDIA Dream Zero 路线)。
  3. 更低成本的数据采集(DexUMI / Egocentric Video):利用人类第一视角外骨骼和随身视频设备采集纯视觉交互数据,填补具身机器人数据缺口。
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐