1)综述

从研究对象,数学形式,模型架构,训练方法,数据集,评测指标,关键难点和顶尖论文8个方面进行系统梳理  世界模型,VLM,VLN,VLA

这四者并非同一层级,VLM 是感知与语义理解基础模型,VLN是导航任务范式,VLA是机器人策略模型,世界模型是与测环境变化并支持规划的模型。

2)整体关系

整体关系:

3)世界模型

3.1 定义:


世界模型学习环境的动态规律,在内部建立一个可预测,可规划的环境表示,使智能体不必对每个候选动作都在真实世界中试验

  一个典型概率模型为:

[ p(s_{t+1},o_{t+1},r_t \mid s_t,a_t) ]

  其中:

  - (o_t):图像、深度、触觉等观测;
  - (s_t):根据历史推断出的隐状态;
  - (a_t):智能体动作;
  - (r_t):奖励或任务得分;
  - (s_{t+1}):动作发生后的新状态。

  部分可观测环境中,真正使用的状态往往是:

[ s_t=f(o_{\le t},a_{<t}) ]

  也就是说,模型要根据历史推断当前无法直接观察到的状态,例如抽屉内部有什么、物体是否被抓稳。

3.2 世界模型内部通常学什么

  一个完整世界模型可能包含:

  1. 表示模型:把高维图像压缩为 latent state。
  2. 动态模型:预测动作如何改变 latent state。
  3. 观测模型:从 latent 重建图像、深度或其他观测。
  4. 奖励模型:预测某个状态和动作的收益。
  5. 终止模型:预测任务是否结束。
  6. 策略或规划器:在模型内部试验轨迹并选出动作。

典型潜伏态模型可以写成:

[ z_t \sim q(z_t\mid o_{\le t},a_{<t}) ] [ \hat z_{t+1}\sim p(z_{t+1}\mid z_t,a_t) ]

规划器随后比较多个候选动作序列
[ a_{t:t+H}^{*}= \arg\max_{a_{t:t+H}} \mathbb E\left[\sum_{k=0}^{H}\gamma^k r_{t+k}\right] ]

3.3 四条主要技术路线

 ### A. 潜空间动态模型

  先压缩图像,再在潜空间预测未来。相比逐像素生成,潜空间更加高效,也更适合控制。

  代表:World Models、PlaNet、Dreamer、TD-MPC。

  ### B. 面向规划的价值等价模型

  模型不一定重建真实画面,只需保留规划所需要的奖励、价值和策略信息。

  代表:MuZero、EfficientZero。

  ### C. 生成式视频世界模型

  将未来建模为图像、视频帧或离散视觉 token。它能够生成可观察的未来,但“视觉逼真”并不自动等于“动力学正确”。

  代表:Genie、GAIA-1、UniSim、V-JEPA 2。

  ### D. 机器人世界模型

  在视觉预测中加入机器人动作、机械臂状态和语言目标,用于:

  - 预测抓取是否成功;
  - 比较不同操作轨迹;
  - 生成训练数据;
  - 检测异常和失败;
  - 执行模型预测控制。

3.4 世界模型与视频生成模型的区别

普通视频模型学习

[ p(o_{t+1:t+H}\mid o_{\le t}) ]

动作条件世界模型学习:

[ p(o_{t+1:t+H}\mid o_{\le t},a_{t:t+H-1}) ]

 后者必须回答“如果采取动作 A 会怎样”,并允许智能体控制未来。只有生成漂亮视频,却不能稳定响应动作条件的模型,不足以成为可靠的控制世界模型。

  3.5 核心难点

  - 长时滚动预测产生误差累积;
  - 接触、碰撞、摩擦、液体等物理规律难以建模;
  - 单目视觉无法完全确定三维状态;
  - 随机环境需要表示多种可能未来;
  - 模型容易关注视觉细节,却忽略任务关键变量;
  - 规划会利用模型漏洞,即 model exploitation;
  - 机器人数据有限,跨环境和跨本体泛化困难;
  - 世界模型预测正确,也不代表规划器一定能找到正确动作。 

4)VLM vision-language-Model

4.1)定义

VLM 将视觉信息和语言映射到统一语义空间,用于图像描述,视觉问答,OCR,定位,视频理解以及多模态推理

条件生成式通常为:

[ p(y\mid x_{\text{image}},x_{\text{text}}) ]

  其中输出 (y) 可以是答案、描述、检测框、坐标或结构化文本。

4.2)典型架构

-

4.3)三条技术路线

A)视觉编码器+语言编码器

  视觉表示通过交叉注意力输入文本解码器。

  代表:Flamingo、BLIP、BLIP-2、PaLI。

B)多模态大语言模型

 把视觉 token 投影到 LLM 的表示空间,再通过视觉指令微调训练对话、推理、OCR和定位能力。

  代表:LLaVA、Qwen-VL、InternVL。

C)双编码

图像和文本分别编码,通过对比学习对齐:

[ \mathcal L_{\mathrm{CLIP}} =-\log \frac{\exp(\operatorname{sim}(v_i,t_i)/\tau)} {\sum_j\exp(\operatorname{sim}(v_i,t_j)/\tau)} ]

优点是检索和零样本分类效率高;缺点是不擅长复杂生成推理

代表:CLIP,ALIGN,SigIP

4.4)训练流程

  典型训练过程包括:

  1. 视觉预训练:ImageNet、自监督或图文对比学习。
  2. 图文对齐:使用大规模图片与描述数据。
  3. 视觉指令微调:训练问答、对话、定位和推理。
  4. 偏好对齐:降低幻觉和不安全输出。
  5. 领域微调:机器人、医疗、遥感、文档或自动驾驶。

4.5)VLM和真正视觉理解之间的差距

VLM的语言表达非常流畅,但仍可能:

-描述不存在的物体
-混淆左右,遮挡和深度关系
-无法稳定计数密集对象
-对微小目标和精密空间关系不可靠
-把数据相关性误认为物理因果
-在视频中丢失长时间状态
-知道“应该怎样抓”,却不具备可执行控制精度

因此,VLM 可以作为机器人的语义大脑,但通常不能单独替代定位,规划和低层控制

4.6)常见评测

  - 通用问答:VQAv2、GQA、OK-VQA;
  - 知识与推理:MMMU、MMBench、MathVista;
  - OCR与文档:TextVQA、DocVQA、OCRBench;
  - 幻觉:POPE、HallusionBench;
  - 视频:Video-MME、MVBench;
  - 定位:RefCOCO、RefCOCO+、RefCOCOg。

5)VLN:Vision-and-Language Navigation

5.1)定义


VLN要求智能体

形式上,策略需要计算:

[ a_t \sim \pi(a_t\mid o_{\le t},l,a_{<t}) ][ a_t \sim \pi(a_t\mid o_{\le t},l,a_{<t}) ]

其中(l)是导航指令,动作可以是离散节点选择,也可以是连续速度,旋转角或航点

例如:

> “走出卧室,经过右侧的沙发,在餐桌前左转,停在冰箱旁。”

  这要求智能体同时具备语言解析、视觉识别、空间记忆、定位、规划、探索与停止判断。

5.2)VLN的主要设定

  ### 离散 VLN

  环境被表示为预先构建的导航图,智能体从相邻全景节点中选择下一节点。经典 R2R 属于此类。

  ### 连续 VLN

  智能体在连续三维空间中移动,需要处理碰撞、局部控制和真实路径规划。VLN-CE 属于此类。

  ### 目标物体导航

  不仅要到达某个位置,还要找到并指认目标物体。代表数据集包括 REVERIE、SOON。

  ### 多语言和长指令导航

  强调跨语言、细粒度地标以及更长轨迹。代表数据集为 RxR。

  ### 开放世界真实导航

  机器人在无预定义导航图的环境中,根据相机、深度、里程计和语言实时建图与行动。

5.3)模型演进

  --->Seq2Seq 阶段

  语言编码器与视觉编码器通过注意力融合,逐步产生动作。

  问题是长时记忆和未见环境泛化较弱。

  --->预训练 Transformer 阶段

  利用视觉语言预训练学习更好的跨模态对应。

  代表:PREVALENT、VLN-BERT、AirBERT、HAMT。

  --->显式地图阶段

  构建拓扑图、语义地图或鸟瞰图,对长期导航更稳定。

  代表:DUET、BEVBert。

  --->LLM/VLM 推理阶段

  VLM 识别地标和空间关系,LLM 分解指令、维护历史并选择航点。

  代表:NavGPT、MapGPT、Uni-NaVid。

5.4)VLN 的关键模块

  语言解析:目标、动作、地标、顺序
  视觉感知:房间、物体、可通行区域
  定位记忆:我在哪里,走过哪里
  地图构建:拓扑图、占据图或语义地图
  规划策略:下一航点和全局路线
  局部控制:避障和连续移动
  停止判断:是否真正到达目标

  5.5) 评测指标

  - NE:终点到目标的导航误差;
  - SR:是否在规定距离内到达目标;
  - SPL:在成功率中加入路径效率惩罚;
  - Oracle SR:轨迹中是否曾经过目标附近;
  - nDTW / SDTW:预测轨迹与参考轨迹的吻合程度;
  - CLS:路径覆盖和长度综合指标;
  - RGS / RGSPL:是否正确定位目标物体及其路径效率。

  SPL 常写为:

[ \mathrm{SPL}=\frac{1}{N}\sum_i S_i \frac{L_i}{\max(P_i,L_i)} ][ \mathrm{SPL}=\frac{1}{N}\sum_i S_i \frac{L_i}{\max(P_i,L_i)} ]

  其中 (S_i) 表示是否成功,(L_i) 是最短路径长度,(P_i) 是实际路径长度。

6)VLA Vision-Language-Action

6.1)定义

VLA 将视觉观察、语言指令和机器人状态直接映射为可执行动作:

[ a_{t:t+H}= \pi(o_{\le t},l,q_{\le t}) ]

  其中:

  - (o):一个或多个摄像头的图像;
  - (l):语言任务;
  - (q):关节位置、末端位姿、夹爪状态等本体感知;
  - (a):关节控制、末端位姿增量、夹爪指令或移动底盘指令;
  - (H):一次预测的动作区间长度。

  例如指令“把红色杯子放进水槽”,VLA 要完成语义目标识别、空间定位、抓取、搬运、放置以及必要的失败恢复。

6.2)VLM与VLA的本质差异

6.3) VLA的主要动作表示

  ### 动作离散化

  将连续动作分桶并转成 token,像生成单词一样预测动作。

  优点:能直接利用自回归 LLM。
  缺点:量化误差、控制频率和轨迹平滑性受限。

  代表:RT-2、OpenVLA。

  ### 连续回归

  动作头直接预测连续控制量。结构简单,但多模态动作分布容易被均方误差平均化。

  ### 扩散策略

  从噪声逐步生成动作块,能够表达多个合理动作模式。

  代表:Diffusion Policy。

  ### Flow Matching

  学习从简单分布到动作分布的连续速度场,采样步骤通常少于扩散过程。

  代表:π0。

  ### Action Chunking

  一次输出未来若干步动作,降低推理频率,增强动作连续性。

  代表:ACT、π0。

6.4)典型训练路线

  1. 在互联网图文数据上获得视觉语言知识;
  2. 使用机器人示范轨迹训练动作预测;
  3. 通过跨机器人数据学习通用表示;
  4. 对特定机器人和任务做少量微调;
  5. 使用闭环执行数据、人工纠正或强化学习进一步改进。

  机器人轨迹通常包含:

  -->语言指令
  -->多视角视频
  -->关节状态 / 末端位姿
  -->动作序列
  -->任务成功标签
  -->机器人本体和相机配置

6.5)通用化面临的三种差异

  - 任务差异:抓取、折叠、装配、移动等任务不同;
  - 环境差异:背景、物体、光照和相机不同;
  - 本体差异:机械臂自由度、控制接口和夹爪结构不同。

  Open X-Embodiment、RT-X 和 Octo 主要研究如何通过跨本体数据缓解这些问题。

6.6)测评方式

  VLA 没有像语言模型那样统一的单一排行榜,常用:

  - 真实机器人任务成功率;
  - 未见物体、背景和指令上的泛化率;
  - CALVIN 长时任务链完成长度;
  - LIBERO 多任务和迁移成功率;
  - BridgeData、Open X-Embodiment 上的策略评测;
  - 动作延迟、控制频率和碰撞率;
  - 跨本体迁移与少样本微调效率。

  仿真成功率不能完全代替实机测试,因为接触、摩擦、视觉噪声和控制延迟存在明显差异。

7)四个方向如何组成完整的具身系统!!!

  举例子

一次“去厨房把杯子拿给我”的任务,可以分解为:

  1. VLM 从图像中识别门、走廊、厨房和杯子,并理解语言目标。
  2. VLN 建立或使用地图,选择去厨房的路径并控制移动。
  3. VLA 在厨房中定位杯子,输出接近、抓取、抬升和搬运动作。
  4. 世界模型 预测候选动作的结果,例如杯子是否会滑落、路径是否碰撞。
  5. 执行后重新观察,形成闭环,而不是一次性输出完整动作。

  未来更可能出现统一模型,但模块化仍有实际价值:导航需要长时地图,操作需要高频精细控制,世界模型需要反事实预测,而 VLM 侧重开放语义理解,这些目标的时空尺度并不相同。

当前最重要的研究问题

  1. 从相关性走向因果性:理解动作真正导致什么结果。
  2. 长时任务:从数秒操作扩展到数十分钟任务。
  3. 失败恢复:识别抓空、滑落、路径受阻并重新规划。
  4. 三维空间理解:从二维图像推断几何、遮挡和可达性。
  5. 跨本体泛化:同一模型控制不同机械臂、夹爪和移动平台。
  6. 数据效率:减少真实机器人遥操作数据需求。
  7. 实时推理:在大模型规模下维持稳定控制频率。
  8. 安全性:加入碰撞约束、不确定性估计和人工接管。
  9. 可验证评测:区分记忆训练场景与真正的新环境泛化。
  10. 世界模型与 VLA 联合训练:同时学习“预测未来”和“选择动作”。

一句话总结:

  > VLM 提供语义理解,VLN 将语言目标转换为导航行为,VLA 将视觉与语言转换为可执行控制,世界模型则预测不同动作将造成的未来,从而支持规划、验证和失败恢复。


  第一阶段:视觉语言基础

  CLIP → Flamingo → BLIP-2 → LLaVA → Qwen2-VL

  第二阶段:世界模型与规划

  World Models → PlaNet → Dreamer → MuZero → TD-MPC2 → Genie

  第三阶段:视觉语言导航

  R2R → Speaker-Follower → PREVALENT → HAMT → DUET → NavGPT

  第四阶段:机器人动作策略

  Transporter Networks → PerAct → Diffusion Policy → ACT

  第五阶段:通用 VLA

  RT-1 → PaLM-E → RT-2 → Open X-Embodiment → Octo → OpenVLA → π0 → π0.5

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐