世界模型,VLM,VLN,VLA等名词概念梳理
1)综述
从研究对象,数学形式,模型架构,训练方法,数据集,评测指标,关键难点和顶尖论文8个方面进行系统梳理 世界模型,VLM,VLN,VLA
这四者并非同一层级,VLM 是感知与语义理解基础模型,VLN是导航任务范式,VLA是机器人策略模型,世界模型是与测环境变化并支持规划的模型。
2)整体关系
整体关系:

3)世界模型
3.1 定义:
世界模型学习环境的动态规律,在内部建立一个可预测,可规划的环境表示,使智能体不必对每个候选动作都在真实世界中试验
一个典型概率模型为:
其中:
- (o_t):图像、深度、触觉等观测;
- (s_t):根据历史推断出的隐状态;
- (a_t):智能体动作;
- (r_t):奖励或任务得分;
- (s_{t+1}):动作发生后的新状态。
部分可观测环境中,真正使用的状态往往是:
也就是说,模型要根据历史推断当前无法直接观察到的状态,例如抽屉内部有什么、物体是否被抓稳。

3.2 世界模型内部通常学什么
一个完整世界模型可能包含:
1. 表示模型:把高维图像压缩为 latent state。
2. 动态模型:预测动作如何改变 latent state。
3. 观测模型:从 latent 重建图像、深度或其他观测。
4. 奖励模型:预测某个状态和动作的收益。
5. 终止模型:预测任务是否结束。
6. 策略或规划器:在模型内部试验轨迹并选出动作。
典型潜伏态模型可以写成:
规划器随后比较多个候选动作序列
3.3 四条主要技术路线
### A. 潜空间动态模型
先压缩图像,再在潜空间预测未来。相比逐像素生成,潜空间更加高效,也更适合控制。
代表:World Models、PlaNet、Dreamer、TD-MPC。
### B. 面向规划的价值等价模型
模型不一定重建真实画面,只需保留规划所需要的奖励、价值和策略信息。
代表:MuZero、EfficientZero。
### C. 生成式视频世界模型
将未来建模为图像、视频帧或离散视觉 token。它能够生成可观察的未来,但“视觉逼真”并不自动等于“动力学正确”。
代表:Genie、GAIA-1、UniSim、V-JEPA 2。
### D. 机器人世界模型
在视觉预测中加入机器人动作、机械臂状态和语言目标,用于:
- 预测抓取是否成功;
- 比较不同操作轨迹;
- 生成训练数据;
- 检测异常和失败;
- 执行模型预测控制。
3.4 世界模型与视频生成模型的区别
普通视频模型学习
动作条件世界模型学习:
后者必须回答“如果采取动作 A 会怎样”,并允许智能体控制未来。只有生成漂亮视频,却不能稳定响应动作条件的模型,不足以成为可靠的控制世界模型。
3.5 核心难点
- 长时滚动预测产生误差累积;
- 接触、碰撞、摩擦、液体等物理规律难以建模;
- 单目视觉无法完全确定三维状态;
- 随机环境需要表示多种可能未来;
- 模型容易关注视觉细节,却忽略任务关键变量;
- 规划会利用模型漏洞,即 model exploitation;
- 机器人数据有限,跨环境和跨本体泛化困难;
- 世界模型预测正确,也不代表规划器一定能找到正确动作。
4)VLM vision-language-Model
4.1)定义
VLM 将视觉信息和语言映射到统一语义空间,用于图像描述,视觉问答,OCR,定位,视频理解以及多模态推理
条件生成式通常为:
其中输出 (y) 可以是答案、描述、检测框、坐标或结构化文本。
4.2)典型架构
-
4.3)三条技术路线
A)视觉编码器+语言编码器
视觉表示通过交叉注意力输入文本解码器。
代表:Flamingo、BLIP、BLIP-2、PaLI。
B)多模态大语言模型
把视觉 token 投影到 LLM 的表示空间,再通过视觉指令微调训练对话、推理、OCR和定位能力。
代表:LLaVA、Qwen-VL、InternVL。
C)双编码
图像和文本分别编码,通过对比学习对齐:
优点是检索和零样本分类效率高;缺点是不擅长复杂生成推理
代表:CLIP,ALIGN,SigIP
4.4)训练流程
典型训练过程包括:
1. 视觉预训练:ImageNet、自监督或图文对比学习。
2. 图文对齐:使用大规模图片与描述数据。
3. 视觉指令微调:训练问答、对话、定位和推理。
4. 偏好对齐:降低幻觉和不安全输出。
5. 领域微调:机器人、医疗、遥感、文档或自动驾驶。
4.5)VLM和真正视觉理解之间的差距
VLM的语言表达非常流畅,但仍可能:
-描述不存在的物体
-混淆左右,遮挡和深度关系
-无法稳定计数密集对象
-对微小目标和精密空间关系不可靠
-把数据相关性误认为物理因果
-在视频中丢失长时间状态
-知道“应该怎样抓”,却不具备可执行控制精度
因此,VLM 可以作为机器人的语义大脑,但通常不能单独替代定位,规划和低层控制
4.6)常见评测
- 通用问答:VQAv2、GQA、OK-VQA;
- 知识与推理:MMMU、MMBench、MathVista;
- OCR与文档:TextVQA、DocVQA、OCRBench;
- 幻觉:POPE、HallusionBench;
- 视频:Video-MME、MVBench;
- 定位:RefCOCO、RefCOCO+、RefCOCOg。
5)VLN:Vision-and-Language Navigation
5.1)定义
VLN要求智能体
形式上,策略需要计算:
其中(l)是导航指令,动作可以是离散节点选择,也可以是连续速度,旋转角或航点
例如:
> “走出卧室,经过右侧的沙发,在餐桌前左转,停在冰箱旁。”
这要求智能体同时具备语言解析、视觉识别、空间记忆、定位、规划、探索与停止判断。
5.2)VLN的主要设定
### 离散 VLN
环境被表示为预先构建的导航图,智能体从相邻全景节点中选择下一节点。经典 R2R 属于此类。
### 连续 VLN
智能体在连续三维空间中移动,需要处理碰撞、局部控制和真实路径规划。VLN-CE 属于此类。
### 目标物体导航
不仅要到达某个位置,还要找到并指认目标物体。代表数据集包括 REVERIE、SOON。
### 多语言和长指令导航
强调跨语言、细粒度地标以及更长轨迹。代表数据集为 RxR。
### 开放世界真实导航
机器人在无预定义导航图的环境中,根据相机、深度、里程计和语言实时建图与行动。
5.3)模型演进
--->Seq2Seq 阶段
语言编码器与视觉编码器通过注意力融合,逐步产生动作。
问题是长时记忆和未见环境泛化较弱。
--->预训练 Transformer 阶段
利用视觉语言预训练学习更好的跨模态对应。
代表:PREVALENT、VLN-BERT、AirBERT、HAMT。
--->显式地图阶段
构建拓扑图、语义地图或鸟瞰图,对长期导航更稳定。
代表:DUET、BEVBert。
--->LLM/VLM 推理阶段
VLM 识别地标和空间关系,LLM 分解指令、维护历史并选择航点。
代表:NavGPT、MapGPT、Uni-NaVid。
5.4)VLN 的关键模块
语言解析:目标、动作、地标、顺序
视觉感知:房间、物体、可通行区域
定位记忆:我在哪里,走过哪里
地图构建:拓扑图、占据图或语义地图
规划策略:下一航点和全局路线
局部控制:避障和连续移动
停止判断:是否真正到达目标
5.5) 评测指标
- NE:终点到目标的导航误差;
- SR:是否在规定距离内到达目标;
- SPL:在成功率中加入路径效率惩罚;
- Oracle SR:轨迹中是否曾经过目标附近;
- nDTW / SDTW:预测轨迹与参考轨迹的吻合程度;
- CLS:路径覆盖和长度综合指标;
- RGS / RGSPL:是否正确定位目标物体及其路径效率。
SPL 常写为:
其中 (S_i) 表示是否成功,(L_i) 是最短路径长度,(P_i) 是实际路径长度。
6)VLA Vision-Language-Action
6.1)定义
VLA 将视觉观察、语言指令和机器人状态直接映射为可执行动作:
其中:
- (o):一个或多个摄像头的图像;
- (l):语言任务;
- (q):关节位置、末端位姿、夹爪状态等本体感知;
- (a):关节控制、末端位姿增量、夹爪指令或移动底盘指令;
- (H):一次预测的动作区间长度。
例如指令“把红色杯子放进水槽”,VLA 要完成语义目标识别、空间定位、抓取、搬运、放置以及必要的失败恢复。
6.2)VLM与VLA的本质差异

6.3) VLA的主要动作表示
### 动作离散化
将连续动作分桶并转成 token,像生成单词一样预测动作。
优点:能直接利用自回归 LLM。
缺点:量化误差、控制频率和轨迹平滑性受限。
代表:RT-2、OpenVLA。
### 连续回归
动作头直接预测连续控制量。结构简单,但多模态动作分布容易被均方误差平均化。
### 扩散策略
从噪声逐步生成动作块,能够表达多个合理动作模式。
代表:Diffusion Policy。
### Flow Matching
学习从简单分布到动作分布的连续速度场,采样步骤通常少于扩散过程。
代表:π0。
### Action Chunking
一次输出未来若干步动作,降低推理频率,增强动作连续性。
代表:ACT、π0。
6.4)典型训练路线
1. 在互联网图文数据上获得视觉语言知识;
2. 使用机器人示范轨迹训练动作预测;
3. 通过跨机器人数据学习通用表示;
4. 对特定机器人和任务做少量微调;
5. 使用闭环执行数据、人工纠正或强化学习进一步改进。
机器人轨迹通常包含:
-->语言指令
-->多视角视频
-->关节状态 / 末端位姿
-->动作序列
-->任务成功标签
-->机器人本体和相机配置
6.5)通用化面临的三种差异
- 任务差异:抓取、折叠、装配、移动等任务不同;
- 环境差异:背景、物体、光照和相机不同;
- 本体差异:机械臂自由度、控制接口和夹爪结构不同。
Open X-Embodiment、RT-X 和 Octo 主要研究如何通过跨本体数据缓解这些问题。
6.6)测评方式
VLA 没有像语言模型那样统一的单一排行榜,常用:
- 真实机器人任务成功率;
- 未见物体、背景和指令上的泛化率;
- CALVIN 长时任务链完成长度;
- LIBERO 多任务和迁移成功率;
- BridgeData、Open X-Embodiment 上的策略评测;
- 动作延迟、控制频率和碰撞率;
- 跨本体迁移与少样本微调效率。
仿真成功率不能完全代替实机测试,因为接触、摩擦、视觉噪声和控制延迟存在明显差异。
7)四个方向如何组成完整的具身系统!!!
举例子
一次“去厨房把杯子拿给我”的任务,可以分解为:
1. VLM 从图像中识别门、走廊、厨房和杯子,并理解语言目标。
2. VLN 建立或使用地图,选择去厨房的路径并控制移动。
3. VLA 在厨房中定位杯子,输出接近、抓取、抬升和搬运动作。
4. 世界模型 预测候选动作的结果,例如杯子是否会滑落、路径是否碰撞。
5. 执行后重新观察,形成闭环,而不是一次性输出完整动作。
未来更可能出现统一模型,但模块化仍有实际价值:导航需要长时地图,操作需要高频精细控制,世界模型需要反事实预测,而 VLM 侧重开放语义理解,这些目标的时空尺度并不相同。
当前最重要的研究问题
1. 从相关性走向因果性:理解动作真正导致什么结果。
2. 长时任务:从数秒操作扩展到数十分钟任务。
3. 失败恢复:识别抓空、滑落、路径受阻并重新规划。
4. 三维空间理解:从二维图像推断几何、遮挡和可达性。
5. 跨本体泛化:同一模型控制不同机械臂、夹爪和移动平台。
6. 数据效率:减少真实机器人遥操作数据需求。
7. 实时推理:在大模型规模下维持稳定控制频率。
8. 安全性:加入碰撞约束、不确定性估计和人工接管。
9. 可验证评测:区分记忆训练场景与真正的新环境泛化。
10. 世界模型与 VLA 联合训练:同时学习“预测未来”和“选择动作”。
一句话总结:
> VLM 提供语义理解,VLN 将语言目标转换为导航行为,VLA 将视觉与语言转换为可执行控制,世界模型则预测不同动作将造成的未来,从而支持规划、验证和失败恢复。
第一阶段:视觉语言基础
CLIP → Flamingo → BLIP-2 → LLaVA → Qwen2-VL
第二阶段:世界模型与规划
World Models → PlaNet → Dreamer → MuZero → TD-MPC2 → Genie
第三阶段:视觉语言导航
R2R → Speaker-Follower → PREVALENT → HAMT → DUET → NavGPT
第四阶段:机器人动作策略
Transporter Networks → PerAct → Diffusion Policy → ACT
第五阶段:通用 VLA
RT-1 → PaLM-E → RT-2 → Open X-Embodiment → Octo → OpenVLA → π0 → π0.5
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)