VLA 模型:概念、演进、代表工作与挑战

塞班是一台搭载 VLA 的移动操作机器人。给定 RGB-D 观测、本体状态和指令“把苹果拿过来”,它需要输出末端执行器位姿序列,并在闭环中完成抓取。VLA 要解决的核心问题是:将视觉感知、语言理解和物理动作生成统一到同一个条件生成框架中。
在这里插入图片描述


1. 概念与架构

VLA(Vision-Language-Action):输入视觉观测、语言指令、本体状态/历史,输出机器人可执行动作序列。它与 VLM 的区别在于,VLM 输出文本,VLA 输出动作。

模块作用常见实现
视觉编码器提取空间、语义、时序特征CLIP、SigLIP、DINOv2
语言底座理解指令、常识、任务上下文LLaMA、Qwen、DeepSeek 等
动作解码器/策略将多模态表征转为控制信号自回归离散 token、扩散、流匹配
本体状态编码引入关节角、末端位姿、历史动作MLP、Transformer、状态 token
动作生成路线原理代表优点局限
自回归离散 token动作离散为 token,逐 token 预测RT-2、OpenVLA复用 LLM 框架,训练稳定频率低,离散精度损失,误差累积
扩散策略从噪声逐步去噪生成动作序列Octo、RDT-1B、CogACT多峰分布,动作平滑多步推理,实时性差
流匹配学习噪声到动作的速度场π0、π0.5、GR00T N1连续动作,高频灵巧,长时程训练与工程门槛高

2. 发展脉络

时间模型机构/公司核心架构动作生成主要贡献/局限
2022RT-1Google RoboticsTransformer离散动作 token早期大规模多任务机器人策略;非 LLM 底座,泛化有限
2023RT-2Google DeepMindVLM + 动作 token自回归离散动作作为文本 token,互联网知识迁移;闭源,高频弱
2023–2024OctoUC Berkeley、Stanford、CMU、Google DeepMind 等Transformer + 扩散头扩散开源通用策略,多本体;规模较小
2024OpenVLAStanford、UC Berkeley、Google DeepMind 等Prismatic VLM + LLaMA 2 7B自回归离散开源基线,易微调;推理频率低,长时程弱
2024π0Physical IntelligenceVLM + Action Expert流匹配高频灵巧,长时程;资源门槛高
2024RDT-1B清华大学 / Spirit AI扩散 VLA扩散双臂操作,1.2B;评测生态早期
2024CogACT上海人工智能实验室等VLM + 扩散动作头扩散认知与动作解耦;生态早期
2025π0.5Physical IntelligenceVLM + Action Expert流匹配开放世界泛化,长时程;细节公开有限
2025GR00T N1NVIDIA双系统 VLM + DiT扩散/流匹配人形机器人通用 VLA;依赖 Isaac/NVIDIA 生态

3. 代表模型优缺点对比

模型机构/公司动作生成优点局限适用场景
RT-1Google Robotics离散 token多任务规模化验证泛化有限,闭源研究史
RT-2Google DeepMind自回归离散语义泛化强,互联网知识迁移闭源,推理慢,高频弱语义泛化研究
OpenVLAStanford、UC Berkeley、Google DeepMind 等自回归离散开源,易微调,生态成熟频率低,动作离散精度损失入门、复现、LIBERO 基线
π0Physical Intelligence流匹配高频灵巧,长时程,跨本体闭源/资源门槛高灵巧操作、工业
π0.5Physical Intelligence流匹配开放世界泛化,长时程资源门槛高通用机器人
GR00T N1NVIDIA扩散/流匹配快慢双系统,人形,仿真合成依赖 NVIDIA 生态,真实部署复杂人形机器人
OctoUC Berkeley 等扩散开源灵活,多本体规模小,泛化有限轻量研究
RDT-1B清华大学 / Spirit AI扩散双臂,1.2B数据/评测有限双臂操作
CogACT上海人工智能实验室等扩散认知与动作解耦生态早期认知操作研究

4. 主要挑战

挑战具体表现常见应对
数据稀缺真机演示昂贵,动作数据远少于图文仿真合成、遥操作、跨本体数据
动作异构不同机器人自由度、夹爪、关节范围不同统一动作空间、本体 token、适配器
实时性大模型推理慢,控制需高频动作 chunk、蒸馏、量化、双系统
泛化新物体、新场景、新指令下性能下降大规模预训练、域随机化、语言条件化
长时程多步任务需要记忆、规划、错误恢复层级规划、记忆检索、Agent 框架
多模态对齐视觉、语言、动作时序对齐困难跨模态注意力、对比损失、动作 chunk
安全与可解释动作有物理后果,幻觉代价高验证器、约束控制、人类兜底
评测不统一仿真成功不等于真机成功多基准评测、真机回归、长尾测试
Sim2Real摩擦、延迟、接触、光照差距域随机化、系统辨识、真实微调
持续学习学新技能遗忘旧技能回放、正则、低秩适配、动态容量
部署显存、延迟、功耗受限INT8/INT4、vLLM、TensorRT、边缘部署

5. 面试回答要点

VLA 是视觉-语言-动作模型,输入图像和语言,输出机器人动作。架构由视觉编码器、语言底座、动作解码器组成。动作生成分自回归离散 token、扩散、流匹配三条路线。代表工作包括 RT-2、OpenVLA、π0、GR00T N1。OpenVLA 适合开源基线,π0 适合高频灵巧,GR00T N1 面向人形双系统。核心挑战是数据、动作异构、实时性、泛化、长时程、安全、评测、Sim2Real 和持续学习。当前 VLA 仍处于快速演进期,但技术路线已经清晰:统一多模态表征,生成可执行动作,并在真实闭环中持续校正。

一句话选型:

想入门、复现、跑 LIBERO:OpenVLA;
想高频灵巧、长时程:π0 / π0.5;
想人形、双系统:GR00T N1;
想轻量开源:Octo / TinyVLA;
想双臂扩散:RDT-1B。
没有最好的 VLA,只有最适合场景的 VLA。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐