VLA 综述:从核心技术到具身智能学习路线——主流方法全景梳理
“视觉-语言-动作(VLA)模型是机器人领域的前沿研究方向。全面梳理VLA的基本概念、核心技术以及强化学习(RL)重返舞台的最新进展,并提供完整的具身智能入门路线。”
引言
视觉-语言-动作(Vision-Language-Action, VLA)模型代表了机器人技术的范式转变,将视觉感知、自然语言理解和动作控制统一在单一的端到端学习框架中。VLA 模型使机器人能够直接从自然语言指令和视觉观察中学习操作策略,无需显式的中间表示或分离的感知-规划-控制模块。
自 2023 年 Google DeepMind 推出 RT-2 以来,VLA 模型在机器人操作任务中展现出强大的泛化能力和零样本学习潜力。这一技术路线继承了大规模视觉-语言模型(VLM)在跨模态理解方面的优势,并将其扩展到具身智能领域,使机器人能够像理解图像和文本一样"理解"物理世界中的交互任务。
VLA 模型在服务机器人、工业自动化、智能制造等领域有着广泛的应用前景。本文旨在系统梳理 VLA 领域的研究进展,为学习和研究 VLA 提供全面参考。
1. VLA核心技术体系
1.1 什么是VLA?
VLA(Vision-Language-Action)模型是一类端到端的多模态学习模型,能够直接从视觉输入(相机图像)和语言指令中预测机器人的控制动作。与传统的模块化机器人系统不同,VLA 将感知、推理和控制统一在单一的神经网络架构中。
VLA的核心特征
1. 端到端学习:直接从原始传感器数据到低层控制信号的映射,无需手工设计的中间表示。
2. 多模态融合:统一处理视觉、语言和动作三种模态,实现跨模态的语义对齐。
3. 指令驱动:通过自然语言指令指定任务目标,支持灵活的任务切换和零样本泛化。
4. 大规模预训练:继承视觉-语言模型的预训练知识,并在机器人演示数据上微调。
VLA的发展里程碑:两年三次范式跃迁
VLA研究时间线:从模块化到端到端统一模型,再到强化学习的自我进化(2022-2026)
具身智能在短短两年内经历了三次核心的"范式跃迁":
- 第一次跃迁(2022-2023初)——从语言规划到VLA:早期如SayCan虽然能让LLM进行任务分解,但它是"闭着眼睛"做规划。直到RT-1、RT-2的出现,将视觉、语言和动作Token统一,第一次证明了VLM可以直接生成动作,实现了端到端的感知-控制。
- 第二次跃迁(2023)——Action Chunking与Diffusion Policy:传统的单步动作预测容易产生累积误差(Compounding Error)。ACT(Action Chunking with Transformers)提出一次性预测一段动作序列(Chunk),解决了误差累积问题。结合成本不到2万美元的ALOHA开源双臂硬件,直接引爆了学界的具身研究。随后,Diffusion Policy用扩散模型替代了传统的CVAE,彻底解决了模型在面对多种合理运动路径时容易"取平均"导致失败的问题,天然且优雅地建模了动作的多模态分布。
- 第三次跃迁(2024-2025)——Flow Matching与RL重返舞台:π₀将Diffusion Policy的弯曲去噪路径拉直(Flow Matching),推理速度提升5-7倍,实现了50Hz的高频连续控制(能玩扑克、折衣服)。更关键的是,π*₀.₆提出了RECAP(优势条件化)方法,巧妙绕过了Flow Matching难以计算对数概率的限制,让强化学习(RL)重新与VLA深度融合。这意味着机器人不再是出厂即定型的静态工具,而是能够通过真实部署收集数据实现"越用越好"的学习型智能体,真正转动了数据飞轮(Data Flywheel)。
1.2 VLA系统架构
一个完整的VLA系统包含三个核心组成部分:
1. 视觉编码器(Vision Encoder):从单眼到多眼
功能:从相机图像中提取视觉特征表示。
主流架构演进:
- 单编码器(早期/RT-2):使用单一 ViT 或 PaLI-X 处理所有信息,效率相对较低。
- 双编码器(OpenVLA 模式):
- DINOv2:负责提取几何与空间特征(理解"在哪里")。
- SigLIP:负责提取语义与常识特征(理解"是什么")。
- 多视角融合:通过融合侧方、腕部等多摄像头输入,解决遮挡与深度感知问题。
2. 语言-行动骨干网络(Language-Action Backbone):System 1 与 System 2 的融合
功能:作为"大脑"层,负责指令理解、推理与动作规划。
主流架构:
- Transformer-based LLM:如 Qwen3-VL、Llama-2/3、Phi-3 等。
- 双系统架构(NVIDIA GR00T 范式):
- System 2 (慢思考):基于视觉语言模型负责理解环境、解读指令并作出长时序规划(~5Hz)。
- System 1 (快思考):基于扩散 Transformer (DiT) 或流匹配负责高频、精细的反射性动作(~50Hz)。
3. 动作解码器(Action Decoder):从语言 Token 到高频连续轨迹
功能:将模型的高层决策转化为具体的机器人控制信号。
主流范式比较:
- 离散动作建模(RT-2/OpenVLA):将动作视为语言 Token 预测。优点是架构统一,缺点是难以生成连续流畅的高频动作。
- 连续动作建模(Diffusion Policy):使用扩散过程建模动作分布,能捕获多模态动作可能性,在精细操作中表现更优。
- 流匹配(Flow Matching, π₀):直接生成连续的关节轨迹,支持 50Hz 高频控制。这是实现"折纸、玩扑克牌"等极高精度任务的关键。
架构分类:端到端 vs 层级
VLA模型可以从架构层面分为两大类:端到端统一模型和层级架构模型。这种分类反映了不同的设计哲学和应用场景。
End-to-End架构 vs Hierarchical架构对比:
| 维度 | End-to-End | Hierarchical |
|---|---|---|
| 设计理念 | 单一统一网络 | 分离规划与执行 |
| 推理方式 | 隐式端到端 | 显式分层推理 |
| 可解释性 | 低 | 高 |
| 适用场景 | 短时域任务 | 长时程复杂任务 |
End-to-End Architecture 代表模型:
| 模型 | 动作解码器 | 参数规模 | 特点 |
|---|---|---|---|
| OpenVLA | 离散token化 | 7B | 首个开源大规模VLA(详见第5.9节) |
| π₀ | Flow Matching | 3B (VLM) + 860M (Action) | 50Hz实时控制(详见第5.10节) |
| Diffusion Policy | DDPM | - | 多模态动作分布(详见第5.5节) |
| RDT-1B | Diffusion Transformer | 1B | 大规模扩散VLA |
Hierarchical Architecture 代表模型:
| 模型 | 高层规划 | 低层执行 | 特点 |
|---|---|---|---|
| π₀.5 | 增强推理VLM | Flow Matching | 多步骤推理链(详见第5.11节) |
| RT-H | VLM子任务分解 | RT-1 | 层级任务执行 |
| Hi Robot | VLM规划器 | VLA执行器 | 两层显式分离 |
| LoHoVLA | 端到端学习的层级 | - | 隐式层级结构 |
最新研究表明,纯端到端和纯层级架构各有优劣,混合方法成为新趋势:ACoT-VLA在动作层面进行显式推理,保持统一架构(详见第5.13节)。
1.3 VLA与传统机器人控制的区别
VLA代表了机器人控制范式的根本性转变:
从模块化到端到端
传统方法:
- 感知模块:物体检测、位姿估计
- 规划模块:轨迹规划、路径优化
- 控制模块:PID控制、力控制
- 各模块独立设计和优化
VLA方法:
- 单一神经网络直接从像素到控制信号
- 联合优化所有组件
- 减少了模块间的信息损失
从任务特定到通用能力
传统方法:为每个任务设计专门的控制策略,难以泛化到新任务和新环境,需要大量的工程调试。
VLA方法:通过自然语言指令指定任务,零样本或少样本泛化到新任务,利用预训练知识处理未见场景。
从显式建模到隐式学习
传统方法:需要精确的环境模型和物体模型,依赖手工设计的特征和规则,对模型误差敏感。
VLA方法:从数据中隐式学习环境动力学,自动发现任务相关的特征,对感知噪声和模型不确定性更鲁棒。
从工程驱动到数据驱动
传统方法:依赖专家知识和人工调参,开发周期长,部署成本高,难以处理长尾场景。
VLA方法:基于大规模演示数据学习,通过数据增强提升泛化能力,持续学习和在线适应。
1.4 VLA任务分类
VLA模型可以应用于多种类型的机器人任务,以下从四个维度进行分类:
| 任务类型 | 典型输入 | 典型输出 | 代表方法 | 关键说明 |
|---|---|---|---|---|
| 单步操作 | RGB图像 + 抓取指令 | 单次抓取动作 | RT-1, OpenVLA | 主要考察感知和控制精度,代表数据集:RLBench简单任务 |
| 多步骤操作 | 多帧图像 + 序列指令 | 有序动作序列 | CALVIN, LIBERO | 涉及子目标分解,需维护任务进度状态 |
| 长时程任务 | 多视角视频 + 目标描述 | 分层规划+执行 | π₀.5, ALFRED | 包含数十至上百步,需错误检测与恢复机制 |
| 刚体操作 | RGB/深度图 + 位置指令 | 6-DOF末端执行器 | RT-2, OpenVLA | 关注几何精度,是最基础的操作类型 |
| 可变形物体 | 多视角RGB + 形变状态 | 精细轨迹 | π₀(折衣服) | 物体状态高维,难以在仿真中准确建模 |
| 流体操作 | RGB + 任务描述 | 力矩控制序列 | 专用模型 | 需流体动力学建模,传感器限制明显 |
| 工具使用 | 场景图像 + 工具描述 | 工具-物体交互 | RT-2 | 需理解工具功能,是语义推理能力的体现 |
| 位置控制 | 视觉观测 | Δxyz + 四元数 | OpenVLA, RT-2 | 适合精确定位,7自由度机械臂标准输出 |
| 速度控制 | 连续帧图像 | dx/dy/dz速度 | 连续控制模型 | 轨迹更平滑,适合连续跟踪任务 |
| 力/阻抗控制 | 视觉+力传感 | 接触力指令 | 专用控制器 | 需力/扭矩传感器,适合组装和人机协作 |
| 桌面操作 | 固定视角图像 | 工作台范围动作 | 大多数VLA | 场景相对简单,是VLA的主要测试场景 |
| 厨房任务 | 多视角图像 | 复合操作序列 | π₀.5 | 多样物体和工具,应用于服务机器人 |
| 移动操作 | 导航+操作图像 | 移动+抓取动作 | π₀.5家庭任务 | 结合导航与操作,大范围工作空间 |
1.5 主流VLA模型横向对比汇总
为了直观展示各阶段代表性 VLA 模型的差异,下表汇总了其核心架构与技术指标:
| 模型 | 发布时间 | 参数规模 | 核心架构/特点 | 开源状态 | 备注 |
|---|---|---|---|---|---|
| RT-1 | 2022.12 | 130M | Transformer + 离散 Token | ✅ 数据+代码 | 奠基之作 |
| RT-2 | 2023.07 | 5B/55B | VLM 直接微调 | ❌ 闭源 | 首次验证 VLM 知识迁移 |
| OpenVLA | 2024.06 | 7B | 双编码器 (DINOv2+SigLIP) | ✅ 权重+代码 | 目前最强开源 VLA 标杆 |
| π₀ | 2024.10 | 3.8B | Flow Matching (50Hz) | ✅ 权重+代码 | 擅长折纸等精细操作 |
| GR00T N1.6 | 2026.01 | 2.2B | 双系统 (System 1+2) | ✅ 权重+代码 | 英伟达全栈生态绑定 |
| Xiaomi-R0 | 2025.02 | 4.7B | MoT 架构(分离脑/小脑) | ✅ 权重+代码 | 中国力量,低延迟优化 |
| LingBot-VLA | 2025.02 | - | 跨形态泛化 (9种机器人) | ✅ 权重+代码 | 蚂蚁集团真机预训练 |
| π₀.5 | 2025.04 | - | 异构任务协同训练 | ❌ 闭源 | 开放世界家庭长时程任务 |
| ACoT-VLA | 2026.01 | - | 动作空间推理 | 📄 仅论文 | 显著减少长时域误差累积 |
| InternVLA-A1.5 | 2026.01 | 8B | 前瞻预测 (Foresight) + 空间定位 | ✅ 权重+代码 | 商汤/上海 AI Lab,端到端高精度坐标 |
| ZR-0 | 2026.06 | 2.6B | 密集 ECoT 跨本体对齐 + 推理零延迟旁路 | ✅ 权重+代码 | 智谱 AI/人大,ProcCorpus-60M 数据集 |
| S²-VLA | 2026.06 | 2B | 状态空间引导自适应注意力 (SSGAA) | 📄 仅论文 | 华东师大/上交,LIBERO 98.2% SOTA |
| RoboTTT | 2026.07 | 2B+ | 测试时训练 (TTT) + 8K 上下文 Scaling | ✅ 代码 | NVIDIA GEAR/Stanford,突破时序瓶颈 |
| TurboVLA | 2026.07 | 0.2B | 直连 V + L → A V+L \to A V+L→A / 32Hz 控制 / <1GB 显存 | ✅ 代码 | 摆脱 LLM 词表,RTX 4090 边缘高频部署 |
1.6 架构演进与发展趋势
架构演进时间线(2022-2026)
| 年份 | 里程碑 | 代表工作 | 技术突破 |
|---|---|---|---|
| 2022 | 模块化阶段 | RT-1 | 大规模多任务Transformer,130k轨迹证明数据规模收益 |
| 2023初 | 语言规划探索 | SayCan, PaLM-E | LLM用于任务分解,但感知-控制分离 |
| 2023中 | 端到端VLA诞生 | RT-2, RT-X | VLM直接微调输出动作Token,涌现推理能力 |
| 2023下 | Action Chunking | ACT + ALOHA | 预测动作序列解决累积误差,低成本硬件普及 |
| 2023下 | 扩散策略 | Diffusion Policy | 多模态动作分布建模,精细操作突破 |
| 2024上 | 开源生态 | OpenVLA | 7B开源标杆,双编码器架构,OXE数据集 |
| 2024下 | Flow Matching | π₀ | 50Hz高频控制,折纸/折衣服等极精细任务 |
| 2025上 | 开放世界泛化 | π₀.5 | 未见家庭环境10-15分钟长时程任务 |
| 2025下 | RL重返舞台 | π*₀.₆ | RECAP优势条件化,数据飞轮转动 |
| 2026 | 动作空间推理 | ACoT-VLA | 动作CoT推理,长时域误差抗累积 |
| 2026 | 密集思考链与解耦 | ZR-0 | ProcCorpus-60M 密集具身CoT跨本体对齐,推理期特征掩码零开销旁路 |
| 2026 | 超长上下文与TTT | RoboTTT | 测试时训练快权重在线更新,突破 8K Timesteps 时序上下文 Scaling |
| 2026 | 状态空间阶段自适应 | S²-VLA | 信念状态自发追踪执行阶段,动态门控融合攻克长程累积误差 |
| 2026 | 极速端侧直连控制 | TurboVLA | V + L → A V+L \to A V+L→A 直连架构,摆脱 LLM 词表在 RTX 4090 实现 32Hz 控制 |
从整体发展脉络来看,VLA研究经历了从模块化系统到端到端模型,再到端到端与层级混合的重要转变。
当前前沿方向:走向通用具身智能(2025-2026)
最新研究趋势表明,VLA正从单一操作任务向通用具身智能体演进,研究重点包括:
- 基于推理的VLA(Reasoning VLA)
- 多任务、多机器人的统一VLA
- VLA与世界模型的结合
- 从模仿学习到强化学习与测试时自适应(TTT)的转变
基于世界模型的VLA:世界模型被认为是机器人学习的"System 2"。如果VLA是"看到就做"的条件反射(System 1),世界模型则允许机器人在脑海中"想象"行动后果后再执行。近期,世界模型正逐渐成为合成数据的终极生成器,转动了VLA的"数据飞轮":
- UniSim:首次证明可以将3D仿真、真实机器人数据和互联网视频混合训练出统一的世界模拟器
- NVIDIA Cosmos:为具身智能专门设计,能生成符合物理规律的视频轨迹
- GIGA-star:利用世界模型生成的合成数据训练VLA,效果提升可达30%
中国力量:中国在具身智能领域的参与正在从"跟跑"转向"参与定义规则"。
1.7 VLA开源生态
开源 VLA 的崛起并非单一模型的功劳,而是 模型 + 数据 + 工具 + 硬件 三层生态形成的"组合拳"效应,使其能够与谷歌、特斯拉等闭源巨头抗衡。
1. 数据层:Open X-Embodiment (OXE)
OXE 是开源阵营最宝贵的资源,它打破了实验室之间的数据孤岛:
- 跨平台多样性:整合 22 种机器人形态,涵盖厨房、实验室、办公室等数百种场景。
- 涌现能力:实验证明,即使模型规模不是最大,只要数据够多样(如引入 OXE),模型也能涌现出原有的空间推理能力(如理解 “on” 和 “near” 的空间语义差异)。
- 标准化贡献:定义了统一的 RLDS 数据格式,解决了不同实验室数据格式不一的痛点。
2. 工具层:LeRobot 与 Genesis
- LeRobot (Hugging Face):由前特斯拉工程师 Remi Cadene 打造,统一了数据格式并一键集成多种策略模型,打通了从采集、训练到部署的全流程。
- Genesis (CMU):极速仿真工具,在一张 RTX 4090 上可实现每秒 4300 万帧的模拟速度(实时速度的 43 万倍),将"百万美元级别"的训练门槛降至数百美元。
- 生成式仿真谱系:RoboGen → Genesis → Gene 26.5:Genesis 的工程实现最初源自 RoboGen (ICML 2024) 项目(CMU、清华、MIT、UMass 联合)——RoboGen 论文中 Section 3.4 的脚注即明确写道 “Genesis is still under development … We build our system on top of an internal version”。该谱系于 2026 年 5 月由 Genesis AI 公司延伸为商业级基础模型 Gene 26.5:在自研 Genesis World 仿真器与 20w+ 小时多模态数据上训练单一 Flow Matching 模型,可完成 4 分钟级长程烹饪、毫米级移液、双臂魔方还原等任务,新任务仅需 20–30 分钟微调数据。这条主线印证了 RoboGen 提出的 “propose-generate-learn” 生成式仿真范式正从学术原型走向真实通用操作。
3. 硬件层:低成本与标准化
- Hugging Face 生态:推出了 $100 的 SO-100 机械臂和 $250 的 Reachy Mini,极大降低了具身智能研究的门槛。
- 通用软件层:如 OpenMind 平台,致力于构建跨厂商兼容的软件层,打破机器人系统的封闭性。
开源生态的三条核心启示
根据 2025-2026 年机器人行业的开源博弈,总结出以下三条核心技术与商业启示:
1. 数据多样性重于单一规模:实验(如 RT-2-X)证明,轨迹的多样性(Diversity)比纯粹的数据量更关键。引入 OXE 这种跨平台、跨场景的多样化数据,能让模型涌现出理解"空间语义(如 on vs near)"的能力,而单一机器人的海量重复数据则难以实现这种跨越。
2. 模型、数据、工具的"生态联动":开源阵营之所以能挑战谷歌、特斯拉,靠的是 OXE (数据) + LeRobot (工具链) + Genesis (极速仿真) + $100 硬件 (SO-100) 形成的闭环。这种"组合拳"将具身智能的研究门槛从百万美元降低到了数百美元,让全球研究者能共同参与测试与改进。
3. 开源与闭源的模糊边界:RT-2-X 虽然是谷歌的闭源模型,但其训练依赖了 OXE 开源数据集;英伟达的 GR00T 介于开源与闭源之间(代码开放但深度绑定芯片生态)。这说明未来的博弈不在于单纯的代码是否公开,而在于谁能定义机器人行业的基础设施标准。
1.8 具身智能学习与入门路线
对于想要进入具身智能(特别是操作策略方向)的研究者或开发者,结合当前的开源生态,推荐以下四步递进式的学习路线:
第一步:动手实践(建立直觉)
- 不要上来就看论文,先花数百美元买一个低成本开源机械臂(如 SO-100 或类 ALOHA 单臂)。
- 运行经典算法:用几周时间跑通 ACT(Action Chunking)和 Diffusion Policy 的 Pipeline。不需要一开始就死磕数学原理,先建立起对"遥操作(Teleoperation)"、“数据采集”、"策略训练"和"真机部署推理"的物理体感。
第二步:跑通轻量级VLA(理解链路)
- 尝试小参数模型:例如基于 Hugging Face 的 SmolVLA(450M参数),它能在单张消费级GPU上轻松运行。
- 理解数据流:通过这个步骤理解"视觉 + 语言指令 -> 神经网络 -> 连续动作序列输出"的完整端到端链路是如何打通的。
第三步:体验SOTA模型(微调前沿基座)
- 微调 π₀ (Open Pi):基于 Physical Intelligence 开源的完整训练管线,收集 1-2 小时的特定任务数据,对 π₀ 进行微调。
- 这一步将让你对当前基于 Flow Matching 的 50Hz 高频精细控制能力有一个最前沿的直观认知。
第四步:真机项目落地(跨越Sim-to-Real)
- 必须走向真实物理世界。在仿真(Simulation)中达到100%成功率并不代表模型具有强鲁棒性,因为仿真环境往往缺乏真实的传感器噪声、光照变化和物理机械的间隙误差。
- 在真机上能稳定达到 60% 以上的成功率,才是跨越了真正的工程瓶颈。
2. VLA核心挑战
本章采用挑战驱动分类法(Challenge-Centric Taxonomy),围绕VLA研究的五大核心瓶颈进行组织,而非传统的架构或任务分类。这种分类方式更好地反映了当前VLA领域亟需突破的关键问题。
VLA研究的五大核心挑战体系:
这五大挑战形成了VLA系统的完整开发路径:
💡 核心链路概览:
- 表示 (Representation):建立多模态感知与物理世界的连接(2D → 3D/4D)
- 执行 (Execution):实现指令理解、分层规划与 30Hz+ 实时控制
- 泛化 (Generalization):从仿真迁移(Sim-to-Real)到开放世界持续进化
- 安全 (Safety):确保动作的可解释性(CoT)与人类交互的可靠性
- 数据 (Data):构建多源异构数据集(OXE)与标准化的评测基准(VLABench)
2.1 多模态对齐与物理世界建模
核心问题:弥合语义感知与物理交互之间的鸿沟,实现从2D图像到时空表示的跨越,并发展动态预测世界模型。
多模态对齐与物理世界建模的三层架构:
- 基础对齐层:语义到物理的接地(Vision-Language-Action对齐)
- 时空表示层:从2D图像到3D空间表示
- 动态预测层:世界模型与物理动力学建模
VLA模型需要将视觉-语言模型的语义理解能力转化为对物理世界的准确建模,这涉及三个层次的挑战:
2.1.1 语义到物理的接地(Semantic-to-Physical Grounding)
问题描述:如何将抽象的语言描述(如"红色的杯子")映射到物理世界中的具体对象和可执行动作。
(1)Vision-Language Gap(视觉-语言鸿沟)
- 问题:RGB的高维感知空间与抽象符号语言之间的语义鸿沟
- 解决方案:
- OTTER:文本感知的特征提取机制
- LIV:针对机器人控制数据的对比学习框架
- 符号推理方式:ACT-LLM, Look Leap等利用LLM进行高层符号推理
(2)Vision-Language-Action Gap(视觉-语言-动作三元鸿沟)
- 问题:VLM的感知对齐能力如何转化为实际的物理动作执行
- 解决方案:
- 端到端微调:RT-2, OpenVLA通过动作token化实现VLM到VLA的转化
- 共享中间表示:CLIP-RT, Humanoid-VLA在动作和感知间建立共享语义空间
- 层级架构:引入显式规划层作为语义-动作的桥梁
- VoxPoser:LLM推理生成3D Affordance Map作为中间表示
(3)多模态感觉融合(Sensory Fusion)
- 问题:如何整合触觉、力传感、音频等额外模态
- 解决方案:
- 专业编码器 + 对比学习:TLA, OmniVTLA对齐多感觉模态
- 融合策略:深融合(Tactile-VLA)vs 模块化MoE融合(ForceVLA)
- 生成式方案:MultiGen在模拟器中生成多模态数据
代表性工作:
- CLAP:对齐视频视觉潜在空间与机器人动作空间
- Point-VLA:通过显式视觉提示(边界框)解决指代模糊
- VoxPoser:生成3D可供性图作为强中间表示
- Tactile-VLA/ForceVLA:整合触觉和力传感的多模态VLA
2.1.2 2D到3D的空间表示(2D-to-3D Spatial Representations)
问题描述:从2D图像输入推断3D空间结构,理解深度、遮挡和空间关系。
空间表示层次:
- 2.5D深度地图:Depth Helps, RoboFlamingo-Plus利用深度信息增强空间感知
- 点云表示:PointVLA, GeoVLA, FP3直接操作3D点云进行操作规划
- 体素/占据栅格:OccLLaMA, RoboMM使用体素化占据表示学习场景结构
- 4D表示(新方向):ARM4R预测3D点的时序运动轨迹,实现动态空间建模
代表性工作:
- OccLLaMA:基于占据网络的3D场景理解,学习体素化空间表示
- TraceVLA:3D轨迹追踪与预测,理解物体运动
- PointVLA/GeoVLA:直接在3D点云上进行操作推理
- ARM4R:预测3D点的运动轨迹,实现4D时空建模
2.1.3 动态世界建模(Dynamic World Modeling)
问题描述:预测物体交互的动态变化,理解物理规律和因果关系。
表示空间选择:
- 观察空间预测(高保真):TriVLA, UP-VLA预测未来视觉观察;CoT-VLA, DreamVLA生成视觉子目标
- 潜在空间预测(高效):VLM-in-the-Loop在压缩潜在空间进行快速预测;MinD轻量级潜在动力学模型
代表性工作:
- TriVLA:三角形架构融合过去-现在-未来的视觉表示
- VideoVLA:视频条件的世界模型,预测动作后果
- LUMOS:显式世界模型进行长时程规划
- DreamVLA:在"梦境"中模拟和优化动作序列
未来方向:
- 混合潜在-物理-语义世界模型:整合3D几何、物理动力学和语义属性
- 因果世界模型:显式建模动作-结果的因果关系
- 可学习物理先验:在神经网络中编码物理定律(守恒律、碰撞等)
2.2 指令跟随、规划与鲁棒实时执行
核心问题:解析复杂指令,进行分层任务分解,实现错误检测与自主恢复,并保证实时计算效率。
指令跟随、规划与实时执行的完整流程:
指令理解 → 任务分解与规划 → 动作执行 → 错误检测与恢复 → 实时性优化
2.2.1 复杂指令解析与理解
问题描述:理解多样化、组合式的自然语言指令,处理模糊性和不完整性。
开放式多模态指令:
- 混合文本+图像+草图:OE-VLA处理开放式混合模态指令;Interleave-VLA交错处理图像和文本序列
模糊和欠指定指令:
- 场景解析与验证:ThinkAct场景分析和反馈验证机制;DeepThinkVLA因果CoT推理和结果驱动RL
- 空间推理:InSpire显式空间推理提示,理解"左边"、"上面"等相对位置
- 主动澄清:AskToAct模糊识别模块+主动请求用户澄清
代表性工作:
- ThinkAct:思考-行动架构,在执行前进行推理验证
- InSpire:空间推理增强的指令理解
- AskToAct:主动询问机制,处理模糊指令
2.2.2 分层任务分解与规划
问题描述:将长时序复杂任务分解为可执行的子任务序列,并进行高层规划。
三大规划范式:
(1)语言驱动规划
- 单推理链方法:π0.5在单一推理链中生成明确的语言子任务;OneTwoVLA在关键决策点进行结构化文本推理
- 层级方法:Hi Robot两层架构(VLM规划 + VLA执行);LoHoVLA端到端学习的层级范式
(2)多模态中间表示规划
- 视觉驱动规划:CoT-VLA生成像素级视觉子目标;HiP三层架构(任务-子任务-动作)
- Affordance驱动规划:RT-Affordance预测可操作性;CoA-VLA的Chain-of-Affordance推理
(3)技能库组合规划
- 显式技能库:VLP预定义技能的组合;RoboBrain大规模技能记忆库
- 隐式技能学习:DexVLA billion参数的隐式技能表示;AgiBot World从大规模数据中自动发现技能
代表性工作:
- π₀.5:增强的推理能力,支持多步骤规划(详见经典论文第5.11节)
- Hi Robot:显式的两层层级架构
- CoT-VLA:视觉子目标作为思维链
- ACoT-VLA:动作空间推理(详见经典论文第5.13节)
- DexVLA:billion参数的灵巧操作专家
2.2.3 错误检测与自主恢复
问题描述:实时检测执行失败,并自主生成恢复策略。
关键技术:
- 失败预测:基于视觉反馈预测潜在失败
- 重规划机制:动态调整执行计划
- 链式思考推理:通过CoT进行故障诊断(如CoT-VLA)
代表性工作:
- Fast-ThinkAct:实时推理与失败恢复
- CoT-VLA:链式思考增强的VLA
2.2.4 实时性与计算效率
问题描述:满足高频控制的实时性要求(30Hz+),同时保证推理准确性。
四大优化方向:
(1)静态架构优化
- 压缩量化:BitVLA 1-bit量化;Evo-1 77M参数的超轻量模型
- 轻量级骨干网络:NORA, TinyVLA专为实时控制设计
- 线性注意力机制:SARA-RT, RoboMamba用Mamba/SSM替代Transformer的二次复杂度
(2)动态优化解码过程
- 动态推理路径:MoLe-VLA跳层推理;CEED-VLA, DeeR-VLA提前退出机制
- Token处理优化:VLA-Cache自适应KV缓存;SpecPrune-VLA token级别剪枝
- 加速解码:OpenVLA-OFT并行解码,25-50倍加速;Spec-VLA推测解码
(3)动作表示和生成范式优化
- 高效token化:FAST频率空间动作序列token化,15倍加速;VQ-VLA向量量化动作表示
- 异步执行:SmolVLA 450M参数实时运行;Real-Time Action Chunking动作块异步执行
- 加速扩散:Time-Diffusion Policy时间条件加速;Discrete Diffusion VLA离散扩散加速
(4)训练范式优化
- 训练时推理,推断时跳过:ECoT-Lite训练中使用推理,推断时直接输出
- 预测压缩表示:V-JEPA 2预测语义压缩表示而非像素
- 双系统架构:Fast-in-Slow快速System 1 + 慢速System 2
代表性工作:
- SmolVLA:450M参数实时运行
- FAST:动作tokenizer,15倍推理加速
- OpenVLA-OFT:优化微调,25-50倍加速
- RoboMamba:Mamba架构的线性复杂度
- MoLe-VLA:动态深度推理
未来方向:
- 自适应架构:根据任务难度自动调整推理深度和模型规模
- 统一决策Token:see-think-act的统一token流
- 硬件协同优化:专用芯片加速VLA推理
–
Token处理优化:VLA模型通常基于大规模VLM构建,其自回归解码机制天然存在计算开销大、推理延迟高的问题。为满足机器人实时控制需求,研究者从多个层面进行优化:
- 动作Token压缩:将连续动作离散化为紧凑的Token序列,减少自回归生成的步数。例如FAST Tokenizer将6-DoF动作压缩为单Token,显著降低解码延迟。
- KV Cache优化:在长时程任务中复用历史视觉与语言特征的键值缓存,避免重复计算,提升多步推理效率。
- 并行解码与投机采样:利用动作序列的时序相关性,采用并行解码或投机采样(Speculative Decoding)策略,在不损失精度的前提下加速Token生成。
- 轻量化骨干网络:如TurboVLA采用直连 V + L → A V+L \to A V+L→A 架构,摆脱LLM词表依赖,在RTX 4090上实现32Hz控制,显存占用低于1GB。
代表性工作:
- π₀ (2024):采用Flow Matching替代自回归Token生成,将推理频率提升至50Hz,首次实现折纸、玩扑克等极高精度任务。
- RoboTTT (2026):通过测试时训练(TTT)将策略注意力上下文扩展至8K时间步,突破长时程任务的时序瓶颈。
- TurboVLA (2026):以0.2B参数实现32Hz实时控制,验证了"小模型+直连架构"在边缘端高频部署的可行性。
- ZR-0 (2026):通过密集ECoT跨本体对齐与推理期特征掩码零开销旁路,在保持推理速度的同时增强长时程任务的理解能力。
综上,实时性与计算效率的优化正沿着"架构轻量化、解码加速、上下文扩展"三条主线推进。从π₀的Flow Matching到TurboVLA的端侧直连,VLA正逐步逼近"感知-决策-控制"全链路实时闭环的目标,为机器人在非结构化环境中的高频鲁棒执行奠定基础。
2.3 从泛化到持续适应
核心问题:实现开放世界泛化,支持持续学习与增量技能获取,完成sim-to-real迁移,并启用在线强化学习。
从泛化到持续适应的四层递进体系:
- 开放世界泛化:未见环境/物体/任务的零样本能力
- 持续学习:增量技能获取,避免灾难性遗忘
- Sim-to-Real迁移:缩小仿真与真实的差距
- 在线强化学习:从交互中自主学习和改进
2.3.1 开放世界泛化(Open-World Generalization)
问题描述:在未见环境、未见物体和未见任务组合上的零样本或少样本泛化。
四大策略:
(1)知识迁移与利用
- 多任务/多机器人预训练:Octo在800k机器人轨迹上预训练;DexVLA billion参数扩散专家跨机器人形态预训练;EO-1在1.5M-EO-Data上预训练共享骨干
- 互联网/人类视频知识迁移:R3M在Ego4D等人类第一人称视频上预训练视觉编码器;GR系列(GR-1, GR-2)从人类视角视频迁移物理和交互知识
(2)范式级创新
- In-Context Learning:ICIL从prompt中的少量演示推断任务,无需重新训练
- 概念泛化:ObjectVLA联合训练机器人轨迹和box标注VL数据,实现零样本操作;LERF融合CLIP和3D NeRF实现自然语言定位和抓取
- 自适应范式:Align-Then-Steer非侵入式适应;Robot Utility Models (RUM)零样本部署
(3)增强数据多样性
- 数据增强:CACTI扩散修补技术生成多样化场景;GenAug文本到图像合成增强训练数据
- 语义增强:ROSIE VLM知识蒸馏到机器人策略
代表性工作:
- Octo:800k轨迹预训练的通用策略
- DexVLA:billion参数跨形态专家
- R3M/GR-2:从人类视频迁移知识
- ICIL:上下文学习范式
- ObjectVLA/LERF:概念级泛化
- Robot Utility Models:零样本家庭部署
2.3.2 持续学习与增量技能获取
问题描述:在不遗忘旧技能的前提下持续学习新技能。
两大策略:
(1)参数隔离与扩展
- 基于提示/码书学习:新技能独立编码为提示或码书向量,保持核心参数不变
- 模块化MoE架构:InstructVLA专家混合架构;iManip PerceiverIO架构实现模块化技能表示
(2)回放知识巩固
- 压缩经验回放:ExpReS-VLA压缩体验回放,高效存储历史经验
- 时间回放策略:iManip关键帧回放,保留重要状态转移
代表性工作:
- InstructVLA:MoE架构的终身学习
- iManip:模块化技能表示
- ExpReS-VLA:压缩经验回放
评测基准:
- LIBERO:首个终身机器人学习基准,评估技能保留和迁移
2.3.3 Sim-to-Real迁移
问题描述:缩小仿真训练与真实部署之间的性能差距。
两大策略:
(1)增强模拟保真度
- 高保真仿真器:ManiSkill3 GPU并行渲染+物理模拟,域随机化
- 稳定中间表示:SLIM使用分割+深度等对光照不敏感的表示,减少视觉域差异
(2)数据驱动模拟器
- 生成增强:GenAug无模拟器直接从文本生成训练数据
- 学习世界模型:DreamGen从真实数据学习生成模型;RynnVLA-001神经模拟器
(3)高效真实适应
- 快速微调:AdaWorld在少量真实数据上高效适应
- 鲁棒视觉表示:学习对光照、纹理变化不敏感的特征;自监督预训练(DINOv2等)
代表性工作:
- ManiSkill3:新一代GPU并行仿真器
- SLIM:稳定中间表示减少域差距
- GenAug:生成式数据增强
- AdaWorld:高效sim-to-real适应
未来方向:
- 神经模拟器:完全从数据学习的可微分模拟器
- 双向迁移:real-to-sim用于改进仿真器
2.3.4 在线强化学习
问题描述:通过与环境交互自主学习和改进策略。
两大方向:
(1)优化学习过程
- 知识迁移加速:RLDG蒸馏预训练VLA知识到RL策略;Refined Policy Distillation MSE约束保持预训练能力;iRe-VLA阶段性冻结-解冻策略
- 算法内部优化:CO-RFT分块时间差分学习,稳定训练
(2)自动化奖励生成
- 感知对齐奖励:VLM-RMs用VLM作为奖励模型;RoboCLIP CLIP对齐的奖励信号
- VLM批评:RL-VLM-F GPT-4V比较不同轨迹;GRAPE VLM生成密集奖励信号
- 代码生成奖励:Eureka LLM生成奖励函数代码;VLA-RL端到端VLA强化学习
代表性工作:
- π*₀.₆:从经验中学习,整合专家干预的RL(详见经典论文第5.12节)
- SERL:样本高效的机器人RL套件
- Eureka:LLM自动生成奖励函数
- VLA-RL:端到端VLA强化学习框架
- RLDG:知识蒸馏加速RL训练
未来方向:
- 形态无关表示:跨具身形态的策略迁移
- 零样本跨具身迁移:在一个机器人上学习,直接部署到另一个
- 自主开放式进化:部署→发现→进化的闭环系统
2.4 安全性、可解释性与可靠交互
核心问题:确保可靠性保证,提升可解释性,实现可信的人机交互,并满足安全约束。
安全性与可解释性的双层结构:
- 第一层:可靠性保证
- 基于约束的安全(规则约束、内部化约束)
- 学习对齐(值对齐、不确定性评估)
- 第二层:透明可信交互
- 增强过程可解释性(CoT、层级结构)
- 行为可预测性(外化决策逻辑)
2.4.1 可靠性保证
三大范式:
(1)基于约束的安全范式
- 规则约束:AutoRT 宪法提示 (Constitutional Prompting) 硬编码安全规则,为机器人建立底线行为准则。
- 区块链硬约束:OpenMind 提出的前卫方案,将机器人安全规则写入以太坊区块链,防止机器人或恶意软件修改安全日志或绕过核心限制。
(2)学习对齐范式
- 值对齐:Gemini Robotics使用 Constitutional AI 后训练,使机器人决策对齐人类价值观。
- 不确定性评估:GPI置信度估计+回溯机制;RationalVLA可学习的拒绝token,主动拒绝不安全/无效指令。
(3)即插即用安全层
- VLSA-AEGIS:基于控制屏障函数(CBF)的安全层,无需修改 VLA 模型即可添加物理硬约束。
代表性工作:
- SafeVLA:约束MDP框架
- RationalVLA:学习拒绝危险指令
- GPI:不确定性感知的安全回溯
2.4.2 可解释性与可信赖性
两大方向:
(1)增强过程可解释性
- 链式思维(CoT):Diffusion-VLA自然语言中间推理步骤;ECoT可编辑的推理链;CoT-VLA视觉子目标作为可视化推理链
- 层级结构天然可解释:RT-H, HiRobot高层语言规划+低层执行;GraSP-VLA分层规划提供可追溯性
- 解码隐藏符号状态:DIARC-OpenVLA线性探针解释内部表示
(2)行为可预测性
- 外化决策逻辑:CrayonRobo视觉提示(箭头、高亮)外化决策过程
- 结构化任务切换:SwitchVLA显式任务切换机制(回滚+平滑过渡)
代表性工作:
- ECoT:可编辑的链式思考推理
- CoT-VLA:视觉CoT增强可解释性
- RT-H/HiRobot:层级架构的天然可解释性
- CrayonRobo:视觉化决策过程
2.4.3 安全约束与主动拒绝
两大技术路线:
- 插件式安全层:VLSA-AEGIS基于控制屏障函数(CBF)的即插即用安全层,在不修改VLA模型的前提下添加硬约束
- 可学习拒绝机制:RationalVLA学习拒绝不安全/无效指令,训练模型识别危险行为并主动拒绝
2.4.4 人机协作交互
关键能力:
- 意图识别:理解人类的隐含意图和目标;从不完整指令中推断完整任务
- 主动询问:AskToAct检测模糊指令时主动请求澄清;OneTwoVLA关键决策点主动询问
- 从反馈学习:Yell At Your Robot实时语言反馈纠正;π*₀.₆从专家干预中学习(详见经典论文第5.12节)
- 协作规划:共享心智模型;预测人类动作在协作环境中避免冲突
未来方向:
- 预测式协作:预测人类下一步动作,主动辅助
- 情境感知安全:根据环境动态调整安全边界
- 自然多模态交互:语言+手势+视觉指向的融合理解
2.5 数据构建与基准测试标准
核心问题:管理多源异构数据整合,建立标准化评测基准。
数据构建与评测标准双轨体系:
- 数据轨:表示层统一对齐 → 数据层增强优化 → 标准化基准构建
- 评测轨:全面性与标准化 → 任务广度与深度扩展 → 真实场景转仿真
2.5.1 多源异构数据整合
三大层面:
(1)表示层统一对齐
- 离散动作表示:LAPA, Moto, UniVLA统一的动作token化方案;跨平台的动作空间标准化
- 共享语义空间:RDT-1B扩散Transformer学习跨机器人表示;AgiBot World大规模统一语义空间;Scaling Cross-Embodied Learning形态无关表示
- 多模态对齐:RT-1, GR-2视觉-动作对齐;ViSA-Flow视觉-空间-动作三元对齐;Humanoid-VLA全身控制的多模态对齐
(2)数据层增强与优化
- 生成增强:CACTI扩散修补生成多样场景;GenAug文本到图像合成;ROSIE VLM知识蒸馏;Residual RL Data Generation通过残差RL生成数据
- 混合优化:Re-Mix自适应采样权重平衡异构数据源
(3)标准化与基准构建
- 统一采集协议:RH20T严格时间对齐的多模态数据(视觉+触觉+音频);BridgeData V2标准化的桌面操作数据
- 跨域标准化:Open X-Embodiment 60+数据集,970k轨迹,22种机器人;RoboMM多模态跨机器人数据
- 人类中心多视角:Ego4D 3700小时第一人称视频;EPIC-KITCHENS厨房活动数据集;Ego-Exo4D同步的自我-外部视角
代表性工作:
- Open X-Embodiment:最大规模的跨机器人数据集
- WALL-OSS:聚合超过10000小时的自收集机器人轨迹
- RH20T:高质量多模态时间对齐数据
- RDT-1B:billion规模的扩散Transformer,统一表示
2.5.2 评测基准与标准化指标
三大方向:
(1)全面性与标准化
- 统一评测框架:Benchmarking VLAs统一输入/输出接口、标准化指标、多机器人支持
- 多维度评分:EUQ (Evaluating Uncertainty and Quality)人类评估的多维评分,超越简单成功率
- 基础设施:ManiSkill3 GPU并行,支持大规模评测;robosuite模块化仿真框架
(2)任务广度与深度扩展
- 长视距序列:CALVIN连续多任务执行,评估长期规划;5个连续任务成功率作为核心指标
- 终身学习:LIBERO 130个任务,4个套件(Spatial, Object, Goal, Long),评估技能保留和前向/后向迁移
- 多维对象/语言复杂度:From Intention to Execution (VLABench)分离意图理解和执行能力;Intention Score + Progress Score双指标
- 零样本多语言:SimplerEnv-Instruct 80个零样本任务,多语言指令
(3)真实场景转仿真
- 神经重建:PolaRiS将真实视频转化为交互式仿真环境,提供可控的评测环境
代表性工作:
- LIBERO:首个终身机器人学习基准,130个任务
- CALVIN:长时序多任务基准
- VLABench (Intention to Execution):分离意图和执行的评测
- SimplerEnv:标准化VLA评测平台,80个零样本任务
- PolaRiS:真实场景神经重建
- ManiSkill3:GPU并行高效评测
未来方向:
- Simulation-First, Failure-Centric Paradigm:以失败为核心的评测
- Turn Failure into Signal:将失败轨迹用于对比学习
- Comprehensive Diagnostic Stress Testing:超越二元成功率的细粒度诊断
2.5.3 数据高效学习
三大策略:
(1)数据增强
- 视觉增强:CACTI扩散修补生成多样化背景;GenAug文本到图像生成;颜色、光照、遮挡变化
- 轨迹增强:时间插值、噪声注入;反向轨迹生成
(2)主动学习
- 不确定性采样;多样性采样;优先标注难例
(3)迁移学习
- 预训练知识利用:VLM预训练(CLIP, SigLIP);人类视频预训练(Ego4D, GR-2);跨机器人迁移(Octo, RoboCat)
- 少样本微调:适配器方法轻量化微调;LoRA, AdaLoRA等参数高效微调
代表性工作:
- CACTI:扩散增强数据生成
- Octo:10次演示实现新任务适应
- ROSIE:VLM知识蒸馏减少数据需求
未来方向:
- 自监督预训练:利用大规模无标注视频
- 主动数据收集:机器人自主选择探索策略
- 合成到真实:完全在合成数据上训练,零样本迁移到真实
3. VLA主流数据集
VLA模型的性能高度依赖于高质量的训练数据。以下是VLA领域最具影响力的数据集。
快速参考:主流数据集概览
| 数据集 | 类型 | 规模 | 机器人/平台 | 发布年份 |
|---|---|---|---|---|
| ProcCorpus-60M | 真实+密集ECoT | 6000万帧 (40万轨迹) | 跨具身 (单/双臂/人形) | 2026 |
| Open X-Embodiment | 真实+跨具身 | 970k 轨迹 | 22种机器人 | 2023 |
| RT-1 Dataset | 真实 | 130k 轨迹 | Everyday Robot | 2022 |
| DROID | 真实,In-the-Wild | 76k 轨迹 | Franka Panda | 2024 |
| EO-1 Dataset | 真实+合成 | ~1.5M 轨迹 | 多种机械臂 | 2024 |
| AgiBot World | 真实,多具身 | 100万+ 轨迹 | 多种机器人 | 2025 |
| BridgeData V2 | 真实 | 60k 轨迹 | WidowX 250 | 2023 |
| ALOHA / ACT | 真实,双臂 | ~50条/任务 | ALOHA双臂 | 2023 |
| UMI Dataset | 真实,手持 | 数百~数千条 | 手持夹爪→Franka | 2024 |
| RH20T | 真实,多模态 | 多模态同步 | 多种机械臂 | 2024 |
| LeRobot (HuggingFace) | 数据中台 | 100+个数据集 | 多平台 | 2024 |
| CALVIN | 仿真 | 6小时遥操作 | PyBullet | 2021 |
| LIBERO | 仿真 | 65k 轨迹 | MuJoCo | 2023 |
| RLBench | 仿真 | 100+任务 | CoppeliaSim | 2019 |
| MimicGen | 仿真(自动生成) | ~50k 轨迹 | MuJoCo | 2024 |
| MetaWorld | 仿真 | 50任务标准化 | MuJoCo (Sawyer) | 2020 |
| ManiSkill3 | 仿真 | GPU并行生成 | 多种机器人 | 2024 |
| RoboCasa | 仿真 | 家庭场景 | MuJoCo | 2024 |
| Ego4D | 人类第一视角 | 3600小时视频 | — | 2022 |
| SimplerEnv | 评测基准 | 80任务 | 多平台 | 2024 |
| VLABench | 评测基准 | 多维评测 | 仿真 | 2025 |
3.1 大规模跨机器人数据集
ProcCorpus-60M Dataset
基本信息:
- 发布时间:2026年6月(中国人民大学 & 智谱 AI)
- 数据规模:约 6,000 万帧(约 1,000 小时、40 万条轨迹)
- 机器人平台:单臂(Franka、xArm)、双臂(AgiBot G1、Agilex)、移动操作及人形机器人(RoboCasa GR-1)
- 采集与标注方式:聚合 DROID、RH20T、Open X-Embodiment、Bridge 等顶尖开源真实与仿真数据集,并通过自动化 VLM 流水线对全量数据进行具身思考链标注
数据特点:
- 密集具身思考链覆盖(96.8%):区别于传统仅标注动作的数据集,ProcCorpus-60M 几乎对每帧提供六层结构化认知标注:
- Scene Description(场景与关键物体描述)
- Progress Assessment(任务进度与完成判定)
- Future Plan(宏观未来规划语言推理)
- To-Do Actions(动宾格式规范化原子动作分解)
- Target Objects(关键操控物体 2D BBox 视觉定位)
- Discrete Actions(FAST Tokenizer 紧凑动作表征)
- 硬件无关的跨本体语义对齐:高层认知标注完全独立于具体的机械臂自由度与控制接口,为不同机器人形态提供了统一的语义学习桥梁。
- 协同图文增强:混入 CapsFusion 与 Pixmo 通用多模态图文数据,保障跨领域开放词表常识不退化。
应用模型:
- ZR-0 (2026):基于该数据集完成跨单臂/双臂/人形预训练的 2.6B VLA 基础模型
Open X-Embodiment Dataset
基本信息:
- 发布时间:2023年10月
- 数据规模:970k条真实机器人轨迹,60+个数据集
- 机器人平台:22种不同的机器人(单臂、双臂、移动操作、人形等)
- 任务类型:多样化的操作任务(抓取、放置、组装、厨房任务等)
数据特点:
- 跨机器人统一格式:RLDS (Reinforcement Learning Datasets)标准
- 多模态观察:RGB图像、深度图、本体感觉
- 语言标注:自然语言任务描述
- 动作表示:统一的动作空间定义
- 支持跨具身形态泛化研究
核心贡献:
- 首个大规模跨机器人数据集
- 定义了机器人数据集的事实标准
- 催生了RT-X、OpenVLA等一系列跨机器人模型
应用模型:
- RT-X:在OXE上训练的跨机器人策略
- OpenVLA:7B参数开源VLA模型
- Octo:通用机器人策略
- DexVLA、RDT-1B等最新VLA模型
获取方式:https://robotics-transformer-x.github.io/
EO-1 Dataset
基本信息:
- 数据规模:约1.5M条轨迹(EO-Data,含真实+合成数据)
- 机器人平台:多种商用机械臂(Franka、UR系列为主)
- 采集方式:大规模人工遥操作 + 自动化数据扩增流水线
数据特点:
- 规模超大:在OXE(970k)基础上进一步扩大规模
- 多任务覆盖:桌面抓取、组装、物体重排、厨房任务等
- 质量筛选:引入自动轨迹评分,过滤低质量演示
- 数据飞轮:EO-1模型部署后持续回收数据,形成闭环迭代
应用:EO-1 通用操作模型预训练
WALL-OSS Dataset
基本信息:
- 数据规模:10,000+ 小时自收集机器人操作轨迹
- 机器人平台:移动操作机器人(Mobile Manipulation)
- 采集方式:大规模自主探索 + 人工标注纠正
数据特点:
- 长时程任务:平均单条轨迹时长远超普通抓取数据集
- 真实家庭场景:厨房、卧室、客厅等多种非结构化环境
- 分层结构:同时记录高层规划决策和低层关节控制动作
- 自主采集优势:大幅降低人工遥操作成本,可持续规模化
应用:大规模分层VLA预训练,支持移动操作长时程任务
RT-1 Dataset
基本信息:
- 发布时间:2022年12月(Google Robotics)
- 数据规模:130k条真实机器人轨迹
- 机器人平台:Everyday Robot(Google定制移动操作机器人)
- 采集周期:17个月持续采集
- 任务类型:700+种日常办公/厨房操作任务
数据特点:
- 高质量专家演示:经专业训练的机器人操作员采集,轨迹成功率高
- 真实办公环境:Google办公楼真实场景,非受控实验室环境
- 丰富语言多样性:同一任务有多种自然语言表达方式(如"把苹果放到碗里" / “将苹果移入容器”)
- 密集标注:动作标注包含末端执行器6DoF位姿、夹爪开合、底盘运动
- 任务层次:包含单步任务(拾取)和多步复合任务(开柜门-取物-关门)
数据格式:
- 观察:单目RGB图像 + 自然语言指令
- 动作:末端执行器位移(x, y, z, roll, pitch, yaw)+ 夹爪状态
应用模型:
- RT-1:在此数据上从零训练的高频控制策略
- RT-2:使用此数据微调PaLI-X/PaLM-E VLM
- 作为OXE数据集子集广泛用于跨机器人训练
3.2 双臂与灵巧操作数据集
ALOHA / ACT Dataset
基本信息:
- 发布时间:2023年(ACT论文,Stanford IRIS Lab)
- 数据规模:每个任务约50条人工演示
- 机器人平台:ALOHA双臂机器人(低成本桌面系统,总成本约$20k)
- 采集方式:人类遥操作——操作者控制"主臂",机器人跟随复现
数据特点:
- 双臂协同:同时记录左右两臂的关节位置、速度、力矩与抓取状态
- 高频采集:50Hz动作帧率,适配精细操作
- 多样化任务:折叠衣物、整理厨具、穿针引线、手术动作模拟等
- 观察模态:4路RGB相机(左/右腕部 + 左/右侧视)+ 本体感觉
关键任务列表:
| 任务 | 难点 |
|---|---|
| 折叠衬衫 | 柔性物体变形预测 |
| 将碗叠放入碗架 | 双手力协调 |
| 开冰箱取饮料 | 长时序、多子任务 |
| 拧紧瓶盖 | 精细操作+力控制 |
影响:
- 直接催生 ACT(Action Chunking with Transformers)方法论
- ALOHA硬件设计完全开源,引爆学界双臂研究热潮
- 后续 π₀.5 等大量工作均采用 ALOHA 硬件采集数据
获取方式:https://mobile-aloha.github.io/
UMI (Universal Manipulation Interface) Dataset
基本信息:
- 发布时间:2024年(Stanford + Columbia)
- 数据规模:数百至数千条轨迹(按任务)
- 采集方式:手持夹持器(无需机器人),操作者手持装置自由操作
数据特点:
- 设备极简:用GoPro + 3D打印夹爪即可采集,成本极低
- 隐式推理:延迟观察(推理时忽略最近0.2s图像),让模型自动预测接触时刻
- 自然场景多样性:采集者可在任意真实场景自由操作,无需固定机器人工位
- 推理接口统一:采集数据直接迁移到Franka等标准机器人执行
应用模型:
- Diffusion Policy(UMI版本)
- UMI-on-Legs(四足机器人上肢任务)
获取方式:https://umi-gripper.github.io/
3.3 模拟器数据集
CALVIN (Composing Actions from Language and Vision)
基本信息:
- 发布时间:2021年(University of Freiburg)
- 环境:PyBullet仿真器(Franka Panda机械臂)
- 数据规模:约6小时人类遥操作Play数据
- 任务类型:34种语言条件操作任务的长时序组合
数据特点:
- Play Data范式:数据采集时操作者随机操作,不针对特定任务,大幅降低采集成本
- 后验标注:采集完成后将轨迹片段与任务语言描述自动对齐
- 多步骤链:评测时要求连续完成1-5个任务(ABCD→D split)
- 4个场景变体(Split):A、B、C(训练)、D(测试),光照/物体布局各异
标准评测协议(ABCD→D split):
| 指标 | 含义 |
|---|---|
| LH-MTLC 1 | 单任务连续成功率 |
| LH-MTLC 5 | 五任务连续成功率 |
| Avg. Len. | 平均连续成功任务数(最高5) |
目前 SOTA:GR-2 (2024) 实现 Avg. Len. ≈ 4.5+
应用:
- 语言条件长时程操作研究的核心基准
- 广泛用于ACT、Diffusion Policy等方法的评测对比
官网:http://calvin.cs.uni-freiburg.de/
LIBERO (Lifelong Benchmark for Robot Manipulation)
基本信息:
- 发布时间:2023年(CMU + Stanford)
- 环境:MuJoCo/RoboSuite仿真器(Franka Panda)
- 任务数量:130个任务,每任务500条专家演示(共65,000条轨迹)
数据特点:
- 持续学习设计:专为评测"学新任务时遗忘旧任务"问题而设计
- 任务套件阶梯式:从空间推理 → 物体泛化 → 目标泛化 → 长时序,难度递增
- 专家演示质量高:基于RoboSuite的运动规划器自动生成高成功率演示
四个任务套件详解:
| 套件 | 任务数 | 核心评测能力 | 示例任务 |
|---|---|---|---|
| LIBERO-Spatial | 10 | 空间关系推理 | “把碗放到架子左边” |
| LIBERO-Object | 10 | 物体类别泛化 | 识别和操作未见物体 |
| LIBERO-Goal | 10 | 目标状态泛化 | 同样物体、不同目标状态 |
| LIBERO-Long | 10 | 长时序多步骤 | 5个子任务的组合序列 |
持续学习评测指标:
- FWT(前向迁移):学新任务对旧任务的正向影响
- BWT(后向迁移/遗忘):学新任务导致旧任务性能下降
应用:
- VLA持续学习研究的标准基准
- OpenVLA、RoboFlamingo等模型的性能对比平台
官网:https://libero-project.github.io/
RLBench
基本信息:
- 发布时间:2019年
- 环境:CoppeliaSim(V-REP)
- 任务数量:100+任务
数据特点:
- 涵盖多种操作技能
- 提供视觉观察和状态信息
- 支持多种机器人平台
任务类别:
- 抓取和放置
- 工具使用
- 组装任务
官网:https://sites.google.com/view/rlbench
MimicGen
基本信息:
- 发布时间:2024年(NVIDIA + UT Austin)
- 核心思路:用少量人类演示(约10条)自动生成大量(1000+条)多样化轨迹
数据特点:
- 数据扩增:通过分解-重组子任务轨迹,自动适配新物体位置/姿态
- 无需额外标注:完全自动化,人工成本接近于零
- 支持多环境:MuJoCo/RoboSuite,官方提供数千条生成轨迹
数据规模:公开 ~50k 条生成轨迹,涵盖 18 类任务
应用:
- Diffusion Policy、ACT等方法的数据增强基线
- 验证"稀疏人类演示 → 大规模训练数据"可行性
官网:https://mimicgen.github.io/
MetaWorld
基本信息:
- 发布时间:2020年(Stanford)
- 环境:MuJoCo仿真器(Sawyer机械臂)
- 任务数量:50个标准化操作任务
任务结构:
- ML10:10任务元学习基准
- ML45:45任务元学习基准
- MT50:50任务多任务学习基准
数据特点:
- 任务覆盖面广(抓取、推动、翻转、穿孔、拧螺丝等)
- 任务设计极度标准化,统一状态/动作空间
- 评估多任务学习和少样本泛化的经典基准
应用:
- 大量VLA与强化学习方法的对比基线
- 多任务学习研究标配
官网:https://meta-world.github.io/
3.4 真实世界数据集
Bridge Dataset (BridgeData V2)
基本信息:
- 发布时间:2023年(UC Berkeley RAIL Lab)
- 数据规模:60,096条真实机器人轨迹
- 机器人平台:WidowX 250(低成本6DoF桌面机械臂,约$3,500)
- 采集场景:24个不同真实场景(厨房操作台、桌面、架子等)
数据特点:
- 低成本硬件验证:证明廉价机械臂可采集高质量训练数据
- 任务多样性:包括抓取、放置、翻转、拖拉、穿插、扫描等多类操作
- 语言条件:每条轨迹配有语言描述任务目标
- 人类遥操作:通过SpaceMouse采集,轨迹自然流畅
V2相比V1的改进:
- 新增 16,000+ 轨迹,场景扩充至 24 个
- 标准化采集协议,各场景使用统一相机角度
- 引入自动质量筛选流程
- RLDS格式标准化,直接兼容OXE
应用:
- Octo 通用机器人策略的核心训练数据
- OpenVLA预训练数据之一
- 模仿学习与Sim-to-Real研究基线
- 完整收录于Open X-Embodiment数据集
官网:https://rail-berkeley.github.io/bridgedata/
RH20T Dataset
基本信息:
- 发布时间:2024年(上海AI实验室 + 香港大学)
- 数据规模:110,000+ 条多模态同步轨迹
- 机器人平台:多种机械臂(Franka、UR5、xArm等)
- 特点:迄今为止时间同步精度最高的多模态机器人数据集
传感器配置:
- 视觉:RGB-D(Realsense D435i,1280×720@30Hz)
- 触觉:高分辨率触觉传感器(手指接触力/形变)
- 音频:操作声音同步录制(夹取、碰撞等声学信号)
- 本体感觉:关节位置、速度、力矩@500Hz
- 时间同步精度:微秒级硬件触发
数据特点:
- 精细操作覆盖:拧螺丝、剪纸、折纸等需要触觉反馈的精密任务
- 多机器人平台:同一任务在不同机械臂上重复采集,便于跨平台研究
- 失败案例保留:包含部分失败轨迹,用于对比学习
应用:
- 触觉-视觉融合VLA训练(Tactile-VLA, OmniVTLA)
- 接触丰富操作(Contact-rich Manipulation)研究
- 多模态感知对齐研究
DROID Dataset
基本信息:
- 发布时间:2024年(Stanford + Berkeley + CMU 等多机构联合)
- 数据规模:76,188条真实机器人操作轨迹,约350小时
- 机器人平台:Franka Panda
- 采集地点:全球50个不同地点(实验室、厨房、办公室等)
数据特点:
- In-the-Wild多样性:50个采集地点带来极高的场景多样性
- 86类任务:覆盖抓取、推动、翻转、清洁、整理等广泛操作
- 双目视角:腕部摄像头 + 外部固定摄像头
- 语言标注:每条轨迹附带自然语言任务描述
- 数据格式:RLDS标准,兼容OXE生态
质量特点:
- 专业采集员培训保证基础质量
- 跨场景一致的采集协议
- 超出OXE子数据集的场景多样性
应用:
- 大规模真实世界VLA预训练
- 跨地点泛化研究基准
- OpenVLA-OFT等模型微调
获取方式:https://droid-dataset.github.io/
Language-Table
基本信息:
- 发布时间:2022年
- 数据类型:真实桌面操作
- 任务类型:语言条件的物体重排列
数据特点:
- 简化的二维操作任务
- 清晰的语言-动作对应
- 便于快速原型开发
应用:
- 语言理解研究
- 策略学习方法验证
AgiBot World
基本信息:
- 发布时间:2025年(AgiBot / 智元机器人)
- 数据规模:100万条轨迹,覆盖多种机器人平台
- 采集方式:人类遥操作 + 自主采集
数据特点:
- 规模领先:目前公开规模最大的真实机器人操作数据集之一
- 多具身形态:单臂、双臂、移动操作、人形机器人
- 场景多样化:工业制造、家庭服务、餐饮、仓储等场景
- 标准化格式:兼容RLDS,可与OXE生态无缝对接
应用:
- 大规模跨具身VLA预训练
- 国内机器人企业数据生态建设参考
获取方式:https://agibot-world.com/
LeRobot Dataset (HuggingFace)
基本信息:
- 发布时间:2024-2025年(HuggingFace)
- 定位:机器人学习领域的开源数据中台
数据特点:
- 统一接口:100+个数据集(包含OXE子集、ALOHA、Bridge等)通过统一API访问
- 标准化格式:基于Apache Parquet,支持流式加载
- 可视化工具:内置数据浏览器,可在线预览轨迹
- 社区驱动:研究者可直接上传自采数据集,共建生态
支持的数据集示例:lerobot/pusht、lerobot/aloha_sim_、lerobot/xarm_
应用:
- 作为统一接口接入多来源数据训练VLA
- 快速搭建机器人学习基线
官网:https://huggingface.co/lerobot
3.5 人机交互数据集
Ego4D
基本信息:
- 发布时间:2022年
- 数据规模:3,600小时第一人称视频
- 场景类型:日常生活活动
数据特点:
- 人类操作演示
- 丰富的语言标注
- 多样化的交互场景
VLA应用:
- 从人类视频中学习操作策略
- 理解人类意图和目标
3.6 评测基准
SIMPLER / SimplerEnv (Simulation Platform for Embodied Learning and Evaluation Research)
基本信息:
- 发布时间:2024-2025年
- 目标:标准化的VLA评测框架
评测内容:
- SimplerEnv-Instruct:80个零样本任务,多语言指令支持
- 跨任务泛化
- 跨环境泛化
- 鲁棒性测试
特点:
- 统一的输入输出接口
- 标准化的评测指标
- 支持多种机器人平台
应用:
- ICLR 2026等会议广泛使用
- 比较不同VLA模型的性能
- π0, OpenVLA等模型的官方评测平台
官网:https://simpler-env.github.io/
VLABench (From Intention to Execution)
基本信息:
- 发布时间:2025年
- 目标:分离评测VLA的意图理解和执行能力
核心指标:
- Intention Score (IS):评估指令理解的准确性
- Progress Score (PS):评估任务执行进度
- 双指标分离意图和执行两个维度
评测维度:
- Seen objects (已见物体)
- Unseen objects (未见物体)
- Unseen colors (未见颜色)
- Unseen textures (未见纹理)
- Unseen scenes (未见场景)
特点:
- 细粒度诊断VLA能力边界
- 超越二元成功率的多维评估
应用:
- ACoT-VLA等最新模型的评测
- 识别模型的弱点和改进方向
ManiSkill3
基本信息:
- 发布时间:2024年
- 特点:GPU并行高性能仿真器
技术特点:
- GPU加速:大规模并行仿真
- 域随机化:自动生成多样化场景
- 物理精度:高保真物理模拟
- 渲染质量:逼真的视觉渲染
应用:
- 大规模数据生成
- 快速策略评估
- Sim-to-Real研究
官网:https://maniskill.ai/
RoboCasa
基本信息:
- 发布时间:2024年(UT Austin ARISE Lab)
- 环境:MuJoCo/RoboSuite仿真器(Franka Panda双臂)
- 场景类型:逼真的家庭厨房环境
特点:
- 100+种厨房布局:随机化橱柜位置、灶台样式、照明条件
- 150+种家庭物品:覆盖厨房常见食材、餐具、电器
- 长时程任务:超市购物→放入冰箱、备餐→烹饪等多步骤任务
- 自动数据生成:配合MimicGen可大规模生成演示数据
- 人形机器人支持:提供双臂操作接口,适配具身机器人研究
任务类别(共100+任务):
- PnP(Pick and Place):从A处取物放到B处
- Drawer/Cabinet操作:开关抽屉、柜门
- Boil/Fry:烹饪动作模拟
- ArrangeItems:物品摆放整理
应用:
- 家庭服务机器人长时程操作研究
- 高数据多样性的VLA预训练数据源
4. VLA的应用场景
工业制造
VLA模型在工业自动化中展现出巨大潜力,能够处理多样化的生产任务。
工业场景中的VLA应用:
| 应用场景 | VLA能力需求 | 典型任务 |
|---|---|---|
| 质量检测 | 视觉缺陷识别 + 自然语言标准理解 | “检查零件表面是否有划痕” |
| 柔性装配 | 视觉定位 + 精细操作 | “将A部件插入B部件的孔中” |
| 智能分拣 | 多物体识别 + 动态规划 | “将红色零件放入左侧托盘” |
应用示例:
- 智能装配线:基于语言指令调整装配流程
- 质量检测:结合视觉检测和操作反馈
- 柔性制造:快速适应产品变化
服务机器人
在家庭和商业服务场景中,VLA使机器人能够理解和执行多样化的用户指令。
典型应用领域:
- 家庭服务:理解"帮我整理客厅"等开放式指令,执行物体重排列、清洁等复合任务(如π₀.5在新家庭环境中的10-15分钟长时程任务)
- 餐饮服务:识别菜品 + 理解点餐指令 → 配送和上菜动作
- 医疗辅助:理解医护人员指令 + 精确操作 → 递送医疗器械、协助护理
关键技术:开放世界泛化、人机交互、安全性保证
仓储物流
VLA模型使仓储机器人能够处理更复杂、更灵活的物流任务。
| 环节 | VLA优势 | 传统方案痛点 |
|---|---|---|
| 智能拣选 | 自然语言订单理解 + 视觉识别 | 需要预定义所有SKU位置 |
| 动态码垛 | 理解"易碎品放上层"等约束 | 固定码垛模式,缺乏灵活性 |
| 异常处理 | 识别损坏物品并自主决策 | 需要人工介入 |
商业价值:减少人工标注成本,适应SKU快速变化,提升仓储自动化柔性
农业自动化与建筑施工
- 农业:精准采摘(识别成熟果实)、植物护理(修剪、施肥)、自动化收获
- 建筑:自动化砌砖、焊接作业、建筑材料搬运
5. 总结与展望
Vision-Language-Action (VLA) 模型代表了机器人技术的重要范式转变,通过统一视觉、语言和行动三个模态,实现了从自然语言指令到机器人控制的端到端学习。自2022年RT-1和2023年RT-2开创这一方向以来,VLA研究取得了爆发式进展。
VLA领域在架构、规模、能力和生态四个维度均取得了显著进展:动作表示从离散token演进到Flow Matching与测试时训练(TTT);模型参数从130M (RT-1) 扩展到多B/十亿级;数据从130k轨迹增长到60M+帧 (ProcCorpus-60M) 与1.5M+轨迹 (EO-Data);开源生态(OpenVLA, LeRobot)和评测基准(LIBERO, SimplerEnv)逐步成熟。
五大核心挑战的现状与展望如下:
| 挑战 | 当前进展 | 未来方向 |
|---|---|---|
| 表示 | 多模态对齐成熟;Dense ECoT跨本体语义对齐;3D空间表示(点云/体素/占用);世界模型快速发展 | 原生多模态统一token化;因果世界模型 |
| 执行 | CoT/ACoT/TTT超长时序推理增强;SSGAA状态空间动态门控;FAST/TurboVLA等端侧极速直连方案 | 自适应架构;see-think-act一体化 |
| 泛化 | 跨机器人预训练为标准;Sim-to-Real差距缩小;在线RL与测试时自适应结合(π*0.6, RoboTTT) | 形态无关表示;自主开放式进化闭环 |
| 安全 | 约束+学习对齐双范式;可学习拒绝机制(RationalVLA) | 不确定性感知;主动风险规避;共享心智模型 |
| 数据与评测 | OXE/EO-Data/ProcCorpus-60M大规模数据集;SimplerEnv/VLABench标准化评测 | Simulation-First;Failure-Centric评测 |
从RT-1到S²-VLA,VLA的演进代表了具身智能研究范式的根本转变:从手工设计到数据驱动,从任务特定到通用能力,从离线学习到在线自适应与持续进化。ICLR/CVPR/ICML 2026收录数百篇VLA论文,标志着这一领域正步入爆发期。
声明:本文转载与下地址并加以修改,其中该文字外有重要论文导读,可供大家预览。
https://tingdeliu.github.io/VLA-Survey/#22-%E6%8C%87%E4%BB%A4%E8%B7%9F%E9%9A%8F%E8%A7%84%E5%88%92%E4%B8%8E%E9%B2%81%E6%A3%92%E5%AE%9E%E6%97%B6%E6%89%A7%E8%A1%8C
6. 参考资料
- An Anatomy of Vision-Language-Action Models (2512.11362v3) - IEEE TPAMI 2025,本文核心参考综述,提出挑战驱动的分类法
- VLA-Survey-Anatomy GitHub - 上述综述配套项目页面
- ZR-0: Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision - 智谱 AI & 中国人民大学,ProcCorpus-60M
- RoboTTT: Scaling Embodied Policy Attention Context to 8K Timesteps via Test-Time Training - NVIDIA GEAR Lab & Stanford
- S²-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation - 华东师大 & 上交 (IJCAI 2026)
- TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 - 直连 V + L → A V+L \to A V+L→A 高频轻量化 VLA
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- 10 Open Challenges Steering the Future of Vision-Language-Action Models
- State of VLA Research at ICLR 2026 - 分析164篇ICLR 2026 VLA论文
- Muhayyuddin’s VLA Repository - 整合102个模型、26个数据集和12个仿真平台
- OpenVLA - 7B参数开源VLA模型
- π₀ (openpi) - Physical Intelligence Flow Matching VLA
- Octo - 通用机器人策略
- LeRobot - Hugging Face机器人学习库
- RT-2 Blog - Google DeepMind
- Open X-Embodiment - 970k真实机器人轨迹,22种机器人
- Bridge Dataset - 60k桌面操作轨迹
- LIBERO - 终身机器人学习基准
- CALVIN - 长时序组合任务基准
- RLBench - 100+仿真操作任务
- SIMPLER - 标准化VLA评测平台
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)