“视觉-语言-动作(VLA)模型是机器人领域的前沿研究方向。全面梳理VLA的基本概念、核心技术以及强化学习(RL)重返舞台的最新进展,并提供完整的具身智能入门路线。”

引言

视觉-语言-动作(Vision-Language-Action, VLA)模型代表了机器人技术的范式转变,将视觉感知、自然语言理解和动作控制统一在单一的端到端学习框架中。VLA 模型使机器人能够直接从自然语言指令和视觉观察中学习操作策略,无需显式的中间表示或分离的感知-规划-控制模块。

自 2023 年 Google DeepMind 推出 RT-2 以来,VLA 模型在机器人操作任务中展现出强大的泛化能力和零样本学习潜力。这一技术路线继承了大规模视觉-语言模型(VLM)在跨模态理解方面的优势,并将其扩展到具身智能领域,使机器人能够像理解图像和文本一样"理解"物理世界中的交互任务。

VLA 模型在服务机器人、工业自动化、智能制造等领域有着广泛的应用前景。本文旨在系统梳理 VLA 领域的研究进展,为学习和研究 VLA 提供全面参考。

1. VLA核心技术体系

1.1 什么是VLA?

VLA(Vision-Language-Action)模型是一类端到端的多模态学习模型,能够直接从视觉输入(相机图像)和语言指令中预测机器人的控制动作。与传统的模块化机器人系统不同,VLA 将感知、推理和控制统一在单一的神经网络架构中。

VLA的核心特征

1. 端到端学习:直接从原始传感器数据到低层控制信号的映射,无需手工设计的中间表示。

2. 多模态融合:统一处理视觉、语言和动作三种模态,实现跨模态的语义对齐。

3. 指令驱动:通过自然语言指令指定任务目标,支持灵活的任务切换和零样本泛化。

4. 大规模预训练:继承视觉-语言模型的预训练知识,并在机器人演示数据上微调。

VLA的发展里程碑:两年三次范式跃迁

VLA研究时间线:从模块化到端到端统一模型,再到强化学习的自我进化(2022-2026)

范式三:Flow Matching & RL复兴

范式二:Action Chunking & Diffusion

范式一:从闭眼规划到VLA

SayCan: LLM规划

RT-1/RT-2: 端到端VLA

ACT: 解决累积误差

ALOHA: 硬件普及

Diffusion Policy: 多模态分布

OpenVLA: 开源标杆

π₀: 50Hz实时控制

π*₀.₆: RECAP强化学习

具身智能在短短两年内经历了三次核心的"范式跃迁":

  • 第一次跃迁(2022-2023初)——从语言规划到VLA:早期如SayCan虽然能让LLM进行任务分解,但它是"闭着眼睛"做规划。直到RT-1、RT-2的出现,将视觉、语言和动作Token统一,第一次证明了VLM可以直接生成动作,实现了端到端的感知-控制。
  • 第二次跃迁(2023)——Action Chunking与Diffusion Policy:传统的单步动作预测容易产生累积误差(Compounding Error)。ACT(Action Chunking with Transformers)提出一次性预测一段动作序列(Chunk),解决了误差累积问题。结合成本不到2万美元的ALOHA开源双臂硬件,直接引爆了学界的具身研究。随后,Diffusion Policy用扩散模型替代了传统的CVAE,彻底解决了模型在面对多种合理运动路径时容易"取平均"导致失败的问题,天然且优雅地建模了动作的多模态分布。
  • 第三次跃迁(2024-2025)——Flow Matching与RL重返舞台:π₀将Diffusion Policy的弯曲去噪路径拉直(Flow Matching),推理速度提升5-7倍,实现了50Hz的高频连续控制(能玩扑克、折衣服)。更关键的是,π*₀.₆提出了RECAP(优势条件化)方法,巧妙绕过了Flow Matching难以计算对数概率的限制,让强化学习(RL)重新与VLA深度融合。这意味着机器人不再是出厂即定型的静态工具,而是能够通过真实部署收集数据实现"越用越好"的学习型智能体,真正转动了数据飞轮(Data Flywheel)。

1.2 VLA系统架构

一个完整的VLA系统包含三个核心组成部分:

视觉观察 + 语言指令

1. 视觉编码器
Vision Encoder

2. 语言-行动骨干网络
Language-Action Backbone

3. 动作解码器
Action Decoder

机器人控制动作

1. 视觉编码器(Vision Encoder):从单眼到多眼

功能:从相机图像中提取视觉特征表示。

主流架构演进

  • 单编码器(早期/RT-2):使用单一 ViT 或 PaLI-X 处理所有信息,效率相对较低。
  • 双编码器(OpenVLA 模式)
    • DINOv2:负责提取几何与空间特征(理解"在哪里")。
    • SigLIP:负责提取语义与常识特征(理解"是什么")。
  • 多视角融合:通过融合侧方、腕部等多摄像头输入,解决遮挡与深度感知问题。

2. 语言-行动骨干网络(Language-Action Backbone):System 1 与 System 2 的融合

功能:作为"大脑"层,负责指令理解、推理与动作规划。

System 1 (快思考/小脑): 动作专家

System 2 (慢思考/脑): 高层规划器

用户指令: 帮我洗杯子

预训练 VLM

多视角视觉观察

任务分解: 1.移动 2.抓取 3.清洗

子目标生成: 3D 姿态/语义点

低频指令 ~5Hz

Flow Matching/Diffusion

电机电流/扭矩控制

实时触觉/位姿反馈

物理动作执行

主流架构

  • Transformer-based LLM:如 Qwen3-VL、Llama-2/3、Phi-3 等。
  • 双系统架构(NVIDIA GR00T 范式)
    • System 2 (慢思考):基于视觉语言模型负责理解环境、解读指令并作出长时序规划(~5Hz)。
    • System 1 (快思考):基于扩散 Transformer (DiT) 或流匹配负责高频、精细的反射性动作(~50Hz)。

3. 动作解码器(Action Decoder):从语言 Token 到高频连续轨迹

功能:将模型的高层决策转化为具体的机器人控制信号。

第三代: 流匹配 Flow Matching (2024-2026)

第二代: 扩散模型 (2023-2024)

第一代: 离散 Token (2022-2023)

动作离散化 bins

语言模型自回归生成

执行频率: 1-5Hz

高斯噪声

迭代去噪 Diffusion

多模态分布建模

执行频率: 10-20Hz

概率路径学习

直接生成连续轨迹

极精细控制: 折纸/扑克

执行频率: 50Hz+

主流范式比较

  • 离散动作建模(RT-2/OpenVLA):将动作视为语言 Token 预测。优点是架构统一,缺点是难以生成连续流畅的高频动作。
  • 连续动作建模(Diffusion Policy):使用扩散过程建模动作分布,能捕获多模态动作可能性,在精细操作中表现更优。
  • 流匹配(Flow Matching, π₀):直接生成连续的关节轨迹,支持 50Hz 高频控制。这是实现"折纸、玩扑克牌"等极高精度任务的关键。

架构分类:端到端 vs 层级

VLA模型可以从架构层面分为两大类:端到端统一模型和层级架构模型。这种分类反映了不同的设计哲学和应用场景。

End-to-End架构 vs Hierarchical架构对比

层级范式

语言子任务

复杂指令

高层规划器/VLM

低层执行器/VLA

视觉观察

高频动作流

端到端范式

视觉+文本

单一VLA模型

底层控制动作

维度End-to-EndHierarchical
设计理念单一统一网络分离规划与执行
推理方式隐式端到端显式分层推理
可解释性
适用场景短时域任务长时程复杂任务

End-to-End Architecture 代表模型

模型动作解码器参数规模特点
OpenVLA离散token化7B首个开源大规模VLA(详见第5.9节
π₀Flow Matching3B (VLM) + 860M (Action)50Hz实时控制(详见第5.10节
Diffusion PolicyDDPM-多模态动作分布(详见第5.5节
RDT-1BDiffusion Transformer1B大规模扩散VLA

Hierarchical Architecture 代表模型

模型高层规划低层执行特点
π₀.5增强推理VLMFlow Matching多步骤推理链(详见第5.11节
RT-HVLM子任务分解RT-1层级任务执行
Hi RobotVLM规划器VLA执行器两层显式分离
LoHoVLA端到端学习的层级-隐式层级结构

最新研究表明,纯端到端和纯层级架构各有优劣,混合方法成为新趋势:ACoT-VLA在动作层面进行显式推理,保持统一架构(详见第5.13节)。

1.3 VLA与传统机器人控制的区别

VLA代表了机器人控制范式的根本性转变:

VLA: 端到端统一

视觉+文本

单一神经网络模型

动作输出

传统机器人控制: 模块化

感知/检测

规划/路径

控制/PID

从模块化到端到端

传统方法

  • 感知模块:物体检测、位姿估计
  • 规划模块:轨迹规划、路径优化
  • 控制模块:PID控制、力控制
  • 各模块独立设计和优化

VLA方法

  • 单一神经网络直接从像素到控制信号
  • 联合优化所有组件
  • 减少了模块间的信息损失

从任务特定到通用能力

传统方法:为每个任务设计专门的控制策略,难以泛化到新任务和新环境,需要大量的工程调试。

VLA方法:通过自然语言指令指定任务,零样本或少样本泛化到新任务,利用预训练知识处理未见场景。

从显式建模到隐式学习

传统方法:需要精确的环境模型和物体模型,依赖手工设计的特征和规则,对模型误差敏感。

VLA方法:从数据中隐式学习环境动力学,自动发现任务相关的特征,对感知噪声和模型不确定性更鲁棒。

从工程驱动到数据驱动

传统方法:依赖专家知识和人工调参,开发周期长,部署成本高,难以处理长尾场景。

VLA方法:基于大规模演示数据学习,通过数据增强提升泛化能力,持续学习和在线适应。


1.4 VLA任务分类

VLA模型可以应用于多种类型的机器人任务,以下从四个维度进行分类:

VLA任务分类

按复杂度

单步操作

多步骤操作

长时程任务

按交互对象

刚体操作

可变形物体

流体操作

工具使用

按控制模式

位置控制

速度控制

力/阻抗控制

按环境类型

桌面操作

厨房环境

移动操作

任务类型典型输入典型输出代表方法关键说明
单步操作RGB图像 + 抓取指令单次抓取动作RT-1, OpenVLA主要考察感知和控制精度,代表数据集:RLBench简单任务
多步骤操作多帧图像 + 序列指令有序动作序列CALVIN, LIBERO涉及子目标分解,需维护任务进度状态
长时程任务多视角视频 + 目标描述分层规划+执行π₀.5, ALFRED包含数十至上百步,需错误检测与恢复机制
刚体操作RGB/深度图 + 位置指令6-DOF末端执行器RT-2, OpenVLA关注几何精度,是最基础的操作类型
可变形物体多视角RGB + 形变状态精细轨迹π₀(折衣服)物体状态高维,难以在仿真中准确建模
流体操作RGB + 任务描述力矩控制序列专用模型需流体动力学建模,传感器限制明显
工具使用场景图像 + 工具描述工具-物体交互RT-2需理解工具功能,是语义推理能力的体现
位置控制视觉观测Δxyz + 四元数OpenVLA, RT-2适合精确定位,7自由度机械臂标准输出
速度控制连续帧图像dx/dy/dz速度连续控制模型轨迹更平滑,适合连续跟踪任务
力/阻抗控制视觉+力传感接触力指令专用控制器需力/扭矩传感器,适合组装和人机协作
桌面操作固定视角图像工作台范围动作大多数VLA场景相对简单,是VLA的主要测试场景
厨房任务多视角图像复合操作序列π₀.5多样物体和工具,应用于服务机器人
移动操作导航+操作图像移动+抓取动作π₀.5家庭任务结合导航与操作,大范围工作空间

1.5 主流VLA模型横向对比汇总

为了直观展示各阶段代表性 VLA 模型的差异,下表汇总了其核心架构与技术指标:

模型发布时间参数规模核心架构/特点开源状态备注
RT-12022.12130MTransformer + 离散 Token✅ 数据+代码奠基之作
RT-22023.075B/55BVLM 直接微调❌ 闭源首次验证 VLM 知识迁移
OpenVLA2024.067B双编码器 (DINOv2+SigLIP)✅ 权重+代码目前最强开源 VLA 标杆
π₀2024.103.8BFlow Matching (50Hz)✅ 权重+代码擅长折纸等精细操作
GR00T N1.62026.012.2B双系统 (System 1+2)✅ 权重+代码英伟达全栈生态绑定
Xiaomi-R02025.024.7BMoT 架构(分离脑/小脑)✅ 权重+代码中国力量,低延迟优化
LingBot-VLA2025.02-跨形态泛化 (9种机器人)✅ 权重+代码蚂蚁集团真机预训练
π₀.52025.04-异构任务协同训练❌ 闭源开放世界家庭长时程任务
ACoT-VLA2026.01-动作空间推理📄 仅论文显著减少长时域误差累积
InternVLA-A1.52026.018B前瞻预测 (Foresight) + 空间定位✅ 权重+代码商汤/上海 AI Lab,端到端高精度坐标
ZR-02026.062.6B密集 ECoT 跨本体对齐 + 推理零延迟旁路✅ 权重+代码智谱 AI/人大,ProcCorpus-60M 数据集
S²-VLA2026.062B状态空间引导自适应注意力 (SSGAA)📄 仅论文华东师大/上交,LIBERO 98.2% SOTA
RoboTTT2026.072B+测试时训练 (TTT) + 8K 上下文 Scaling✅ 代码NVIDIA GEAR/Stanford,突破时序瓶颈
TurboVLA2026.070.2B直连 V + L → A V+L \to A V+LA / 32Hz 控制 / <1GB 显存✅ 代码摆脱 LLM 词表,RTX 4090 边缘高频部署

1.6 架构演进与发展趋势

架构演进时间线(2022-2026)

年份里程碑代表工作技术突破
2022模块化阶段RT-1大规模多任务Transformer,130k轨迹证明数据规模收益
2023初语言规划探索SayCan, PaLM-ELLM用于任务分解,但感知-控制分离
2023中端到端VLA诞生RT-2, RT-XVLM直接微调输出动作Token,涌现推理能力
2023下Action ChunkingACT + ALOHA预测动作序列解决累积误差,低成本硬件普及
2023下扩散策略Diffusion Policy多模态动作分布建模,精细操作突破
2024上开源生态OpenVLA7B开源标杆,双编码器架构,OXE数据集
2024下Flow Matchingπ₀50Hz高频控制,折纸/折衣服等极精细任务
2025上开放世界泛化π₀.5未见家庭环境10-15分钟长时程任务
2025下RL重返舞台π*₀.₆RECAP优势条件化,数据飞轮转动
2026动作空间推理ACoT-VLA动作CoT推理,长时域误差抗累积
2026密集思考链与解耦ZR-0ProcCorpus-60M 密集具身CoT跨本体对齐,推理期特征掩码零开销旁路
2026超长上下文与TTTRoboTTT测试时训练快权重在线更新,突破 8K Timesteps 时序上下文 Scaling
2026状态空间阶段自适应S²-VLA信念状态自发追踪执行阶段,动态门控融合攻克长程累积误差
2026极速端侧直连控制TurboVLA V + L → A V+L \to A V+LA 直连架构,摆脱 LLM 词表在 RTX 4090 实现 32Hz 控制

从整体发展脉络来看,VLA研究经历了从模块化系统到端到端模型,再到端到端与层级混合的重要转变。

当前前沿方向:走向通用具身智能(2025-2026)

最新研究趋势表明,VLA正从单一操作任务向通用具身智能体演进,研究重点包括:

  • 基于推理的VLA(Reasoning VLA)
  • 多任务、多机器人的统一VLA
  • VLA与世界模型的结合
  • 从模仿学习到强化学习与测试时自适应(TTT)的转变

基于世界模型的VLA:世界模型被认为是机器人学习的"System 2"。如果VLA是"看到就做"的条件反射(System 1),世界模型则允许机器人在脑海中"想象"行动后果后再执行。近期,世界模型正逐渐成为合成数据的终极生成器,转动了VLA的"数据飞轮":

  • UniSim:首次证明可以将3D仿真、真实机器人数据和互联网视频混合训练出统一的世界模拟器
  • NVIDIA Cosmos:为具身智能专门设计,能生成符合物理规律的视频轨迹
  • GIGA-star:利用世界模型生成的合成数据训练VLA,效果提升可达30%

中国力量:中国在具身智能领域的参与正在从"跟跑"转向"参与定义规则"。

中国具身智能生态

巨头派

小米: Xiaomi-Robotics-0 / MoT架构

蚂蚁集团: LingBot-VLA / 跨形态泛化

阿里巴巴: 达摩院 VLA 预训练

智谱 AI: ZR-0 / 密集 ECoT 跨本体对齐

创业精英派

智元机器人: Agibot GO-1 / 真机部署

自变量机器人: 空间推理 / 灵巧操作

星海图: G0 Plus / 真实数据集开源

星动纪元: ERA-42 / 人形机器人控制

学术开源派

清华 AIR: X-VLA / 软提示技术

上海 AI Lab: InternVLA / InternData / 标准化评测

中国人民大学: ZR-0 / ProcCorpus-60M 数据集

华东师大 / 上交: S²-VLA / 状态空间长程操控

1.7 VLA开源生态

开源 VLA 的崛起并非单一模型的功劳,而是 模型 + 数据 + 工具 + 硬件 三层生态形成的"组合拳"效应,使其能够与谷歌、特斯拉等闭源巨头抗衡。

模型层

开源生态闭环

OXE 数据集: 跨具身/多场景数据

LeRobot: 标准化训练/部署工具

Genesis: 极速物理仿真/合成数据

SO-100/Reachy Mini: $100-$250 低成本硬件

OpenVLA: 最强开源标杆

π₀: 高频精细控制

X-VLA: 跨具身软提示

1. 数据层:Open X-Embodiment (OXE)

OXE 是开源阵营最宝贵的资源,它打破了实验室之间的数据孤岛:

  • 跨平台多样性:整合 22 种机器人形态,涵盖厨房、实验室、办公室等数百种场景。
  • 涌现能力:实验证明,即使模型规模不是最大,只要数据够多样(如引入 OXE),模型也能涌现出原有的空间推理能力(如理解 “on” 和 “near” 的空间语义差异)。
  • 标准化贡献:定义了统一的 RLDS 数据格式,解决了不同实验室数据格式不一的痛点。

2. 工具层:LeRobot 与 Genesis

  • LeRobot (Hugging Face):由前特斯拉工程师 Remi Cadene 打造,统一了数据格式并一键集成多种策略模型,打通了从采集、训练到部署的全流程。
  • Genesis (CMU):极速仿真工具,在一张 RTX 4090 上可实现每秒 4300 万帧的模拟速度(实时速度的 43 万倍),将"百万美元级别"的训练门槛降至数百美元。
  • 生成式仿真谱系:RoboGen → Genesis → Gene 26.5:Genesis 的工程实现最初源自 RoboGen (ICML 2024) 项目(CMU、清华、MIT、UMass 联合)——RoboGen 论文中 Section 3.4 的脚注即明确写道 “Genesis is still under development … We build our system on top of an internal version”。该谱系于 2026 年 5 月由 Genesis AI 公司延伸为商业级基础模型 Gene 26.5:在自研 Genesis World 仿真器与 20w+ 小时多模态数据上训练单一 Flow Matching 模型,可完成 4 分钟级长程烹饪、毫米级移液、双臂魔方还原等任务,新任务仅需 20–30 分钟微调数据。这条主线印证了 RoboGen 提出的 “propose-generate-learn” 生成式仿真范式正从学术原型走向真实通用操作。

3. 硬件层:低成本与标准化

  • Hugging Face 生态:推出了 $100 的 SO-100 机械臂和 $250 的 Reachy Mini,极大降低了具身智能研究的门槛。
  • 通用软件层:如 OpenMind 平台,致力于构建跨厂商兼容的软件层,打破机器人系统的封闭性。

开源生态的三条核心启示

根据 2025-2026 年机器人行业的开源博弈,总结出以下三条核心技术与商业启示:

1. 数据多样性重于单一规模:实验(如 RT-2-X)证明,轨迹的多样性(Diversity)比纯粹的数据量更关键。引入 OXE 这种跨平台、跨场景的多样化数据,能让模型涌现出理解"空间语义(如 on vs near)"的能力,而单一机器人的海量重复数据则难以实现这种跨越。

2. 模型、数据、工具的"生态联动":开源阵营之所以能挑战谷歌、特斯拉,靠的是 OXE (数据) + LeRobot (工具链) + Genesis (极速仿真) + $100 硬件 (SO-100) 形成的闭环。这种"组合拳"将具身智能的研究门槛从百万美元降低到了数百美元,让全球研究者能共同参与测试与改进。

3. 开源与闭源的模糊边界:RT-2-X 虽然是谷歌的闭源模型,但其训练依赖了 OXE 开源数据集;英伟达的 GR00T 介于开源与闭源之间(代码开放但深度绑定芯片生态)。这说明未来的博弈不在于单纯的代码是否公开,而在于谁能定义机器人行业的基础设施标准

1.8 具身智能学习与入门路线

对于想要进入具身智能(特别是操作策略方向)的研究者或开发者,结合当前的开源生态,推荐以下四步递进式的学习路线:

第一步:动手实践(建立直觉)

  • 不要上来就看论文,先花数百美元买一个低成本开源机械臂(如 SO-100 或类 ALOHA 单臂)。
  • 运行经典算法:用几周时间跑通 ACT(Action Chunking)和 Diffusion Policy 的 Pipeline。不需要一开始就死磕数学原理,先建立起对"遥操作(Teleoperation)"、“数据采集”、"策略训练"和"真机部署推理"的物理体感。

第二步:跑通轻量级VLA(理解链路)

  • 尝试小参数模型:例如基于 Hugging Face 的 SmolVLA(450M参数),它能在单张消费级GPU上轻松运行。
  • 理解数据流:通过这个步骤理解"视觉 + 语言指令 -> 神经网络 -> 连续动作序列输出"的完整端到端链路是如何打通的。

第三步:体验SOTA模型(微调前沿基座)

  • 微调 π₀ (Open Pi):基于 Physical Intelligence 开源的完整训练管线,收集 1-2 小时的特定任务数据,对 π₀ 进行微调。
  • 这一步将让你对当前基于 Flow Matching 的 50Hz 高频精细控制能力有一个最前沿的直观认知。

第四步:真机项目落地(跨越Sim-to-Real)

  • 必须走向真实物理世界。在仿真(Simulation)中达到100%成功率并不代表模型具有强鲁棒性,因为仿真环境往往缺乏真实的传感器噪声、光照变化和物理机械的间隙误差。
  • 在真机上能稳定达到 60% 以上的成功率,才是跨越了真正的工程瓶颈。

2. VLA核心挑战

本章采用挑战驱动分类法(Challenge-Centric Taxonomy),围绕VLA研究的五大核心瓶颈进行组织,而非传统的架构或任务分类。这种分类方式更好地反映了当前VLA领域亟需突破的关键问题。

VLA研究的五大核心挑战体系

VLA 核心挑战体系

1. 表示 Representation

2. 执行 Execution

3. 泛化 Generalization

4. 安全 Safety

5. 数据 Data

3D空间表示

动态世界模型

任务分解规划

实时性优化

Sim-to-Real 迁移

持续技能获取

可解释性 CoT

人机协作交互

多源数据整合

标准化评测基准

这五大挑战形成了VLA系统的完整开发路径:

💡 核心链路概览

  1. 表示 (Representation):建立多模态感知与物理世界的连接(2D → 3D/4D)
  2. 执行 (Execution):实现指令理解、分层规划与 30Hz+ 实时控制
  3. 泛化 (Generalization):从仿真迁移(Sim-to-Real)到开放世界持续进化
  4. 安全 (Safety):确保动作的可解释性(CoT)与人类交互的可靠性
  5. 数据 (Data):构建多源异构数据集(OXE)与标准化的评测基准(VLABench)

2.1 多模态对齐与物理世界建模

核心问题:弥合语义感知与物理交互之间的鸿沟,实现从2D图像到时空表示的跨越,并发展动态预测世界模型。

多模态对齐与物理世界建模的三层架构

  1. 基础对齐层:语义到物理的接地(Vision-Language-Action对齐)
  2. 时空表示层:从2D图像到3D空间表示
  3. 动态预测层:世界模型与物理动力学建模

第一层:基础对齐层
语义接地(OTTER、LIV、CLIP-RT)

第二层:时空表示层
2D→3D 空间表示(PointVLA、OccLLaMA)

第三层:动态预测层
世界模型与物理动力学(TriVLA、DreamVLA)

VLA模型需要将视觉-语言模型的语义理解能力转化为对物理世界的准确建模,这涉及三个层次的挑战:

2.1.1 语义到物理的接地(Semantic-to-Physical Grounding)

问题描述:如何将抽象的语言描述(如"红色的杯子")映射到物理世界中的具体对象和可执行动作。

(1)Vision-Language Gap(视觉-语言鸿沟)

  • 问题:RGB的高维感知空间与抽象符号语言之间的语义鸿沟
  • 解决方案
    • OTTER:文本感知的特征提取机制
    • LIV:针对机器人控制数据的对比学习框架
    • 符号推理方式:ACT-LLM, Look Leap等利用LLM进行高层符号推理

(2)Vision-Language-Action Gap(视觉-语言-动作三元鸿沟)

  • 问题:VLM的感知对齐能力如何转化为实际的物理动作执行
  • 解决方案
    • 端到端微调:RT-2, OpenVLA通过动作token化实现VLM到VLA的转化
    • 共享中间表示:CLIP-RT, Humanoid-VLA在动作和感知间建立共享语义空间
    • 层级架构:引入显式规划层作为语义-动作的桥梁
    • VoxPoser:LLM推理生成3D Affordance Map作为中间表示

(3)多模态感觉融合(Sensory Fusion)

  • 问题:如何整合触觉、力传感、音频等额外模态
  • 解决方案
    • 专业编码器 + 对比学习:TLA, OmniVTLA对齐多感觉模态
    • 融合策略:深融合(Tactile-VLA)vs 模块化MoE融合(ForceVLA)
    • 生成式方案:MultiGen在模拟器中生成多模态数据

代表性工作

  • CLAP:对齐视频视觉潜在空间与机器人动作空间
  • Point-VLA:通过显式视觉提示(边界框)解决指代模糊
  • VoxPoser:生成3D可供性图作为强中间表示
  • Tactile-VLA/ForceVLA:整合触觉和力传感的多模态VLA
2.1.2 2D到3D的空间表示(2D-to-3D Spatial Representations)

问题描述:从2D图像输入推断3D空间结构,理解深度、遮挡和空间关系。

空间表示层次

  • 2.5D深度地图:Depth Helps, RoboFlamingo-Plus利用深度信息增强空间感知
  • 点云表示:PointVLA, GeoVLA, FP3直接操作3D点云进行操作规划
  • 体素/占据栅格:OccLLaMA, RoboMM使用体素化占据表示学习场景结构
  • 4D表示(新方向):ARM4R预测3D点的时序运动轨迹,实现动态空间建模

代表性工作

  • OccLLaMA:基于占据网络的3D场景理解,学习体素化空间表示
  • TraceVLA:3D轨迹追踪与预测,理解物体运动
  • PointVLA/GeoVLA:直接在3D点云上进行操作推理
  • ARM4R:预测3D点的运动轨迹,实现4D时空建模
2.1.3 动态世界建模(Dynamic World Modeling)

问题描述:预测物体交互的动态变化,理解物理规律和因果关系。

表示空间选择

  • 观察空间预测(高保真):TriVLA, UP-VLA预测未来视觉观察;CoT-VLA, DreamVLA生成视觉子目标
  • 潜在空间预测(高效):VLM-in-the-Loop在压缩潜在空间进行快速预测;MinD轻量级潜在动力学模型

代表性工作

  • TriVLA:三角形架构融合过去-现在-未来的视觉表示
  • VideoVLA:视频条件的世界模型,预测动作后果
  • LUMOS:显式世界模型进行长时程规划
  • DreamVLA:在"梦境"中模拟和优化动作序列

未来方向

  • 混合潜在-物理-语义世界模型:整合3D几何、物理动力学和语义属性
  • 因果世界模型:显式建模动作-结果的因果关系
  • 可学习物理先验:在神经网络中编码物理定律(守恒律、碰撞等)

2.2 指令跟随、规划与鲁棒实时执行

核心问题:解析复杂指令,进行分层任务分解,实现错误检测与自主恢复,并保证实时计算效率。

指令跟随、规划与实时执行的完整流程

指令理解 → 任务分解与规划 → 动作执行 → 错误检测与恢复 → 实时性优化

重规划

指令理解

任务分解与规划

动作执行

错误检测与恢复

实时性优化

2.2.1 复杂指令解析与理解

问题描述:理解多样化、组合式的自然语言指令,处理模糊性和不完整性。

开放式多模态指令

  • 混合文本+图像+草图:OE-VLA处理开放式混合模态指令;Interleave-VLA交错处理图像和文本序列

模糊和欠指定指令

  • 场景解析与验证:ThinkAct场景分析和反馈验证机制;DeepThinkVLA因果CoT推理和结果驱动RL
  • 空间推理:InSpire显式空间推理提示,理解"左边"、"上面"等相对位置
  • 主动澄清:AskToAct模糊识别模块+主动请求用户澄清

代表性工作

  • ThinkAct:思考-行动架构,在执行前进行推理验证
  • InSpire:空间推理增强的指令理解
  • AskToAct:主动询问机制,处理模糊指令
2.2.2 分层任务分解与规划

问题描述:将长时序复杂任务分解为可执行的子任务序列,并进行高层规划。

三大规划范式

(1)语言驱动规划

  • 单推理链方法:π0.5在单一推理链中生成明确的语言子任务;OneTwoVLA在关键决策点进行结构化文本推理
  • 层级方法:Hi Robot两层架构(VLM规划 + VLA执行);LoHoVLA端到端学习的层级范式

(2)多模态中间表示规划

  • 视觉驱动规划:CoT-VLA生成像素级视觉子目标;HiP三层架构(任务-子任务-动作)
  • Affordance驱动规划:RT-Affordance预测可操作性;CoA-VLA的Chain-of-Affordance推理

(3)技能库组合规划

  • 显式技能库:VLP预定义技能的组合;RoboBrain大规模技能记忆库
  • 隐式技能学习:DexVLA billion参数的隐式技能表示;AgiBot World从大规模数据中自动发现技能

代表性工作

  • π₀.5:增强的推理能力,支持多步骤规划(详见经典论文第5.11节
  • Hi Robot:显式的两层层级架构
  • CoT-VLA:视觉子目标作为思维链
  • ACoT-VLA:动作空间推理(详见经典论文第5.13节
  • DexVLA:billion参数的灵巧操作专家
2.2.3 错误检测与自主恢复

问题描述:实时检测执行失败,并自主生成恢复策略。

关键技术

  • 失败预测:基于视觉反馈预测潜在失败
  • 重规划机制:动态调整执行计划
  • 链式思考推理:通过CoT进行故障诊断(如CoT-VLA)

代表性工作

  • Fast-ThinkAct:实时推理与失败恢复
  • CoT-VLA:链式思考增强的VLA
2.2.4 实时性与计算效率

问题描述:满足高频控制的实时性要求(30Hz+),同时保证推理准确性。

四大优化方向

(1)静态架构优化

  • 压缩量化:BitVLA 1-bit量化;Evo-1 77M参数的超轻量模型
  • 轻量级骨干网络:NORA, TinyVLA专为实时控制设计
  • 线性注意力机制:SARA-RT, RoboMamba用Mamba/SSM替代Transformer的二次复杂度

(2)动态优化解码过程

  • 动态推理路径:MoLe-VLA跳层推理;CEED-VLA, DeeR-VLA提前退出机制
  • Token处理优化:VLA-Cache自适应KV缓存;SpecPrune-VLA token级别剪枝
  • 加速解码:OpenVLA-OFT并行解码,25-50倍加速;Spec-VLA推测解码

(3)动作表示和生成范式优化

  • 高效token化:FAST频率空间动作序列token化,15倍加速;VQ-VLA向量量化动作表示
  • 异步执行:SmolVLA 450M参数实时运行;Real-Time Action Chunking动作块异步执行
  • 加速扩散:Time-Diffusion Policy时间条件加速;Discrete Diffusion VLA离散扩散加速

(4)训练范式优化

  • 训练时推理,推断时跳过:ECoT-Lite训练中使用推理,推断时直接输出
  • 预测压缩表示:V-JEPA 2预测语义压缩表示而非像素
  • 双系统架构:Fast-in-Slow快速System 1 + 慢速System 2

代表性工作

  • SmolVLA:450M参数实时运行
  • FAST:动作tokenizer,15倍推理加速
  • OpenVLA-OFT:优化微调,25-50倍加速
  • RoboMamba:Mamba架构的线性复杂度
  • MoLe-VLA:动态深度推理

未来方向

  • 自适应架构:根据任务难度自动调整推理深度和模型规模
  • 统一决策Token:see-think-act的统一token流
  • 硬件协同优化:专用芯片加速VLA推理


Token处理优化:VLA模型通常基于大规模VLM构建,其自回归解码机制天然存在计算开销大、推理延迟高的问题。为满足机器人实时控制需求,研究者从多个层面进行优化:

  • 动作Token压缩:将连续动作离散化为紧凑的Token序列,减少自回归生成的步数。例如FAST Tokenizer将6-DoF动作压缩为单Token,显著降低解码延迟。
  • KV Cache优化:在长时程任务中复用历史视觉与语言特征的键值缓存,避免重复计算,提升多步推理效率。
  • 并行解码与投机采样:利用动作序列的时序相关性,采用并行解码或投机采样(Speculative Decoding)策略,在不损失精度的前提下加速Token生成。
  • 轻量化骨干网络:如TurboVLA采用直连 V + L → A V+L \to A V+LA 架构,摆脱LLM词表依赖,在RTX 4090上实现32Hz控制,显存占用低于1GB。

代表性工作

  • π₀ (2024):采用Flow Matching替代自回归Token生成,将推理频率提升至50Hz,首次实现折纸、玩扑克等极高精度任务。
  • RoboTTT (2026):通过测试时训练(TTT)将策略注意力上下文扩展至8K时间步,突破长时程任务的时序瓶颈。
  • TurboVLA (2026):以0.2B参数实现32Hz实时控制,验证了"小模型+直连架构"在边缘端高频部署的可行性。
  • ZR-0 (2026):通过密集ECoT跨本体对齐与推理期特征掩码零开销旁路,在保持推理速度的同时增强长时程任务的理解能力。

综上,实时性与计算效率的优化正沿着"架构轻量化、解码加速、上下文扩展"三条主线推进。从π₀的Flow Matching到TurboVLA的端侧直连,VLA正逐步逼近"感知-决策-控制"全链路实时闭环的目标,为机器人在非结构化环境中的高频鲁棒执行奠定基础。

2.3 从泛化到持续适应

核心问题:实现开放世界泛化,支持持续学习与增量技能获取,完成sim-to-real迁移,并启用在线强化学习。

从泛化到持续适应的四层递进体系

  1. 开放世界泛化:未见环境/物体/任务的零样本能力
  2. 持续学习:增量技能获取,避免灾难性遗忘
  3. Sim-to-Real迁移:缩小仿真与真实的差距
  4. 在线强化学习:从交互中自主学习和改进

开放世界泛化
未见环境/物体/任务的零样本能力

持续学习
增量技能获取,避免灾难性遗忘

Sim-to-Real 迁移
缩小仿真与真实世界的差距

在线强化学习
从实时物理交互中自主学习

2.3.1 开放世界泛化(Open-World Generalization)

问题描述:在未见环境、未见物体和未见任务组合上的零样本或少样本泛化。

四大策略

(1)知识迁移与利用

  • 多任务/多机器人预训练:Octo在800k机器人轨迹上预训练;DexVLA billion参数扩散专家跨机器人形态预训练;EO-1在1.5M-EO-Data上预训练共享骨干
  • 互联网/人类视频知识迁移:R3M在Ego4D等人类第一人称视频上预训练视觉编码器;GR系列(GR-1, GR-2)从人类视角视频迁移物理和交互知识

(2)范式级创新

  • In-Context Learning:ICIL从prompt中的少量演示推断任务,无需重新训练
  • 概念泛化:ObjectVLA联合训练机器人轨迹和box标注VL数据,实现零样本操作;LERF融合CLIP和3D NeRF实现自然语言定位和抓取
  • 自适应范式:Align-Then-Steer非侵入式适应;Robot Utility Models (RUM)零样本部署

(3)增强数据多样性

  • 数据增强:CACTI扩散修补技术生成多样化场景;GenAug文本到图像合成增强训练数据
  • 语义增强:ROSIE VLM知识蒸馏到机器人策略

代表性工作

  • Octo:800k轨迹预训练的通用策略
  • DexVLA:billion参数跨形态专家
  • R3M/GR-2:从人类视频迁移知识
  • ICIL:上下文学习范式
  • ObjectVLA/LERF:概念级泛化
  • Robot Utility Models:零样本家庭部署
2.3.2 持续学习与增量技能获取

问题描述:在不遗忘旧技能的前提下持续学习新技能。

两大策略

(1)参数隔离与扩展

  • 基于提示/码书学习:新技能独立编码为提示或码书向量,保持核心参数不变
  • 模块化MoE架构:InstructVLA专家混合架构;iManip PerceiverIO架构实现模块化技能表示

(2)回放知识巩固

  • 压缩经验回放:ExpReS-VLA压缩体验回放,高效存储历史经验
  • 时间回放策略:iManip关键帧回放,保留重要状态转移

代表性工作

  • InstructVLA:MoE架构的终身学习
  • iManip:模块化技能表示
  • ExpReS-VLA:压缩经验回放

评测基准

  • LIBERO:首个终身机器人学习基准,评估技能保留和迁移
2.3.3 Sim-to-Real迁移

问题描述:缩小仿真训练与真实部署之间的性能差距。

两大策略

(1)增强模拟保真度

  • 高保真仿真器:ManiSkill3 GPU并行渲染+物理模拟,域随机化
  • 稳定中间表示:SLIM使用分割+深度等对光照不敏感的表示,减少视觉域差异

(2)数据驱动模拟器

  • 生成增强:GenAug无模拟器直接从文本生成训练数据
  • 学习世界模型:DreamGen从真实数据学习生成模型;RynnVLA-001神经模拟器

(3)高效真实适应

  • 快速微调:AdaWorld在少量真实数据上高效适应
  • 鲁棒视觉表示:学习对光照、纹理变化不敏感的特征;自监督预训练(DINOv2等)

代表性工作

  • ManiSkill3:新一代GPU并行仿真器
  • SLIM:稳定中间表示减少域差距
  • GenAug:生成式数据增强
  • AdaWorld:高效sim-to-real适应

未来方向

  • 神经模拟器:完全从数据学习的可微分模拟器
  • 双向迁移:real-to-sim用于改进仿真器
2.3.4 在线强化学习

问题描述:通过与环境交互自主学习和改进策略。

两大方向

(1)优化学习过程

  • 知识迁移加速:RLDG蒸馏预训练VLA知识到RL策略;Refined Policy Distillation MSE约束保持预训练能力;iRe-VLA阶段性冻结-解冻策略
  • 算法内部优化:CO-RFT分块时间差分学习,稳定训练

(2)自动化奖励生成

  • 感知对齐奖励:VLM-RMs用VLM作为奖励模型;RoboCLIP CLIP对齐的奖励信号
  • VLM批评:RL-VLM-F GPT-4V比较不同轨迹;GRAPE VLM生成密集奖励信号
  • 代码生成奖励:Eureka LLM生成奖励函数代码;VLA-RL端到端VLA强化学习

代表性工作

  • π*₀.₆:从经验中学习,整合专家干预的RL(详见经典论文第5.12节
  • SERL:样本高效的机器人RL套件
  • Eureka:LLM自动生成奖励函数
  • VLA-RL:端到端VLA强化学习框架
  • RLDG:知识蒸馏加速RL训练

未来方向

  • 形态无关表示:跨具身形态的策略迁移
  • 零样本跨具身迁移:在一个机器人上学习,直接部署到另一个
  • 自主开放式进化:部署→发现→进化的闭环系统

2.4 安全性、可解释性与可靠交互

核心问题:确保可靠性保证,提升可解释性,实现可信的人机交互,并满足安全约束。

安全性与可解释性的双层结构

  • 第一层:可靠性保证
    • 基于约束的安全(规则约束、内部化约束)
    • 学习对齐(值对齐、不确定性评估)
  • 第二层:透明可信交互
    • 增强过程可解释性(CoT、层级结构)
    • 行为可预测性(外化决策逻辑)

第二层:透明可信交互

增强可解释性
CoT推理 / 层级架构 / ECoT

行为可预测性
外化决策逻辑 / CrayonRobo

第一层:可靠性保证

基于约束的安全
AutoRT / SafeVLA / VLSA-AEGIS

学习对齐
Gemini Robotics / GPI / RationalVLA

2.4.1 可靠性保证

三大范式

(1)基于约束的安全范式

  • 规则约束:AutoRT 宪法提示 (Constitutional Prompting) 硬编码安全规则,为机器人建立底线行为准则。
  • 区块链硬约束:OpenMind 提出的前卫方案,将机器人安全规则写入以太坊区块链,防止机器人或恶意软件修改安全日志或绕过核心限制。

(2)学习对齐范式

  • 值对齐:Gemini Robotics使用 Constitutional AI 后训练,使机器人决策对齐人类价值观。
  • 不确定性评估:GPI置信度估计+回溯机制;RationalVLA可学习的拒绝token,主动拒绝不安全/无效指令。

(3)即插即用安全层

  • VLSA-AEGIS:基于控制屏障函数(CBF)的安全层,无需修改 VLA 模型即可添加物理硬约束。

代表性工作

  • SafeVLA:约束MDP框架
  • RationalVLA:学习拒绝危险指令
  • GPI:不确定性感知的安全回溯
2.4.2 可解释性与可信赖性

两大方向

(1)增强过程可解释性

  • 链式思维(CoT):Diffusion-VLA自然语言中间推理步骤;ECoT可编辑的推理链;CoT-VLA视觉子目标作为可视化推理链
  • 层级结构天然可解释:RT-H, HiRobot高层语言规划+低层执行;GraSP-VLA分层规划提供可追溯性
  • 解码隐藏符号状态:DIARC-OpenVLA线性探针解释内部表示

(2)行为可预测性

  • 外化决策逻辑:CrayonRobo视觉提示(箭头、高亮)外化决策过程
  • 结构化任务切换:SwitchVLA显式任务切换机制(回滚+平滑过渡)

代表性工作

  • ECoT:可编辑的链式思考推理
  • CoT-VLA:视觉CoT增强可解释性
  • RT-H/HiRobot:层级架构的天然可解释性
  • CrayonRobo:视觉化决策过程
2.4.3 安全约束与主动拒绝

两大技术路线

  • 插件式安全层:VLSA-AEGIS基于控制屏障函数(CBF)的即插即用安全层,在不修改VLA模型的前提下添加硬约束
  • 可学习拒绝机制:RationalVLA学习拒绝不安全/无效指令,训练模型识别危险行为并主动拒绝
2.4.4 人机协作交互

关键能力

  • 意图识别:理解人类的隐含意图和目标;从不完整指令中推断完整任务
  • 主动询问:AskToAct检测模糊指令时主动请求澄清;OneTwoVLA关键决策点主动询问
  • 从反馈学习:Yell At Your Robot实时语言反馈纠正;π*₀.₆从专家干预中学习(详见经典论文第5.12节
  • 协作规划:共享心智模型;预测人类动作在协作环境中避免冲突

未来方向

  • 预测式协作:预测人类下一步动作,主动辅助
  • 情境感知安全:根据环境动态调整安全边界
  • 自然多模态交互:语言+手势+视觉指向的融合理解

2.5 数据构建与基准测试标准

核心问题:管理多源异构数据整合,建立标准化评测基准。

数据构建与评测标准双轨体系

  • 数据轨:表示层统一对齐 → 数据层增强优化 → 标准化基准构建
  • 评测轨:全面性与标准化 → 任务广度与深度扩展 → 真实场景转仿真

评测轨道

数据轨道

Sim-to-Real

多源整合
OXE / RLDS 格式

跨具身统一
970k 轨迹 / 22 种机器人

合成数据
InternData-A1 / 630k 轨迹

仿真基准
LIBERO / CALVIN

跨场景泛化
SimplerEnv / RoboCasa

开放世界评测
VLABench / 真实机器人

2.5.1 多源异构数据整合

三大层面

(1)表示层统一对齐

  • 离散动作表示:LAPA, Moto, UniVLA统一的动作token化方案;跨平台的动作空间标准化
  • 共享语义空间:RDT-1B扩散Transformer学习跨机器人表示;AgiBot World大规模统一语义空间;Scaling Cross-Embodied Learning形态无关表示
  • 多模态对齐:RT-1, GR-2视觉-动作对齐;ViSA-Flow视觉-空间-动作三元对齐;Humanoid-VLA全身控制的多模态对齐

(2)数据层增强与优化

  • 生成增强:CACTI扩散修补生成多样场景;GenAug文本到图像合成;ROSIE VLM知识蒸馏;Residual RL Data Generation通过残差RL生成数据
  • 混合优化:Re-Mix自适应采样权重平衡异构数据源

(3)标准化与基准构建

  • 统一采集协议:RH20T严格时间对齐的多模态数据(视觉+触觉+音频);BridgeData V2标准化的桌面操作数据
  • 跨域标准化:Open X-Embodiment 60+数据集,970k轨迹,22种机器人;RoboMM多模态跨机器人数据
  • 人类中心多视角:Ego4D 3700小时第一人称视频;EPIC-KITCHENS厨房活动数据集;Ego-Exo4D同步的自我-外部视角

代表性工作

  • Open X-Embodiment:最大规模的跨机器人数据集
  • WALL-OSS:聚合超过10000小时的自收集机器人轨迹
  • RH20T:高质量多模态时间对齐数据
  • RDT-1B:billion规模的扩散Transformer,统一表示
2.5.2 评测基准与标准化指标

三大方向

(1)全面性与标准化

  • 统一评测框架:Benchmarking VLAs统一输入/输出接口、标准化指标、多机器人支持
  • 多维度评分:EUQ (Evaluating Uncertainty and Quality)人类评估的多维评分,超越简单成功率
  • 基础设施:ManiSkill3 GPU并行,支持大规模评测;robosuite模块化仿真框架

(2)任务广度与深度扩展

  • 长视距序列:CALVIN连续多任务执行,评估长期规划;5个连续任务成功率作为核心指标
  • 终身学习:LIBERO 130个任务,4个套件(Spatial, Object, Goal, Long),评估技能保留和前向/后向迁移
  • 多维对象/语言复杂度:From Intention to Execution (VLABench)分离意图理解和执行能力;Intention Score + Progress Score双指标
  • 零样本多语言:SimplerEnv-Instruct 80个零样本任务,多语言指令

(3)真实场景转仿真

  • 神经重建:PolaRiS将真实视频转化为交互式仿真环境,提供可控的评测环境

代表性工作

  • LIBERO:首个终身机器人学习基准,130个任务
  • CALVIN:长时序多任务基准
  • VLABench (Intention to Execution):分离意图和执行的评测
  • SimplerEnv:标准化VLA评测平台,80个零样本任务
  • PolaRiS:真实场景神经重建
  • ManiSkill3:GPU并行高效评测

未来方向

  • Simulation-First, Failure-Centric Paradigm:以失败为核心的评测
  • Turn Failure into Signal:将失败轨迹用于对比学习
  • Comprehensive Diagnostic Stress Testing:超越二元成功率的细粒度诊断
2.5.3 数据高效学习

三大策略

(1)数据增强

  • 视觉增强:CACTI扩散修补生成多样化背景;GenAug文本到图像生成;颜色、光照、遮挡变化
  • 轨迹增强:时间插值、噪声注入;反向轨迹生成

(2)主动学习

  • 不确定性采样;多样性采样;优先标注难例

(3)迁移学习

  • 预训练知识利用:VLM预训练(CLIP, SigLIP);人类视频预训练(Ego4D, GR-2);跨机器人迁移(Octo, RoboCat)
  • 少样本微调:适配器方法轻量化微调;LoRA, AdaLoRA等参数高效微调

代表性工作

  • CACTI:扩散增强数据生成
  • Octo:10次演示实现新任务适应
  • ROSIE:VLM知识蒸馏减少数据需求

未来方向

  • 自监督预训练:利用大规模无标注视频
  • 主动数据收集:机器人自主选择探索策略
  • 合成到真实:完全在合成数据上训练,零样本迁移到真实

3. VLA主流数据集

VLA模型的性能高度依赖于高质量的训练数据。以下是VLA领域最具影响力的数据集。

快速参考:主流数据集概览

数据集类型规模机器人/平台发布年份
ProcCorpus-60M真实+密集ECoT6000万帧 (40万轨迹)跨具身 (单/双臂/人形)2026
Open X-Embodiment真实+跨具身970k 轨迹22种机器人2023
RT-1 Dataset真实130k 轨迹Everyday Robot2022
DROID真实,In-the-Wild76k 轨迹Franka Panda2024
EO-1 Dataset真实+合成~1.5M 轨迹多种机械臂2024
AgiBot World真实,多具身100万+ 轨迹多种机器人2025
BridgeData V2真实60k 轨迹WidowX 2502023
ALOHA / ACT真实,双臂~50条/任务ALOHA双臂2023
UMI Dataset真实,手持数百~数千条手持夹爪→Franka2024
RH20T真实,多模态多模态同步多种机械臂2024
LeRobot (HuggingFace)数据中台100+个数据集多平台2024
CALVIN仿真6小时遥操作PyBullet2021
LIBERO仿真65k 轨迹MuJoCo2023
RLBench仿真100+任务CoppeliaSim2019
MimicGen仿真(自动生成)~50k 轨迹MuJoCo2024
MetaWorld仿真50任务标准化MuJoCo (Sawyer)2020
ManiSkill3仿真GPU并行生成多种机器人2024
RoboCasa仿真家庭场景MuJoCo2024
Ego4D人类第一视角3600小时视频2022
SimplerEnv评测基准80任务多平台2024
VLABench评测基准多维评测仿真2025

3.1 大规模跨机器人数据集

ProcCorpus-60M Dataset

基本信息

  • 发布时间:2026年6月(中国人民大学 & 智谱 AI)
  • 数据规模:约 6,000 万帧(约 1,000 小时、40 万条轨迹)
  • 机器人平台:单臂(Franka、xArm)、双臂(AgiBot G1、Agilex)、移动操作及人形机器人(RoboCasa GR-1)
  • 采集与标注方式:聚合 DROID、RH20T、Open X-Embodiment、Bridge 等顶尖开源真实与仿真数据集,并通过自动化 VLM 流水线对全量数据进行具身思考链标注

数据特点

  • 密集具身思考链覆盖(96.8%):区别于传统仅标注动作的数据集,ProcCorpus-60M 几乎对每帧提供六层结构化认知标注:
    1. Scene Description(场景与关键物体描述)
    2. Progress Assessment(任务进度与完成判定)
    3. Future Plan(宏观未来规划语言推理)
    4. To-Do Actions(动宾格式规范化原子动作分解)
    5. Target Objects(关键操控物体 2D BBox 视觉定位)
    6. Discrete Actions(FAST Tokenizer 紧凑动作表征)
  • 硬件无关的跨本体语义对齐:高层认知标注完全独立于具体的机械臂自由度与控制接口,为不同机器人形态提供了统一的语义学习桥梁。
  • 协同图文增强:混入 CapsFusion 与 Pixmo 通用多模态图文数据,保障跨领域开放词表常识不退化。

应用模型

  • ZR-0 (2026):基于该数据集完成跨单臂/双臂/人形预训练的 2.6B VLA 基础模型

Open X-Embodiment Dataset

基本信息:

  • 发布时间:2023年10月
  • 数据规模:970k条真实机器人轨迹,60+个数据集
  • 机器人平台:22种不同的机器人(单臂、双臂、移动操作、人形等)
  • 任务类型:多样化的操作任务(抓取、放置、组装、厨房任务等)

数据特点

  • 跨机器人统一格式:RLDS (Reinforcement Learning Datasets)标准
  • 多模态观察:RGB图像、深度图、本体感觉
  • 语言标注:自然语言任务描述
  • 动作表示:统一的动作空间定义
  • 支持跨具身形态泛化研究

核心贡献

  • 首个大规模跨机器人数据集
  • 定义了机器人数据集的事实标准
  • 催生了RT-X、OpenVLA等一系列跨机器人模型

应用模型

  • RT-X:在OXE上训练的跨机器人策略
  • OpenVLA:7B参数开源VLA模型
  • Octo:通用机器人策略
  • DexVLA、RDT-1B等最新VLA模型

获取方式:https://robotics-transformer-x.github.io/


EO-1 Dataset

基本信息

  • 数据规模:约1.5M条轨迹(EO-Data,含真实+合成数据)
  • 机器人平台:多种商用机械臂(Franka、UR系列为主)
  • 采集方式:大规模人工遥操作 + 自动化数据扩增流水线

数据特点

  • 规模超大:在OXE(970k)基础上进一步扩大规模
  • 多任务覆盖:桌面抓取、组装、物体重排、厨房任务等
  • 质量筛选:引入自动轨迹评分,过滤低质量演示
  • 数据飞轮:EO-1模型部署后持续回收数据,形成闭环迭代

应用:EO-1 通用操作模型预训练


WALL-OSS Dataset

基本信息

  • 数据规模:10,000+ 小时自收集机器人操作轨迹
  • 机器人平台:移动操作机器人(Mobile Manipulation)
  • 采集方式:大规模自主探索 + 人工标注纠正

数据特点

  • 长时程任务:平均单条轨迹时长远超普通抓取数据集
  • 真实家庭场景:厨房、卧室、客厅等多种非结构化环境
  • 分层结构:同时记录高层规划决策和低层关节控制动作
  • 自主采集优势:大幅降低人工遥操作成本,可持续规模化

应用:大规模分层VLA预训练,支持移动操作长时程任务


RT-1 Dataset

基本信息:

  • 发布时间:2022年12月(Google Robotics)
  • 数据规模:130k条真实机器人轨迹
  • 机器人平台:Everyday Robot(Google定制移动操作机器人)
  • 采集周期:17个月持续采集
  • 任务类型:700+种日常办公/厨房操作任务

数据特点

  • 高质量专家演示:经专业训练的机器人操作员采集,轨迹成功率高
  • 真实办公环境:Google办公楼真实场景,非受控实验室环境
  • 丰富语言多样性:同一任务有多种自然语言表达方式(如"把苹果放到碗里" / “将苹果移入容器”)
  • 密集标注:动作标注包含末端执行器6DoF位姿、夹爪开合、底盘运动
  • 任务层次:包含单步任务(拾取)和多步复合任务(开柜门-取物-关门)

数据格式

  • 观察:单目RGB图像 + 自然语言指令
  • 动作:末端执行器位移(x, y, z, roll, pitch, yaw)+ 夹爪状态

应用模型

  • RT-1:在此数据上从零训练的高频控制策略
  • RT-2:使用此数据微调PaLI-X/PaLM-E VLM
  • 作为OXE数据集子集广泛用于跨机器人训练

3.2 双臂与灵巧操作数据集

ALOHA / ACT Dataset

基本信息:

  • 发布时间:2023年(ACT论文,Stanford IRIS Lab)
  • 数据规模:每个任务约50条人工演示
  • 机器人平台:ALOHA双臂机器人(低成本桌面系统,总成本约$20k)
  • 采集方式:人类遥操作——操作者控制"主臂",机器人跟随复现

数据特点

  • 双臂协同:同时记录左右两臂的关节位置、速度、力矩与抓取状态
  • 高频采集:50Hz动作帧率,适配精细操作
  • 多样化任务:折叠衣物、整理厨具、穿针引线、手术动作模拟等
  • 观察模态:4路RGB相机(左/右腕部 + 左/右侧视)+ 本体感觉

关键任务列表

任务难点
折叠衬衫柔性物体变形预测
将碗叠放入碗架双手力协调
开冰箱取饮料长时序、多子任务
拧紧瓶盖精细操作+力控制

影响

  • 直接催生 ACT(Action Chunking with Transformers)方法论
  • ALOHA硬件设计完全开源,引爆学界双臂研究热潮
  • 后续 π₀.5 等大量工作均采用 ALOHA 硬件采集数据

获取方式:https://mobile-aloha.github.io/


UMI (Universal Manipulation Interface) Dataset

基本信息:

  • 发布时间:2024年(Stanford + Columbia)
  • 数据规模:数百至数千条轨迹(按任务)
  • 采集方式:手持夹持器(无需机器人),操作者手持装置自由操作

数据特点

  • 设备极简:用GoPro + 3D打印夹爪即可采集,成本极低
  • 隐式推理:延迟观察(推理时忽略最近0.2s图像),让模型自动预测接触时刻
  • 自然场景多样性:采集者可在任意真实场景自由操作,无需固定机器人工位
  • 推理接口统一:采集数据直接迁移到Franka等标准机器人执行

应用模型

  • Diffusion Policy(UMI版本)
  • UMI-on-Legs(四足机器人上肢任务)

获取方式:https://umi-gripper.github.io/


3.3 模拟器数据集

CALVIN (Composing Actions from Language and Vision)

基本信息:

  • 发布时间:2021年(University of Freiburg)
  • 环境:PyBullet仿真器(Franka Panda机械臂)
  • 数据规模:约6小时人类遥操作Play数据
  • 任务类型:34种语言条件操作任务的长时序组合

数据特点

  • Play Data范式:数据采集时操作者随机操作,不针对特定任务,大幅降低采集成本
  • 后验标注:采集完成后将轨迹片段与任务语言描述自动对齐
  • 多步骤链:评测时要求连续完成1-5个任务(ABCD→D split)
  • 4个场景变体(Split):A、B、C(训练)、D(测试),光照/物体布局各异

标准评测协议(ABCD→D split)

指标含义
LH-MTLC 1单任务连续成功率
LH-MTLC 5五任务连续成功率
Avg. Len.平均连续成功任务数(最高5)

目前 SOTA:GR-2 (2024) 实现 Avg. Len. ≈ 4.5+

应用

  • 语言条件长时程操作研究的核心基准
  • 广泛用于ACT、Diffusion Policy等方法的评测对比

官网:http://calvin.cs.uni-freiburg.de/


LIBERO (Lifelong Benchmark for Robot Manipulation)

基本信息:

  • 发布时间:2023年(CMU + Stanford)
  • 环境:MuJoCo/RoboSuite仿真器(Franka Panda)
  • 任务数量:130个任务,每任务500条专家演示(共65,000条轨迹)

数据特点

  • 持续学习设计:专为评测"学新任务时遗忘旧任务"问题而设计
  • 任务套件阶梯式:从空间推理 → 物体泛化 → 目标泛化 → 长时序,难度递增
  • 专家演示质量高:基于RoboSuite的运动规划器自动生成高成功率演示

四个任务套件详解

套件任务数核心评测能力示例任务
LIBERO-Spatial10空间关系推理“把碗放到架子左边”
LIBERO-Object10物体类别泛化识别和操作未见物体
LIBERO-Goal10目标状态泛化同样物体、不同目标状态
LIBERO-Long10长时序多步骤5个子任务的组合序列

持续学习评测指标

  • FWT(前向迁移):学新任务对旧任务的正向影响
  • BWT(后向迁移/遗忘):学新任务导致旧任务性能下降

应用

  • VLA持续学习研究的标准基准
  • OpenVLA、RoboFlamingo等模型的性能对比平台

官网:https://libero-project.github.io/


RLBench

基本信息:

  • 发布时间:2019年
  • 环境:CoppeliaSim(V-REP)
  • 任务数量:100+任务

数据特点

  • 涵盖多种操作技能
  • 提供视觉观察和状态信息
  • 支持多种机器人平台

任务类别

  • 抓取和放置
  • 工具使用
  • 组装任务

官网:https://sites.google.com/view/rlbench


MimicGen

基本信息:

  • 发布时间:2024年(NVIDIA + UT Austin)
  • 核心思路:用少量人类演示(约10条)自动生成大量(1000+条)多样化轨迹

数据特点

  • 数据扩增:通过分解-重组子任务轨迹,自动适配新物体位置/姿态
  • 无需额外标注:完全自动化,人工成本接近于零
  • 支持多环境:MuJoCo/RoboSuite,官方提供数千条生成轨迹

数据规模:公开 ~50k 条生成轨迹,涵盖 18 类任务

应用

  • Diffusion Policy、ACT等方法的数据增强基线
  • 验证"稀疏人类演示 → 大规模训练数据"可行性

官网:https://mimicgen.github.io/


MetaWorld

基本信息:

  • 发布时间:2020年(Stanford)
  • 环境:MuJoCo仿真器(Sawyer机械臂)
  • 任务数量:50个标准化操作任务

任务结构

  • ML10:10任务元学习基准
  • ML45:45任务元学习基准
  • MT50:50任务多任务学习基准

数据特点

  • 任务覆盖面广(抓取、推动、翻转、穿孔、拧螺丝等)
  • 任务设计极度标准化,统一状态/动作空间
  • 评估多任务学习和少样本泛化的经典基准

应用

  • 大量VLA与强化学习方法的对比基线
  • 多任务学习研究标配

官网:https://meta-world.github.io/


3.4 真实世界数据集

Bridge Dataset (BridgeData V2)

基本信息:

  • 发布时间:2023年(UC Berkeley RAIL Lab)
  • 数据规模:60,096条真实机器人轨迹
  • 机器人平台:WidowX 250(低成本6DoF桌面机械臂,约$3,500)
  • 采集场景:24个不同真实场景(厨房操作台、桌面、架子等)

数据特点

  • 低成本硬件验证:证明廉价机械臂可采集高质量训练数据
  • 任务多样性:包括抓取、放置、翻转、拖拉、穿插、扫描等多类操作
  • 语言条件:每条轨迹配有语言描述任务目标
  • 人类遥操作:通过SpaceMouse采集,轨迹自然流畅

V2相比V1的改进

  • 新增 16,000+ 轨迹,场景扩充至 24 个
  • 标准化采集协议,各场景使用统一相机角度
  • 引入自动质量筛选流程
  • RLDS格式标准化,直接兼容OXE

应用

  • Octo 通用机器人策略的核心训练数据
  • OpenVLA预训练数据之一
  • 模仿学习与Sim-to-Real研究基线
  • 完整收录于Open X-Embodiment数据集

官网:https://rail-berkeley.github.io/bridgedata/


RH20T Dataset

基本信息

  • 发布时间:2024年(上海AI实验室 + 香港大学)
  • 数据规模:110,000+ 条多模态同步轨迹
  • 机器人平台:多种机械臂(Franka、UR5、xArm等)
  • 特点:迄今为止时间同步精度最高的多模态机器人数据集

传感器配置

  • 视觉:RGB-D(Realsense D435i,1280×720@30Hz)
  • 触觉:高分辨率触觉传感器(手指接触力/形变)
  • 音频:操作声音同步录制(夹取、碰撞等声学信号)
  • 本体感觉:关节位置、速度、力矩@500Hz
  • 时间同步精度:微秒级硬件触发

数据特点

  • 精细操作覆盖:拧螺丝、剪纸、折纸等需要触觉反馈的精密任务
  • 多机器人平台:同一任务在不同机械臂上重复采集,便于跨平台研究
  • 失败案例保留:包含部分失败轨迹,用于对比学习

应用

  • 触觉-视觉融合VLA训练(Tactile-VLA, OmniVTLA)
  • 接触丰富操作(Contact-rich Manipulation)研究
  • 多模态感知对齐研究

DROID Dataset

基本信息

  • 发布时间:2024年(Stanford + Berkeley + CMU 等多机构联合)
  • 数据规模:76,188条真实机器人操作轨迹,约350小时
  • 机器人平台:Franka Panda
  • 采集地点:全球50个不同地点(实验室、厨房、办公室等)

数据特点

  • In-the-Wild多样性:50个采集地点带来极高的场景多样性
  • 86类任务:覆盖抓取、推动、翻转、清洁、整理等广泛操作
  • 双目视角:腕部摄像头 + 外部固定摄像头
  • 语言标注:每条轨迹附带自然语言任务描述
  • 数据格式:RLDS标准,兼容OXE生态

质量特点

  • 专业采集员培训保证基础质量
  • 跨场景一致的采集协议
  • 超出OXE子数据集的场景多样性

应用

  • 大规模真实世界VLA预训练
  • 跨地点泛化研究基准
  • OpenVLA-OFT等模型微调

获取方式:https://droid-dataset.github.io/


Language-Table

基本信息:

  • 发布时间:2022年
  • 数据类型:真实桌面操作
  • 任务类型:语言条件的物体重排列

数据特点

  • 简化的二维操作任务
  • 清晰的语言-动作对应
  • 便于快速原型开发

应用

  • 语言理解研究
  • 策略学习方法验证

AgiBot World

基本信息:

  • 发布时间:2025年(AgiBot / 智元机器人)
  • 数据规模:100万条轨迹,覆盖多种机器人平台
  • 采集方式:人类遥操作 + 自主采集

数据特点

  • 规模领先:目前公开规模最大的真实机器人操作数据集之一
  • 多具身形态:单臂、双臂、移动操作、人形机器人
  • 场景多样化:工业制造、家庭服务、餐饮、仓储等场景
  • 标准化格式:兼容RLDS,可与OXE生态无缝对接

应用

  • 大规模跨具身VLA预训练
  • 国内机器人企业数据生态建设参考

获取方式:https://agibot-world.com/


LeRobot Dataset (HuggingFace)

基本信息:

  • 发布时间:2024-2025年(HuggingFace)
  • 定位:机器人学习领域的开源数据中台

数据特点

  • 统一接口:100+个数据集(包含OXE子集、ALOHA、Bridge等)通过统一API访问
  • 标准化格式:基于Apache Parquet,支持流式加载
  • 可视化工具:内置数据浏览器,可在线预览轨迹
  • 社区驱动:研究者可直接上传自采数据集,共建生态

支持的数据集示例:lerobot/pusht、lerobot/aloha_sim_、lerobot/xarm_

应用

  • 作为统一接口接入多来源数据训练VLA
  • 快速搭建机器人学习基线

官网:https://huggingface.co/lerobot


3.5 人机交互数据集

Ego4D

基本信息:

  • 发布时间:2022年
  • 数据规模:3,600小时第一人称视频
  • 场景类型:日常生活活动

数据特点

  • 人类操作演示
  • 丰富的语言标注
  • 多样化的交互场景

VLA应用

  • 从人类视频中学习操作策略
  • 理解人类意图和目标

3.6 评测基准

SIMPLER / SimplerEnv (Simulation Platform for Embodied Learning and Evaluation Research)

基本信息

  • 发布时间:2024-2025年
  • 目标:标准化的VLA评测框架

评测内容

  • SimplerEnv-Instruct:80个零样本任务,多语言指令支持
  • 跨任务泛化
  • 跨环境泛化
  • 鲁棒性测试

特点

  • 统一的输入输出接口
  • 标准化的评测指标
  • 支持多种机器人平台

应用

  • ICLR 2026等会议广泛使用
  • 比较不同VLA模型的性能
  • π0, OpenVLA等模型的官方评测平台

官网:https://simpler-env.github.io/


VLABench (From Intention to Execution)

基本信息

  • 发布时间:2025年
  • 目标:分离评测VLA的意图理解和执行能力

核心指标

  • Intention Score (IS):评估指令理解的准确性
  • Progress Score (PS):评估任务执行进度
  • 双指标分离意图和执行两个维度

评测维度

  • Seen objects (已见物体)
  • Unseen objects (未见物体)
  • Unseen colors (未见颜色)
  • Unseen textures (未见纹理)
  • Unseen scenes (未见场景)

特点

  • 细粒度诊断VLA能力边界
  • 超越二元成功率的多维评估

应用

  • ACoT-VLA等最新模型的评测
  • 识别模型的弱点和改进方向

ManiSkill3

基本信息

  • 发布时间:2024年
  • 特点:GPU并行高性能仿真器

技术特点

  • GPU加速:大规模并行仿真
  • 域随机化:自动生成多样化场景
  • 物理精度:高保真物理模拟
  • 渲染质量:逼真的视觉渲染

应用

  • 大规模数据生成
  • 快速策略评估
  • Sim-to-Real研究

官网:https://maniskill.ai/


RoboCasa

基本信息

  • 发布时间:2024年(UT Austin ARISE Lab)
  • 环境:MuJoCo/RoboSuite仿真器(Franka Panda双臂)
  • 场景类型:逼真的家庭厨房环境

特点

  • 100+种厨房布局:随机化橱柜位置、灶台样式、照明条件
  • 150+种家庭物品:覆盖厨房常见食材、餐具、电器
  • 长时程任务:超市购物→放入冰箱、备餐→烹饪等多步骤任务
  • 自动数据生成:配合MimicGen可大规模生成演示数据
  • 人形机器人支持:提供双臂操作接口,适配具身机器人研究

任务类别(共100+任务):

  • PnP(Pick and Place):从A处取物放到B处
  • Drawer/Cabinet操作:开关抽屉、柜门
  • Boil/Fry:烹饪动作模拟
  • ArrangeItems:物品摆放整理

应用

  • 家庭服务机器人长时程操作研究
  • 高数据多样性的VLA预训练数据源

4. VLA的应用场景

工业制造

VLA模型在工业自动化中展现出巨大潜力,能够处理多样化的生产任务。

工业场景中的VLA应用

应用场景VLA能力需求典型任务
质量检测视觉缺陷识别 + 自然语言标准理解“检查零件表面是否有划痕”
柔性装配视觉定位 + 精细操作“将A部件插入B部件的孔中”
智能分拣多物体识别 + 动态规划“将红色零件放入左侧托盘”

应用示例

  • 智能装配线:基于语言指令调整装配流程
  • 质量检测:结合视觉检测和操作反馈
  • 柔性制造:快速适应产品变化

服务机器人

在家庭和商业服务场景中,VLA使机器人能够理解和执行多样化的用户指令。

典型应用领域:

  • 家庭服务:理解"帮我整理客厅"等开放式指令,执行物体重排列、清洁等复合任务(如π₀.5在新家庭环境中的10-15分钟长时程任务)
  • 餐饮服务:识别菜品 + 理解点餐指令 → 配送和上菜动作
  • 医疗辅助:理解医护人员指令 + 精确操作 → 递送医疗器械、协助护理

关键技术:开放世界泛化、人机交互、安全性保证

仓储物流

VLA模型使仓储机器人能够处理更复杂、更灵活的物流任务。

环节VLA优势传统方案痛点
智能拣选自然语言订单理解 + 视觉识别需要预定义所有SKU位置
动态码垛理解"易碎品放上层"等约束固定码垛模式,缺乏灵活性
异常处理识别损坏物品并自主决策需要人工介入

商业价值:减少人工标注成本,适应SKU快速变化,提升仓储自动化柔性

农业自动化与建筑施工

  • 农业:精准采摘(识别成熟果实)、植物护理(修剪、施肥)、自动化收获
  • 建筑:自动化砌砖、焊接作业、建筑材料搬运

5. 总结与展望

Vision-Language-Action (VLA) 模型代表了机器人技术的重要范式转变,通过统一视觉、语言和行动三个模态,实现了从自然语言指令到机器人控制的端到端学习。自2022年RT-1和2023年RT-2开创这一方向以来,VLA研究取得了爆发式进展。

VLA领域在架构、规模、能力和生态四个维度均取得了显著进展:动作表示从离散token演进到Flow Matching与测试时训练(TTT);模型参数从130M (RT-1) 扩展到多B/十亿级;数据从130k轨迹增长到60M+帧 (ProcCorpus-60M) 与1.5M+轨迹 (EO-Data);开源生态(OpenVLA, LeRobot)和评测基准(LIBERO, SimplerEnv)逐步成熟。

五大核心挑战的现状与展望如下:

挑战当前进展未来方向
表示多模态对齐成熟;Dense ECoT跨本体语义对齐;3D空间表示(点云/体素/占用);世界模型快速发展原生多模态统一token化;因果世界模型
执行CoT/ACoT/TTT超长时序推理增强;SSGAA状态空间动态门控;FAST/TurboVLA等端侧极速直连方案自适应架构;see-think-act一体化
泛化跨机器人预训练为标准;Sim-to-Real差距缩小;在线RL与测试时自适应结合(π*0.6, RoboTTT)形态无关表示;自主开放式进化闭环
安全约束+学习对齐双范式;可学习拒绝机制(RationalVLA)不确定性感知;主动风险规避;共享心智模型
数据与评测OXE/EO-Data/ProcCorpus-60M大规模数据集;SimplerEnv/VLABench标准化评测Simulation-First;Failure-Centric评测

RT-1S²-VLA,VLA的演进代表了具身智能研究范式的根本转变:从手工设计到数据驱动,从任务特定到通用能力,从离线学习到在线自适应与持续进化。ICLR/CVPR/ICML 2026收录数百篇VLA论文,标志着这一领域正步入爆发期。


声明:本文转载与下地址并加以修改,其中该文字外有重要论文导读,可供大家预览。
https://tingdeliu.github.io/VLA-Survey/#22-%E6%8C%87%E4%BB%A4%E8%B7%9F%E9%9A%8F%E8%A7%84%E5%88%92%E4%B8%8E%E9%B2%81%E6%A3%92%E5%AE%9E%E6%97%B6%E6%89%A7%E8%A1%8C


6. 参考资料


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐