系列文章目录


前言

 论文名称:《Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications》

引用:Kawaharazuka, K., Oh, J., Yamada, J., Posner, I., & Zhu, Y. (2025). Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications. IEEE Access, 13, 162467-162504.

论文链接:https://arxiv.org/abs/2510.07077

1. 系统梳理 VLA 模型,涵盖设计策略与架构演进、核心架构与模块、模态处理技术、学习范式;

2. 同时为支持 VLA 在实际机器人应用中的部署,综述常用机器人平台、数据采集方案、公开数据集、数据增强方法与评测基准。

3. 所有参考文献按训练方法、评测方式、模态与数据集分类,可在项目网站查看:https://vla-survey.github.io


引言

大语言模型(LLMs)与大视觉语言模型(VLMs)的快速发展,极大推动了自然语言处理与计算机视觉领域的变革。这些技术也延伸至机器人领域,LLMs 与 VLMs 被用于解读多模态输入、推理任务、执行上下文感知动作,为更具泛化性与可扩展性的机器人系统奠定基础。

早期工作将 LLMs 与 VLMs 和负责生成动作的底层机器人策略解耦。这类系统在有限预定义任务上有效,但通常依赖固定运动基元选择或模仿学习策略,难以泛化到更广泛任务。如何从当前观测与指令泛化到未知任务,仍是核心挑战。

为突破这一局限,越来越多研究聚焦视觉 - 语言 - 动作(VLA)模型。VLA 通过端到端框架联合学习视觉、语言、动作模态,让机器人执行更丰富任务,目标是实现跨任务泛化与跨机器人本体迁移,减少大量任务专属数据采集与训练成本,显著降低实际部署成本。因此,VLA 为更可扩展、易落地的机器人系统提供了可行路径。

尽管关注度持续提升,VLA 研究仍处早期阶段,架构与训练方法尚未标准化,难以形成统一认知。本文系统梳理 VLA 当前研究全貌,包括发展历程、模型架构、模态融合策略、学习范式。与以往仅关注动作分词或通用架构演进的综述不同,本文提供全栈式概览,覆盖软件与硬件全组件。

为明确范围,本文定义VLA 模型:以视觉观测与自然语言指令为核心输入,直接生成控制命令输出机器人动作的系统(定义 I.1)。可包含额外模态(如本体感知、深度信息),但视觉与语言融合为必要条件;排除仅用视觉语言做高层推理 / 任务规划、不落地到动作执行的方法(如高层策略仅从预训练技能库中选择索引的方案)。

本文整体结构如图 1 所示:第二章概述 VLA 研究的核心挑战;第三章梳理 VLA 模型设计策略与架构演进;第四章介绍核心架构组件与模态专用处理模块;第五章讨论关键训练策略与工程实现要点;第六章总结数据采集方法、公开数据集与数据增强;第七章给出实际部署指导,涵盖常用机器人平台、评测协议与当前实际应用;第八章基于系统综述结果为从业者提出建议;第九章探讨开放挑战与未来方向;第十章总结全文。

一、核心挑战

视觉、语言、运动模态的融合为通用机器人策略研发提供了可行路径,但稳健可部署的 VLA 模型仍受多项基础挑战制约,涵盖数据、本体差异、计算约束,在架构设计、训练策略与部署可行性上带来关键权衡。

1.1 数据需求与稀缺性

训练 VLA 模型需要大规模、多样化、标注精准的数据,实现视觉观测、自然语言指令与对应动作的对齐。但同时覆盖视觉、语言、动作三模态的数据集,在规模与多样性上均存在局限。

COCO Captions 等视觉语言数据集或网络语料具备广泛语言 grounding,但缺少机器人所需的动作对齐信息;而机器人演示数据集通常语言多样性有限,或局限于窄任务分布。

这种 mismatch 带来两大数据瓶颈:

  1. 在网络或视频数据上预训练的模型,因缺少运动 grounding 或领域差异,难以有效迁移到机器人任务;
  2. 高质量机器人演示(多通过遥操作采集)成本高、难以规模化,增加模态(触觉、听觉、3D 信息)会进一步加剧这一问题。

1.2 本体迁移

机器人本体形态差异极大:仅带机械臂、带轮式 / 腿式移动机构、关节配置、连杆结构、传感器类型与安装位姿、物理外观均显著不同。尽管 VLA 越来越多在多样本体数据上训练,但跨本体策略迁移仍是主要挑战。不同机器人的动作空间、本体感知观测空间差异显著,对应自由度、传感器模态、运动学结构的不同。

相关挑战是利用人体运动数据训练。机器人数据采集成本高,人体演示是有潜力的替代方案,但这类数据通常缺少显式动作标签,即便推理出动作,其形式与语义也和机器人动作差异巨大。与机器人间迁移类似,将人体演示映射为机器人可执行动作难度极高。

这些本体相关挑战为 VLA 研发提出核心问题:

  • 何种数据最支持跨本体泛化?
  • 如何表示形态与感知差异?
  • 如何训练模型以保证视觉语言在多样机器人与人体本体上的稳健 grounding?

1.3 计算与训练成本

VLA 模型输入为高维多模态(视觉、语言、动作),训练计算需求极大。尽管多数方法以预训练 VLM 为骨干,但仍需通过大规模机器人演示或仿真数据适配到机器人领域。从业者通常基于预训练模型,用任务专属高质量专家演示微调下游任务,而非从零端到端训练。

即便如此,适配与微调阶段计算成本仍很高,尤其处理长时序序列、高分辨率图像或 3D 点云、本体感知等额外模态时。当前主流的 Transformer 架构,随序列长度与输入维度扩展性差,进一步放大内存与计算开销。推理阶段,在资源受限的机器人平台上运行模型,面临延迟与内存占用挑战。这些计算负担限制了 VLA 系统的可及性与可部署性,推动高效模型架构与蒸馏方法的研究,以在不显著降低性能的前提下减少资源需求。

二、VLA 设计策略与演进

本节按历史演进,将视觉语言输入转换为机器人动作的主流接口策略分类(图 2),每类架构对应一代 VLA 系统,特征为多模态表示与控制的对齐方式。梳理从早期 CNN 模型,到 Transformer 模型、扩散策略、最终分层控制框架的演进。

2.1 早期基于 CNN 的端到端架构

端到端 VLA 的基础方案是CLIPort,最早融合 CLIP 提取视觉与语言特征的模型之一。它结合模态与 Transporter Network,端到端学习物体操作任务,定位待移动物体与放置位置。CLIPort 证明了借助 CLIP 预训练 VLM,联合训练视觉、语言、动作的可行性。但基于 CNN 与 MLP 的方案难以统一多样模态,扩展性受限。

2.2 基于 Transformer 的序列模型

为解决上述局限,DeepMind 发布Gato,通用智能体,也是机器人 Transformer(RT)系列的前驱。Gato 用单一 Transformer 模型执行文本对话、视觉问答、图像描述、游戏、机器人控制等广泛任务。它用 SentencePiece 分词语言指令,ViT 编码图像,解码器 - only Transformer 基于融合输入序列自回归生成动作。尽管 Gato 用单一网络实现多任务,但其机器人技能仍局限于窄范围(如机械臂堆叠方块)。

类似地,VIMA是编码器 - 解码器 Transformer 模型,让机器人遵循文本 + 目标图像组合的通用任务指令。先用 Mask R-CNN 检测物体,再用 ViT 将检测到的物体图像分词,边界框坐标单独嵌入为 token,文本指令用 T5 分词器分词。冻结 T5 编码器与 Transformer 解码器,自回归生成离散动作 token。VIMA 可执行广泛机器人任务,但所有实验均局限于仿真环境。

2.3 基于预训练 VLM 的统一实际部署策略

为支持可规模化实际应用,Robotics Transformer-1(RT-1) 作为实时通用控制模型推出,可执行广泛实际任务。RT-1 用 EfficientNet 处理图像序列,通过 Universal Sentence Encoder(USE)编码的语言特征做 FiLM 条件化,实现视觉与语言模态早期融合。提取的 token 经 TokenLearner 压缩,输入解码器 - only Transformer,非自回归输出离散动作 token。RT-1 在 700 任务、13 万 episode 大规模数据集上训练,被视为首个统一广泛机器人任务的 VLA。

随后推出RT-2,作为 RT-1 的继任者。它以 PaLM-E 或 PaLI-X 等预训练于大规模互联网数据的 VLM 为骨干,在互联网规模视觉语言任务与 RT-1 机器人数据上联合微调,获得强泛化到新环境的能力。这种基于 VLM 的设计成为 VLA 标准架构。

与之相对,RT-X证明在多机器人采集的数据集上训练,可研发更通用的 VLA,突破 RT-1 与 RT-2 的单机器人训练范式。

RT 系列延伸出多个变体:RT-Sketch(输入手绘草图)、RT-Trajectory(输入运动轨迹)、RT-H、Sara-RT、AutoRT 等。其中RT-H引入分层策略结构,基于 RT-2 架构,包含预测 “语言运动” 中间表示的高层策略,与基于其生成动作的低层策略。通过修改输入 prompt,模型可灵活切换生成语言高层动作与直接生成低层机器人动作。RT-H 通过顺序切换高低层策略,在长视野任务上性能提升。这类分层 VLA 架构成为后续模型的常用设计。

基于 RT 系列,OpenVLA作为开源 VLA 框架推出,架构高度对齐 RT-2,以预训练 VLM 为骨干。它采用基于 LLaMA 2(7B)的 Prismatic VLM,用 DINOv2 与 SigLIP 编码图像输入。在 Open-X Embodiment(OXE)数据集全量微调,性能超过 RT-2 与 Octo,成为 VLA 主流架构。

2.4 扩散策略

RT 系列之后推出的Octo,是首个采用扩散策略的 VLA,且以全开源实现受到关注。Octo 支持灵活目标指定(语言指令 + 目标图像),分别由 T5 编码器与 CNN 处理;观测输入同样用 CNN 编码图像、轻量 MLP 嵌入本体信号。所有 token 拼接为单一序列,添加模态专属可学习 token,输入 Transformer;最终扩散策略基于输出 readout token 生成连续动作。

2.5 扩散 Transformer 架构

RDT-1B作为机器人大规模扩散 Transformer 被提出。与此前仅在动作头应用扩散的方案不同,RDT-1B 以扩散 Transformer(DiT)为骨干,将扩散过程直接集成到 Transformer 解码器生成动作。RDT-1B 中,语言输入用 T5 编码器分词,视觉输入用 SigLIP 编码;扩散模型以带交叉注意力的扩散 Transformer 训练,条件于视觉与文本 token。为支持多模态条件化并避免过拟合,提出交替条件注入,每层 Transformer 交替以图像与文本 token 为 query。

2.6 流匹配策略架构

近期受 Transfusion 启发,π₀基于 PaliGemma,定制动作输出模块(action expert),让多模态模型同时处理离散与连续数据。action expert 借助流匹配,以最高 50Hz 速率生成动作。它接收机器本体感知输入与 Transformer 的 readout token,通过逆扩散过程生成动作。非自回归生成 token,而是并行输出完整动作块,实现平滑稳定的实时控制。

2.7 从视频学习隐动作

另一值得关注的方法是LAPA,利用无标注视频数据预训练,学习 VLA 模型的隐动作,让策略有效利用人体演示,对本体变化鲁棒,适配实际部署。该方法对图像 xₜ与 xₜ₊ₕ应用 patch 嵌入、空间 Transformer、因果时序 Transformer,计算差值;对差值应用 VQ-VAE,生成离散 token zₜ,与 xₜ一起重建 xₜ₊ₕ。整个网络联合训练,形成隐量化网络。基于 LWM-Chat-1M(7B),视觉与文本编码器保持冻结,输出 readout token 经 MLP 训练预测 zₜ;最终仅替换 MLP 组件为独立网络,直接输出机器人控制命令。

2.8 分层策略架构

最新一代 VLA 采用分层策略,衔接高层语言理解与低层运动执行。RT-H 是典型代表,引入高层控制器预测中间 “语言运动” 规划,再由低层控制器细化为具体动作。系统可动态切换生成符号动作与执行精细控制序列,提升长视野多步骤任务性能。

该设计在π₀.₅中得到扩展,结合高层动作 token 生成(FAST token)与低层流匹配训练控制器。预训练让符号动作与语言对齐,后训练通过连续动作解码保证平滑执行。GR00T N1整合多类元素:LAPA 的隐动作、RDT-1B 的扩散生成、π₀的流匹配控制器,统一为多阶段策略,跨机器人与任务泛化。分层架构成为当前可扩展自适应 VLA 的前沿方案,平衡语言 grounding 的抽象性与运动控制的精确性。

三、架构与基础模块

主流方案是感觉运动模型,联合学习视觉、语言、动作表示,输入图像与语言、直接输出动作,可采用扁平或分层结构、多样骨干网络。感觉运动模型是 VLA 的基础类型,此外还有世界模型、基于可及性(affordance)的模型等替代架构。

3.1 感觉运动模型

当前感觉运动模型有七种架构变体(图 4):

  1. Transformer + 离散动作 token将图像与语言表示为 token,输入 Transformer 预测下一动作(通常为离散 token),也包含用 CLS token 并通过 MLP 生成连续动作的模型。代表:VIMA、Gato,将多模态用语言分词器、ViT、MLP 等分词,输出离散化动作(如分箱值)。VIMA 采用编码器 - 解码器 Transformer,条件于多样任务模态;Gato 采用解码器 - only Transformer,自回归处理单一序列所有 token。与 VIMA、Gato 自回归生成动作 token 不同,RT-1 用 TokenLearner 压缩输入,解码器 - only Transformer 非自回归预测所有动作 token。实际中 48 个 token 输入 Transformer,提取最后 11 个 token 作为动作输出。该架构被 MOO、RT-Sketch、RT-Trajectory 等采用,也成为 Robocat、RoboFlamingo 等众多 VLA 的通用设计,因其简洁与可扩展性。

  2. Transformer + 扩散动作头在 (1) 结构基础上,于 Transformer 后添加扩散策略作为动作头。离散动作 token 通常缺少实时响应性与平滑性,这类模型用扩散模型实现连续稳定动作输出。代表:Octo、NoMAD。Octo 将图像与语言 token 作为单一序列输入 Transformer,再基于 readout token 应用扩散动作头;NoMAD 将语言输入替换为目标图像,对 Transformer 输出平均池化压缩,用向量条件化扩散模型。TinyVLA、RoboBERT、VidBot 也采用该架构。

  3. 扩散 Transformer将 Transformer 与扩散动作头融合,扩散过程直接在 Transformer 内执行,让模型直接基于图像与语言 token 执行扩散。代表:RDT-1B,通过与视觉语言 query 的交叉注意力生成动作 token 序列,再经 MLP 映射为可执行机器人动作。大型行为模型(LBM)也采用扩散 Transformer 架构,强调大规模多样化预训练的重要性。StructDiffusion、MDT、DexGraspVLA 等均采用该架构。

  4. VLM + 离散动作 token将 (1) 中 Transformer 替换为预训练于大规模互联网数据的 VLM,提升泛化能力。借助 VLM,模型可融入人类常识知识,支持上下文学习。代表:RT-2,以 PaLM-E 或 PaLI-X 等大 VLM 为骨干,输入图像与语言 token,输出下一动作离散 token。LEO、GR-1、RTH、RoboMamba、OpenVLA 等采用该架构。

  5. VLM + 扩散动作头在 (2) 基础上用 VLM 替换 Transformer,结合 VLM 的强泛化能力与扩散模型的平滑连续机器人动作命令生成能力。代表:Diffusion-VLA、DexVLA、ChatVLA、ObjectVLA 等。HybridVLA 进一步融合 (4) 与 (5),在单一模型内自回归生成离散 token,同时用扩散动作头生成连续动作。

  6. VLM + 流匹配动作头将 (5) 中扩散模型替换为流匹配动作头,提升实时响应性,同时保持平滑连续控制。代表:π₀,基于 PaliGemma,控制速率最高 50Hz。其他示例:GraspVLA、OneTwoVLA、Hume、SwitchVLA。π₀.₅整合 (4) 与 (6) 架构,在统一框架内支持离散 token 与流匹配。

  7. VLM + 扩散 Transformer结合 VLM 与 (3) 所述扩散 Transformer。VLM 通常作为高层策略(系统 2),扩散 Transformer 作为低层策略(系统 1),扩散 Transformer 可采用扩散或流匹配实现。代表:GR00T N1,通过扩散 Transformer 对 VLM token 做交叉注意力,经流匹配生成连续动作。该设计也用于 CogACT、TrackVLA、SmolVLA、MinD。

3.2 世界模型

世界模型可基于当前输入预测未来观测或隐表示,其前向预测能力逐渐成为 VLA 系统的核心,支持规划、推理与控制。本节将这类方法分为三类(图 5):

  1. 世界模型中的动作生成与直接生成动作的模型不同,世界模型生成未来视觉观测(图像 / 视频序列),用于指导动作生成。例如 UniPi 采用受 Video UNet 启发的扩散模型,从初始观测图像与任务指令生成视频序列;再由逆动力学模型(IDM)将预测图像序列转换为低层动作。视觉预测 + IDM 控制是基于模型的 VLA 常用设计。DreamGen、GeVRM 预测未来视觉表示用于动作生成;HiP 结合 LLM 做子任务分解,执行更长视野行为。Dreamitate 微调 Stable Video Diffusion,合成人类使用工具操作任务的视频;再通过 MegaPose 估计工具 6-DoF 位姿,让机器人跟随工具位姿。与生成完整视频序列不同,SuSIE 用 InstructPix2Pix 生成抽象子目标图像,从初始观测与任务指令生成中间目标图像,用于条件化扩散策略。CoT-VLA 采用类似方法做思维链推理。LUMOS 也生成目标图像,但使用接收低层动作命令的世界模型。LUMOS 中策略通过与学习到的世界模型交互,模仿专家演示。除视频与图像生成,近期多项工作利用光流或特征点跟踪。光流与特征跟踪与机器人本体无关,为利用人体演示提供更泛化的方式。AVDC 与 UniPi 类似生成视频序列,用 GMFlow 计算每帧光流,将目标物体 SE (3) 刚体变换估计建模为优化问题。ATM 预测任意特征点未来轨迹(训练用 CoTracker),训练 Transformer 在轨迹引导下生成动作。Track2Act 预测初始与目标图像间特征点轨迹,优化 3D 刚体变换,学习残差策略细化运动。LangToMo 从初始图像与任务指令预测未来光流,用 RAFT 监督光流,将预测映射为机器人动作。MinD 采用端到端方案,联合学习视频与动作预测,结合低频视频生成器(从初始图像与指令在隐空间预测未来视觉观测)与 DiffMatcher(将预测转换为时序特征,供高频动作策略高效生成动作序列)。PPI 接收视觉语言输入,预测每一关键帧夹持器位姿与物体位移(Pointflow),作为动作生成的中间条件。

  2. 通过世界模型生成隐动作这类 VLA 借助世界模型从人体演示中学习隐动作表示。例如 LAPA(详见第三章)联合学习从当前与未来图像元组预测动作表示,以及基于当前图像与隐动作生成未来帧。双目标让模型可在无显式标签的数据集(如人体视频)上训练。学习到隐动作后,用这些 token 训练 VLA 策略,再替换动作头微调输出机器人动作。LAPA 被用于 GR00T N1 与 DreamGen 预训练。GO-1、Moto 采用类似方法。UniVLA 用语言输入扩充 DINOv2 隐空间,两阶段训练解耦任务无关与任务相关隐动作 token。UniSkill 采用基于图像编辑的方法,从 RGB-D 图像提取隐动作,作为扩散策略的条件。

  3. 带隐式世界模型的感觉运动模型这类 VLA 同时输出动作与未来观测预测以提升性能。GR-1 集成预训练 MAE-ViT 编码器、CLIP 文本编码器、Transformer,在 Ego4D 数据集训练预测未来观测图像,再微调从图像、语言、本体感知输入联合预测动作与未来帧。GR-1 将类似视频预测模型的观测预测融入标准 VLA 框架,任务成功率提升。GR-2 在 GR-1 基础上扩展训练数据集,架构优化(VQGAN 图像分词、条件 VAE 动作生成)。GR-MG 用基于 InstructPix2Pix 的模型生成中间目标图像,嵌入 GR-1 风格框架。GR-3 实现分层结构,集成 VLM(Qwen2.5-VL)与带流匹配的扩散 Transformer 生成动作。3D-VLA 用 Stable Diffusion 预测 RGB-D 图像、Point-E 预测点云,扩展该方向。FLARE、UVA、WorldVLA、ViSA-Flow 等模型将完整视频预测集成到感觉运动模型。

3.3 基于可及性(Affordance)的模型

可及性指环境为智能体提供的动作可能性,相对其物理与感知能力。在机器人中,该概念常适配表示物体或场景的可动作属性,即给定机器人本体与空间 / 功能线索下可执行的动作。基于可及性预测的 VLA 当前分为三类(图 6):

  1. 用 VLM 预测可及性并生成动作预训练 VLM 常用于估计可及性并生成对应动作。例如 VoxPoser 用 GPT-4、OWL-ViT、Segment Anything 从语言指令生成可及性与约束地图,通过模型预测控制(MPC)指导动作生成。KAGI 用 GPT-4o 从带叠加网格的俯视与侧视图像推理目标关键点序列,为强化学习提供指导。LERFTOGO 用基于 CLIP 与 DINO 提取视觉特征训练的 NeRF 构建 3D 场景(LERF),用 CLIP 文本编码器计算语言指令与视觉特征相似度,高激活区域转换为 3D 点云,再由 GraspNet 排序抓取位姿。Splat-MOVER 用高斯溅射替代 NeRF 加速场景构建,融入 VRB 模型的可及性热图,效率与性能提升。

  2. 从人体数据集提取可及性这类工作聚焦从无标注人体运动视频提取可及性,支持机器人动作生成的可扩展学习。VRB 从 EPIC-KITCHENS 数据集演示视频学习接触点与手部轨迹,用 HandObject Detector(HOD)识别手部位置与接触状态,跟踪图像平面后续手部运动,自动构建训练数据集,提取数据投影到 3D 生成机器人动作。HRP 从 Ego4D 数据集提取手部、接触、物体可及性标签,训练 ViT 模型预测标签,用隐表示做模仿学习。VidBot 将 2D 可及性表示扩展到 3D,支持机器人零样本部署。

  3. 感觉运动模型与可及性模型融合这类方法将可及性预测集成到 VLA。CLIPort 从视觉语言输入预测物体与环境可及性,基于可及性生成动作。RoboPoint 构建视觉语言模型,识别可及性点(图像中机器人应执行动作的位置),投影到 3D 生成对应动作。RoboGround 在拾取放置任务中预测目标物体与放置区域掩码;RT-Affordance 输出关键时刻末端执行器位姿;A0 预测物体接触点轨迹;RoboBrain 将可及性区域识别为边界框。这些模型将可及性信息作为动作生成的条件输入。Chain-of-Affordance 受思维链推理启发,自回归预测物体位置、抓取点、放置位置等一系列可及性,再生成动作,性能提升。

3.4 数据模态

VLA 同时处理多模态:视觉、语言、动作。本节梳理前沿系统对各模态的处理方式。

  1. 视觉VLA 视觉特征提取最常用 ResNet 或 Vision Transformer(ViT),通常在 ImageNet、LAION 等大规模数据集预训练,ResNet 也常从零训练。部分方法直接将 ResNet 应用于图像,经 MLP 转换为 token;部分先将图像分 patch 再送入编码器。此外,MAE 预训练 ViT、EfficientNet 也常用。CLIP、SigLIP 等视觉语言模型也广泛使用。CLIP 通过对比学习学习视觉文本联合表示,SigLIP 移除 softmax 约束、降低批大小敏感度,性能提升。这些模型常与自监督视觉模型 DINOv2 配合使用。CLIP 曾是主导选择,SigLIP 与 DINOv2 现已成为 VLA 视觉特征提取的首选。OpenCLIP、EVA-CLIP 也被多项工作采用。此外,VQ-GAN、VQ-VAE 常用于将图像离散化为 token 序列。与 ViT/CLIP 生成连续嵌入不同,这类模型生成离散 token,与 LLM 输入格式更自然对齐。生成的视觉 token 常进一步处理以融合其他模态或缩短长度。知名示例:Flamingo 的 Perceiver Resampler,通过交叉注意力用固定长度可学习隐 token 压缩视觉信息;BLIP-2 的 Q-Former 结合交叉注意力与自注意力提取任务相关信息;QT-Former 融入时序结构;TokenLearner 通过空间摘要减少 token 数量。这些压缩融合技术在 VLA 中广泛应用。部分 VLA 工作采用以物体为中心的特征(边界框坐标、裁剪区域嵌入),而非仅依赖连续特征图。这类特征通常用物体检测、分割、跟踪模型提取,包括 Mask R-CNN、OWL-ViT、SAM、GroundingDINO、Detic、Cutie。

  2. 语言VLA 语言分词通常继承底层 LLM 骨干的分词器,如 T5 分词器、LLaMA 分词器。若基础模型非预训练 LLM,通常用字节对编码(BPE)等子词算法或 SentencePiece 工具分词。语言编码方面,VLA 采用各类文本编码器将自然语言指令嵌入向量表示,包括 Universal Sentence Encoder(USE)、CLIP 文本编码器、Sentence-BERT、DistilBERT。这些语言嵌入常通过 FiLM 条件化等技术用于视觉特征条件化。以 VLM 为骨干的架构中,视觉信息直接集成到 LLM 组件,主流选择包括 LLaMA 2、Vicuna、Gemma、Qwen2、Phi-2、SmolLM2、GPT-NeoX、Pythia。

  3. 动作端到端 VLA 模型的动作表示主要分为几类(排除可及性、世界模型等专用架构):

    • 分箱离散动作 token:VLA 最常用动作表示方式,将动作空间每一维度离散为分箱(通常 256),每个分箱 ID 视为离散 token。例如带 PaLI-X 的 RT-2 直接输出数字 token 作为动作;带 PaLM-E 的 RT-2 与 OpenVLA 在词表中保留 256 个最低频 token 表示动作。这类模型通常用交叉熵损失训练,采用与 LLM 类似的自回归解码。部分模型采用非自回归解码,插入 readout token 并行生成所有动作 token,或把最后几个输出 token 作为离散化臂式与底盘动作(如 RT-1)。标准分箱的已知缺陷是 token 长度增加,限制控制频率。为缓解该问题,FAST 沿时序轴应用离散余弦变换(DCT),量化频率分量,用 BPE 压缩,显著减少 token 长度,推理速度快于传统分箱。

    • token 解码为连续动作:Transformer 生成的 token 经 MLP 映射为连续动作,通常用 L2/L1 损失训练;夹持器开合等二元输出常用二元交叉熵。OpenVLA-OFT 指出 L1 损失性能更优。MLP 解码器可替换为 LSTM 融入时序上下文,或高斯混合模型(GMM)建模动作空间随机性。本体感知 / 力信号常集成到解码模块(MLP/LSTM)。非自回归变体常用池化(平均 / 最大池化)将多 token 压缩为单一动作表示,如 RoboFlamingo。OpenVLA-OFT 扩展预测多步动作块,轨迹更平滑时序一致。

    • 扩散 / 流匹配连续动作建模:扩散模型与流匹配成为 VLA 生成连续动作的主流方案,如 Octo 与 π₀。这类模型非自回归生成动作,控制更平滑可扩展。流匹配尤其适合实时应用,推理步骤少于传统扩散。部分模型将扩散作为 Transformer 后的外部动作头,近期设计越来越多地将扩散过程集成到 Transformer 内部,如扩散 Transformer 架构。训练与推理通常基于 DDPM 与 DDIM,TUDP 等方法在每一步保证去噪一致性,稳定性与效率提升。

    • 从网络规模数据学习隐动作表示:在无显式动作时(如人体演示),利用世界建模获取隐动作表示。借助网络规模视频数据,模型可在更大数据集训练,学习更泛化的 VLA。LAPA、Moto、UniVLA、UniSkill 证明该方法有效(详见 4.2 节)。

    • 跨本体动作表示:本体多样性带来处理机器人专属模态(动作、本体感知)的挑战。Open X-Embodiment 项目首个解决该本体挑战。基于 RT-1 与 RT-2 架构,该工作用统一格式标准化不同机器人数据集:单摄像头输入、语言指令、7 自由度动作(位置、姿态、夹持器开合)。该方法证明,融合多样本体机器人数据,比单一本体训练显著提升 VLA 性能。此外,有工作将异构本体的动作与观测归一对齐到共享第一人称视角,仅用观测与目标图像实现多机器人统一控制。但这类方法难以统一处理观测 / 控制输入差异极大的机器人(如机械臂、移动机器人、腿式机器人)。为解决该局限,CrossFormer 首先用模态专属分词器处理异构传感器观测(视觉、本体感知、任务描述),所有 token 组装为统一序列,缺失模态做掩码;序列由共享解码器 - only Transformer 处理,readout token 提取任务相关表示,再输入机器人专属动作头(单臂、双臂、导航、四足)生成对应动作。UniAct 提出通用动作空间(UAS),实现跨本体共享离散码本,Transformer 从码本预测离散动作 token,再由本体专属解码器转换为连续动作。通过明确定义共享原子动作空间,UniAct 促进知识迁移与跨多样机器人本体复用。此外,UniSkill 与 LAPA 类似,除机器人数据外,从无标注人体视频数据提取隐技能表示,融入人体演示知识,实现更泛化的 VLA。

    • 与本体无关框架如 LangToMo、ATM 利用中间表示(光流、特征点轨迹)实现跨本体学习,无需直接对齐动作空间。

  4. 其他模态除视觉、语言、动作外,现代 VLA 模型越来越多地融入额外模态,增强感知与交互能力。本节介绍三类与 VLA 系统相关的传感模态:音频、触觉、3D 空间信息。

    • 音频:Unified-IO 2、SOLAMI、FuSe、VLAS、MultiGen 等工作将音频作为输入。音频编码器通常以频谱图或梅尔频谱图为输入,用 ResNet/ViT-VQGAN 转换为音频 token;基于 RVQ-VAE 的 SpeechTokenizer、音频频谱图 Transformer(AST)、Whisper 编码器也常用作预训练模型。这些编码器让系统利用无法轻易转录为文本的音频信息做机器人决策。解码常用 SoundStorm 或 VQGAN 解码器。简单直接的方案(如 RoboNurseVLA)是用标准自动语音识别(ASR)系统将音频转换为文本。

    • 触觉传感器:FuSe、TLA、VTLA、Tactile-VLA 融入触觉信息作为输入。常用 DIGIT、GelStereo 2.0 等输出图像的触觉传感器,触觉图像用 ViT 编码,或经预训练 Touch-Vision-Language(TVL)模型分词。这让视觉与触觉信息融合,学习接触丰富任务(如插孔)的精细操作技能。ForceVLA 融入通用 6 轴力 - 扭矩传感器,力感知专家混合融合模块将 6 轴力 - 扭矩数据导出的力 token 与预训练 VLM 提取的视觉语言特征融合,经动作头生成动作。

    • 3D 信息:融入 3D 信息让机器人更精准感知环境、规划动作。3D 感知具体介绍:(a) 深度图像、(b) 多视角图像、(c) 体素表示、(d) 点云。

      • 深度图像:融入深度信息的常用策略是用标准视觉骨干(ViT/ResNet)分词深度图像,与 RGB 图像处理方式一致。无直接深度感知时,常用 Depth Anything、ZoeDepth 等单目深度估计模型从 RGB 输入预测深度。SpatialVLA 是利用深度图像的代表方法,引入自我 3D 位置编码:先用 ZoeDepth 从 RGB 输入估计深度图,通过相机内参计算每像素 3D 坐标,对 3D 坐标做正弦位置编码与 MLP 处理,结果与 SigLIP 提取的 2D 视觉特征相加,组合表示作为自我 3D 位置编码输入 LLM。此外,HAMSTER、RationalVLA、OpenHelix 融入 3D Diffuser Actor,基于 3D 空间的扩散动作头,处理 RGB-D 输入生成动作。

      • 多视角图像:多项工作尝试从多视角图像提取 3D 信息。例如 GO-1 直接输入多视角 RGB-D 图像,促进 3D 结构隐式理解。3D-VLA 将 Q-Former(详见 4.D1)扩展处理 RGB-D 与多视角输入。Evo-0 采用 Visual Geometry Grounded Transformer(VGGT)从多视角 RGB 图像提取隐式 3D 几何信息。RoboUniView、RoboMM 利用 UVFormer,预训练模型接收多视角 RGB-D 图像与对应相机参数,输出 3D 占用网格,编码器输出特征作为下游处理 token。此外,SAM2Act、HAMSTER 使用 Robotic View Transformer-2(RVT-2),将点云 / 深度信息重投影到虚拟视角(常用正交投影生成三张图像),每张图像由 ViT 分词。类似方法也用于 OG-VLA、BridgeVLA。总体出现两种主要方案:融合多视角信息,将 3D 数据投影到正交图像简化处理。

      • 体素表示:体素表示是编码 3D 信息的另一广泛采用方案。OccLLaMA、OpenDriveVLA 将 3D 占用网格转换为 2D 鸟瞰(BEV)特征图,再用 VQ-VAE 分词。多项方法直接处理三维体素网格,如 iManip 用 3D UNet 提取特征,VidBot 先将体素网格转换为截断符号距离场(TSDF),再用 3D U-Net 处理。体素表示与图像结构类似、兼容卷积处理,在各类研究中广泛采用。

      • 点云:常用方案是用 PointNet、PointNet++、PointNext、Uni3D ViT 等预训练基于点的 Transformer 分词点云,这类骨干在 SOFAR、LEO、PPI、LMM-3DP、GeneralFlow、FP3、DexTOG 等模型广泛采用。部分方法选择任务专属训练:StructDiffusion 使用 Point Cloud Transformer(PCT),PointVLA 采用 PointCNN,两种模型均从零训练。此外,LERF-TOGO、Splat-MOVER 将 NeRF / 高斯溅射重建的点云与 CLIP 提取的语义特征融合,这些增强表示与 GraspNet 配合生成抓取规划。

3.5 新兴技术

近期 VLA 研究凸显两大新兴方向:分层架构思维链(CoT)推理。两种方法均在语言指令与低层动作间引入结构化中间表示,实现更鲁棒的规划、分解与推理,详细介绍如下:

  • 分层架构:最基础方案是 Atomic Skill 与 LMM-3DP,用现有 VLM 作为高层策略,将任务指令分解为子任务,子任务描述传递给作为低层策略的 VLA。低层策略接收更简洁清晰的语言输入,比直接处理复杂无结构指令更可靠执行动作。Hi Robot 自定义高层策略,不依赖现有 VLM。NAVILA、HumanoidVLA 采用强化学习(RL)训练的低层策略,实现精细运动控制。RT-H、LoHoVLA 采用更集成的方案,在单一网络内联合训练高低层策略,通过切换输入 prompt,灵活将任务指令分解为子任务、将子任务转换为对应动作。该方法进一步扩展到 π₀.₅,在同一网络内统一子任务分解、离散动作 token 生成、连续动作生成。任务分解与 VLA 模型融合成为实现更灵活可扩展机器人行为的有前景方向。此外,FiS-VLA、OpenHelix、DP-VLA 提出通过隐空间连接高低层策略,不将中间表示明确定义为子任务。Tri-VLA 集成预训练视觉语言模型做场景理解与 Stable Video Diffusion,生成捕捉静态观测与未来动态的视觉表示,作为输入输入扩散 Transformer,通过交叉注意力生成动作。

  • 思维链(CoT)推理:思维链推理概念上与分层方法类似,但引入独特机制,已集成到 ECoT、CoT-VLA 等 VLA 模型。ECoT 解决典型 VLA 缺少中间推理的关键局限,在观测、指令、动作生成间引入分步过程,增强规划与推理能力。具体而言,ECoT 在生成最终动作序列前,自回归预测任务描述、子任务、物体位置等中间表示。CoT-VLA 生成子目标图像,在更视觉接地的任务上提升成功率。ECoT-Lite 通过训练时选择性丢弃部分推理组件,降低推理带来的延迟。Fast ECoT 进一步复用中间推理输出,并行化推理与动作生成,动作执行更快。

四、训练策略与实现

VLA 模型训练方法分为监督学习自监督学习强化学习三类。本节总结各方法核心特征与代表工作。

4.1 监督学习

多数 VLA 模型在图像 - 语言 - 动作配对数据集上以监督学习训练。因多数 VLA 基于 LLM 构建,训练常建模为下一个 token 预测任务。动作损失函数选择取决于动作头架构(MLP、扩散模型、流匹配网络),保证各模型类型的合适监督。

VLA 训练通常分为两阶段:预训练后训练。多数情况下,先使用网络规模数据预训练的 LLM/VLM 作为初始骨干训练。部分模型从零训练,更常见的是用已获取常识知识的预训练 VLM 初始化,提升泛化能力。预训练通常采用人体演示、异构机器人演示、机器人规划相关 VQA 数据集。与 LLM 类似,数据规模在 VLA 预训练中至关重要,大规模多样化数据集可研发跨任务与本体泛化能力更强的 VLA 模型。预训练阶段,预训练 VLM 通常全量微调以适配机器人相关领域。

预训练后,使用任务 / 机器人专属数据集进行后训练。该阶段数据质量比数量更重要,数据集通常比预训练更小。微调策略因实现而异:部分情况全模型微调,部分仅适配动作头。

此外,上下文学习(最初为 LLM 开发)也被适配用于 VLA 系统。非显式微调演示数据,上下文 VLA 模型在测试时基于少量人体遥操作轨迹推断合适动作。例如 ICRT 提出框架,输入 1-3 个遥操作演示作为 prompt,模型零样本生成对应机器人动作。

4.2 自监督学习

自监督学习偶尔融入 VLA 训练,主要有三个目的:

  • 模态对齐:学习 VLA 模型跨模态的时序与任务级一致性。例如 TRA 用对比学习在共享隐空间对齐当前与未来状态表示,实现时序对齐;类似地,通过对比目标将语言指令嵌入与目标图像嵌入对齐,实现任务对齐。

  • 视觉表示学习:用掩码自编码(如 MAE)、对比学习(如 CLIP)、自蒸馏(如 DINOv2)等技术从图像 / 视频提取视觉特征,这些预训练模型广泛作为 VLA 的基础视觉编码器。

  • 隐动作表示学习:借助自监督技术学习动作嵌入(详见 4.2 与 4.D3)。从初始与目标图像提取隐动作,用初始图像与提取的隐动作重建目标图像,模型无需显式标签即可学习有意义动作表示。该方法可扩展性强,适合大规模无标注数据集。

4.3 强化学习

尽管 VLA 通常通过模仿学习训练,仅模仿学习面临无法处理新行为、需要足够大规模高质量专家演示的挑战。为解决这些问题,多项此前工作探索用强化学习(RL,如 PPO、SAC)微调 VLA 或训练低层策略。这类方法大致分为两类(图 7):

  1. 用 RL 改进 VLA近期工作用 RL 提升 VLA 模型的鲁棒性、适应性与实际性能。多项方法以任务成功 / 失败为奖励信号,用 RL 微调 VLA。iRe-VLA 通过反复组合专家数据监督微调(SFT)、基于成功 / 失败奖励对动作头在线 RL、再用专家数据与在线学习收集的成功轨迹做 SFT,实现高性能。ConRFT 在少量演示上做模仿学习,离线 RL 学习 Q 函数,再通过人类干预在线微调策略。该方法受 SERL、HIL-SERL 启发,这些是为实际机器人学习设计的无重置、离线 RL 方法。VLA-RL 引入机器人过程奖励模型(RPRM),用基于夹持器动作与任务进度的密集伪奖励替代稀疏二元奖励,实现更稳定的 PPO 训练。RLDG 用 HIL-SERL 收集的成功轨迹微调 OpenVLA、Octo 等大型 VLA 模型,将多个专家策略集成到统一 VLA。MoRE 在 VLA 中引入专家混合(MoE)结构,支持 token 级专家选择与 RL 细化。RLRC 压缩 OpenVLA(剪枝 90% 参数),通过 SFT 恢复性能,再用 RL 基于任务级反馈最终微调。这些研究证明,RL(尤其结合专家演示或人类干预时)可显著提升 VLA 系统在实际环境的灵活性与可靠性。近期,为解决通过扩散链反向传播可能带来的不稳定性,DSRL 提出在扩散策略的隐噪声空间应用 RL。该方法在 RL 微调期间避免更新底层 VLA 模型参数,转而学习隐噪声分布,让模型从有信息的初始噪声向量而非标准高斯分布采样。值得注意的是,DSRL 证明仅用 10K 样本即可将 π₀成功率从约 20% 提升至近 100%。

  2. VLA 作为高层策略、RL 用于低层控制这类方法将高层决策委托给 VLA,低层控制由 RL 训练的策略处理。Humanoid-VLA 用 VLA 生成高层命令,由 RL 训练的全身控制器执行,用于人形机器人。NAVILA 采用类似策略,用 RL 将 VLA 的速度命令转换为腿式机器人扭矩控制。更先进的系统 SLIM 针对带四足底盘与机械臂的移动操作机器人,先用带特权输入(脚步规划、物体位置、子任务标识)的 RL 训练教师策略,生成底盘与臂轨迹;再通过模仿学习将教师策略蒸馏为学生 VLA,实现从图像与语言到动作的端到端映射。RPD 采用互补方案,用预训练 VLA 指导 RL 探索,VLA 作为教师塑造学习过程,而非高层控制器。

    此外,LUMOS 在世界模型隐空间中进行模仿学习,采用内在奖励引导的强化学习,量化隐空间中与专家轨迹的偏差。DexTOG 用扩散模型生成多样抓取位姿,用强化学习评估各候选位姿是否带来任务成功,通过成功轨迹迭代微调,扩散模型学习适合后续任务的物体专属抓取位姿。

尽管越来越多 VLA 方法融入 RL,多数此前工作仍局限于仿真或简化实际设置,原因是 RL 样本效率低、探索不安全、计算效率低。

4.4 训练阶段

VLA 模型训练通常包含多个阶段,各阶段针对特定学习目标。预训练旨在获取通用能力,促进跨多样机器人本体的迁移能力。当使用预训练视觉语言模型(VLM)作为 VLA 骨干时,必须适配机器人领域,有效将语言与视觉理解接地到动作。随后是后训练,用高质量机器人演示数据进一步精调模型,提升特定下游任务性能。本节按阶段概述代表训练策略, highlight 近期 VLA 系统常用的关键数据源、模型骨干与适配技术。

  1. 预训练预训练对塑造 VLA 模型的泛化能力与语义接地至关重要。本小节概述近期预训练流程的关键策略与设计选择, highlight 大规模多模态数据、强大 VLM 骨干、训练稳定技术如何助力有效策略初始化。

    • 数据规模与来源:训练数据的规模与异构性显著影响 VLA 模型跨多样场景、物体、任务的泛化能力。近期模型越来越多地利用融合机器人演示、网络规模视觉语言语料、结构化标注的大规模数据集,提升语义理解与视觉运动接地能力。π₀在多样本体与任务的数百万实际轨迹上训练。其继任者 π₀.₅扩展该方法,除机器人数据外,还融入常用于目标检测与视觉推理的大规模视觉语言数据集(如 COCO、VQA),模型用边界框预测、图像描述、子任务语言生成、离散动作预测等多任务辅助交叉熵损失训练。类似地,Gr00T N1 引入辅助边界框损失,提升空间定位与可及性检测。这些边界框标签用 OWL-ViT 获取,让模型可从弱监督视觉数据学习。Gr00T N1 进一步利用自我中心人体视频,提取隐动作表示监督 VLA 模型,此外引入仿真生成的多样合成轨迹,通过 COSMOS 世界模型转换为真实视觉观测,提升模型学习长视野多阶段行为的能力。这些方法证明 VLA 训练数据在规模、结构、模态上日益丰富。通过在动作、接地、推理任务上联合训练,现代 VLA 获取更丰富的表示,支撑鲁棒策略学习与泛化。

    • VLM 骨干:近期 VLA 模型的通用实践是利用在大规模网络数据预训练的视觉语言模型(VLM)。该策略让模型继承广泛的视觉与语言先验,包括常识知识、语义接地、推理能力。通过将低层感知接地与动作策略学习解耦,预训练 VLM 提供灵活基础,仅需少量额外监督即可适配多样机器人任务。现介绍 VLA 模型采用的代表 VLM 骨干。PaLM-E(谷歌开发)与 PaLI-X 一起作为 RT-2 及其后续 VLA 模型的骨干。PaliGemma 融合 Gemma 与 SigLIP,用于 Physical Intelligence 开发的 π₀与 π₀.₅。PrismaticVLM 基于 LLaMA 2,融合 DINOv2 与 SigLIP,广泛用于当前 VLA 模型,包括 OpenVLA 与 CogACT。Qwen2.5-VL(阿里巴巴开发)融合 Qwen2.5 LLM 与基于 ViT 的视觉编码器,用于 NORA、Interleave-VLA、CombatVLA 等多种 VLA 模型。LLaVA 集成基于 LLaMA 的 LLM Vicuna 与 CLIP 的视觉编码器(通过 MLP),广泛用于 OpenHelix、OE-VLA、RationalVLA 等模型。Gemini 2.0(谷歌开发)包括用于机器人问答的 Gemini Robotics-ER、扩展到 VLA 应用的 Gemini Robotics。Fuyu-8B:QUAR-VLA、MoRE。OpenFlamingo:RoboFlamingo、DeeRVLA、RoboMM。BLIP-2:3D-VLA。LLaMA3.2:FOREWARN。AnyGPT:SOLAMI。Phi:TraceVLA、UP-VLA、HybridVLA。Molmo:UAV-VLA。VILA:NaVILA、HAMSTER。InternVL:GO-1。Eagle-2:GR00T N1。Chameleon:WorldVLA。这证明当前 VLA 领域采用的 VLM 骨干极为多样。

    • 梯度隔离:VLA 模型训练的新兴趋势是阻止梯度从动作头流入视觉语言骨干。允许随机初始化动作头的梯度传播可能破坏已学习的表示,导致训练不稳定低效。此前工作证明这种梯度隔离显著提升训练稳定性与效率。GR00T N1.5 也完全冻结 VLA 模型,可能出于类似原因。RevLA 受模型合并启发,通过逐步回滚骨干权重解决灾难性遗忘。

    • 稳定性与效率启发式方法:Re-Mix 基于超额损失(量化各领域策略改进潜力)调整单个数据集的采样权重。

  2. 后训练与依赖大规模多样化数据集的预训练不同,后训练需要高质量、机器人与任务专属数据。全量微调通常需要大量计算资源,替代策略是冻结骨干权重、仅微调动作头。另一方法是低秩适配(LoRA),计算高效微调,性能下降极小。此外,BitVLA 引入基于蒸馏的方法量化视觉编码器,实现内存高效训练。具体而言,通过蒸馏将全精度编码器压缩为 1.58 比特量化学生模型,该策略在性能极小下降的前提下节省大量内存,助力资源受限系统高效部署。

    • 冻结骨干 vs 全量微调:将预训练 VLM 适配机器人任务时,关键选择是冻结视觉语言骨干还是全量微调。该决策涉及多维度基本权衡:

      1. 计算效率:冻结骨干仅需计算动作头梯度,GPU 内存与训练需求大幅降低,支持消费级 GPU 训练;全量微调需要大量计算资源,通常需要大型 GPU 集群与长时间训练,限制多数研究者的可及性。

      2. 领域适配:全量微调通过端到端优化联合学习感知与控制,让模型适配机器人专属视觉模式与领域专属知识;冻结骨干无法适配这些领域偏移,可能在预训练表示与机器人感知需求间产生差距。

      3. 性能 - 资源权衡:数据与计算资源充足时,VLA 模型全量微调通常获得最高任务专属性能,但计算成本巨大。为缓解该问题,低秩适配(LoRA)等参数高效适配方法提供有吸引力的替代方案。例如 OpenVLA 证明 LoRA 可实现有竞争力的性能,同时显著降低内存与计算需求,支持消费级 GPU 而非大型集群训练。近期工作也探索中间策略,如分步解冻或特定层选择性微调,平衡适配能力与效率。

      4. 知识保留:冻结骨干保留从网络规模数据学习的丰富视觉语言表示,避免灾难性遗忘通用视觉语言能力;全量微调虽让模型专精机器人视觉特征与动作接地语言,但可能破坏预训练表示,丢失有益于零样本泛化的宝贵通用知识。

4.5 推理

为解决实际执行延迟问题,实时分块(RTC)引入异步动作生成策略。RTC 通过固定已执行动作、同时生成序列后续动作缓解延迟。该方法用软掩码保持与过去轨迹的时序一致性,同时支持基于更新传感输入的动态重规划。此外,DeeR-VLA 训练为 Transformer 每一层提供动作预测,若连续两层预测动作差异小,跳过剩余层加速推理。VLA-Cache 通过识别静态 token、复用前期计算的特征提升推理速度。

五、数据集

5.1 VLA 数据采集

训练 VLA 模型需要大量高质量数据。本节概述 VLA 研究采用的主要数据采集策略。仿真数据采集见 6.B 节,本节聚焦基于实际设备的方法。

  • 遥操作:该方法由人类操作员实时直接控制机器人,同步记录演示,采集高质量轨迹。该方法是众多 VLA 数据集的基础。例如 ALOHA 采用单侧遥操作设置,双腕 WidowX 250 作为主端、双腕 ViperX-300 作为从端,从端机器人模仿主端运动,采集精准操作数据。Mobile ALOHA 将系统安装在移动底盘上,采集移动操作演示。ALOHA 框架历经多次迭代,ALOHA 2 引入升级硬件组件(升级夹持器、重力补偿机制)、开源硬件与仿真环境。基于升级平台,ALOHA Unleashed 探索大规模模仿学习。此外,Bi-ACT 引入双侧控制,主从机器人交互更灵敏;GELLO 通过按比例调整连杆长度的缩小从端机器人适配系统。与主从方法(主从端均需机器人)不同,多项此前工作提出降低人类操作员负担与遥操作系统整体成本的方法。例如 AnyTeleop 通过单 RGB 相机用 MediaPipe 估计人类手部位置与姿态,通过 CuRobo 重定位到机器人实现遥操作。ACE 结合外骨骼设备精准手腕跟踪与 Mediapipe 手部姿态估计,实现精准遥操作。针对人形机器人应用,OpenTelevision 利用 Apple Vision Pro 的手部与头部姿态估计,支持遥操作与主动视觉操作。Bunny-VisionPro 也采用 Apple Vision Pro,更强调触觉反馈与实时系统集成。除这些方法外,数据采集也可通过 3D 鼠标、游戏手柄等更直接的控制方式完成。这些替代方案简化设置,无需可穿戴或基于视觉的姿态估计系统,但复制自然人体运动的保真度可能更低。

  • 代理设备数据采集:直接控制物理机器人为数据采集规模化带来重大挑战。通过将人体运动与物理机器人控制解耦,近期方法通过代理设备实现更直观、灵活、可扩展的数据采集。例如 UMI 是配备 GoPro 相机的手持夹持器,通过视觉 SLAM 估计 6 自由度轨迹。采集的数据可用于训练策略,后续将 UMI 安装为机器人末端执行器,机器人可复现演示运动,无需数据采集时物理参与。近期 LBM 借助 UMI 采集 32 小时演示。DexUMI 将概念扩展到灵巧操作,用五指机器人手替代简单夹持器。人类演示者佩戴配备与目标机器人相同相机与触觉传感器的外骨骼手套,记录的手部运动可精准迁移。基于相似原理,Dobb-E 使用类似 Hello Stretch 末端执行器的杆状设备采集人体演示。RUMs 进一步增强该范式,增加采集任务多样性、融入故障检测机制、改进网络架构,这些改进让机器人仅通过预训练即可泛化到广泛任务。DexCap 是双手佩戴 Realsense T265 相机、胸部额外安装 Realsense T265 与 L515 传感器的数据采集设备,支持基于 SLAM 的 6 自由度手腕姿态估计与基于手套的手部姿态跟踪。与之相对,DexWild 通过 EMF 手套结合双手掌心朝向相机、外部相机 ArUco 标记跟踪,解决 DexCap 的布线复杂与 SLAM 校准挑战。

  • 人体数据采集:该方法通过记录自然人体行为采集数据,不依赖模仿机器人末端执行器的代理设备。最简单形式是在用户头部安装 GoPro 相机或麦克风,采集第一人称视觉与听觉数据,常补充惯性测量单元(IMU)或视线信息。该技术在 Ego4D、EPIC-KITCHENS 等大规模自我中心数据集广泛采用。近期可穿戴传感技术进步支持更自然可扩展的数据采集,使用 Meta Project Aria 等紧凑型智能眼镜。这些设备助力 Ego Exo4D、HOT3D、HD EPIC、Aria Everyday Activities 等增强数据集开发。基于这些数据集,多项此前工作直接从人体演示数据训练机器人策略。例如 EgoMimic、EgoZero 通过模仿自我中心人体行为学习视觉运动控制。类似地,其他研究用 Apple Vision Pro 等设备采集的数据,基于自然人体运动训练人形机器人策略。

  • 数据采集流程:数据采集在 VLA 模型训练中至关重要。这些模型需要大规模高质量数据集,数据获取流程必须精心设计以保证效率与多样性。以 RT-1 为例,用框架从 curated 指令集采样指令与随机化初始状态,实现跨广泛任务与环境的演示采集,人类操作员执行采样指令生成多样平衡数据。RoboTurk 开发基于 iPhone 的 6 自由度遥操作界面,通过众包平台采集大规模机器人操作演示。此外,此前工作证明用自然语言标注预采集数据集的有效性。例如 Language Table 数据集采集遥操作轨迹,后续通过众包添加语言标注,形成约 60 万语言标注轨迹的大规模数据集。类似地,DROID 在 18 家研究机构分布式采集数据,在 564 场景、86 任务收集 7.6 万轨迹、350 小时交互数据,后续通过众包平台用自然语言标注。然而,人类标注成本高,近期趋势越来越多地利用 VLM 等基础模型自动化标注流程。ECoT、EMMAX 结合 Grounding DINO 与 SAM 的物体检测与夹持器定位、Gemini 1.0 的高层规划与子任务生成,实现自动标注。NILS 是无需人类干预、分割长视野机器人视频并生成语言标注的框架,集成多个 VLM 基于物体状态变化与夹持器运动检测关键状态,用 LLM 生成自然语言指令。RoboMIND 也采用基于 Gemini 的标注系统,证明通过 VLA 模型预训练性能大幅提升。尽管这类方法比人类事后标注更经济可扩展,面临细粒度场景理解与幻觉等挑战。尤其仅依赖文本的 ECoT 等方法,更容易出现与实际视觉上下文不一致的情况。基于视觉输入(如 EMMAX)或集成多感知模态(如 NILS)的方法被证明有效解决这些问题。

5.2 VLA 数据集

本节概述用于 VLA 模型预训练的关键数据集。由于 VLA 发展基于 LLM 与 VLM 进步,广泛利用网络数据集。本节重点聚焦 VLA 模型预训练专用数据集,分为三大类。后训练数据集通常专属或集成到 CALVIN、LIBERO 等评测基准,因此不纳入总结。

  • 人体数据集:采集人体数据比机器人数据可扩展性强得多,无需访问物理机器人、精准校准或安全关键执行环境。尽管仍使用第三人称视觉数据,第一人称数据与实际机器人(尤其配备头部传感器或类人本体)的感知输入更接近,已成为 VLA 预训练的关键资源。因此,第一人称视觉数据现已广泛作为 VLA 模型预训练的核心资源。例如 Ego4D 是最大最全面的自我中心视频数据集之一,包含 9 国 74 城 800 + 参与者的 3000 + 小时头戴式 RGB 视频。其他知名示例包括记录日常厨房活动的 EPIC-KITCHENS、捕捉细粒度人体 - 物体交互的 HOI4D。多项数据集聚焦操作任务,OAKINK2、H2O 用 RGB-D 传感器与动作捕捉系统采集双手物体操作;ARCTIC 聚焦双手灵巧操作铰接物体;EgoPAT3D 聚焦从自我中心视角预测人体动作目标。此外,基于智能眼镜的录制设备支持更自然无干扰的自我中心数据采集(详见 6.A 节)。知名示例包括 Aria Everyday Activities、融合自我中心与外中心视角的 Ego-Exo4D、聚焦细粒度手部 - 物体跟踪的 HOT3D、扩展自我中心烹饪数据的 HD-EPIC。这些数据集频繁用于 VLA 模型预训练,常通过 LAPA 等隐动作预测方法。尽管非自我中心,HowTo100M、SomethingSomething V2、Kinetics-700 等大规模视频语言数据集也用于模型预训练,有时适配 VLA 相关任务。随着 VLA 研究越来越多地采用人形机器人与类人感知配置,自我中心数据集(尤其捕捉自然目标导向行为的数据集)预计发挥越来越重要的作用。

  • 仿真数据集:仿真环境长期用于安全、经济、可扩展地生成机器人数据集,支持可控数据采集与灵活场景配置,特别适合模仿学习与大规模模型预训练。例如 RoboTurk 包含 MuJoCo 物理引擎内 Sawyer 机器人的任务演示,通过云端远程人类遥操作采集。然而,在仿真中(尤其通过遥操作)采集大规模演示数据仍耗时。为缓解该局限,MimicGen 提出从少量专家演示生成大规模数据集的框架,将演示分解为以物体为中心的子任务,在新场景中变换重组合成新轨迹。DexMimicGen 将方法扩展到更复杂本体(双臂机器人、多指手)。同时,COSMOS 等大规模视频世界模型被开发用于生成多样想象轨迹,为 VLA 模型提供丰富可扩展的训练数据。尽管仿真在 VLA 早期研究中占核心地位,随着大规模实际机器人数据集可用性提升(见下一节实际机器人数据集),其主导地位下降。尽管如此,仿真仍在生成多样可控数据方面(尤其实际采集不切实际或成本过高时)保持强大工具价值。

  • 实际机器人数据集:实际机器人数据集在 VLA 模型开发与评测中至关重要。在物理机器人硬件上采集,提供多样本体、真实交互、丰富传感输入,对训练可泛化到实际任务的模型必不可少。MIME 是首批大规模机器人数据集之一,包含 20 任务 8.2K 轨迹,由人类对 Baxter 机器人执行的配对人体演示与动觉教学组成。同期推出 QT-Opt,包含 7 台 KUKA LBR iiwa 机械臂四个月采集的 58 万次抓取尝试。MT-Opt 作为 QT-Opt 的扩展,扩展任务范围 beyond 抓取,支持更广泛操作技能。RoboNet 包含 7 类机器人(Sawyer、Baxter、WidowX、Franka Emika Panda、KUKA LBR iiwa、Fetch、谷歌机器人)采集的 16.2 万轨迹。尽管轨迹由随机或基于规则的动作生成,非专家演示,数据集支持跨多样平台与环境的泛化研究。BridgeData 通过 Oculus Quest 2 与 WidowX 250 机器人 VR 遥操作采集,包含 10 环境 71 任务 7200 轨迹。该工作扩展版 BridgeData V2 将数据集扩展到 24 多样环境 6 万轨迹。BC-Z 由 7 名人类遥操作员操控 12 台谷歌机器人执行 100 + 操作任务,通过带人类监督的策略执行采集额外数据,形成 2.59 万轨迹。Language Table 包含 60 万块操作轨迹(实际 41.3 万、仿真 18.1 万)与自然语言指令配对,数据通过无目标长演示采集,众包标注支持指令条件训练。RH20T 提供 4 台机器人(Franka Emika Panda、UR5、KUKA LBR iiwa、Flexiv Rizon)147 任务 7 配置采集的多模态数据,与早期数据集不同,包含同步 RGB-D、6 轴力 - 扭矩、关节扭矩、音频信号,支持多模态感知与控制。RT-1 包含 13 台谷歌机器人 17 个月采集的 13 万实际机器人演示轨迹,是实时指令条件行为的机器人 Transformer 系列 VLA 模型的基础。最终,Open-X Embodiment(OXE)数据集将众多数据集(包括 RT-1、BC-Z、BridgeData、Language Table)统一为 RLDS schema 标准格式,由 21 家机构 173 名作者协作开发,是目前最全面、广泛采用的实际机器人 VLA 数据集之一。多项额外实际机器人数据集发布,进一步推动 VLA 研究。DROID 是 13 家机构使用标准化硬件设置采集的大规模数据集,包含 7.6 万轨迹。各参与实验室使用配备 Robotiq 2F-85 夹持器、两台外部立体相机、腕部相机的 Franka Emika Panda 臂。与聚合异构机器人平台数据的 Open X-Embodiment 数据集不同,DROID 保证环境与本体一致性,非常适合基准测试。FuSe 提供 WidowX 250 平台采集的 2.7 万多模态轨迹,机器人配备外部相机、腕部相机、DIGIT 触觉传感器、麦克风、IMU,支持 VLA 任务丰富跨模态学习。RoboMIND 提供多样机器人本体(单臂、双臂、人形、灵巧手配置)采集的 10.7 万轨迹,数据集强调形态与操作策略多样性,支持泛化与迁移研究。AgiBot World Dataset 是 100 + 台 AgiBot G1 机器人采集的 100 万轨迹大规模数据集,空前规模支持在高度多样条件下训练大型 VLA 模型。除这些主要发布外,多项任务专属或平台专属数据集推出,包括 TaskAgnostic Robot Play、Jaco Play、Cable Routing、Berkeley Autolab UR5、TOTO、RoboSet。导航聚焦 VLA 数据集也出现,如 SACSoN、SCAND、RECON、BDD100K,支持移动平台指令跟随与目标导向行为。最终,RoboVQA 等专用数据集面向机器人专属问答,进一步拓宽 VLA 应用 beyond 操作与导航。

5.3 VLA 数据增强

鉴于数据集采集成本高,多种数据增强方法被开发以扩展现有数据集,方法覆盖视觉、语言、动作多模态。

  • 视觉增强:多数计算机视觉任务常用旋转、裁剪、缩放等增强技术提升泛化能力。但在机器人中,机器人本体与相机空间关系至关重要,此类变换可能扭曲关系、负面影响性能。为解决该问题,近期方法提出使用 Stable Diffusion 等图像生成模型,实现本体感知增强。CACTI 借助 Stable Diffusion 修改图像特定区域,增强小而高质量的数据集。GenAug 引入更复杂的视觉增强,通过 Stable Diffusion 应用三类变换:改变物体纹理、插入任务无关干扰物、修改背景。这些增强在保留任务相关语义的前提下增加视觉多样性,提升策略鲁棒性。ROSIE 在 CACTI 与 GenAug 基础上,使用 LLM、OWLViT、Imagen Editor,基于文本 prompt 自动识别修改掩码区域,实现目标物体、背景可控编辑或新物体插入,增强数据用于训练 RT-1。DreamGen 利用视频世界模型生成多样视觉变化,配合逆动力学模型(IDM)推理对应动作,该组合支持训练数据合成,助力新环境策略学习,提升泛化能力。与之相对,MOO 放弃显式视觉增强,转而用视觉语言模型(VLM)解耦物体与技能表示,让策略从有限数据泛化到未知物体 - 技能组合,通过预训练 VLM 的广泛泛化能力隐式处理视觉变化。此外,BYOVLA 在运行时提取修复图像观测中的任务无关区域,旨在提升对视觉干扰的鲁棒性。

  • 语言增强:DIAL 从少量人工标注的轨迹 - 指令对种子集开始,在种子集上训练 VLM,计算轨迹与指令相似度;同时 LLM 生成种子指令的多样复述,形成大型候选池。用训练好的 VLM 将候选池与剩余无标注轨迹匹配,分配 top-k 最相似指令,生成的数据集用于训练 RT-1。

  • 动作增强:动作与机器人物理行为与本体直接相关,动作数据增强通常难度高。解决该挑战的常用方法是通过 DAgger 等交互方法扩展数据集,迭代在学习策略访问的状态采集专家动作。类似地,CCIL 在策略遇到分布外状态时,通过学习局部平滑动力学模型生成纠正数据,合成将机器人从新状态引导回专家访问状态的动作,生成的纠正数据与原始演示结合优化策略。

六、现实世界机器人应用综述

本节总结 VLA 研究的关键实用方面,包括常用机器人类型、数据采集方法、公开数据集与增强技术、评测模型性能的评测协议。

6.1 VLA 所用机器人

本节概述 VLA 研究常用机器人类型。

  • 操作臂:机器人操作臂是 VLA 研究最常用机器人,包括单臂与双臂配置。本文综述此前工作所用单臂机器人包括:Franka Emika Panda、Franka Research 3、UR5、UR5e、UR3、UR3e、UR10、Kinova Gen3、Kinova Jaco 2、Sawyer、KUKA LBR iiwa 14、UFactory xArm、DENSO Cobotta、FANUC LR Mate 200iD、Realman RM65-B、Realman RM75-6F、AgileX PiPER、Unitree Z1 Pro、Dobot、Flexiv Rizon、AIRBOT Play、ARX、DLR SARA、WidowX 250 6DoF、ViperX 300 6DoF、SO-100/101、PAMY2。这些操作臂通常具备 5/6/7 自由度,关节配置与连杆长度各异。PAMY2 采用气动驱动,反映机器人体态多样性。此外,多个系统(如 AgileX PiPER、ARX、Franka Emika Panda、UFactory xArm、UR5e、AIRBOT Play、ALOHA、ALOHA2)双臂并排部署形成双臂配置。WidowX、ViperX、ALOHA、SO100/101、PAMY2 硬件完全开源,研究者可灵活修改扩展物理本体。这些操作臂用于执行广泛任务,包括物体抓取与移放、装配、变形物体操作、插孔操作。

  • 手 / 夹持器:本类别指安装在上述操作臂上的末端执行器手与夹持器。此前 VLA 工作所用手包括 ROBOTERA Xhand、PSYONIC Ability Hand、Inspire Robots RH56、Shadow Hand、PsiBot G0-R、Robotiq 2F-85/140、LEAP Hand、UMI。设计各异:LEAP Hand 四指;Robotiq 夹持器、UMI 两指;其余五指。部分系统使用吸盘或任务专属夹持器,如 Shake-VLA。ALOHA、ARX、PiPER 等平台默认配备两指夹持器。LEAP Hand 与 UMI 开源,硬件修改便捷。两指夹持器适合抓取,四指 / 五指手支持工具使用与手内操作。

  • 移动机器人:VLA 研究中的移动机器人包括轮式平台与集成机械臂与移动底盘的移动操作臂。Jackal、TurtleBot 2 是仅依赖轮式移动、不包含操作能力的系统示例。与之相对,移动操作臂呈现多样配置,包括 Hello Stretch、谷歌机器人、LoCoBot 等单臂平台,以及 Mobile ALOHA、PR2、Fibocom、AgiBot G1 等双臂系统。LoCoBot、TurtleBot 2 硬件完全开源,支持本体定制化实验。移动平台提供超越固定臂或夹持器的移动与环境交互能力,支持导航与动态场景交互任务。部分模型(如 RT-1)可同时执行导航与操作。

  • 四足机器人:四足机器人具备类动物移动能力,能在非结构化不平坦环境导航,在 VLA 研究中受到越来越多关注。Unitree A1、Go1、Go2、B1、Boston Dynamics Spot、ANYmal 频繁使用,均为商用系统,可通过 RL 控制策略遍历复杂地形。这些平台不仅提供移动能力,还可配备操作臂,支持广泛操作任务。

  • 人形机器人:人形机器人具备类人身体结构,是 VLA 研究探索的另一类平台。此前工作中,Fourier GR-1、Unitree G1、Unitree H1、Booster T1 常用,这些系统通常具备双腿、双臂、末端五指手。类人形态使其适合在为人类设计的空间中操作,便于与基于人体运动数据训练的 VLA 兼容。

6.2 VLA 评测

VLA 模型评测指标仍未完善,尤其在实际环境。因本体差异、安全顾虑、复现性受限,在物理机器人上评测泛化能力难度高。因此,多数评测在仿真中进行,标准化环境与基准支持不同方法公平对比。下文介绍常用仿真环境及其变体,用于评测对比 VLA 模型。

另外Meta-World也是基于 MuJoCo 的仿真环境,用于评估多任务与元强化学习,包含 50 个不同任务,由 Sawyer 机器人执行,可评估多样操作技能的泛化能力。

PhysXIsaacLab是基于 IsaacSim、底层物理引擎为 PhysX 的 GPU 加速框架,提供丰富的机器人学习工具、多样机器人、环境、传感器与真实感渲染能力。

LeVERB-Bench同样基于 IsaacSim,专注于全身人形控制,包含 154 个视觉语言任务与 460 个纯语言任务。

ManiSkill系列基于 SAPIEN 仿真平台(物理引擎为 PhysX),是从 3D 视觉输入学习物体操作技能的综合基准,包含铰接体、可变形物体、移动操作、多样机器人等大量任务,并提供大规模演示数据。

RoboTwin是双臂操作基准,提供 50 个任务、731 个物体、5 种不同本体。

BulletRavens是基于 PyBullet 的 10 类桌面操作任务基准。VIMABENCH扩展出 17 个多模态提示任务。LoHoRavens用于评估长视野规划能力。

CALVIN提供基于自然语言指令的长视野操作仿真基准,包含 34 个由 Franka Emika Panda 执行的操作任务。

Habitat系列主要由 Meta 开发:

V-REPRLBench是首个大规模模仿与强化学习基准,基于 V-REP 与 PyRep,包含 100 个 Panda 机器人操作任务。THE COLOSSEUM在 RLBench 之上,系统评估环境变化下的策略泛化能力。

UnityAI2-THOR是基于 Unity 引擎的真实感可交互 3D 环境,提供多套室内场景与任务套件。CHORES是其扩展,用于导航任务最短路径规划。

其他评估方向

  • VLATest:系统评估干扰物数量、光照、相机位姿、未见物体、指令变化等对模型的影响

  • 对抗鲁棒性测试

  • 可解释性测试:探测模型隐空间是否出现物体属性、空间关系、动作状态等符号结构

更真实、可扩展的 VLA 评估

  • SIMPLER:实现真实数据训练策略在仿真中评估,缩小视觉与控制域间隙

  • RoboArena:分布式真实世界评估框架,多机构机器人联合测评、全局排名

6.3 现实世界应用

本节具体介绍各类机器人平台(操作臂、手 / 夹持器、移动机器人、四足机器人、人形机器人)在 VLA 模型研发与评估中的应用。

操作臂操作臂是 VLA 研究最常用平台,用于抓取、放置、装配、变形物体操作、插孔等任务。双臂协调可完成更复杂操作,如Shake-VLA调制鸡尾酒、RoboNurseVLA自动完成手术器械交接。

手 / 夹持器两指夹持器适合一般抓取;多指灵巧手可完成工具使用、手内操作。例如GraspVLA面向两指抓取,DexGraspVLA面向多指精细操作。

移动机器人移动机器人用于导航、移动操作等任务。RT-1 等模型可同时生成手臂与底盘动作。VLA 也被扩展到无人机、自动驾驶领域:

四足机器人四足机器人可在非平整地形导航,如 TrackVLA、NaVILA、CrossFormer 等实现野外部署。部分搭载机械臂完成导航 + 操作,如 SLIM、Track2Act、VidBot。

人形机器人人形机器人因类人形态更适合人类环境与工具,成为 VLA 研究热点。

  • MuJoCo:多项仿真环境基于 MuJoCo 开发,支持机器人操作研究。例如 robosuite 是模块化仿真框架,机器人、场景、任务物体通过 MJCF 文件组合,提供 11 项操作任务。

  • 在 robosuite 基础上,robomimic提出了系统的基准,用于评估从演示中学习机器人操作的效果,包含 8 个由 Franka Emika Panda 机器人完成的任务。

  • RoboCasa进一步扩展了 robosuite,包含大规模 photorealistic 场景,覆盖 100 个任务、多种机器人平台,支持更广泛的泛化与迁移学习研究。

    目前最常用的 VLA 评估基准是LIBERO,专为语言条件操作任务设计,提供 4 个任务集共 130 个任务,均由 Franka Emika Panda 执行:

  • LIBERO-SPATIAL:关注物体间空间推理

  • LIBERO-OBJECT:面向物体类别识别

  • LIBERO-GOAL:评估物体操作目标理解

  • LIBERO-100:整合前三套,评估组合泛化能力

  • ManiSkill

  • ManiSkill 2

  • ManiSkill 3

  • ManiSkill-HAB

  • Habitat 1.0:专注视觉导航

  • Habitat 2.0:支持移动操作,引入家庭助手基准 HAB

  • Habitat 3.0:支持机器人与人类虚拟化身

  • VLATest:系统评估干扰物数量、光照、相机位姿、未见物体、指令变化等对模型的影响

  • 对抗鲁棒性测试

  • 可解释性测试:探测模型隐空间是否出现物体属性、空间关系、动作状态等符号结构

  • SIMPLER:实现真实数据训练策略在仿真中评估,缩小视觉与控制域间隙

  • RoboArena:分布式真实世界评估框架,多机构机器人联合测评、全局排名

  • UAV-VLA、RaceVLA、CognitiveDrone:面向无人机自主飞行

  • OpenDriveVLA、ORION、CoVLA、OccLLaMA:面向自动驾驶

  • NaVILA:实现稳健 locomotions

  • EgoVLA、GO-1:完成家庭环境拾取、放置、倾倒、折叠等操作

七、给从业者的建议

结合近年 VLA 研究成果,本节为设计、训练、部署 VLA 模型的从业者提供可落地建议。

  1. 优先使用多样、高质量数据集跨任务、物体、本体的泛化依赖大规模、多模态对齐数据,尽量选择任务覆盖广、环境变化多、本体类型丰富的数据。

  2. 优先用生成式方法输出连续动作离散动作 token 不利于平滑精准控制,建议使用扩散、流匹配等生成式方法输出连续动作。

  3. 预训练时使用梯度隔离随机初始化的动作头梯度会破坏预训练 VLM 的常识表示,建议冻结主干或加入梯度隔离,提升训练稳定性与效果。

  4. 先从轻量适配方法开始没有 GPU 集群时,优先只微调动作头、冻结主干;或使用 LoRA 等高效微调方法,平衡性能与资源。

  5. 融入世界模型或隐动作学习以提升可扩展性人形机器人场景可优先用人视频预训练,利用无标注视频学习隐动作;世界模型预测能力可提升长视野规划与推理。

  6. 用多任务学习增强动作生成表示除动作外,加入可及性预测、关键点检测、未来状态预测、分割等辅助任务,让模型更贴合动作生成需求。

八、未来研究方向

9.1 数据模态

现有模型已尝试融入音频、触觉、3D 点云,但大规模多模态数据集仍然稀缺。触觉传感器差异大、格式不统一,阻碍统一建模。未来需要统一传感器配置,构建规模化多模态 VLA 系统。

9.2 推理

长视野任务需要更强推理能力,包括记忆、时序抽象、信息检索与决策。例如机器人需要记住货架位置,后续取回并完成放置。未来需强化记忆机制、时序推理、分层规划。

9.3 持续学习

当前 VLA 训练完成后基本冻结,无法在线学习与适应新场景。持续学习 / 终身学习是关键方向,但面临灾难性遗忘、安全性等挑战。RLHF、认知启发的主动学习可能成为可行路径。

9.4 强化学习

目前 RL 微调大多停留在仿真,原因是样本低效、探索不安全。未来方向:

  • 在学习到的世界模型里做 RL

  • 数字孪生 / 实到虚环境中微调

  • 更好的物理参数识别与多视角场景重建

9.5 安全性

无结构环境中部署 VLA 存在安全风险,缺乏对人体、意外障碍物的感知与避碰。需要 hybrid 架构:结合学习策略的泛化能力 + 模型预测控制的安全性。

9.6 故障检测与恢复

现实中故障不可避免,但多数 VLA 无故障检测与重规划。未来需要:

  • 执行中识别失败状态

  • 自动恢复、重规划

  • 分层重试机制:低层动作重试→高层子任务重生成

9.7 评估

现有 VLA 架构、模态、训练方法繁多,但缺乏严格统计对比。未来需要:

  • 统一基准

  • 足够测评次数

  • 置信区间、显著性检验

  • 可复现、可对比

9.8 应用

VLA 可用于医疗、助老、工业、自动驾驶等,但目前可靠性不足。未来会更关注:

  • 安全性

  • 鲁棒性

  • 运行效率

  • 真实场景落地


总结

本文全面综述了机器人视觉 - 语言 - 动作(VLA)模型,梳理了从早期 CNN 模型到扩散、隐动作、分层架构的演进路线。覆盖核心挑战、架构创新、训练方法、现实应用。

主要结论:

  1. 大规模数据与预训练基础模型是泛化的关键
  2. 分层架构成为主流,分离高层推理与低层控制
  3. 多模态输入不断扩展(视觉、语言、动作、触觉、3D 等)
  4. 跨本体迁移、仿真到现实仍是核心挑战

随着基础模型进步、数据采集与训练方法成熟,VLA 将推动更通用、更强泛化能力的机器人系统出现。世界模型、可及性推理、强化学习的融合,将成为下一代 VLA 的核心,支持持续学习、复杂推理、多样化无结构环境适应。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐