超越数据规模化:面向视觉-语言-动作模型的表征中心持续预训练
26年8月来自Star VLA的论文“Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models”。
核心定位:提出VLAct,一套面向视觉‑语言‑动作(VLA)模型的以表征为中心的持续预训练范式。不追求无限扩大机器人轨迹数据规模,而是在固定机器人数据预算下,改进预训练流程,从有限轨迹中学习可迁移的视觉‑动作表征;全部使用开源数据集,仅 16‑GPU 训练即可取得媲美工业级闭源 VLA 系统的效果,模型与训练代码全部开源。
基础模型:Qwen3‑VL‑4B 作为初始 VLM 骨干网络。
如图 1 所示 VLAct 概述。VLAct 采用以表征为中心的持续预训练,以学习跨任务、具身、环境和动作头的可泛化的动作感知表征。

一、研究背景与动机
1. VLA 模型现有困境
大模型领域普遍遵循数据缩放(Data Scaling)范式,但是机器人轨迹数据和互联网图文数据存在本质差异:
机器人轨迹需要实体硬件采集,采集成本高;
物理世界交互空间是组合、连续的,现有机器人数据集对真实世界覆盖稀疏。
单纯增加机器人轨迹数据不是唯一出路:在有限数据预算下,表征质量成为核心瓶颈。朴素 VLA 持续预训练存在 3 个典型失效模式:
全量更新 VLM 骨干会破坏原有通用图文先验,丢失通用视觉语言能力;
单一动作头监督,会让骨干网络表征过度适配该解码器,产生解码器锁死(decoder lock‑in),无法迁移到其他动作头;
不同机器人本体(embodiment)使用完全独立的动作头,物理上等价的动作语义(如夹爪开合)无法跨机器人共享监督信号。
2. 研究问题
在固定机器人数据预算下,如何设计 VLA 持续预训练,让骨干网络学到可以泛化到新任务、新环境、新机器人本体、新动作头的可迁移视觉‑动作表征,而不只是拟合预训练分布内的动作?
区别于从零训练,本文的 “持续预训练(continued pre‑training)”:从已经预训练好的通用 VLM 出发,在机器人多本体轨迹上继续训练,之后再做下游任务微调。微调阶段丢弃预训练阶段的动作头,重新初始化任务专属动作头。
二、VLAct 核心技术方案
VLAct 由三大核心模块共同组成,全部作用于持续预训练阶段;下游微调时重新初始化动作头,骨干解冻全部参数。
如图 3所示VLAct 概述。在预训练阶段,1 VLAct 通过浅层保护和图像描述混合保留了 VLM 先验信息;2 使用多头连续监督来避免头部特定表征的崩溃;3 将跨具身动作语义与统一的动作布局和环绕感知损失对齐。4 在微调阶段,重用预训练的主干网络,并重新初始化特定任务的动作头。

模块 1:保护原有 VLM 图文表征
目的:学习动作知识的同时,不要破坏通用 VLM 先验。
浅层层保护(Shallow‑Layer Protection):预训练阶段冻结完整视觉编码器 + LLM 下半部分浅层;只更新 LLM 上层和动作头。浅层负责底层视觉与早期图文对齐,上层负责动作相关推理;下游微调阶段全部参数解冻。消融实验证明该策略带来 LIBERO‑Plus +3.7%、RoboTwin2.0 +3.4% 的提升。
图文字幕混合预训练(Caption‑mixed pre‑training):预训练 minibatch 混合机器人轨迹数据 + 图像字幕数据。字幕数据对物体属性、空间关系提供稠密监督,作为表征锚点,防止模型被狭窄机器人数据带偏。消融表明图像字幕是效果最强的辅助数据;空间 QA、点 / 框定位、纯文本指令也有增益。
总损失:L_{total}=L_{action}+0.5 L_{VLM‑CE}
模块 2:多头连续动作联合监督
解决单头预训练带来的解码器锁死问题。
在同一个 VLM 骨干上并行挂载 3 种主流连续动作头:OFT(并行回归)、PI(流匹配)、GR00T(双系统流匹配);共享同一个骨干隐状态 z,预测同一套真实动作。
损失为三者损失相加:L_{action }=L_{OFT }+L_{PI}+L_{GR 00 T}。
核心思想:迫使骨干网络编码动作信息的格式要能够被多种不同解码器读取,而不是只适配某一种动作头。
效果:既提升向未见过动作头的迁移;同时即便是下游使用预训练中出现过的动作头,性能也优于单头预训练基线。
对比实验:只用 OFT 预训练,下游换 PI 头性能下降;OFT+GR00T 多头预训练,下游 PI 头性能反而高于从零开始微调。
如图9所示:本文研究的代表性 VLA 动作头对比。FAST 通过将动作块离散化为动作tokens来保留 VLM 的自回归接口。OFT 将一个轻量级的 MLP 头附加到 VLM 动作特征上,并并行预测连续动作。PI 和 GR00T 使用一个独立的 DiT 式电机模块,该模块基于 VLM 特征,通过流匹配生成连续动作块,其中 GR00T 采用一种更明确解耦的双系统设计。

模块 3:跨本体部分统一动作表征
解决不同机器人本体动作空间割裂,物理等价动作语义无法共享的问题。
部分统一动作空间:不强制把所有机器人强行对齐到一套完整动作维度;只对物理语义可对齐维度做共享(例如夹爪开合),本体特有自由度做掩码屏蔽,不参与损失计算。
环绕感知损失(Wrap‑aware loss):针对旋转关节角度周期性问题。179° 与‑179° 物理角度接近,但欧式距离很大;将角度残差对(2\pi)取模之后再计算 L1 损失,修正周期性角度的回归距离度量。消融显示该机制给 RoboTwin Base 带来 5% 的成功率提升。
如图 4所示统一动作空间设计。比较针对不同具体形态的独立头部、简单的统一动作空间以及部分统一的动作空间。VLAct 共享物理对齐的尺寸,例如夹爪的开/关,同时隐藏了不可用或特定于具体形态的尺寸。

注:架构上没有引入本体适配器、路由模块,仅依靠动作空间布局和掩码实现跨本体监督共享。
训练数据与计算资源
预训练开源机器人数据集:DROID、InternA1、RoboCoin、MolmoAct,搭配图文字幕辅助数据; 训练硬件:仅 16 GPU;训练脚本、模型权重计划全部开源。
三、实验结果分析
实验覆盖仿真基准、真实机器人、未见本体跨实体迁移三大维度;对比大量开源与工业 VLA/WAM(世界动作模型)基线。
1. 仿真 Benchmark 结果
表格

2. 真实机器人实验(Franka 7 自由度机械臂)
如图10所示机器人实验环境和真实世界训练数据集概述。(a) 实验的机器人实验环境。(b) 收集11个任务套件的真实世界机器人轨迹。测试场景:单臂短时序、单臂长时序、双臂协同、分布外 OOD 泛化(新物体、物体全集替换)。

单臂短时序域内:VLAct 92.5% vs 基线 77.5%;堆叠、杯中放笔这类空间敏感任务增益最大。
OOD 短时序(全新物体):90.0% 成功率,基线仅 65‑73%。
单臂长时序:清理桌面 86.6%、舀豆子 80.0%;基线分别 73.3%、33.3%。在物体完全替换的 OOD 长时序任务维持 83.3%,基线暴跌至 46.6%。
双臂协同:平均 72.0%,基线 44.0%;在可变形物体(叠裤子、叠毛巾)上优势巨大,模型能输出同步双臂运动。
真实机实验严格控制变量:仅骨干网络不同;动作头、微调数据、优化器、训练步数全部一致。性能增益完全来自 VLAct 预训练得到的骨干表征。
如图 11所示真实机器人域内和域外评估任务的示意图:

3. 未见本体迁移实验(最重要核心结果)
VLAct 预训练阶段完全没有见过 GR‑1 人形机器人本体。
RoboCasa‑GR1 人形机器人:仅使用下游20% 训练轨迹时,VLAct 达到 49.5% 成功率,已经超过使用全部数据的 GR00T‑N1.6 基线(47.6%);使用全部下游数据达到 54.0%。
说明 VLAct 学到的是通用动作语义表征,而不是过拟合预训练见过的机器人形态。
四、关键消融实验结论
浅层层保护:全部层更新→仅冻结视觉编码器→冻结视觉 + 下半 LLM 层,性能逐步上涨,证明保留 VLM 底层特征的重要性。
辅助预训练数据:图像字幕单源带来最大收益;空间 QA、Grounding QA、甚至纯文本指令都可以带来提升,证明辅助数据价值来自表征正则化,而不是任务直接迁移。
多头监督:多头预训练可以缓解解码器锁死;即便下游使用预训练没有出现过的动作头,性能不会下降。同时对已经见过的动作头也有小幅增益。
部分统一动作空间 + 环绕损失:关节角度周期性处理对双臂任务收益显著。
异构数据兼容性:加入 20K UMI 采集的异构轨迹,性能继续小幅上涨,证明 VLAct 预训练流程可以吸收来源差异很大的机器人数据。
五、论文创新点总结
视角创新:跳出 “扩大机器人数据规模” 单一思路,提出以表征为中心的 VLA 持续预训练范式。强调 VLM 骨干不是一个固定组件,而是 VLA 系统的核心可设计变量。
整套三模块预训练配方:浅层层保护 + 字幕混合、多头连续动作共监督、部分统一跨本体动作空间 + 环绕感知损失。所有组件仅用于预训练,下游可自由更换动作头,部署友好。
揭示朴素 VLA 预训练两个关键缺陷:VLM 先验被侵蚀;单动作头预训练造成解码器锁死,表征绑定特定解码器,降低迁移性。
资源友好的高性能方案:全部开源数据,仅 16‑GPU 即可在多个基准追上甚至超过很多工业闭源 VLA/WAM 系统;尤其在低数据、跨未见本体迁移场景表现亮眼。
六、局限性与未来工作
局限性
本文实验只基于 4B 规模 Qwen3‑VL 骨干,没有验证更大模型规模下这套配方的最优配置;
在 RoboDojo 基准的 Memory 类任务仍然是短板;
没有研究极端长时序、移动操作机器人本体。
未来方向
针对更大规模 VLM,研究适配的表征‑中心持续预训练超参与设计;
进一步提升记忆能力;
将这套范式拓展到移动 + 操作复合机器人本体;
降低通用机器人模型对大规模私有机器人轨迹的依赖。
七、论文启示
机器人 VLA 的进步不完全依赖更大的机器人数据集;预训练流程与表征学习策略是一条独立重要优化轴。同等数据与算力下,更好的预训练配方可以显著提升泛化、少样本、跨本体能力。
VLM 迁移到机器人任务,不能简单直接全量微调,需要机制保护原本通用视觉语言先验;
VLA 预训练阶段不能绑定死下游使用的动作头;多头共监督是提升解码器兼容性简单有效的手段;
跨本体学习不应当粗暴强制全部动作维度对齐;物理语义等价维度做共享,其余做掩码屏蔽是更合理设计。
工程实践启发:想要一个通用 VLA 骨干,预训练阶段就应当让骨干适配多种动作输出范式,下游再按需挂载动作头,而不是预训练和下游绑定死一套动作头。
八、思考与不足(批判视角)
整套预训练流程模块较多,包含冻结策略、多种辅助数据、多头损失、动作空间包装、环绕损失,各个模块的耦合比较强,很难定位单一模块在不同数据集上收益波动;
没有对比参数量同等的更强基线;
所有跨本体测试仍然是仿真 + 有限真实机;没有测试现实世界完全全新硬件本体零样本 / 极少样本效果;
辅助数据混合比例是固定超参,没有做大量搜索;
Memory 类任务效果弱,论文只陈述现象,没有给出针对性改进方案。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)