Beyond Data Scaling: Representation‑Centric Continued Pre‑training for Vision‑Language‑Action Models

arXiv:2608.27550,基于 Qwen3‑VL‑4B,依托 StarVLA 框架,全部使用公开机器人数据集,训练硬件仅 16 张 GPU,代码、模型、实验脚本完整开源。

核心命题:机器人 VLA 模型不能只依靠扩大数据集规模。在固定的数据与算力预算下,优化主干网络学到的表征质量,是一条独立且重要的性能提升路径。本文提出表征为中心的持续预训练(representation‑centric continued pre‑training)范式 VLAct

定义:持续预训练(continued pre‑training):不从零训练基础模型,在已经训练完毕的通用视觉语言模型 VLM 权重基础上,使用多源机器人轨迹继续训练主干;预训练完成之后再开展下游任务微调。预训练阶段的模块不会直接带到微调,下游可以重新初始化任意任务动作头。

1 研究背景与动机

现代基础模型的成功大多来自数据、模型、算力缩放范式。VLA(视觉‑语言‑动作)领域也普遍希望通过收集更多机器人轨迹来获得更强的通用机器人策略。 但是机器人轨迹和互联网图文有本质区别:

  1. 机器人轨迹无法网络爬取,必须实体硬件执行遥操作或者仿真采集,采集成本高;

  2. 机器人需要泛化的空间是组合连续空间:不同场景、物体、任务、机器人本体、接触动力学;即便很大的机器人数据集,对于整个物理交互空间仍然只是稀疏采样,无法做到全覆盖。

因此作者提出思考:既然无法指望数据集对物理世界做到穷尽覆盖,那预训练的成败,不应该只看轨迹数量,更要看能不能从有限轨迹里面提炼出可迁移的视觉‑动作表征 (不要把机器人持续预训练单纯当成大规模动作拟合。 理想的 VLA 主干,不只是复现训练集里面看到过的动作,还需要内化物体属性、操作 affordance、空间关系、动作条件下物理交互的先验,能够被下游不同任务、不同环境、不同机器人本体复用。

先导研究(第 2 章):朴素 VLA 持续预训练的三类失效模式

作者做受控对照实验,固定 VLM 主干 Qwen3‑VL‑4B,只改变预训练 / 微调阶段的动作头,揭示传统预训练存在的问题:

  1. VLM 通用先验被侵蚀 机器人轨迹数据集场景、视角、任务分布相比互联网图文狭窄很多。如果端到端更新全部网络参数,来自机器人数据的梯度会改写原本 VLM 学到的通用视觉语言特征。虽然在预训练数据集上动作预测效果变好,但是对外的泛化能力下降。

  2. 解码器锁死 Decoder lock‑in(表征坍缩 head‑specific representation collapse)

  • 离散动作头(FAST token):可以跨不同动作头迁移,但是离散量化会丢失操控必需的细粒度时序、动作幅值信息,上限低。

  • 单头连续动作预训练(例如只用 OFT):当微调也用 OFT 时性能很好;但是切换 PI、GR00T 等其他连续动作头,性能显著下跌。

现象说明:主干学到的不是与解码器无关的通用动作特征;而是特征几何被改造为专门适配当前预训练动作头,动作信息以其他解码器难以读取的私有格式存储。同动作头的好结果,会高估主干真实可复用能力。

  1. 跨本体知识被隔离 常规做法给每一种机器人设置独立动作头。物理含义相同的维度(例如夹爪开合),被封闭在各个本体专属输出层内部,不同机器人之间无法共享监督信号。

综上,一个可迁移 VLA 主干需要同时满足三点:①保留原始 VLM 的视觉‑语言先验;②表征兼容多种下游动作头;③跨机器人共享物理等价动作语义。这就是 VLAct 全部设计的出发点。

2 VLAct 完整方法(第 3 章)

⚠️重要:下面全部组件只运行在持续预训练阶段;进入下游微调,预训练阶段的多头、caption 数据流全部丢弃,重新初始化全新的任务专属动作头。所有性能增益来自主干网络权重,而不是复用预训练过的动作头。

2.1 保护原有 VLM 先验:浅层冻结 + Caption 图文混合共训

  1. 浅层层保护 Shallow‑Layer Protection 预训练时冻结整个视觉编码器 + LLM 下半部分浅层;只更新 LLM 上层网络 + 各个动作头。

  • 底层网络负责低级视觉处理、早期图文对齐,尽量保护不被机器人数据梯度破坏;上层保留自由度学习动作条件推理。

  • 下游微调的时候全部网络解冻,所有参数均可更新适配目标任务。

  • 消融:全参数更新 LIBERO‑Plus 只有 78.9%;仅冻结视觉编码器 81.3%;冻结视觉 + 下半 LLM 达到 82.6%,带来 + 3.7 个点收益。

  1. Caption 图像描述辅助数据混合训练 机器人样本只提供动作监督;同时混入图文 caption、grounding QA 等 VLM 数据一起训练。总损失:

$$\mathcal{L}_{total}=\mathcal{L}_{action}+0.5\mathcal{L}_{VLM‑CE$$ 消融对比多种辅助数据:图像 caption 带来的收益最大;BBox‑QA、Point‑QA、Spatial‑QA、纯文本指令也有正向增益。 原理:caption 提供物体、属性、空间关系稠密监督,充当表征锚点,防止训练过程主干特征发生漂移。

2.2 多头连续动作联合监督 Multi‑head continuous action co‑supervision

预训练阶段,同一个 VLM 主干输出共享隐状态z,并行挂载OFT、PI、GR00T 三个不同的连续动作头,全部预测同一 ground‑truth 动作块a。 总动作损失:

$$\mathcal{L}_{action}=\mathcal{L}_{OFT}+\mathcal{L}_{PI}+\mathcal{L}_{GR00T$$

  • 所有动作头复用主干前向传播,仅增加动作头侧轻量计算开销,不会重复跑主干;

  • 三个解码器有完全不同归纳偏置。要同时降低三者损失,主干就不能把动作特征适配某单一解码器,必须编码对多种解码器都可读的通用动作表征。

  • 双重收益:①缓解解码器锁死,提升向未见过动作头迁移能力;②即便是下游使用预训练见过的动作头,多头监督也起到正则效果,性能优于单头预训练。消融显示相比单头,同头微调提升 1.6~4.3 个百分点。

2.3 半统一跨本体动作空间 Partially unified cross‑embodiment action layout + Wrap‑aware loss 环绕感知损失

  1. 半统一动作空间 对比三种方案:

  • 方案 A:每个机器人独立动作头 → 监督完全隔离;

  • 方案 B:粗暴全局统一动作空间,低自由度机器人补零填充,强行对齐物理含义不同关节;

  • VLAct 方案 C 半统一

    • 物理语义等价维度(夹爪开合)全局共享;

    • 机械臂关节等随运动学变化的维度保留本体专属定义;

    • 训练每条样本,仅对当前机器人有效的维度计算 loss,不存在的维度做掩码屏蔽,不参与更新

架构极简:没有本体适配器、路由模块、本体条件解码器,跨本体知识共享直接来自动作空间坐标的语义对齐。消融表 12 显示该设计相比分离头带来 1.5 点左右提升。

  1. Wrap‑aware loss 环绕感知损失(针对周期性绝对关节角) 物理上$$179^\cir$$与$$-179^\cir$$只相差 2°;普通 L1 损失把二者视作相差 358°,带来错误损失信号。 两步处理: ①数据端:训练前把所有绝对关节角 wrap 折叠到 $$[-\pi,\pi$$; ②损失端:计算预测值与标签残差时,同样做模$$2\p$$环绕,再计算 L1 损失。 消融:原始基线 75.5%;仅数据端 wrap 78.6%;数据 + 损失双 wrap 80.5%。

2.4 附录 H:多级数据清洗流水线

详见: VLAct 数据清洗总结 (对应代码)-CSDN博客

输入数据来自 DROID、InternData‑A1、RoboCoin、MolmoAct 多源公开数据集,不同平台、帧率、标注规范,存在噪声与异构。清洗目标:尽可能保留有效轨迹,仅移除不可靠监督信号,避免整条轨迹丢弃

  1. 删除任务名无效样本:unknown_task、n/a、空字符串,整条轨迹移除(唯一整条删除的条件)。

  2. 末端 delta 动作异常检测:把帧间 delta 按 FPS 缩放换算成每秒物理速度;平移速度$$>0.5\ \text{m/s$$、旋转速度$$>1.0\ \text{rad/s$$标记为坏 step。

    1. 不直接丢轨迹:按 chunk 动作块统计坏步占比,如果块内无效 step>50% 丢弃整个 chunk;少量坏 step 只在训练时 mask 该 step 的 loss。

  3. 动作对齐:

    1. delta 末端动作:FPS 归一化到每秒速度,做数值缩放;

    2. 绝对关节角:wrap 折叠;

    3. 夹爪:每个数据集独立 min‑max 归一化映射\([0,1]\)。

重要说明:论文没有专门过滤静止帧 / 零动帧。静止帧被视为合法的机器人操作行为(抓取保持、对准等待),不做特殊删除或者下采样。过滤规则只针对采集故障产生的超大异常动作跳变

2.5 额外验证:兼容异构采集范式数据

额外加入 20K 条 UMI 手持遥操作采集的轨迹,不需要重度精细筛选,直接加入预训练;LIBERO‑Plus 性能从 82.6%→83.7%,+1.1。说明整套预训练配方可以吸收不同采集范式的数据,不会被异构数据破坏。

3 全套实验(第 4 章 + 附录 B‑J)

关键控制变量:所有对比实验,下游微调阶段:动作头、初始化、微调数据集、优化器、训练迭代预算全部保持完全一样。唯一变化只有预训练之后的 VLM 主干权重。性能差异全部来自表征,而不是下游训练设置。

3.1 仿真基准

  1. LIBERO‑Plus(Franka 单臂,鲁棒扰动基准)

扰动维度:相机、机器人姿态、语言指令、光照、背景、噪声、物体布局。

VLAct 总分82.6%,对比同主干基线 Qwen3VL‑OFT 提升 7.6 个百分点;超过工业基线 Abot‑M0 (80.5%);最大增益来自相机视角、机器人姿态、噪声、布局扰动。证明预训练得到更强鲁棒的视觉‑空间表征。

  1. VLA‑Arena 行为泛化基准

评测维度:Safety 安全、Distractor 干扰物、Extrap. 外推、Long‑H 长时序。

VLAct 平均 54.8%,对比基线提升 21.4 个点,超过$$\pi_{0.5$$,长时序、安全任务提升幅度最大。

  1. RoboTwin 2.0 双臂 AgileX 基准

两个设置:

  • Base:每个任务仅 50 条干净轨迹;VLAct‑OFT Clean=92.5%,Random=90.8%,优于 InternVLA‑A1、LingBot‑VLA、ABot‑M0 等大量系统;更换 PI、GR00T 下游动作头,得分差距小于 3.4,验证跨动作头迁移能力。

  • Data Scaling:额外增加大量域随机轨迹;VLAct 依然保持很强,说明该表征不只在小数据区间生效,增加下游数据可以继续涨点。

  1. DOMINO 动态物体操纵基准

测试物体运动、环境动态变化的时空推理;SR=18.50,MS=34.20,显著优于基线,证明对动态交互场景同样有效。

  1. 未见本体迁移(论文核心结果)

VLAct 预训练数据只有 Franka 单臂、AgileX 双臂;GR‑1 人形、ARX‑X5 双臂完全没有出现在预训练中

① RoboCasa‑GR1 人形机器人

  • 全量下游微调:VLAct=54.0%,超过 Qwen3VL‑OFT (48.8%)、GR00T‑N1.6 (47.6%);

  • 只用 20% 下游微调轨迹,成功率 49.5%,已经超过 100% 全量数据训练 GR00T‑N1.6(47.6%);50% 数据 51.0%。

证明主干学到通用动作表征,不是对预训练见过的机器人过拟合;全新人形本体具备很高样本效率。

② RoboDojo 官方排行榜(ARX‑X5 平台,42 任务,一共 35 支参赛策略)

  • VLAct 平均分 10.66(第 8),成功率 7.60%(第 6),处于全部策略前 25%;

  • 在平均分、成功率两项指标全部优于 4 个 WAM 世界动作模型(X‑WAM、GigaWorld‑Policy‑0、AHA‑WAM、Fast‑WAM);对比同主干 StarVLA‑α,平均分 + 4.26,成功率 + 4.36;

  • 短板:Memory 记忆类任务得分很低,是明确的缺陷;

重要结论:不需要专门设计 WAM 世界动作模型架构;高质量表征导向 VLM 预训练,就可以实现更强通用动作建模效果。

3.2 真实硬件实验:Franka Research 3 机械臂

对比基线:没有经过 VLAct 预训练的 Qwen3‑VL‑4B‑OFT,下游微调设置完全对齐。 测试分为四类:

  1. 单臂短程域内任务:胡萝卜抓取、按键、堆叠方块、杯中放笔。VLAct 平均 92.5%,基线 77.5%;堆叠、插笔这类对空间精度要求高任务提升明显。

  2. 单臂短程分布外泛化(新物体):替换物体,VLAct 90.0%;基线只有 65‑73.3%。

  3. 单臂长程任务 + OOD 长序列:擦桌子、舀豆子;包括序列延长、物体全部替换。VLAct 可以更好维持多步任务逻辑,基线容易跳过步骤、丢失目标物体。

  4. 双臂协同任务:拔插头、准备早餐、递香蕉、折叠裤子 / 毛巾;VLAct 平均 72.0%,基线 44.0%;可变形物体折叠任务收益最大,模型实现更好双臂同步、接触稳定性。

4 消融实验总览(附录 C‑F‑I‑L)

表格

消融变量核心结论
浅层冻结冻结视觉编码器 + 下半 LLM 效果最优,抑制表征漂移
辅助训练数据Caption > 空间 QA / Point‑QA / BBox‑QA > 纯文本;全部优于仅机器人数据
多头联合监督缓解解码器锁死;同头微调也有正则增益
统一关节 + 环绕损失解决角度周期性回归错误,两项叠加收益最大
半统一动作空间语义等价维度共享,不强行对齐无关关节,优于完全独立头
加入 UMI 异构数据性能小幅上涨,证明预训练配方兼容不同采集范式

5 论文整体结论

  1. VLA 模型性能提升,不只有数据缩放这一条路线;表征为中心持续预训练是独立有效的提升轴。在有限开源数据、16GPU 算力条件下,就可以得到极具竞争力结果。

  2. 三大设计分别对应解决朴素 VLA 预训练的三类缺陷:浅层冻结 + caption 混合保护 VLM 先验;多头联合监督解决解码器锁死;半统一动作空间 + 环绕损失实现合理跨本体动作语义共享。

  3. 不一定需要专门的世界动作模型(WAM)架构;通过优化 VLM 主干表征,VLA 方案可以在通用动作建模评测上全面超过 WAM 类模型。

  4. 很强的未见本体小样本迁移:从未见过的机器人,只需要少量下游微调数据就可以得到高性能策略。

6 局限性(Limitation)

  1. 只完成 4B 规模 VLM 验证;更大参数量模型的最优预训练超参数、配方还需要进一步研究。

  2. Memory 记忆类任务是明确短板,长时序记忆能力不足。

  3. 没有开展大规模真实世界多机器人部署测试。

  4. 预训练全部基于开源数据集;没有验证闭源大规模数据下这套配方表现。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐