VLA 微调实战指南:算法选型、数据采集与效果全景

从 OpenVLA 到 π0.5、GR00T N1.5,再到 GRPO 系 RL 后训练——一篇讲清 VLA 微调"怎么训、喂什么数据、能到什么程度"。


摘要

视觉-语言-动作模型(VLA)的后训练正在形成一套清晰的工程范式。算法上,主流仍是行为克隆式 SFT:LoRA(rank 32)以约 1.4% 的可训参数追平全量微调(OpenVLA 实测 68.2% vs 69.7%),而"并行解码 + 动作分块 + 连续动作头"的解码侧改造收益甚至大于参数策略(OpenVLA-OFT 在 LIBERO 上 76.5%→97.1%、吞吐 ×26);2025 年起 GRPO/PPO 类 RL 后训练成为第二梯队,能把成功率从个位数拉到 90%+。数据上,有强基座时每任务 50–200 条示教是甜点区间;数据缩放定律证明泛化能力与"环境数 × 物体数"呈幂律关系、每个环境-物体对 50 条示教即饱和,多样性远比堆量重要;π0.5 用 97.6% 的异构"非目标数据"换来开放世界泛化。效果上,SFT 微调样本效率比从头训练高约一个数量级,但存在未见任务上的灾难性遗忘;RL 后训练是当前压错误率、换 OOD 泛化的最有效手段——但基座成功率为 0 时 RL 也无力回天。

关键词:VLA、LoRA、动作分块、GRPO、数据缩放定律、异构 co-training、域随机化


全文总览

VLA 微调全景

一、微调算法

SFT:LoRA 为默认

解码设计影响更大

RL 后训练崛起

二、数据采集

甜点区间 50–200 条/任务

多样性 ≫ 数量(幂律)

泛化导向采集三范式

三、微调效果

样本效率提升约 10×

RL 再压一层错误率

两个负面结论

四、最佳实践

算法选型清单

数据预算分配

目录


一、微调算法:两条技术路线

微调算法

SFT 监督微调(主流)

参数更新策略

全量微调:大数据跨本体

LoRA / QLoRA:默认选择

冻结 VLM + 动作头:防遗忘

动作表示与解码

并行解码 + 动作分块 K=8

连续动作 L1 / diffusion

FiLM + 多视角 + 本体感觉

co-training 防遗忘

RL 后训练(增强)

SimpleVLA-RL:GRPO

RIPT-VLA:LOO-PPO

ConRFT:一致性策略 + HIL

RLDG:RL 数据蒸馏

RLinf-Co:sim-real 协同

边界:零能力基座失效

1. 监督微调(SFT / 行为克隆)——当前绝对主流

VLA 微调的主流范式仍是基于示教数据的行为克隆式 SFT,分化集中在两个维度:“更新哪些参数""动作如何表示”

(1)参数更新策略
方案做法适用场景
全量微调(Full FT)更新全部参数数据量大(>1 万条、跨本体)、下游任务与预训练差异大时更优
LoRA / QLoRA冻结基座,注入低秩适配器(7B 模型 rank 16–32 时仅训练约 1.4% 参数);QLoRA 用 4-bit 量化进一步压缩显存(社区方案,非 OpenVLA 原论文结论)领域与预训练数据接近、示教 <500 条、算力有限时的默认选择
冻结 VLM 骨干 + 只训 action expert / adapter如 GR00T N1.5 冻结 Eagle VLM,只微调 DiT 动作模块和 MLP adapter,明确目的是防止语言能力的灾难性遗忘需保留预训练语义先验;但只训 action expert 在同分布场景会欠拟合

支撑证据(逐条可考):

  • OpenVLA 论文实测:LoRA rank=32 在新任务上基本追平全量微调(68.2% vs 69.7%),只训练 1.4% 的参数(97.6M/7.2B),算力需求降低约 8 倍,单卡 A100 约 10–15 小时完成;rank 大小影响很小,推荐 r=32 为默认
  • π0 的系统消融(2026 年工业场景研究):LoRA rank 从 8 扫到 256,性能在 r=32 饱和,全量微调无统计显著优势;显存从 36.2 GiB 降到 10.8 GiB。但冻结 VLM 主干、或只对视觉编码器做 LoRA 都会显著掉点——具身适配同时需要语义和视觉两侧的可塑性。
  • 冻结视觉编码器的代价:OpenVLA 论文发现冻结视觉编码器使平均成功率从 80.0% 跌至 46.7%
  • 小数据下全量微调反而有害:SemiVLA 对比实验显示仅 10% 标注数据时,全量微调 78.4% < LoRA 81.0%——全量更新在小样本上过拟合并破坏预训练先验。
  • GR00T N1.5 的正面证据:冻结 VLM 保住了语言 grounding——真机 GR-1 任务语言跟随率从 N1 的 46.6% 提升至 93.3%,官方称"冻结 VLM 是该版本最核心的改进"。
  • 其他参数高效方案:TinyVLA 仅训练约 5% 参数的 LoRA 方案;SemiVLA 用选择性 LoRA + 无标注轨迹伪动作做半监督微调。

【重点】默认配方:LoRA r=32 + 视觉编码器参与训练。 两个极端都要避免——全量微调在小数据下过拟合,完全冻结视觉侧则严重欠拟合。

(2)动作表示与解码设计(影响比参数策略更大)

OpenVLA-OFT(RSS 2025)系统对比了微调设计决策,收益分解如下(LIBERO 四套件平均成功率):

改造项成功率增量
起点:自回归 + 离散 token76.5%
+ 并行解码 & 动作分块(K=8)90.2%≈ +14,同时吞吐 ×26
+ 连续动作头(L1 回归或 diffusion)95.3%(L1)/ 95.4%(diffusion)≈ +5,两者相当
+ 多视角 + 本体感觉 + FiLM 语言增强97.1%≈ +2
  • 该配方让 OpenVLA 可适配 25–50Hz 的 ALOHA 双臂平台(原自回归方案仅 3–5Hz,OFT 吞吐达 77.9Hz),真机双臂任务上比从头训练的 Diffusion Policy/ACT 高至 15 个百分点

【重点】解码侧改造(并行解码、动作分块、连续动作)的收益大于参数侧策略,且直接决定模型能否部署到高频双臂平台。

(3)防止遗忘的 co-training

微调时混入预训练分布的数据(视觉-语言任务、其他本体数据)是当前共识:实验表明 VLA 与视觉-语言任务 co-training 可显著提升识别与执行成功率;窄数据上的激进微调会侵蚀预训练泛化性,实践中常用 co-train 一批更广数据、或用 LoRA 缩短训练来保护先验。π0.5 的异构混合配方与 GR00T N1.5 冻结 VLM 都是这一思路的代表(详见"二、3")。

2. 强化学习后训练(RL Post-training)——2025 年快速崛起的第二梯队

动机:SFT 重度依赖数据质量和数量,且在 OOD 场景泛化差。代表性算法与效果:

  • SimpleVLA-RL(GRPO 系):基于 veRL 的 GRPO + 轨迹级二元结果奖励 + 动态采样/非对称 clip/高温采样等探索增强。每任务仅 1 条示教时,LIBERO 平均从 48.9% → 96.9%,LIBERO-Long 从 17.3% → 91.7%;在满血 SFT 基座上仍把 LIBERO 平均从 91% 推到 99%;RoboTwin 1.0 双臂任务 39.8%→70.4%、RoboTwin 2.0 38.3%→68.8%(相对 +80%);且仿真训练的策略无需真机数据即可 sim-to-real 迁移。
  • RIPT-VLA(PPO 变体 + 拒绝采样):仅用成功/失败二元稀疏奖励 + 动态采样留一优势(LOO-PPO),无需价值模型;单条示教、15 次迭代内把成功率从 4% 提到 97%;LIBERO-90 达 94.3%,跨场景泛化最高提升 93.7 个百分点(3.5%→97.2%)。
  • ConRFT(RSS 2025,中科院):两阶段——离线 Cal-ConRFT 用少量演示做 BC+Q 学习的一致性目标初始化,在线 HIL-ConRFT 以一致性策略 + 人工接管保证安全。8 个真实任务上 45–90 分钟在线微调,平均成功率从 SFT 的 39.4% 提到 96.3%(+144%),回合长度缩短 1.9 倍;对照实验显示简单把人采演示加到 150 条并不能让 SFT 追平 RL,因为人采数据存在不一致和次优动作。
  • RLDG(RL 蒸馏):用任务专属 RL 策略生成高质量数据再蒸馏进通用 VLA——45 条 RL 轨迹即达 100%,而人类示教需 300 条;未见 Type-C 插接任务上,150 条 RL 轨迹训练的模型达 100%,900 条人类示教训练的模型封顶 90%;总体相当于 6–10 倍人类数据效率。
  • RLinf-Co:仿真交互 RL + 真实数据正则的 sim-real 协同训练,防灾难性遗忘,OpenVLA 与 π0.5 真机成功率分别再 +24% / +20%
  • 其他:VLA-RL(PPO + 多轮对话式轨迹 + VLM 稠密奖励 + 课程式组织)、TGRPO/Temporal GRPO(轨迹级信用分配)、GRAPE(DPO 偏好对齐)、iRe-VLA(SFT+RL 交替)等。

【重点】RL 的边界:基座模型完全没有初始任务能力时 RL 会彻底失效(全零奖励无法学习——SimpleVLA-RL 实测原始 OpenVLA 在 LIBERO 上成功率为 0%、无法直接做在线 RL,需先用 1 条演示 SFT"点火")。RL 目前定位是"SFT 之后的增强"而非替代。


二、数据采集:数据量、分布与泛化导向采集

数据采集

数据量:甜点区间

OpenVLA:10–150 条/任务

π0:1–20 小时/任务

GR00T:30/100/300 梯度,G1 用 1000 条

从头训练对照:5,000–50,000 条

数据分布:多样性 ≫ 数量

缩放定律:泛化 ∝ 环境数×物体数(幂律)

每个环境-物体对 50 条即饱和

配方:32 环境 × 50 条 → 90%

质量:100 条专家 > 500 条平庸

泛化导向采集

π0.5:97.6% 异构数据 co-training

智元 ADC:对抗式双人采集

RoboTwin 2.0:强域随机化预训练

实操要点

空间/语言/视觉多样性

保留失败与恢复片段

多视角 RGB + ≥50Hz + 归一化

1. 数据量:微调的"甜点区间"

基座微调数据量备注
OpenVLA每任务 10–150 条示教LoRA 单卡 A100 约 10–15 小时
π0每任务 1–20 小时(官方口径;约合百条量级,复杂任务如叠衣远超此量)预训练为 1 万小时、7 种构型、68 任务
GR00T N1/N1.5后训练协议 0/30/100/300 条梯度;真机 G1 用 1000 条达 98.8%(未见物体 84.2%)RoboCasa 30 条/任务下 N1.5 以 47.5% 大幅超过 N1 的 17.4%
Octo每任务约 100 条单卡 A5000 训 5 小时
从头训练对照(ACT / Diffusion Policy)5,000–50,000 条
  • 社区经验(LoRA 方案):单任务 100–500 条示教可达 80%+ 成功率;10+ 任务时每任务 200–1,000 条。
  • 总体经验:有强基座时 50–100 条任务示教微调 ≈ 从头训练 300–500 条的效果,样本效率提升约一个数量级(各研究口径不一:RLDG 报 6–10 倍,第三方对 OpenVLA 测算约 10 倍,统一记为 3–10 倍,取决于基座与任务)。

【重点】有强基座时,每任务 50–200 条示教是甜点区间;不要按从头训练的标准备数据。

2. 数据分布:多样性 ≫ 绝对数量(有幂律依据)

清华/上海期智/上海 AI Lab 的"模仿学习数据缩放定律"研究(ICLR 2025;4 万+ 示教、1.5 万+ 真机 rollout)给出迄今最系统的结论:

  • 策略对新物体、新环境的泛化能力与训练环境数、物体数呈近似幂律关系
  • 环境和物体的多样性远比单点示教数量重要——每个"环境-物体对"的示教数超过约 50 条后,再加数据几乎无收益;
  • 高效采集配方:32 个环境 × 每个环境 1 个独特物体 × 50 条示教(4 个人采一下午),即可训出在新环境、新物体上约 90% 成功率的单任务策略;
  • 质量同样优先:100 条平滑、一致、无犹豫的专家演示优于 500 条平庸演示;
  • 基准侧的分布设计参照:LIBERO 按 Spatial / Object / Goal / Long 四套件分别控制空间布局、物体类别、任务目标、长程性的变化,每套件 10 任务 × 50 条演示。

3. 泛化性采集:三种代表性范式

(1)π0.5 的异构 co-training(开放世界标杆)
  • 目标本体(移动操作机器人)只采了约 400 小时、覆盖约 100 个不同家庭的数据——这只是中等规模;
  • 关键在于 97.6% 的训练样本来自目标机器人之外的异构来源:多环境非移动机械臂数据(ME)、实验室跨本体数据(CE)、高层语义子任务预测(HL)、网页多模态数据(WD:图像描述/VQA/目标定位)、人口头指令数据(VI);
  • 泛化能力随训练环境数量稳定增长,约 100 个环境后逼近"直接在测试环境训练"的上限
  • 结果:模型能在从未见过的家庭里完成 10–15 分钟的长程任务(清理厨房、整理卧室)。
(2)对抗式数据采集(智元 ADC)

双人协同采集——一名操作员正常遥操作,另一名"对抗操作员"动态改变背景、物体位置/姿态乃至语言指令,主动注入跨模态扰动,提升单条数据信息密度,减少后训练数据需求并增强鲁棒性。其底座数据 AgiBot World 为 100 万+ 条轨迹、217 个任务、五大场景的真机数据,支撑 GO-1(ViLLA 架构)的小样本快速泛化。

(3)仿真域随机化(RoboTwin 2.0)

32 任务 × 300 条(共 9,600 条轨迹)、叠加强域随机化的数据预训练 RDT/π0,对未见环境扰动的鲁棒性相对提升约 30%,而等量干净数据几乎无收益。

(4)行业数据产能侧

行业共识是"数据若只来自少数实验室场景,量再大泛化也受限":智元(觅蜂科技)在建设覆盖商业/酒店/商超/家居多场景的千万小时级数采产能;宇树开源了 340 小时、189 万条 G1 真机全身遥操作轨迹。

4. 泛化导向采集的实操要点

综合各来源,采集时应主动覆盖的分布维度:

  • 空间变化:物体位置/朝向要铺开采——空间泛化弱通常意味着数据中位置变化不足;
  • 语言多样性:同一任务至少 5 种指令表述标注,否则语言泛化(换说法)会差;
  • 视觉多样性至少 3 种光照条件、变换相机角度、≥30% 的演示放置干扰物;
  • 轨迹多样性与失败案例:同一任务用不同轨迹/接近角/抓取策略采集,并保留失败与恢复片段(抓空、拿错物体),否则模型学不会从可预见的错误中恢复;
  • 演示质量:平滑、一次成功、无停顿/重试/恢复的轨迹;Spacemouse、GELLO 等遥操作接口中,旋转少的任务用 Spacemouse 数据更干净;
  • 记录规范:多视角 RGB(2–3 路)、≥50Hz 关节轨迹、语言标注、本体自有动作空间及归一化统计、本体构型元数据。

三、微调效果:代表性数字与警示

微调效果

SFT 路线

OpenVLA LoRA 68.2% ≈ 全量 69.7%

OpenVLA-OFT:76.5% → 97.1%

SemiVLA:81.0% → 89.0%

GR00T N1.5:17.4% → 47.5%

RL 路线

SimpleVLA-RL:91% → 99%

RIPT-VLA:4% → 97%(15 次迭代)

ConRFT:39.4% → 96.3%

RLDG:6–10× 数据效率

RLinf-Co:再 +20~24%

两个警示

SFT 未见任务遗忘至 0%

基座决定下限

1. 效果汇总表

模型/方法设置效果
OpenVLA(LoRA vs 全量)Franka 新任务,10–150 条示教LoRA 68.2% ≈ 全量 69.7%,仅训 1.4% 参数,算力降 8×
OpenVLA(微调 vs 从头训练)同上唯一全任务 ≥50% 成功率,平均比 Diffusion Policy 高 20.4 个百分点
OpenVLA-OFTLIBERO 四套件76.5% → 97.1%,吞吐 ×26;真机双臂比从零训练策略高至 +15pp
SemiVLA(选择性 LoRA + 半监督)10% 标注数据81.0% → 89.0%;1 条示教 few-shot 47.5% → 58.7%,20 条示教达 87.3%
GR00T N1.5冻结 VLM + FLARE 等三改动RoboCasa 30 条/任务 17.4% → 47.5%(纯配方改进,未加数据);语言跟随率 46.6% → 93.3%
SimpleVLA-RLOpenVLA-OFT + GRPOLIBERO 91% → 99%;单示教 LIBERO-Long 17.3% → 91.7%;RoboTwin2.0 38.3% → 68.8%
RIPT-VLA单示教 + 15 次迭代4% → 97%;LIBERO-90 94.3%
ConRFT45–90 分钟真机在线39.4% → 96.3%(+144%),回合长度缩短 1.9×
RLDGRL 数据蒸馏45 条 RL 轨迹 = 300 条人类示教;未见任务 150 条 RL → 100% vs 900 条人类 → 90%
RLinf-Cosim-real 协同训练真机成功率再 +24%(OpenVLA)/ +20%(π0.5)
数据缩放定律策略32 环境 × 50 条新环境新物体零样本约 90% 成功率

2. 两个值得警惕的负面结论

【警示 1】SFT 的过拟合与遗忘:SFT 和 RL 在训练任务上都能到 90%+,但 SFT 在未见任务上经常灾难性遗忘、成功率掉到 0%,RL 则能在未见任务上稳中有升(SimpleVLA-RL 论文的泛化实验结论)。

【警示 2】基座决定下限:OpenVLA 零样本泛化极有限,若基座在目标任务上成功率为 0%,RL 也无法救回——微调效果高度依赖预训练数据与下游任务的接近程度


四、总结:当前最佳实践清单

最佳实践

算法

LoRA r=32 + 视觉编码器参与训练

连续动作头 + 动作分块 K≈8

数据 >1 万条再上全量微调

SFT 达标后接 GRPO/PPO 类 RL

数据量

甜点区间:50–200 条/任务

评估分 ID 与 OOD 两组

数据分布

预算砸向多样性而非堆量

32 环境 × 50 条配方

宁要 100 条专家级不要 500 条平庸

泛化采集

异构 co-training 最有效

仿真域随机化再 +30% 鲁棒性

  1. 算法:默认 **LoRA(rank 32,视觉编码器必须参与训练)+ 连续动作头 + 动作分块(K≈8)**起步;LoRA 性能封顶或数据量 >1 万条时再上全量微调;SFT 达标后可用 GRPO/PPO 类 RL 再压一层错误率并换取 OOD 泛化;
  2. 数据量:有强基座时每任务 50–200 条示教是甜点区间;评估要分 in-distribution 与 OOD 两组;
  3. 数据分布:预算优先砸在环境/物体/位置/指令表述的多样性上,而不是单点示教数量;"32 环境 × 50 条"是经过验证的高性价比配方;质量上宁要 100 条专家级、不要 500 条平庸演示;
  4. 泛化性采集:异构 co-training(其他本体数据 + 网页多模态数据 + 高层语义标注)是目前开放世界泛化最有效的手段,π0.5 用 97.6% 的"非目标数据"换来了未见家庭中的长程操作能力;仿真侧用强域随机化预训练(RoboTwin 2.0 配方)可再叠加约 30% 的鲁棒性收益。

参考来源

  • Kim et al., OpenVLA: An Open-Source Vision-Language-Action Model, CoRL 2024
  • Kim et al., Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success(OpenVLA-OFT), RSS 2025
  • Physical Intelligence, π0: A Vision-Language-Action Flow Model for General Robot Control, RSS 2025
  • Physical Intelligence, π0.5: a Vision-Language-Action Model with Open-World Generalization, 2025
  • NVIDIA, GR00T N1: An Open Foundation Model for Generalist Humanoid Robots 及 GR00T N1.5 官方技术博客, 2025
  • SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning, 2025
  • RIPT-VLA: Interactive Post-Training for Vision-Language-Action Models, 2025
  • ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy, RSS 2025
  • RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning, 2024
  • Lin et al., Data Scaling Laws in Imitation Learning for Robotic Manipulation, ICLR 2025
  • SemiVLA: Activation-Function-Guided Selective Fine-Tuning for Vision-Language-Action Models, 2025
  • RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation, 2025
  • 智元机器人 ADC / AgiBot World / GO-1 公开技术资料
  • A Systematic Study of LoRA-based Fine-tuning of π0-style VLA Models, 2026

分享完成~

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐