VLA 微调实战指南:算法选型、数据采集与效果全景
VLA 微调实战指南:算法选型、数据采集与效果全景
从 OpenVLA 到 π0.5、GR00T N1.5,再到 GRPO 系 RL 后训练——一篇讲清 VLA 微调"怎么训、喂什么数据、能到什么程度"。
摘要
视觉-语言-动作模型(VLA)的后训练正在形成一套清晰的工程范式。算法上,主流仍是行为克隆式 SFT:LoRA(rank 32)以约 1.4% 的可训参数追平全量微调(OpenVLA 实测 68.2% vs 69.7%),而"并行解码 + 动作分块 + 连续动作头"的解码侧改造收益甚至大于参数策略(OpenVLA-OFT 在 LIBERO 上 76.5%→97.1%、吞吐 ×26);2025 年起 GRPO/PPO 类 RL 后训练成为第二梯队,能把成功率从个位数拉到 90%+。数据上,有强基座时每任务 50–200 条示教是甜点区间;数据缩放定律证明泛化能力与"环境数 × 物体数"呈幂律关系、每个环境-物体对 50 条示教即饱和,多样性远比堆量重要;π0.5 用 97.6% 的异构"非目标数据"换来开放世界泛化。效果上,SFT 微调样本效率比从头训练高约一个数量级,但存在未见任务上的灾难性遗忘;RL 后训练是当前压错误率、换 OOD 泛化的最有效手段——但基座成功率为 0 时 RL 也无力回天。
关键词:VLA、LoRA、动作分块、GRPO、数据缩放定律、异构 co-training、域随机化
全文总览
目录
一、微调算法:两条技术路线
1. 监督微调(SFT / 行为克隆)——当前绝对主流
VLA 微调的主流范式仍是基于示教数据的行为克隆式 SFT,分化集中在两个维度:“更新哪些参数"和"动作如何表示”。
(1)参数更新策略
| 方案 | 做法 | 适用场景 |
|---|---|---|
| 全量微调(Full FT) | 更新全部参数 | 数据量大(>1 万条、跨本体)、下游任务与预训练差异大时更优 |
| LoRA / QLoRA | 冻结基座,注入低秩适配器(7B 模型 rank 16–32 时仅训练约 1.4% 参数);QLoRA 用 4-bit 量化进一步压缩显存(社区方案,非 OpenVLA 原论文结论) | 领域与预训练数据接近、示教 <500 条、算力有限时的默认选择 |
| 冻结 VLM 骨干 + 只训 action expert / adapter | 如 GR00T N1.5 冻结 Eagle VLM,只微调 DiT 动作模块和 MLP adapter,明确目的是防止语言能力的灾难性遗忘 | 需保留预训练语义先验;但只训 action expert 在同分布场景会欠拟合 |
支撑证据(逐条可考):
- OpenVLA 论文实测:LoRA rank=32 在新任务上基本追平全量微调(68.2% vs 69.7%),只训练 1.4% 的参数(97.6M/7.2B),算力需求降低约 8 倍,单卡 A100 约 10–15 小时完成;rank 大小影响很小,推荐 r=32 为默认。
- π0 的系统消融(2026 年工业场景研究):LoRA rank 从 8 扫到 256,性能在 r=32 饱和,全量微调无统计显著优势;显存从 36.2 GiB 降到 10.8 GiB。但冻结 VLM 主干、或只对视觉编码器做 LoRA 都会显著掉点——具身适配同时需要语义和视觉两侧的可塑性。
- 冻结视觉编码器的代价:OpenVLA 论文发现冻结视觉编码器使平均成功率从 80.0% 跌至 46.7%。
- 小数据下全量微调反而有害:SemiVLA 对比实验显示仅 10% 标注数据时,全量微调 78.4% < LoRA 81.0%——全量更新在小样本上过拟合并破坏预训练先验。
- GR00T N1.5 的正面证据:冻结 VLM 保住了语言 grounding——真机 GR-1 任务语言跟随率从 N1 的 46.6% 提升至 93.3%,官方称"冻结 VLM 是该版本最核心的改进"。
- 其他参数高效方案:TinyVLA 仅训练约 5% 参数的 LoRA 方案;SemiVLA 用选择性 LoRA + 无标注轨迹伪动作做半监督微调。
【重点】默认配方:LoRA r=32 + 视觉编码器参与训练。 两个极端都要避免——全量微调在小数据下过拟合,完全冻结视觉侧则严重欠拟合。
(2)动作表示与解码设计(影响比参数策略更大)
OpenVLA-OFT(RSS 2025)系统对比了微调设计决策,收益分解如下(LIBERO 四套件平均成功率):
| 改造项 | 成功率 | 增量 |
|---|---|---|
| 起点:自回归 + 离散 token | 76.5% | — |
| + 并行解码 & 动作分块(K=8) | 90.2% | ≈ +14,同时吞吐 ×26 |
| + 连续动作头(L1 回归或 diffusion) | 95.3%(L1)/ 95.4%(diffusion) | ≈ +5,两者相当 |
| + 多视角 + 本体感觉 + FiLM 语言增强 | 97.1% | ≈ +2 |
- 该配方让 OpenVLA 可适配 25–50Hz 的 ALOHA 双臂平台(原自回归方案仅 3–5Hz,OFT 吞吐达 77.9Hz),真机双臂任务上比从头训练的 Diffusion Policy/ACT 高至 15 个百分点。
【重点】解码侧改造(并行解码、动作分块、连续动作)的收益大于参数侧策略,且直接决定模型能否部署到高频双臂平台。
(3)防止遗忘的 co-training
微调时混入预训练分布的数据(视觉-语言任务、其他本体数据)是当前共识:实验表明 VLA 与视觉-语言任务 co-training 可显著提升识别与执行成功率;窄数据上的激进微调会侵蚀预训练泛化性,实践中常用 co-train 一批更广数据、或用 LoRA 缩短训练来保护先验。π0.5 的异构混合配方与 GR00T N1.5 冻结 VLM 都是这一思路的代表(详见"二、3")。
2. 强化学习后训练(RL Post-training)——2025 年快速崛起的第二梯队
动机:SFT 重度依赖数据质量和数量,且在 OOD 场景泛化差。代表性算法与效果:
- SimpleVLA-RL(GRPO 系):基于 veRL 的 GRPO + 轨迹级二元结果奖励 + 动态采样/非对称 clip/高温采样等探索增强。每任务仅 1 条示教时,LIBERO 平均从 48.9% → 96.9%,LIBERO-Long 从 17.3% → 91.7%;在满血 SFT 基座上仍把 LIBERO 平均从 91% 推到 99%;RoboTwin 1.0 双臂任务 39.8%→70.4%、RoboTwin 2.0 38.3%→68.8%(相对 +80%);且仿真训练的策略无需真机数据即可 sim-to-real 迁移。
- RIPT-VLA(PPO 变体 + 拒绝采样):仅用成功/失败二元稀疏奖励 + 动态采样留一优势(LOO-PPO),无需价值模型;单条示教、15 次迭代内把成功率从 4% 提到 97%;LIBERO-90 达 94.3%,跨场景泛化最高提升 93.7 个百分点(3.5%→97.2%)。
- ConRFT(RSS 2025,中科院):两阶段——离线 Cal-ConRFT 用少量演示做 BC+Q 学习的一致性目标初始化,在线 HIL-ConRFT 以一致性策略 + 人工接管保证安全。8 个真实任务上 45–90 分钟在线微调,平均成功率从 SFT 的 39.4% 提到 96.3%(+144%),回合长度缩短 1.9 倍;对照实验显示简单把人采演示加到 150 条并不能让 SFT 追平 RL,因为人采数据存在不一致和次优动作。
- RLDG(RL 蒸馏):用任务专属 RL 策略生成高质量数据再蒸馏进通用 VLA——45 条 RL 轨迹即达 100%,而人类示教需 300 条;未见 Type-C 插接任务上,150 条 RL 轨迹训练的模型达 100%,900 条人类示教训练的模型封顶 90%;总体相当于 6–10 倍人类数据效率。
- RLinf-Co:仿真交互 RL + 真实数据正则的 sim-real 协同训练,防灾难性遗忘,OpenVLA 与 π0.5 真机成功率分别再 +24% / +20%。
- 其他:VLA-RL(PPO + 多轮对话式轨迹 + VLM 稠密奖励 + 课程式组织)、TGRPO/Temporal GRPO(轨迹级信用分配)、GRAPE(DPO 偏好对齐)、iRe-VLA(SFT+RL 交替)等。
【重点】RL 的边界:基座模型完全没有初始任务能力时 RL 会彻底失效(全零奖励无法学习——SimpleVLA-RL 实测原始 OpenVLA 在 LIBERO 上成功率为 0%、无法直接做在线 RL,需先用 1 条演示 SFT"点火")。RL 目前定位是"SFT 之后的增强"而非替代。
二、数据采集:数据量、分布与泛化导向采集
1. 数据量:微调的"甜点区间"
| 基座 | 微调数据量 | 备注 |
|---|---|---|
| OpenVLA | 每任务 10–150 条示教 | LoRA 单卡 A100 约 10–15 小时 |
| π0 | 每任务 1–20 小时(官方口径;约合百条量级,复杂任务如叠衣远超此量) | 预训练为 1 万小时、7 种构型、68 任务 |
| GR00T N1/N1.5 | 后训练协议 0/30/100/300 条梯度;真机 G1 用 1000 条达 98.8%(未见物体 84.2%) | RoboCasa 30 条/任务下 N1.5 以 47.5% 大幅超过 N1 的 17.4% |
| Octo | 每任务约 100 条 | 单卡 A5000 训 5 小时 |
| 从头训练对照(ACT / Diffusion Policy) | 5,000–50,000 条 | — |
- 社区经验(LoRA 方案):单任务 100–500 条示教可达 80%+ 成功率;10+ 任务时每任务 200–1,000 条。
- 总体经验:有强基座时 50–100 条任务示教微调 ≈ 从头训练 300–500 条的效果,样本效率提升约一个数量级(各研究口径不一:RLDG 报 6–10 倍,第三方对 OpenVLA 测算约 10 倍,统一记为 3–10 倍,取决于基座与任务)。
【重点】有强基座时,每任务 50–200 条示教是甜点区间;不要按从头训练的标准备数据。
2. 数据分布:多样性 ≫ 绝对数量(有幂律依据)
清华/上海期智/上海 AI Lab 的"模仿学习数据缩放定律"研究(ICLR 2025;4 万+ 示教、1.5 万+ 真机 rollout)给出迄今最系统的结论:
- 策略对新物体、新环境的泛化能力与训练环境数、物体数呈近似幂律关系;
- 环境和物体的多样性远比单点示教数量重要——每个"环境-物体对"的示教数超过约 50 条后,再加数据几乎无收益;
- 高效采集配方:32 个环境 × 每个环境 1 个独特物体 × 50 条示教(4 个人采一下午),即可训出在新环境、新物体上约 90% 成功率的单任务策略;
- 质量同样优先:100 条平滑、一致、无犹豫的专家演示优于 500 条平庸演示;
- 基准侧的分布设计参照:LIBERO 按 Spatial / Object / Goal / Long 四套件分别控制空间布局、物体类别、任务目标、长程性的变化,每套件 10 任务 × 50 条演示。
3. 泛化性采集:三种代表性范式
(1)π0.5 的异构 co-training(开放世界标杆)
- 目标本体(移动操作机器人)只采了约 400 小时、覆盖约 100 个不同家庭的数据——这只是中等规模;
- 关键在于 97.6% 的训练样本来自目标机器人之外的异构来源:多环境非移动机械臂数据(ME)、实验室跨本体数据(CE)、高层语义子任务预测(HL)、网页多模态数据(WD:图像描述/VQA/目标定位)、人口头指令数据(VI);
- 泛化能力随训练环境数量稳定增长,约 100 个环境后逼近"直接在测试环境训练"的上限;
- 结果:模型能在从未见过的家庭里完成 10–15 分钟的长程任务(清理厨房、整理卧室)。
(2)对抗式数据采集(智元 ADC)
双人协同采集——一名操作员正常遥操作,另一名"对抗操作员"动态改变背景、物体位置/姿态乃至语言指令,主动注入跨模态扰动,提升单条数据信息密度,减少后训练数据需求并增强鲁棒性。其底座数据 AgiBot World 为 100 万+ 条轨迹、217 个任务、五大场景的真机数据,支撑 GO-1(ViLLA 架构)的小样本快速泛化。
(3)仿真域随机化(RoboTwin 2.0)
用 32 任务 × 300 条(共 9,600 条轨迹)、叠加强域随机化的数据预训练 RDT/π0,对未见环境扰动的鲁棒性相对提升约 30%,而等量干净数据几乎无收益。
(4)行业数据产能侧
行业共识是"数据若只来自少数实验室场景,量再大泛化也受限":智元(觅蜂科技)在建设覆盖商业/酒店/商超/家居多场景的千万小时级数采产能;宇树开源了 340 小时、189 万条 G1 真机全身遥操作轨迹。
4. 泛化导向采集的实操要点
综合各来源,采集时应主动覆盖的分布维度:
- 空间变化:物体位置/朝向要铺开采——空间泛化弱通常意味着数据中位置变化不足;
- 语言多样性:同一任务至少 5 种指令表述标注,否则语言泛化(换说法)会差;
- 视觉多样性:至少 3 种光照条件、变换相机角度、≥30% 的演示放置干扰物;
- 轨迹多样性与失败案例:同一任务用不同轨迹/接近角/抓取策略采集,并保留失败与恢复片段(抓空、拿错物体),否则模型学不会从可预见的错误中恢复;
- 演示质量:平滑、一次成功、无停顿/重试/恢复的轨迹;Spacemouse、GELLO 等遥操作接口中,旋转少的任务用 Spacemouse 数据更干净;
- 记录规范:多视角 RGB(2–3 路)、≥50Hz 关节轨迹、语言标注、本体自有动作空间及归一化统计、本体构型元数据。
三、微调效果:代表性数字与警示
1. 效果汇总表
| 模型/方法 | 设置 | 效果 |
|---|---|---|
| OpenVLA(LoRA vs 全量) | Franka 新任务,10–150 条示教 | LoRA 68.2% ≈ 全量 69.7%,仅训 1.4% 参数,算力降 8× |
| OpenVLA(微调 vs 从头训练) | 同上 | 唯一全任务 ≥50% 成功率,平均比 Diffusion Policy 高 20.4 个百分点 |
| OpenVLA-OFT | LIBERO 四套件 | 76.5% → 97.1%,吞吐 ×26;真机双臂比从零训练策略高至 +15pp |
| SemiVLA(选择性 LoRA + 半监督) | 10% 标注数据 | 81.0% → 89.0%;1 条示教 few-shot 47.5% → 58.7%,20 条示教达 87.3% |
| GR00T N1.5 | 冻结 VLM + FLARE 等三改动 | RoboCasa 30 条/任务 17.4% → 47.5%(纯配方改进,未加数据);语言跟随率 46.6% → 93.3% |
| SimpleVLA-RL | OpenVLA-OFT + GRPO | LIBERO 91% → 99%;单示教 LIBERO-Long 17.3% → 91.7%;RoboTwin2.0 38.3% → 68.8% |
| RIPT-VLA | 单示教 + 15 次迭代 | 4% → 97%;LIBERO-90 94.3% |
| ConRFT | 45–90 分钟真机在线 | 39.4% → 96.3%(+144%),回合长度缩短 1.9× |
| RLDG | RL 数据蒸馏 | 45 条 RL 轨迹 = 300 条人类示教;未见任务 150 条 RL → 100% vs 900 条人类 → 90% |
| RLinf-Co | sim-real 协同训练 | 真机成功率再 +24%(OpenVLA)/ +20%(π0.5) |
| 数据缩放定律策略 | 32 环境 × 50 条 | 新环境新物体零样本约 90% 成功率 |
2. 两个值得警惕的负面结论
【警示 1】SFT 的过拟合与遗忘:SFT 和 RL 在训练任务上都能到 90%+,但 SFT 在未见任务上经常灾难性遗忘、成功率掉到 0%,RL 则能在未见任务上稳中有升(SimpleVLA-RL 论文的泛化实验结论)。
【警示 2】基座决定下限:OpenVLA 零样本泛化极有限,若基座在目标任务上成功率为 0%,RL 也无法救回——微调效果高度依赖预训练数据与下游任务的接近程度。
四、总结:当前最佳实践清单
- 算法:默认 **LoRA(rank 32,视觉编码器必须参与训练)+ 连续动作头 + 动作分块(K≈8)**起步;LoRA 性能封顶或数据量 >1 万条时再上全量微调;SFT 达标后可用 GRPO/PPO 类 RL 再压一层错误率并换取 OOD 泛化;
- 数据量:有强基座时每任务 50–200 条示教是甜点区间;评估要分 in-distribution 与 OOD 两组;
- 数据分布:预算优先砸在环境/物体/位置/指令表述的多样性上,而不是单点示教数量;"32 环境 × 50 条"是经过验证的高性价比配方;质量上宁要 100 条专家级、不要 500 条平庸演示;
- 泛化性采集:异构 co-training(其他本体数据 + 网页多模态数据 + 高层语义标注)是目前开放世界泛化最有效的手段,π0.5 用 97.6% 的"非目标数据"换来了未见家庭中的长程操作能力;仿真侧用强域随机化预训练(RoboTwin 2.0 配方)可再叠加约 30% 的鲁棒性收益。
参考来源
- Kim et al., OpenVLA: An Open-Source Vision-Language-Action Model, CoRL 2024
- Kim et al., Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success(OpenVLA-OFT), RSS 2025
- Physical Intelligence, π0: A Vision-Language-Action Flow Model for General Robot Control, RSS 2025
- Physical Intelligence, π0.5: a Vision-Language-Action Model with Open-World Generalization, 2025
- NVIDIA, GR00T N1: An Open Foundation Model for Generalist Humanoid Robots 及 GR00T N1.5 官方技术博客, 2025
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning, 2025
- RIPT-VLA: Interactive Post-Training for Vision-Language-Action Models, 2025
- ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy, RSS 2025
- RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning, 2024
- Lin et al., Data Scaling Laws in Imitation Learning for Robotic Manipulation, ICLR 2025
- SemiVLA: Activation-Function-Guided Selective Fine-Tuning for Vision-Language-Action Models, 2025
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation, 2025
- 智元机器人 ADC / AgiBot World / GO-1 公开技术资料
- A Systematic Study of LoRA-based Fine-tuning of π0-style VLA Models, 2026
分享完成~
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)