DeepMind EXIMO:用 VLM 当「大脑」,把 VLA 机器人微调的样本效率拉到新基线

Hugging Face 每日论文(2026-08-23 精选)

图:工业产线上的机械臂是 VLA 微调最典型的应用载体

把一个会做菜的机器人教会做一道新菜,传统做法需要「人坐在机器人面前,手把手演示几十遍到几百遍」。如果按一家工厂有 20 种工序、每种要 50 次演示来算,单是采集数据就要 1000 次遥操作——按一次演示 3 分钟、人均工资折算下来,单个工厂的数据成本就能砸进六位数。这还没算数据清洗、标注、训练的时间。

2026 年 8 月 20 日 arXiv 上挂出的 EXIMO 论文(编号 2608.19891,标题「EXIMO: VLM Guided Exploration of VLA Policies」),由 DeepMind 的 Bhavya Sukhija、Oliver Groth、Mohit Shridhar、Tim Hertweck、Michael Bloesch、Markus Wulfmeier、Abbas Abdolmaleki、Martin Riedmiller 等 8 位研究员联合署名,直接瞄准的就是这个痛点:能不能让 VLA 机器人在学习新任务时,既不用人演示几百遍,又比传统强化学习省样本

答案是把一台 VLM(Vision-Language Model,视觉语言模型)请进机器人的训练回路当「大脑」,让它在训练阶段自己出题、自己执行、自己打分。论文报告的结果显示:相比传统方法,EXIMO 在样本效率和最终成功率上同时取得显著提升,特别在长周期、组合型、需要推理的任务上拉开了明显差距。

一、问题在哪:为什么 VLA 微调至今没解决

VLA 模型近两年在通用机器人操作上掀起了一波高潮——OpenVLA、RT-2、π0 一类模型用数十万小时的人类遥操作数据训练,能完成「把红色方块放到蓝色杯子里」这种基础指令。但要把这样的「通才机器人」适配到工厂、家里的新任务时,研究人员马上撞上三堵墙:

  1. 人类演示贵:每个新任务要几十到几百次演示,按一次 3 分钟算,单任务就是 5 到 20 小时的人工采集;
  2. 强化学习慢:传统 RL 用在 VLA 上样本效率极差,特别是长周期任务,探索阶段要跑几万次才能收敛;
  3. VLA 架构对 RL 不友好:动辄几十亿参数的 VLA 直接跑策略梯度,显存吃紧、梯度不稳,「小样本 + 大模型」几乎成了不可调和的矛盾。

EXIMO 的切入点很有趣:既然「端到端 RL」不可行,那能不能把 VLM 当成「任务分解器」,让 VLM 在仿真里给 VLA 出子任务,再让 VLA 在这些子任务上做「半监督式」的模仿和强化?

二、核心方法:三阶段流水线

EXIMO 把整个微调流程拆成三个阶段:Explore(探索)、Imitate(模仿)、Optimize(优化)。每个阶段解决一类问题:

图:仿人机器人在家庭环境里执行抓取任务

阶段一:Explore(VLM 当出题人)

这一阶段的核心是让 VLM 给 VLA「分解任务」。给定一个新指令(比如「把桌上的工具按尺寸从大到小排好」),VLM 先把任务拆成更短、更可执行的子任务序列(先抓最大的、再抓中间的、最后抓最小的、放到对应位置)。

拆完之后,VLM 会在仿真环境里跑一遍,用 VLA 来执行每个子任务,并且记录「每个子任务执行得怎么样」。这个过程不依赖任何人类演示——VLM 出题,VLA 答题,全程自动循环。

VLM 在这里充当的角色类似一个「任务工程师」:它本身不直接控制机器人,但能把复杂任务翻译成 VLA 能完成的简单指令。

阶段二:Imitate(VLA 从 VLM 出题中学)

把第一阶段收集到的「VLM 出题 + VLA 执行」轨迹打包成一个数据集,让 VLA 在这个数据集上做监督学习微调。

这一步看起来普通,但关键是「数据集结构」:每一段轨迹都包含 (子任务指令, 当前观察, 应该执行的动作) 三元组,而且子任务比原始任务短得多——VLA 在更短、更聚焦的样本上学,样本效率比直接学完整长任务高很多。

论文报告说,单是这个模仿阶段,就让 VLA 在新任务上的成功率从基线的十几百分点拉到四十以上。

阶段三:Optimize(残差 off-policy RL 微调)

最后一步是用残差强化学习继续打磨 VLA 策略。这里的关键设计是「残差」:不在 VLA 的全部参数上跑策略梯度,而是在 VLA 输出的动作上加一个「残差修正项」——这个残差修正项是一个轻量级的策略头,只占 VLA 参数量的极小一部分。

这样做的好处是双重的:一方面残差项的参数少,RL 的梯度方差小、训练稳定;另一方面 VLA 的原始能力被保留下来,RL 只是在「最后一步」做微调,不会把已经学会的东西推翻。

论文特别强调,残差项用的是「off-policy」数据——也就是说不需要在线跑机器人,训练时可以从之前 Explore 阶段收集的缓冲区里采样,训练效率和样本多样性都好得多。

三、实验结果:三个数字说明问题

EXIMO 论文在仿真和真实机器人上都做了评估。下面这张表是论文里给出的关键消融数据:

配置平均成功率训练样本数(仿真交互步)
基线(无微调,直接跑 VLA)12.4%0
传统行为克隆(人类演示 50 次)31.7%50 次演示
传统 RL(PPO,从零训练)28.5%120 万步
EXIMO 三阶段完整版67.3%约 25 万步(Explore+Optimize 合计)
EXIMO 去掉 Explore 阶段51.2%约 18 万步
EXIMO 去掉 Optimize 阶段58.6%50 次演示

几个关键观察:

  • 完整 EXIMO 比「人类演示 50 次 + 行为克隆」成功率翻倍还多,但只用了不到传统 RL 五分之一的样本;
  • 去掉 Explore 阶段(不让 VLM 出题)后性能掉 16 个百分点——说明「VLM 分解任务」这个设计贡献了将近四分之一的最终性能;
  • 去掉 Optimize 阶段(不做残差 RL)后性能掉 8.7 个百分点,但只省了 12% 的样本——性价比最高的部分正是残差 RL 这块「小参数大收益」的设计。

论文还在真实机器人上做了验证:用一台 Franka Panda 机械臂做了 4 个真实任务(叠毛巾、把杯子放到架子上、分类垃圾、拼装插头),EXIMO 微调后的 VLA 比基线平均提升 24 个百分点。

四、为什么 VLM 出题这么管用

论文给了一个比较细致的解释。VLM 在分解任务时实际上做了两件事:

  1. 任务粒度匹配:把长任务切成「VLA 单次能完成」的短子任务。VLA 在短子任务上的成功率远高于长任务——这个观察在多个 VLA 论文里都被提到,但 EXIMO 是第一个用 VLM 系统化做这件事的。
  2. 失败模式提示:VLM 在仿真里跑一遍后,能识别哪些子任务 VLA 容易失败,并在下一轮出题时给 VLA 「针对性练习」。比如发现 VLA 在「精确放置」任务上失败率高,VLM 就会多生成一些「抓 → 移动 → 精确放置」的三步子任务,让 VLA 在这个特定模式上多训练。

图:深度学习是 EXIMO 的算法底座

论文里有一段很有意思的消融:把 VLM 换成「基于规则的子任务分解器」(即人工写一套 if-else 把任务切成固定子任务),性能立刻从 67.3% 掉到 44.1%。这说明 VLM 提供的「自适应任务分解」是 EXIMO 真正值钱的地方——它不是简单的「自动切任务」,而是「针对 VLA 当前能力动态出题」。

五、强化学习的「残差化」设计

EXIMO 在第三阶段用的是「残差 off-policy RL」,这个设计值得单独说两句。

传统的「端到端 RL 微调大模型」有两个老大难问题:一是梯度方差大(动辄数十亿参数的策略梯度更新一次要跑几小时),二是「灾难性遗忘」——RL 的探索阶段会把模型已经学会的能力推翻。

EXIMO 的解决思路是把 RL 限定在一个「动作残差」上:

  • VLA 推理出一个动作 a_vla;
  • 残差策略头推理出一个修正量 δ;
  • 实际执行的动作是 a_vla + δ。

残差策略头的参数量只占 VLA 的 1% 左右,训练速度快、显存占用低;同时因为 VLA 的原始输出被保留,「灾难性遗忘」的问题在很大程度上被缓解。

论文给出的数字是:用残差 RL 训练 25 万步(其中 Explore 阶段贡献约 18 万步,Optimize 阶段贡献约 7 万步),VLA 在测试任务上的成功率从 58.6% 提升到 67.3%——7 万步 RL 换 8.7 个百分点,性价比相当可观。

六、意义与局限

图:强化学习是 EXIMO 第三阶段的数学基础

EXIMO 给机器人领域提供了一个相对完整的「新任务适配」范式:

  • 用 VLM 替代昂贵的人类演示,降低数据采集成本;
  • 用「残差 RL」替代端到端 RL,提升训练稳定性;
  • 用三阶段流水线(Explore → Imitate → Optimize)把不同训练范式的优势串起来。

对具身智能赛道的从业者来说,这篇论文最直接的启发可能是:「VLM + VLA」的组合不再只是推理时的「任务规划器」,也可以是训练时的「数据增强器」和「出题人」。

但论文也承认了几个局限:

  • VLM 本身的「任务分解能力」决定了 EXIMO 的上限——如果 VLM 把任务切错了,VLA 跟着学错;
  • 残差 RL 在「高度结构化」的任务上效果好,但在「开放式探索」任务上提升有限;
  • 真实机器人的实验只在 4 个任务上验证,更多样化的硬件和任务还没覆盖;
  • 计算开销上,VLM 出题阶段在仿真里跑可能要几十分钟到几小时,对实时性要求高的场景不友好。

从更宏观的角度看,EXIMO 代表的是 2026 下半年机器人微调方法的一个明确趋势——「VLM 当大脑 + VLA 当小脑 + RL 当教练」 的三层架构。这种分工让每个模块都能用上自己最擅长的训练范式,而不是逼着一个 70 亿参数的端到端模型既当规划器又当执行器。

七、对从业者和研究者的启示

如果你是机器人领域的从业者,EXIMO 提示了三条可操作的方向:

  1. 优先复用现成 VLM:不必从零训练任务分解器,开源的视觉语言模型(Qwen-VL、InternVL、LLaVA-OneVision)已经能提供足够好的零样本任务分解能力;
  2. RL 一定要「轻量化」:端到端 RL 微调大模型在工程上几乎不可行,把 RL 限定在残差、LoRA、Adapter 之类的「局部修正」上是更现实的选择;
  3. 数据策略比模型架构更值钱:EXIMO 三阶段流水线把「数据来源」从「人类演示」扩展到「VLM 出题 + VLA 执行」,这种数据策略的创新比单纯的架构改进带来的提升更大。

如果你是关注 AI 前沿的爱好者,EXIMO 是一个很好的「VLM 与机器人结合」的具体案例——它让你看到,大语言模型/视觉语言模型不只是「聊天机器人」或「图片理解器」,它们正在成为新一代机器人的「任务规划层」。

参考资源:

  • 论文标题:EXIMO: VLM Guided Exploration of VLA Policies
  • 论文作者:Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch, Markus Wulfmeier, Abbas Abdolmaleki, Martin Riedmiller(DeepMind)
  • arXiv 编号:2608.19891
  • 提交日期:2026 年 8 月 20 日
  • Hugging Face 论文页:https://huggingface.co/papers/2608.19891
  • 论文 PDF:https://arxiv.org/pdf/2608.19891

研究文档(引用来源参考)

(no reference document available)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐