让大模型真的上机器人

目录

01    让 VLA 更“听指挥”

02    大模型推理太慢,机器人也不能停下来等

03    VLA 为什么喜欢“一次预测很多步”?

04    不用重新训练,先把 VLA 已经学会的技能找出来

05    机器人不能只在任务结束时才知道自己做错了

06    让强化学习直接学“应该对 VLA 说什么”

07    机器人已经能“边想边动”,还能不能“边动边学”?

08    从“训练通用策略”到“把通用策略真正用起来”


Sergey Levine 是当前机器人学习与强化学习领域最具代表性的学者之一,现任加州大学伯克利分校电子工程与计算机科学系副教授,并领导 Robotic Artificial Intelligence and Learning(RAIL)团队开展机器人学习、强化学习和通用自主智能体研究。

从早期的端到端视觉运动控制,到真实机器人强化学习,再到今天的VLA模型,他长期关注的核心问题都是:机器人如何通过数据和交互真正学会复杂行为

进入 2026 年后,Levine 团队的研究出现了一个值得关注的变化。相比单纯训练更大、更通用的机器人基础模型,今年不少工作进一步把注意力放到了这些模型“训练完成以后怎么办”:

怎样让 VLA 更容易控制,怎样解决大模型推理延迟,怎样利用已经学会的技能处理新任务,以及如何通过强化学习让通用策略在部署后继续提升。

本文选取其中 7 项具有代表性的机器人研究进行盘点。

01    让 VLA 更“听指挥”

图1 | Steerable Policies 让 VLA 同时接受子任务、运动方向、像素位置和轨迹等不同粒度的指令,使上层 VLM 能够更细致地控制机器人的执行过程。

论文标题: Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control

项目主页:https://steerable-policies.github.io/

论文介绍:现有 VLA 通常通过语言指令控制机器人,例如“把胡萝卜放进锅里”。这类指令能告诉机器人最终要做什么,却很难继续提供更细致的执行指导:抓错位置时,上层模型可能希望它“往左一点”“抓这里”或者“沿着这条轨迹移动”,但传统 VLA 往往没有学习过这些不同粒度的控制方式。

针对这一问题,研究提出了 Steerable Policies。核心思路是让 VLA 不只理解完整任务,还同时学习子任务、具体运动、像素位置和夹爪运动轨迹等多种 steering commands。这样,上层 VLM 可以根据当前情况决定指令要说到多细,而不是始终只能给一句笼统任务描述。

作者分别基于 OpenVLA 和 π0.5 构建了 Steerable Policy,并进一步展示了两种高层控制方式:一种训练专门的 embodied reasoner 来选择合适的指令,另一种直接利用现成 VLM 通过上下文学习调整指挥方式。真实机器人实验显示,这种更丰富的接口能够更好地处理长时任务、执行纠错和细粒度空间推理。

02    大模型推理太慢,机器人也不能停下来等

图2 | AsyncVLA 将大型 VLA 的低频语义推理与机器人本地的高频响应解耦。即使远端模型出现明显延迟,Edge Adapter 仍可以利用最新画面及时修正动作。

论文标题: AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge

项目主页:https://asyncvla.github.io/

论文介绍:VLA 模型越来越大,也带来了一个非常现实的问题:推理速度跟不上机器人控制速度。尤其在移动机器人导航中,如果大型 VLA 几秒才能给出一次结果,等动作真正执行时,周围环境可能早已变化。比如行人已经走到机器人面前,模型却还在根据几秒前的画面继续向前。

AsyncVLA 没有试图让整个大模型都高速运行,而是把“语义理解”和“实时执行”拆成两个不同频率的控制环。大型基础 VLA 运行在工作站上,低频提供高层指导;机器人本地则运行一个轻量 Edge Adapter,持续读取最新画面并高频修正动作。简单来说,就是“大模型负责判断往哪走,本地小模型负责看着眼前情况怎么走”。

作者在真实室内外导航中人为加入 0.2 秒、2 秒和 5 秒等推理延迟,并测试了最高约 6 秒延迟的场景。相比直接依赖大型 VLA 的方法,AsyncVLA 能利用最新观察持续修正动作,论文报告其相对强基线最高获得约 40% 的成功率提升。

03    VLA 为什么喜欢“一次预测很多步”?

图3 | 研究重新分析了 Action Chunking 的作用机制,发现其优势与过去观察、误差累积以及不同时间关系带来的隐式集成效果密切相关。

论文标题: Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control?

项目主页:https://action-chunking.github.io/

论文介绍:Action Chunking 已经成为机器人模仿学习中的常见设计。相比每次只预测下一个动作,模型会一次输出未来一小段动作序列。ACT、Diffusion Policy 以及很多 VLA 都采用了类似方法,而且实践中通常更加稳定。但一个很基础的问题过去并没有完全解释清楚:Action Chunking 到底为什么有效?

Levine 团队今年专门对这个问题进行了系统研究。作者首先检验了一些常见解释,例如它是否主要改善了动作的时间连续性、是否因为一次预测多步而缩短了任务长度,以及是否带来了更好的表示学习。结果显示,这些说法都不足以完整解释 Action Chunking 的优势。

研究发现,更重要的因素包括利用过去观察减少行为克隆中的误差累积,以及一种“隐式集成”效应。因为同一个动作可以从不同时间点的观察中被预测,相当于模型同时获得了多个不同时间视角下的判断。作者进一步设计随机延迟策略,在 LIBERO、Robomimic 和真实 Franka 机械臂任务上,不真正连续执行完整 action chunk,也能达到接近甚至匹配标准 Action Chunking 的效果。

04    不用重新训练,先把 VLA 已经学会的技能找出来

图4 | FRS 将人类或 VLM 提供的粗略参考动作反向映射到 Flow Policy 的潜在空间,再重新生成一个更符合基础模型已有行为模式的动作。

论文标题: Improving Robotic Generalist Policies via Flow Reversal Steering

项目主页:https://flow-reversal-steering.github.io/

论文介绍:大型机器人基础模型已经从海量数据中学习了丰富的行为,但面对一个新的具体任务时,模型未必能正确调用这些能力。换句话说,问题有时并不是机器人完全“不会”,而是我们不知道如何把它已经学过的正确行为引导出来。

在这项 Stanford 与 UC Berkeley 的合作研究中,作者提出 Flow Reversal Steering(FRS)。它面向采用 Flow Matching 生成动作的通用机器人策略:人类或 VLM 先提供一个方向大致合理、但不够精确的参考动作,FRS 再把它反向送回生成过程,找到对应的潜在噪声,随后重新通过基础策略生成一个更接近模型已有行为分布的动作。

通俗来说,人或 VLM 只需要告诉机器人“大概应该怎么动”,基础模型再把这个建议修成“自己真正会做的动作”。项目在 LIBERO 和真实 DROID 机器人任务上进行了测试。除了直接用于零样本控制,FRS 产生的成功行为还可以继续用于行为克隆和强化学习。在六个真实 DROID 任务的相关实验中,基于少量 FRS 数据训练的 DSBC 达到 80% 成功率,而基础 VLA 为 20%。

05    机器人不能只在任务结束时才知道自己做错了

图5 | SVM 利用过去成功和失败的机器人轨迹构建过程奖励,让强化学习在任务完成之前就能判断当前行为是否正在接近成功。

论文标题:Learning Process Rewards via Success Visitation Matching for Efficient RL

项目主页:https://success-visitation-matching.github.io/

论文介绍:强化学习要让机器人通过不断尝试改进策略,首先需要一个能够告诉它“做得好不好”的奖励信号。但很多真实机器人任务的奖励非常稀疏,例如只有最终完成任务才能得到 1 分,其余过程全部是 0。机器人连续执行几十步以后失败,只知道“这次没成功”,却很难判断究竟从哪一步开始走错。

Success Visitation Matching(SVM)试图把这种最终结果奖励变成更加密集的过程反馈。它利用过去执行过的成功和失败轨迹训练判别器,判断机器人当前访问的状态和动作更像成功过程,还是更像失败过程。这样,机器人不需要等到任务结束,就可以获得“现在是不是正在朝成功方向前进”的反馈。

作者在 LIBERO、RoboCasa 和真实 WidowX 机械臂上进行了强化学习微调,包括抓取放置、打开抽屉和覆盖刀具等任务。结果显示,相比只使用最终成功奖励,SVM 能够明显加快策略学习;在使用预训练通用策略 π0 的相关实验中,达到 90% 成功率所需的环境交互量大约减少了一半。

06    让强化学习直接学“应该对 VLA 说什么”

图6 | SARL 将强化学习从低层机器人动作空间提升到语言指令空间,通过真实交互学习“什么样的 prompt 才能真正调用 VLA 已经掌握的技能”。

论文标题:Adapting Generalist Robot Policies with Semantic Reinforcement Learning

项目主页:https://semantic-action-rl.github.io/

论文介绍:面对新的复杂任务,传统强化学习往往直接调整机器人的低层动作,例如机械臂往哪里移动、夹爪什么时候闭合。但如果一个通用 VLA 已经在预训练阶段学会了大量基础技能,是否还有必要重新从这些底层动作开始探索?

Semantic Action Reinforcement Learning(SARL)给出了一个很有意思的答案:不让强化学习直接学习机器人怎么动,而是学习“现在应该给 VLA 什么语言指令”。例如一个 VLA 听到“抓住锤子”可能抓错物体,但输入“向下移动并抓取”却能够成功执行。VLM 可以从语义上提出合理的子任务,却不知道这些话落到眼前这台机器人上究竟会产生什么动作。

SARL 因此把语言 prompt 当成强化学习中的“动作”。VLM 先生成少量候选指令,强化学习再通过真实执行结果,逐渐学会当前状态下哪一句话最能推动任务继续向前。在四个真实 WidowX 长时任务中,直接给基础 VLA 输入复杂任务时成功率接近 0;经过约 60 至 100 个在线 episode 后,SARL 可以将成功率提升到约 80%。

07    机器人已经能“边想边动”,还能不能“边动边学”?

图7 | ARLI 在异步执行过程中显式利用已经承诺执行的动作和中间观察,让强化学习能够在大型机器人策略存在推理延迟时继续进行在线微调。

论文标题: Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency

项目主页:https://async-rl-intermediate-information.github.io/

论文介绍:异步执行可以缓解大型 VLA 推理速度慢的问题:当模型还在计算下一组动作时,机器人继续执行之前已经生成的动作,不必原地等待。但如果还希望通过强化学习在线改进策略,一个新的问题又出现了。

模型开始推理时看到的是较早的状态,但几百毫秒的计算过程中机器人还在继续运动。等新动作真正生成出来,现实环境已经发生变化。如果强化学习忽略中间执行的这些动作,就很容易错误判断“什么动作导致了什么结果”。

在这项多机构联合研究中,Levine 作为末位作者参与提出 Asynchronous RL with Intermediate Information(ARLI)。其核心思路是显式告诉强化学习“等待期间发生了什么”:除了较早的观察,系统还加入这段时间已经承诺执行的动作,以及更接近当前时刻的中间观察,让轻量 RL 策略更准确地判断机器人真正所处的状态。作者在模拟和真实机器人操作任务中验证了这一方法。在存在明显推理延迟时,标准 RL 可能无法有效学习,而 ARLI 仍能完成策略微调,并在部分设置下达到或超过理想化无延迟 RL 的表现。

08    从“训练通用策略”到“把通用策略真正用起来”

如果只看论文标题,Sergey Levine 2026 年参与的这些研究覆盖了 VLA、导航、模仿学习、Flow Matching 和强化学习等多个方向。

但把其中由 Levine 作为末位作者、且与机器人学习主线密切相关的工作放到一起,可以看到一个相对清晰的共同问题:机器人已经拥有越来越强的预训练策略以后,接下来怎样把这些能力真正用起来?

Steerable Policies 尝试让 VLA 更容易接受不同粒度的控制;

AsyncVLA 关注大型模型如何在真实机器人上保持实时响应;

Action Chunking 的研究则回过头分析今天机器人策略中一个已经被广泛采用的基础设计。

另一方面,FRS、SVM 和 SARL 更多关注模型部署后的持续改进:怎样调用已有行为、怎样获得更有效的强化学习反馈,以及怎样直接在语义层面利用机器人已有技能。

最新的 ARLI 又进一步把这一问题带到了真实推理延迟下。

这并不意味着机器人基础模型的“预训练”已经不重要。数据规模、模型规模和预训练质量依然决定了基础策略拥有多少能力。但当 VLA 越来越“会做”以后,怎样正确调用这些技能、及时执行,并利用新的真实交互经验继续改进,正在成为同样重要的问题。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐