从行为克隆到生成式策略:机器人动作生成方法的完整演进图谱

核心脉络:一条由"单峰假设"驱动的分化之路

机器人动作生成方法的演进,本质上是对同一个核心矛盾的持续回应:专家行为是多模态的,但传统回归范式只能建模单峰分布。这条矛盾线索驱动了从BC出发的三次重大分化——扩散模型路线、流匹配路线、自回归/离散化路线——并在2024–2025年间汇聚为"大规模预训练骨干 + 生成式动作头"的混合架构。

如果按生成方式区分当前最优方案:

  • 若优先建模精度与多模态覆盖:扩散策略(Diffusion Policy)系列仍是基准,DP4(ICCV
    2025)在17项任务上刷新SOTA [1]
  • 若优先推理速度与训练稳定性:Flow Matching路线已将采样时间压缩至扩散模型的约20% [2],π₀(RSS 2025)是当前最具代表性的融合范本 [3]
  • 若优先语言泛化与零样本迁移:自回归VLA路线(RT-2→OpenVLA)提供最自然的语言对齐,但精细操作性能受离散化损失制约

最关键的单一洞察:Flow Matching并非扩散模型的"加速版",而是一个理论上独立的生成范式;π₀将二者的优势分工明确——VLM骨干负责语义理解,流匹配动作头负责连续动作生成——这一架构正在成为2025年的主流设计模式。

第一节:起点——行为克隆(BC)与回归/分类范式

1.1 范式定义与奠基工作

行为克隆将模仿学习转化为监督学习:给定专家演示的状态-动作对 (st,at)(st​,at​),学习策略 πθ(a∣s)πθ​(a∣s) 使得预测动作与专家动作之间的损失(连续动作用MSE,离散动作用交叉熵)最小化。这一范式的奠基工作可追溯至1989年 ALVINN(Pomerleau),该系统用单层神经网络直接从摄像头图像预测转向角,是端到端机器人学习的最早实例之一。

DAgger(Dataset Aggregation,Ross et al., 2011)[4] 是BC范式内最重要的改进:标准BC在测试时遭遇分布偏移——训练数据来自专家轨迹,但策略执行时会产生偏离专家的状态,导致误差累积(compounding error)。DAgger通过在线数据聚合解决这一问题:在每轮迭代中,用当前策略与环境交互,再由专家对这些新状态标注动作,将新数据并入训练集。这将BC从"离线静态"推向"在线交互",是分布偏移问题的经典解法。

进入深度学习时代,Implicit BC(iBC,CoRL 2021)[5] 引入基于能量的模型(EBM),将策略建模为 π(a∣s)∝exp⁡(−Eθ(s,a))π(a∣s)∝exp(−Eθ​(s,a)),通过优化能量函数而非直接回归动作,在多项机器人操作任务上优于显式MSE回归。这是BC范式内第一次系统性地用隐式模型替代显式映射,也预示了后续生成式方法的方向。

BC-Z(Jang et al., 2021)​ 将BC扩展至语言条件化的多任务场景,使单一策略能够依据语言指令执行不同任务,是从单任务BC向通用策略迈进的早期尝试。

ACT(Action Chunking with Transformers,Zhao et al., 2023)​ 引入两项关键创新:
(1)动作分块(action chunking)——每次预测一段动作序列而非单步动作,降低了时序相关性对策略的干扰;
(2)用Transformer架构替代MLP,显著提升精细操作(如双臂协作)的性能。ACT本质上仍是回归范式,但其动作分块思想被后续扩散/流匹配方法广泛继承。

1.2 BC范式的核心局限:单峰假设

MSE损失的数学本质是最大化高斯似然,隐含假设动作分布是单峰的。当专家演示包含多种等价解法时(例如绕障碍物可以从左或从右),MSE回归会将所有模式"平均化",产生任何一种模式都不对应的折中动作。这一单峰假设是BC范式无法建模多模态动作分布的根本原因,也是后续所有生成式方法出现的核心动机。

1.3 BC及其直接变体对比

方法 年份 核心创新 动作表示 核心局限
ALVINN 1989 端到端神经网络驾驶 连续回归 无泛化能力
DAgger [4] 2011 在线数据聚合,解决分布偏移 连续回归 需要在线专家查询
BC-Z 2021 语言条件化多任务BC 连续回归 单峰,无法多模态
Implicit BC [5] 2021 EBM隐式策略 隐式能量 推理需要优化循环
ACT 2023 动作分块 + Transformer 连续回归 仍为单峰MSE

BC路线的中间过渡:在扩散模型出现之前,研究者尝试了两条过渡路径:
(1)对抗路线:GAIL(Ho & Ermon, NIPS 2016)[6] 将模仿学习形式化为对抗学习,生成器策略学习匹配专家的状态-动作分布,无需显式定义奖励函数;InfoGAIL在此基础上引入隐变量推断,能够无监督地发现演示中的多种行为模式。
(2)变分路线:VAE-based方法(如VILD)通过隐空间建模尝试捕捉多模态分布。这两条路径都证明了多模态建模的必要性,但均存在训练不稳定或模式覆盖不完整的问题,为扩散模型的引入奠定了需求背景。

第二节:第一条分支——扩散策略(Diffusion Policy)路线

2.1 奠基:将DDPM引入策略学习

Diffusion Policy(Chi et al., RSS 2023)​[7] 是这条分支的起点,也是整个生成式策略领域的里程碑。其核心思想是将机器人的视觉运动策略表示为条件去噪扩散过程:动作生成从高斯噪声出发,通过迭代去噪逐步逼近专家动作分布。这一设计从根本上解决了单峰假设问题——扩散过程可以建模任意复杂的多模态分布。
在这里插入图片描述

本文介绍了扩散策略,这是一种通过将机器人的视觉运动策略表示为条件去噪扩散过程来生成机器人行为的新方法。我们对扩散政策在4个不同机器人操作基准测试中的12个不同任务进行了基准测试,发现其持续优于现有最先进的机器人学习方法,平均提升达46.9%。扩散策略学习作用-分布得分函数的梯度,并通过一系列随机朗之万动力学步骤,在推断过程中对该梯度场进行迭代优化。我们发现,扩散表述在机器人策略中使用时具有强大优势,包括优雅地处理多模态作用分布,适合高维动作空间,并展现出令人印象深刻的训练稳定性。为了充分释放扩散模型在物理机器人视觉运动政策学习中的潜力,本文提出了一系列关键技术贡献,包括引入后退视界控制、视觉条件反射以及时间序列扩散变换器。我们希望这项工作能激励新一代政策学习技术,利用扩散模型强大的生成建模能力。

在这里插入图片描述

a)总体框架: Diffusion Policy 的基本思想是在每个时间步,策略接收最近若干步的观测数据作为输入,并生成未来一段时间内的动作序列,从而实现基于历史观测的连续动作预测。

b)基于 CNN 的 Diffusion Policy: 在基于 CNN 的实现中,观测信息通过 FiLM(特征级线性调制)机制作为条件输入,以逐通道的方式作用于网络中的每一层卷积结构。动作生成过程从随机高斯噪声开始,通过噪声预测网络不断估计并去除当前动作中的噪声,经过多次迭代去噪后,最终得到目标动作序列。这种方式本质上是一个逐步优化动作分布的生成过程。
c)基于 Transformer 的 Diffusion Policy: 在基于 Transformer 的实现中,观测信息首先被编码为嵌入表示,并输入到每个 Transformer 解码器模块的多头交叉注意力层中,以实现环境状态与动作生成之间的信息交互。同时,为保证动作生成满足时间上的因果关系,每个动作仅能关注自身及之前的动作信息,而不能访问未来动作,这一约束通过因果注意力掩码机制实现。

从数学角度看,Diffusion Policy等价于学习动作分布的得分函数(score function,即对数概率密度的梯度)。训练时学习如何从噪声动作去噪,推理时通过DDPM或DDIM采样器迭代生成动作。论文提供CNN和Transformer两种骨干网络,在12项任务、4个机器人操作环境上系统性地优于标准BC [7]。

这一方法的代价:每次推理需要多步去噪(DDPM通常需要数十步),导致推理延迟高,难以满足实时控制需求。这一局限直接催生了后续两个子分支:一致性蒸馏(加速扩散)和Flow Matching(替代扩散)。

2.2 架构扩展:从二维视觉到三维空间

3D Diffusion Policy(DP3,2024)​[8] 将点云三维表示引入扩散策略,解决了原始Diffusion Policy依赖二维图像时对空间几何感知不足的问题。点云输入使策略能够直接感知物体的三维形状和位置,在仿人操作(humanoid manipulation)任务上取得显著提升。

RDT-1B(2024)​[9] 代表扩散策略的大规模预训练方向:10亿参数的扩散Transformer,在超过100万条多机器人演示上预训练,是迄今参数规模最大的扩散策略模型之一。同期,Scaling Diffusion Policy in Transformer to 1 Billion Parameters [10] 从另一维度验证了扩散策略的可扩展性。

Video Diffusion Policy(2024/2025)​[11] 引入离散扩散(discrete diffusion),将视频生成预训练与策略微调统一:先在人类视频上预训练视频生成模型,再微调为机器人策略,使人类演示视频可直接作为机器人策略的训练信号,无需机器人专用数据。

2.3 鲁棒性增强

DIFO(Diffusion Imitation from Observation,NeurIPS 2024)​[12] 解决了一个实际痛点:许多演示数据只有状态轨迹,没有动作标签。DIFO采用条件扩散模型,从纯状态演示中学习策略,将对抗模仿学习与扩散生成相结合,无需动作标注。

DisDP(Disentangled Diffusion Policy,RLC 2025)​[13] 引入多视角解耦机制:将不同视角的视觉信息在扩散过程中解耦建模,增强策略对视角变化和遮挡的鲁棒性。

Reactive Diffusion Policy(RDP,RSS 2025 Best Student Paper Finalist)​[14] 提出慢-快双层架构:慢速扩散策略负责生成长时域动作轨迹,快速反应策略处理接触丰富操作中的实时触觉反馈,是扩散策略与多模态感知融合的代表性工作。

DP4(Diffusion Policy 4,ICCV 2025)​[1] 在时空感知视觉运动学习框架下,在17项仿真和真实机器人任务上达到当前最优成功率。

2.4 推理加速:一致性蒸馏子分支

这是扩散路线内部最重要的子分支,专门回应"多步去噪推理太慢"的问题。

Consistency Policy(2024)​[15] 将Song et al.提出的一致性模型(Consistency Models)引入机器人策略,核心思想是训练一个函数 fθfθ​,使得从任意去噪步骤直接映射到最终干净动作,从而实现少步(1–2步)推理。

One-Step Diffusion Policy(OneDP,ICLR 2025)​[16] 将预训练多步扩散策略蒸馏为单步生成器,实现约40倍的推理加速 [16],在保持操作成功率的同时大幅降低延迟。

FRMD(Fast Robot Motion Diffusion)​[15] 将运动基元(Movement Primitives)与一致性模型相结合,利用结构化运动先验指导一致性蒸馏,使生成的轨迹既快速又平滑,适合高频控制场景。

Accelerating Diffusion Policy with Real-time Pruning(ICCV 2025)​[17] 将动态剪枝与一致性蒸馏结合:在推理时动态生成并调整稀疏度调度,进一步压缩计算开销,是系统级优化与算法优化协同的代表。

DiMO(Distilling Masked Diffusion Models into One-step Generator,ICCV 2025)​[18] 针对掩码扩散模型(Masked Diffusion Models)提出在策略蒸馏方法,将其压缩为单步生成器,扩展了一致性蒸馏的适用范围。

2.5 扩散策略与强化学习的结合

DPPO(Diffusion Policy Policy Optimization,ICLR 2025)​[19] 是将扩散策略与在线RL结合的系统性框架,提供了一套针对扩散策略微调的最佳实践。扩散+RL的核心挑战在于梯度传播困难:扩散采样过程是随机的、多步的,难以直接对奖励信号反向传播。DPPO通过策略梯度估计绕过这一问题。同期,GenPO(NeurIPS 2025)​ 被认为是首个成功将扩散策略集成到在策略RL(on-policy RL)框架的方法。

可组合扩散策略是2025年出现的另一研究方向:CoDiG(ICLR 2025)​[20] 通过可组合扩散引导实现模块化策略组合;Compose Your Policies!(GPC)​[21] 提出无需额外训练的测试时策略组合方法,通过叠加多个预训练扩散/流匹配策略的分布得分实现即插即用的技能组合。

扩散路线时间线

论文 年份/会议 核心创新 推理步数 是否需要预训练
Diffusion Policy [7] 2023 / RSS 将DDPM引入机器人策略,多模态动作建模 多步(DDPM/DDIM)
DP3 [8] 2024 引入点云3D表示 多步
DIFO [12] 2024 / NeurIPS 无动作标签的观测模仿 多步
RDT-1B [9] 2024 10亿参数,大规模预训练 多步 是(100万+演示)
Video Diffusion Policy [11] 2024/2025 离散扩散,统一视频预训练与策略微调 多步 是(人类视频)
Consistency Policy [15] 2024 一致性模型,少步推理 1–2步 是(预训练扩散策略)
OneDP [16] 2025 / ICLR 单步蒸馏,约40倍加速 1步
DPPO [19] 2025 / ICLR 扩散策略 + 在线RL微调框架 多步
DisDP [13] 2025 / RLC 多视角解耦,鲁棒性增强 多步
RDP [14] 2025 / RSS 慢-快双层,视觉-触觉融合 多步+快速反应
DP4 [1] 2025 / ICCV 时空感知,17任务SOTA 多步
Pruning+蒸馏 [17] 2025 / ICCV 动态剪枝 + 一致性蒸馏 少步
DiMO [18] 2025 / ICCV 掩码扩散单步蒸馏 1步
dVLA [22] 2025 扩散VLA,多模态整合 多步 是(VLA骨干)

第三节:第二条分支——Flow Matching(流匹配)路线

3.1 理论基础:为什么Flow Matching是独立范式

Flow Matching(Lipman et al., 2022)​[23] 的理论出发点与扩散模型截然不同。扩散模型通过随机微分方程(SDE)定义前向加噪过程,训练得分函数(score function)来逆转这一过程;Flow Matching则直接学习一个确定性常微分方程(ODE)​的向量场,将噪声分布"流动"到目标动作分布。

关键差异在于传输路径的形状:扩散模型的去噪轨迹是弯曲的(由SDE的随机性决定),而Flow Matching可以学习接近直线的传输路径(Rectified Flow变体),从而用更少的数值积分步骤(NFE,Number of Function Evaluations)完成采样。实证结果表明,流匹配策略可将采样时间压缩至扩散模型所需时间的约20% [2]。

对机器人策略而言,这一优势直接对应实时控制可行性:高频控制(如触觉反馈、接触丰富操作)要求毫秒级推理,扩散模型的多步去噪往往成为瓶颈,而流匹配的低NFE特性天然适合这类场景。

训练稳定性方面,流匹配以向量场回归为目标,避免了扩散训练中得分匹配的数值敏感性,多项研究表明其训练更稳定、泛化性能与扩散策略相当 [23]。

3.2 核心论文

π₀(Physical Intelligence,arXiv Oct 2024,RSS 2025)​[3] 是Flow Matching路线最具里程碑意义的工作。其架构设计体现了"分工明确"的思想:在预训练视觉-语言模型(VLM)骨干之上,附加流匹配动作头——VLM骨干通过自回归预训练继承互联网规模的语义知识,流匹配动作头负责生成连续、精细的机器人动作序列。这一设计使π₀同时具备强大的语言理解能力和精细操作能力,代表了VLA与Flow Matching融合的范本(与第四节交叉)。
pi0算法框架图

我们的通用机器人策略采用了一个预训练的视觉-语言模型(VLM)骨干网络,并结合了一个涵盖多种灵巧操作任务、跨不同机器人本体(cross-embodiment)的多样化数据集。为了让该模型适用于机器人控制,我们额外加入了一个独立的动作专家模块(action expert),通过 flow matching 生成连续动作,从而实现精确且流畅的操作技能。该模型既可以根据文本提示(prompt)直接执行任务,也可以在高质量数据上进一步微调,以完成更复杂的多阶段任务,例如折叠多件衣物或组装一个盒子。

在这里插入图片描述

我们框架的概述如下:首先,我们构建了一个预训练数据混合集,其中既包含我们自己的灵巧操作(dexterous manipulation)数据集,也包含开源数据。我们使用这一数据混合集来训练我们的 flow matching VLA(Vision-Language-Action)模型。该模型由一个较大的 VLM(Vision-Language Model)骨干网络 和一个较小的 action expert(动作专家模块) 组成,后者专门用于处理机器人的状态和动作信息。VLM 骨干网络的权重初始化自 PaliGemma [5],从而继承了大规模互联网预训练所学习到的表征能力。最终得到的 π₀ 模型 可以用于控制具有不同动作空间的多种机器人本体(robot embodiments),以完成各种各样的任务。

Learning Robotic Manipulation Policies from Point Clouds with Conditional Flow Matching(arXiv Sep 2024)​[24] 将条件流匹配(CFM)应用于点云输入的操作策略,验证了流匹配在三维感知场景下的有效性,与DP3在扩散路线的工作形成对称。

AdaFlow(NeurIPS 2024)​[25] 是流匹配路线早期的重要工作,提出方差自适应流匹配框架,在推理速度与动作生成多样性之间取得更好的权衡,是流匹配进入主流机器人学习视野的标志性论文。

FlowPolicy(AAAI 2025 Oral)​[26] 将一致性流匹配(Consistency Flow Matching)引入三维机器人操作,在保持流匹配低延迟优势的同时进一步稳定训练过程,获得AAAI 2025口头报告。

ManiFlow(2025)​[27] 专为灵巧操作任务设计,结合连续时间一致性训练目标,实现1–2步推理的高质量动作生成,是流匹配路线中推理效率最高的代表之一。

Action Flow Matching for Continual Robot Learning(RSS 2025)​[28] 将流匹配扩展至持续学习场景:利用流匹配实现在线机器人动力学模型对齐,使策略能够在部署后持续适应新环境,无需完整重训练。

Streaming Flow Policy(May 2025)​[29] 将动作轨迹本身视为流轨迹,简化了扩散/流匹配策略的推理过程,实现更紧密的感知-运动循环(sensorimotor loop),降低端到端延迟。

ReinFlow(NeurIPS 2025)​[30] 是流匹配路线中RL微调的对应工作(对应扩散路线的DPPO),被认为是首个能够稳定微调一系列流匹配策略的在线RL框架。

FLOWER(2025)​[31] 提出高效VLA流匹配策略,代表了将流匹配民主化(democratizing)到更广泛机器人平台的趋势。

FlowMP(2025)​[32] 将流匹配扩展至二阶轨迹动力学,引入加速度效应,使生成的轨迹更符合真实机器人的物理约束。

CoLA-Flow Policy(2026)​[33] 引入轨迹级潜空间流匹配框架,在快速推理与平滑稳定操作之间取得更好的平衡,代表2026年初流匹配路线的最新进展。

Fourier Flow Matching(FFM)​[34] 用傅里叶表示替代VLA流匹配模型中的逐步关节/笛卡尔动作,使策略能够对平滑轨迹进行推理,是流匹配在VLA场景下的架构创新。

3.3 Flow Matching vs. Diffusion Policy:核心对比

在这里插入图片描述

这张图说明了 diffusion 和flow matching在学习目标上的本质区别

  • 左侧 diffusion 学的是条件 score function(概率密度上升最快的方向),因此随着时间推进、噪声逐渐减少,向量场的方向会从指向噪声中心逐渐旋转到指向目标样本,表现为一个随时间剧烈变化的复杂动态场;
  • 右侧 OT 学的是条件 vector field(样本从初始点到目标点的运输方向),由于最优传输通常沿近似直线路径移动,其方向在整个过程中基本保持不变,只是速度大小有所变化,因此向量场更加稳定、规则,也更容易被神经网络拟合。
维度 Diffusion Policy Flow Matching
生成轨迹形状 弯曲(SDE随机性) 接近直线(ODE确定性)
训练目标 得分匹配(score matching) 向量场回归(vector field regression)
推理步数 多步(DDPM:100步;DDIM:10–20步) 少步(通常1–10步;ODE求解器)
求解器类型 SDE/ODE均可 ODE(确定性)
推理延迟 较高 约为扩散模型的20% [2]
训练稳定性 对超参数敏感 更稳定
代表论文 Diffusion Policy [7],DP3 [8] π₀ [3],ManiFlow [27],AdaFlow [25]
与RL结合 DPPO [19],GenPO ReinFlow [30]
可组合性 CoDiG [20],GPC [21] GPC [21](跨范式)

值得注意的是,一致性蒸馏使扩散策略也能实现1–2步推理(OneDP [16]),这在推理速度上与流匹配趋于接近。二者的真正区别在于训练范式:扩散策略仍需先训练多步模型再蒸馏,而流匹配从一开始就以低NFE为设计目标。

第四节:第三条分支——自回归与离散化动作生成

4.1 动作Tokenization的奠基

RT-1(Robotics Transformer,Google,arXiv Dec 2022)​[35] 将大规模Transformer架构引入机器人控制,核心贡献是将机器人的感知输入(图像、语言指令)和动作输出统一Tokenize:连续动作被量化为离散token,用分类损失替代回归损失,从而可以直接复用Transformer的高效推理能力。RT-1在超过700项真实机器人任务上训练,奠定了大规模机器人数据训练的基础架构。

离散化动作的核心逻辑:将连续动作空间(如关节角度的实数值)分桶量化为有限的离散类别,每个动作维度独立预测一个类别,整体动作通过分类头输出。这一设计的代价是精度损失——量化误差在精细操作(如毫米级插针)中可能显著影响成功率。

FAST tokenizer(2025)​[36] 是近期对动作Tokenization的重要改进,通过高效的频域动作编码,使自回归VLA能够在高频机器人数据(如灵巧手操作)上训练,部分缓解了传统离散化方法在高频控制场景下的精度损失问题。

4.2 VLA路线:将互联网知识迁移到机器人

RT-2(Google,arXiv Jul 2023)​[37] 是VLA路线的里程碑:将在互联网规模数据上预训练的视觉-语言模型(VLM)迁移到机器人控制,动作被编码为语言token(与文本token共享词汇表),实现端到端联合训练。RT-2在RT-1的机器人数据基础上,同时在互联网视觉-语言任务上微调,展现出对新环境和新任务的强泛化能力——这是纯BC或扩散策略难以实现的。

OpenVLA(arXiv Jun 2024)​[38] 将VLA研究民主化:7B参数的开源VLA,在97万条真实机器人演示上训练,推动了学术界对VLA的广泛研究。OpenVLA的开放使得后续大量工作能够在其基础上进行改进和比较。
在这里插入图片描述

OpenVLA 模型架构。 给定图像观察和语言指令,模型预测 7 维机器人控制动作。该架构由三个关键组成部分:(1) 连接 Dino V2 和 SigLIP 特征的视觉编码器 ,(2) 将视觉特征映射到语言嵌入空间的投影器 ,以及(3) LLM 骨干网 ,一个 Llama 2 7B 参数大型语言模型 。

Octo(2024)​ 是另一个重要的开源通用策略,基于Transformer的扩散策略,在Open X-Embodiment数据集的80万条轨迹上训练,代表了"扩散策略 + 大规模数据"路线的开源前沿。

π₀(已在第三节详述)-在此处的意义是作为VLA + Flow Matching融合的代表,打通了自回归路线(语言理解)与流匹配路线(连续动作生成)之间的壁垒。

HybridVLA(2025)​[39] 进一步探索融合:统一框架同时吸收扩散动作的连续性与自回归推理的上下文能力,代表2025年VLA架构设计的最新探索。

dVLA(Diffusion VLA,Dec 2025)​[22] 用扩散过程建模VLA中的动作生成,据报告在多项指标上显著优于当前离散和连续VLA模型,是扩散路线与VLA路线的深度融合。

4.3 离散扩散与向量量化

STAR框架[9] 通过旋转增强的向量量化(VQ)学习和组合多样化机器人技能,将技能表示为离散码本中的向量,再通过组合实现新任务泛化。Discrete Diffusion VLA(Aug 2025)​[40] 将离散扩散引入VLA的动作生成,在离散token上运行扩散过程,融合了离散化的语言对齐优势和扩散的多模态建模能力。

4.4 自回归路线的结构性权衡

优势 局限
直接复用LLM/VLM预训练权重 量化误差损失精细操作精度
语言对齐自然,零样本泛化强 自回归生成延迟随动作维度线性增长
互联网规模知识可直接迁移 难以建模连续动作的精细多模态分布
统一的token框架,多模态融合便利 离散化设计对高频控制不友好

VLA发展时间线

论文 年份/会议 基础模型规模 动作表示 数据规模
RT-1 [35] 2022 / arXiv 专用Transformer 离散token >700任务
RT-2 [37] 2023 / arXiv PaLM-E等VLM 语言token 互联网+机器人
OpenVLA [38] 2024 / arXiv 7B参数 离散token 97万条演示
Octo 2024 Transformer 扩散动作头 80万条轨迹
π₀ [3] 2024 / RSS 2025 预训练VLM 流匹配连续 大规模多任务
HybridVLA [39] 2025 混合架构 扩散+自回归 多来源
dVLA [22] 2025 VLM+扩散 扩散连续 多模态
FAST+VLA [36] 2025 自回归VLA 频域离散 高频数据

第五节:大规模预训练与多范式融合——当前前沿(2024–2025)

5.1 混合架构:为什么"VLM骨干 + 生成式动作头"成为主流

π₀确立的架构模式揭示了一个重要洞察:语言理解与精细动作生成是两个性质不同的问题,应由不同的模块处理。自回归Transformer在语义推理上具有无可替代的优势(互联网规模预训练),但其离散化输出对连续动作的精细建模不足;流匹配/扩散动作头则专为连续、多模态动作分布设计,但缺乏语义上下文。混合架构通过模块分工,将两者的优势叠加。

这一设计的涌现并非偶然:它反映了机器人学习社区从"单一最优生成范式"向"任务分解后各取所长"的认识转变。2025年出现的FLOWER [31]、HybridVLA [39]、dVLA [22] 等工作均沿此方向探索,形成了清晰的研究格局。

5.2 持续学习与在线适应

离线模仿学习的根本局限在于分布偏移:训练分布与部署分布之间的差距随时间累积,导致策略性能下降。Action Flow Matching for Continual Robot Learning(RSS 2025)[28] 利用流匹配实现在线动力学模型对齐,是将生成式策略推向持续学习的代表性工作。

与此并行,DPPO [19] 和ReinFlow [30] 分别为扩散和流匹配策略提供了在线RL微调框架,标志着机器人学习从"离线预训练"向"在线持续优化"的系统性转变。这一转变的技术挑战在于:生成式策略的随机采样过程使标准策略梯度估计方差较大,需要专门的训练稳定化技术。

5.3 效率优化:从"能用"到"实时可部署"

2024–2025年间,推理效率成为独立的研究主轴,形成了系统性的技术栈:

  • 算法层:一致性蒸馏(OneDP [16],FRMD [15],ManiFlow [27])将推理步数从数十步压缩至1–2步
  • 系统层:动态剪枝(ICCV 2025 [17])在推理时动态调整网络稀疏度
  • 架构层:Streaming Flow Policy [29] 重新设计策略-环境交互循环,减少端到端延迟
  • 量化:扩散模型量化(INT8/INT4)正在从图像生成领域向机器人策略迁移

这一趋势的深层逻辑是:学术评测中的成功率指标并不等于工业部署可行性。一个在仿真中成功率95%但推理延迟500ms的策略,在需要20ms响应的接触丰富操作中是不可用的。效率优化研究的兴起,标志着机器人学习社区开始认真对待实际部署约束。

5.4 当前方法全景对比

方法 年份 生成范式 动作表示 推理速度 大规模预训练 代表会议
DAgger [4] 2011 BC(在线) 连续回归 单步 ICML
GAIL [6] 2016 对抗 连续 单步 NIPS
Implicit BC [5] 2021 能量模型 隐式 优化循环 CoRL
ACT 2023 BC+Transformer 连续回归 单步 RSS
Diffusion Policy [7] 2023 扩散(DDPM) 连续 多步 RSS
RT-2 [37] 2023 自回归 离散token 单步 是(VLM) arXiv
DP3 [8] 2024 扩散 连续(3D) 多步
DIFO [12] 2024 扩散+对抗 连续 多步 NeurIPS
OpenVLA [38] 2024 自回归 离散token 单步 是(7B) arXiv
AdaFlow [25] 2024 流匹配 连续 少步 NeurIPS
Consistency Policy [15] 2024 扩散蒸馏 连续 1–2步
RDT-1B [9] 2024 扩散Transformer 连续 多步 是(1B参数)
π₀ [3] 2024 流匹配+VLM 连续(混合) 少步 是(VLM) RSS 2025
OneDP [16] 2025 扩散蒸馏 连续 1步 ICLR
DPPO [19] 2025 扩散+RL 连续 多步 ICLR
FlowPolicy [26] 2025 流匹配 连续(3D) 少步 AAAI
ManiFlow [27] 2025 流匹配 连续 1–2步
ReinFlow [30] 2025 流匹配+RL 连续 少步 NeurIPS
DisDP [13] 2025 扩散 连续 多步 RLC
RDP [14] 2025 扩散(慢-快) 连续 多步+快速 RSS
DP4 [1] 2025 扩散 连续 多步 ICCV
HybridVLA [39] 2025 扩散+自回归 混合 混合
dVLA [22] 2025 扩散VLA 连续 多步 是(VLM)
FLOWER [31] 2025 流匹配VLA 连续 少步
Streaming Flow [29] 2025 流匹配 连续 少步
CoLA-Flow [33] 2026 潜空间流匹配 连续 少步

第六节:演进脉络的底层逻辑

6.1 三条核心矛盾线索

技术演进并非随机,而是由三条相互交织的矛盾线索驱动:

矛盾一:多模态动作分布 → 生成模型的引入。BC的MSE损失无法建模多模态分布,这一局限在接触丰富操作(如插销、开门)中最为突出——同一任务存在多种等价解法,MSE会产生"平均化"的无效动作。扩散模型和流匹配通过建模完整的动作分布(而非分布均值)从根本上解决这一问题。

矛盾二:推理延迟 → 蒸馏与Flow Matching的兴起。扩散模型解决了多模态问题,但多步去噪带来了新的矛盾:推理延迟(数十毫秒到数百毫秒)与实时控制需求(毫秒级)之间的鸿沟。这一矛盾催生了两条并行解法:(1)在扩散路线内部做一致性蒸馏(OneDP等);(2)切换到Flow Matching这一天然低NFE的生成范式。

矛盾三:泛化能力 → 大规模预训练与VLA。单任务策略的泛化能力有限,无法处理新场景、新指令。RT-2证明互联网规模的视觉-语言知识可以迁移到机器人控制,π₀证明这种迁移与生成式动作头可以无缝结合。泛化矛盾的解法因此从"更多机器人数据"转向"更好的预训练基础 + 更小的领域适应代价"。

6.2 三个关键转折点

转折点一(2023):Diffusion Policy — 证明生成模型可以直接用于策略学习,而无需作为规划器或数据增强工具。这一概念验证打开了整个生成式策略领域的大门。

转折点二(2023):RT-2 — 证明互联网规模的视觉-语言知识可以直接迁移到机器人控制,改变了"机器人学习需要大量机器人专用数据"的基本假设。

转折点三(2024):π₀ — 证明"VLM骨干 + 流匹配动作头"的混合架构是当前最优的融合方式,将语言泛化与精细动作生成统一在同一框架内。

6.3 场景分析:两种部署约束下的方法选择

场景A:高精度、低频操作(如精密装配、手术辅助)​
推理延迟要求宽松(>100ms可接受),多模态建模和动作精度是首要目标。此场景下扩散策略(Diffusion Policy、DP3)或大规模预训练扩散VLA(RDT-1B、dVLA)是合理选择;一致性蒸馏可选用但非必须。

**场景B:高频、接触丰富操作(如触觉反馈、快速抓取)**​
推理延迟是硬约束(<20ms),同时需要处理接触不确定性带来的多模态分布。此场景下流匹配策略(ManiFlow、FlowPolicy)或一步扩散蒸馏(OneDP)是首选;Reactive Diffusion Policy的慢-快架构为这类场景提供了另一种设计思路。

6.4 尚未解决的问题

以下三个开放问题将驱动下一波演进:

1. 样本效率:当前SOTA方法(RDT-1B、OpenVLA)仍需数十万条演示。如何从少量演示快速适应新任务,是将方法推向实际部署的关键瓶颈。
2. 长时域规划:现有生成式策略擅长短时域操作(数秒内),但对需要数分钟的长时域任务(如烹饪、组装复杂产品)表现不稳定。层次化扩散策略(HDP [41])是当前探索方向之一。
3. 跨形态泛化:同一策略能否在不同机器人形态(单臂、双臂、移动底盘、仿人机器人)间迁移,是通用机器人智能的核心挑战。当前方法大多针对特定形态设计,跨形态泛化仍是开放问题。

6.5 延伸探索方向

方向一:一致性模型与Flow Matching的深度对比。两者都追求少步生成,但理论基础不同:一致性模型是扩散模型的蒸馏产物(需要预训练多步模型),Flow Matching是独立的生成范式(直接训练低NFE模型)。在机器人实时控制场景下,二者的trade-off(训练成本、推理质量、对预训练数据的依赖)值得系统性对比。

方向二:VLA的动作头设计演进。从离散token(RT-2)到连续流匹配(π₀),动作头的设计选择如何影响精细操作性能?FAST tokenizer [36] 的频域编码是否能弥合离散化的精度损失?这是2025–2026年VLA架构研究的核心设计问题。

方向三:从模仿学习到在线强化学习的桥接。DPPO [19] 和ReinFlow [30] 已分别为扩散和流匹配策略建立了RL微调框架,但如何在稀疏奖励、高维连续动作空间下实现稳定的在线RL仍是开放问题。结合人类反馈(RLHF for robotics)和世界模型的方法是2025–2026年的重要前沿方向。

参考文献

[1] Spatial-Temporal Aware Visuomotor Diffusion Policy Learning (DP4). https://openaccess.thecvf.com/content/ICCV2025/papers/Liu_Spatial-Temporal_Aware_Visuomotor_Diffusion_Policy_Learning_ICCV_2025_paper.pdf

[2] Flow-matching policies reduce sampling time to ~20% of diffusion models (arXiv 2508.01622). https://arxiv.org/html/2508.01622v2

[3] π₀: A Vision-Language-Action Flow Model for General Robot Control. https://arxiv.org/abs/2410.24164

[4] DAgger: A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning. https://arxiv.org/abs/1011.0686

[5] Implicit Behavioral Cloning (CoRL 2021). https://arxiv.org/html/2403.03181v1

[6] Generative Adversarial Imitation Learning (NIPS 2016). https://papers.neurips.cc/paper/6391-generative-adversarial-imitation-learning.pdf

[7] Diffusion Policy: Visuomotor Policy Learning via Action Diffusion. https://diffusion-policy.cs.columbia.edu/

[8] 3D Diffusion Policy (DP3). https://arxiv.org/html/2504.08438v3

[9] STAR framework and RDT-1B (1B-parameter Diffusion Transformer). https://arxiv.org/html/2506.03863v3

[10] Scaling Diffusion Policy in Transformer to 1 Billion Parameters. https://scaling-diffusion-policy.github.io/

[11] Video Diffusion Policy (unified discrete diffusion for video pretraining and policy finetuning). https://video-diff.github.io/

[12] DIFO: Diffusion Imitation from Observation (NeurIPS 2024). https://arxiv.org/abs/2410.05429

[13] DisDP: Disentangled Diffusion Policy (RLC 2025). https://openreview.net/forum?id=0GSL9VRBib

[14] Reactive Diffusion Policy (RSS 2025). https://reactive-diffusion-policy.github.io/

[15] FRMD: Fast Robot Motion Diffusion with Consistency Distillation. https://arxiv.org/abs/2503.02048

[16] One-Step Diffusion Policy (OneDP, ICLR 2025). https://openreview.net/forum?id=E2VsqgKNlr

[17] Accelerating Diffusion Policy with Real-time Pruning (ICCV 2025). https://arxiv.org/html/2601.12894v2

[18] DiMO: Distilling Masked Diffusion Models into One-step Generator (ICCV 2025). https://openaccess.thecvf.com/content/ICCV2025/papers/Zhu_DiMO_Distilling_Masked_Diffusion_Models_into_One-step_Generator_ICCV_2025_paper.pdf

[19] Diffusion Policy Policy Optimization (DPPO, ICLR 2025). https://proceedings.iclr.cc/paper_files/paper/2025/file/c0749c39aaff9e9e4c91f7118bf21b1e-Paper-Conference.pdf

[20] Composable Diffusion Guidance (CoDiG, ICLR 2025). https://iclr.cc/virtual/2025/32503

[21] Compose Your Policies! General Policy Composition (GPC). https://arxiv.org/abs/2510.01068

[22] dVLA: Diffusion Vision-Language-Action Model. https://openreview.net/forum?id=2rxgospB5s

[23] Flow Matching for Generative Modeling (Lipman et al., 2022). https://arxiv.org/abs/2210.02747

[24] Learning Robotic Manipulation Policies from Point Clouds with Conditional Flow Matching (arXiv Sep 2024). https://arxiv.org/abs/2409.07343

[25] AdaFlow: Imitation Learning with Variance-Adaptive Flow-Based Policies (NeurIPS 2024). https://neurips.cc/virtual/2025/poster/117411

[26] FlowPolicy: Enabling Fast and Robust 3D Flow-based Policy via Consistency Flow Matching (AAAI 2025). https://github.com/zql-kk/FlowPolicy

[27] ManiFlow: flow matching with consistency training for dexterous manipulation. https://arxiv.org/html/2509.01819v1

[28] Action Flow Matching for Continual Robot Learning (RSS 2025). https://arxiv.org/html/2504.18471v1

[29] Streaming Flow Policy (May 2025). https://arxiv.org/abs/2505.21851

[30] ReinFlow: Fine-Tuning Flow Matching Policies via Online Reinforcement Learning (NeurIPS 2025). https://neurips.cc/virtual/2025/poster/119473

[31] FLOWER: Efficient Vision-Language-Action Flow Policies (2025). https://arxiv.org/html/2509.04996v1

[32] FlowMP: Flow Matching with Second-Order Trajectory Dynamics. https://mkhangg.com/assets/papers/nguyen2025flowmp.pdf

[33] CoLA-Flow Policy: Trajectory-level Latent Flow Matching (2026). https://arxiv.org/html/2601.23087v2

[34] Fourier Flow Matching for VLA Policies. https://arxiv.org/html/2504.18471v1

[35] RT-1: Robotics Transformer for Real-World Control at Scale (arXiv Dec 2022). https://arxiv.org/abs/2212.06817

[36] FAST Tokenizer for Autoregressive VLA Training (2025). https://arxiv.org/html/2501.09747v1

[37] RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotics (arXiv Jul 2023). https://arxiv.org/abs/2307.15818

[38] OpenVLA: An Open-Source Vision-Language-Action Model (arXiv Jun 2024). https://arxiv.org/abs/2406.09246

[39] HybridVLA: Unified Framework for Diffusion and Autoregressive VLA (2025). https://arxiv.org/abs/2503.10631

[40] Discrete Diffusion VLA (Aug 2025). https://www.techrxiv.org/doi/full/10.36227/techrxiv.175624440.05705133/v1

[41] Hierarchical Diffusion Policy (HDP, T-RO 2025). https://dl.acm.org/doi/10.1109/TRO.2025.3547272
Heavy

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐