#论文阅读 #具身智能 #VLA #FlowMatching #OfflineRL #ValueGradient #RobotLearning

Q-VGM:让 Q 梯度教会流匹配 VLA 的速度场

一句话总结: Q-VGM 不把 critic 梯度穿过整条多步去噪链,而是在每个去噪时刻先估计 clean action、用 Q 梯度局部改进该动作,再把终点位移转换成残差速度监督,从而仅凭固定 rollout 离线提升流匹配 VLA,并在推理时彻底移除 critic。

论文信息

  • 英文标题:Q-VGM: Q-Guided Value-Gradient Matching for Flow-Matching VLA Policies
  • 作者:Ziqian Wang、Jiayu Sun、Xingjian Mao、Minqian Wang、Yao Mu
  • 机构:上海交通大学、密歇根大学安娜堡分校、电子科技大学
  • 版本:arXiv:2606.08015v1,2026-06-06
  • 链接:arXiv HTMLPDF
  • 本地来源:[[source_2606.08015v1.html]]、[[source_2606.08015v1.pdf]]
  • 代码/项目页:当前版本未提供

摘要:忠实翻译

本文提出 Q-Guided Value-Gradient Matching(Q-VGM),一种离策略强化学习方法,目标是解决流匹配视觉—语言—动作策略后训练中的长期难题:如何利用学到的 Q Q Q 函数,高效改进表达能力很强的流匹配动作专家。

有效的策略改进应使用 critic 的一阶梯度信息,但流策略使这件事格外困难。把价值直接穿过多步去噪过程反向传播,在 VLA 规模下会数值不稳定;策略梯度需要的可处理动作似然,在迭代去噪过程中又不可得。已有价值方法或沿完整去噪链反传,或只在测试时使用 critic 而不更新策略,或把 critic 改进后的动作作为终点监督标签蒸馏,没有直接监督中间速度场。

Q-VGM 借助 VGG-Flow 的价值梯度视角,把价值梯度转换为随去噪时间变化的价值梯度场,避开不稳定的端到端目标。它不需要动作 likelihood,不需要穿过整条去噪链反传,并能在固定 replay buffer 上训练。其 critic 是建立在紧凑 RLT 特征上的动作敏感 Cal-QL 集成,并在每个隐藏层重新注入动作。

Q-VGM 支持“少样本初始化,再从经验中学习”的范式:从少样本 SFT 的 VLA 出发,只利用模型自己产生的 rollout 数据,在不增加专家监督的情况下提升任务性能。它把 LIBERO 平均成功率从 75.0% 提高到 92.5%,RoboTwin 2.0 从 76.4% 提高到 87.2%,两项真机桌面任务从 40.0% 提高到 67.5%,在三类设置中都超过共享相同 backbone 和 critic 的对照方法。

1. 真正的难点:critic 与流策略说着两种语言

VLA 接收视觉观测、语言指令和机器人本体状态,输出一段连续动作。流匹配 VLA 不直接回归唯一动作,而是学习一个速度场,将高斯噪声逐步运输到动作分布。这种参数化能表达多峰动作,也适合灵巧操作和长时序任务。

但 critic 和 flow action expert 的接口天然错位:

  • critic 评价的是能执行的 clean action chunk;
  • 策略训练和采样经历的是多个 noisy intermediate state;
  • 策略梯度需要 log ⁡ π ( A ∣ s ) \log\pi(A|s) logπ(As),流 ODE 的迭代生成没有现成 likelihood;
  • 直接最大化 Q ( s , A ) Q(s,A) Q(s,A),又要让梯度穿过所有去噪步。

已有方案各自只解决一部分:

  1. Diffusion-QL 类链式反传:直接、端到端,但长梯度路径在大型 VLA 上不稳定。
  2. 测试时 Q 选择/引导:不改训练,却在部署时要多次采样、排序或优化动作。
  3. Q 改进动作蒸馏:把测试时优化摊销进策略,但只告诉模型“最终答案是什么”,没有告诉流在中间时刻应如何改变速度。

Q-VGM 的重新表述是:不要让 critic 直接监督最终采样链,而要把 clean action 上的改进方向改写为 去噪时间中的速度修正

在这里插入图片描述

图 1:Q-VGM 总览。 左:用 rollout buffer、冻结 VLM 与 RLT 特征训练 Cal-QL critic 集成。中:把 ∇ A Q \nabla_AQ AQ 转成价值梯度诱导的流速度修正。右:LIBERO、RoboTwin 2.0 和真机任务的成功率提升。

2. 基础:流匹配与 KL 正则化策略改进

2.1 动作块与线性流路径

k k k 个动作块含 H H H 个连续动作:

A k = [ a k , 0 , a k , 1 , … , a k , H − 1 ] . A_k=[a_{k,0},a_{k,1},\ldots,a_{k,H-1}]. Ak=[ak,0,ak,1,,ak,H1].

设 clean action 为 A k A_k Ak,高斯噪声为 ϵ \epsilon ϵ。论文约定 t = 0 t=0 t=0 是干净动作, t = 1 t=1 t=1 是噪声,线性插值路径为

x k t = ( 1 − t ) A k + t ϵ , t ∈ [ 0 , 1 ] . x_k^t=(1-t)A_k+t\epsilon,\qquad t\in[0,1]. xkt=(1t)Ak+tϵ,t[0,1].

动作专家 v θ ( x t , t , s ) v_\theta(x^t,t,s) vθ(xt,t,s) 学习沿该路径从噪声走回动作的速度。推理时从 x 1 ∼ N ( 0 , I ) x^1\sim\mathcal N(0,I) x1N(0,I) 出发,用若干个 Euler 步积分到 t = 0 t=0 t=0

💡 讲解补注:这里的“速度”不是机械臂关节速度,而是生成过程在动作张量空间中的变化率。一个动作块本身仍可编码 EEF delta、qpos 等控制量。

2.2 高回报与不偏离基准之间的平衡

为什么不能只做“让 Q Q Q 尽可能大”

最直接的策略改进似乎是:让新策略只生成 critic 认为 Q Q Q 值最高的动作。但在离线 RL 中,这通常很危险。critic 只在 rollout buffer 覆盖的动作附近接受过训练;如果优化把动作推到数据分布之外,critic 可能因为外推误差而给某些不合理动作虚高的分数。策略随后追逐这些“虚假高价值动作”,形成典型的 critic exploitation

对 VLA 而言,少样本 SFT 策略还有一个重要作用:它已经学会生成大体合法、平滑并符合机器人动作结构的动作块。若 RL 更新完全抛弃这个先验,即使 critic 的局部分数提高,也可能破坏原有的多模态动作分布和基本操作能力。

因此策略改进同时需要两个目标:

  1. 提高回报:增加高 Q Q Q 动作的概率;
  2. 限制漂移:不要离生成合法动作的基准策略太远。

💡 讲解补注:可以把基准策略想成一条已经能通行的山路,critic 梯度告诉我们哪一侧可能更接近山顶。策略可以沿山路附近修正,但不能因为一张不完整的价值地图就直接冲下悬崖。

从优化目标推导指数倾斜分布

设基准策略在 clean action 上的分布为 p b a s e ( x 0 ) p_{\mathrm{base}}(x_0) pbase(x0),待优化的新分布为 p ( x 0 ) p(x_0) p(x0)。一种标准的 KL 正则化策略改进目标是

max ⁡ p E x 0 ∼ p [ r ( x 0 ) ] − λ D K L  ⁣ ( p   ∥   p b a s e ) , \max_p\quad \mathbb E_{x_0\sim p}[r(x_0)] -\lambda D_{\mathrm{KL}}\!\left(p\,\|\,p_{\mathrm{base}}\right), pmaxEx0p[r(x0)]λDKL(ppbase),

并满足 ∫ p ( x 0 ) d x 0 = 1 \int p(x_0)dx_0=1 p(x0)dx0=1。其中

D K L  ⁣ ( p   ∥   p b a s e ) = E x 0 ∼ p [ log ⁡ p ( x 0 ) p b a s e ( x 0 ) ] . D_{\mathrm{KL}}\!\left(p\,\|\,p_{\mathrm{base}}\right) =\mathbb E_{x_0\sim p}\left[\log\frac{p(x_0)}{p_{\mathrm{base}}(x_0)}\right]. DKL(ppbase)=Ex0p[logpbase(x0)p(x0)].

第一项希望新策略选择高回报动作,第二项惩罚新策略相对基准策略的分布漂移。对带归一化约束的目标做变分优化,可得到

p ⋆ ( x 0 ) = 1 Z p b a s e ( x 0 ) exp ⁡  ⁣ ( r ( x 0 ) / λ ) , p^\star(x_0) =\frac{1}{Z} p_{\mathrm{base}}(x_0) \exp\!\left(r(x_0)/\lambda\right), p(x0)=Z1pbase(x0)exp(r(x0)/λ),

其中归一化常数

Z = ∫ p b a s e ( x 0 ) exp ⁡  ⁣ ( r ( x 0 ) / λ ) d x 0 . Z=\int p_{\mathrm{base}}(x_0) \exp\!\left(r(x_0)/\lambda\right)dx_0. Z=pbase(x0)exp(r(x0)/λ)dx0.

这就是文中的指数倾斜分布:新策略不是凭空寻找高回报动作,而是在基准分布已有概率质量的地方重新加权。若两个动作在基准策略下概率相近,但动作 1 比动作 2 的回报高 Δ r \Delta r Δr,那么最优分布中的概率比会额外乘上

exp ⁡ ( Δ r / λ ) . \exp(\Delta r/\lambda). exp(Δr/λ).

λ \lambda λ 是“保守程度”或温度参数:

  • λ → ∞ \lambda\to\infty λ:回报重加权趋近于 1,新策略几乎等于基准策略;
  • λ \lambda λ 较大:只做温和、局部的策略改进;
  • λ \lambda λ 较小:更激进地集中到高回报动作,批外 critic 误差也更容易被放大;
  • λ → 0 \lambda\to0 λ0:趋向只选择回报最大的动作,几乎失去对基准策略的约束。

在 Q-VGM 中,状态 s s s 固定时,可以把终点回报理解为 critic 给 clean action 的评价,即 r ( x 0 ) = Q ( s , x 0 ) r(x_0)=Q(s,x_0) r(x0)=Q(s,x0)。因此这个公式表达的是“对基准 VLA 的动作分布做受约束的 Q 改进”。

为什么又变成了去噪路径上的控制问题

上式描述的是最终 clean-action 分布应该变成什么样,却没有告诉流匹配模型每个中间去噪状态应该怎样移动。流策略真正学习的是速度场,所以需要把“终点分布不要偏离太远”翻译成“整条生成路径不要改得太猛”。在 VGG-Flow 的最优控制视角下,对应目标写成

min ⁡ h    E [ λ 2 ∫ 0 1 ∥ h ( x t , t ) ∥ 2 d t − r ( x 0 ) ] . \min_h\;\mathbb E\left[\frac{\lambda}{2}\int_0^1\|h(x_t,t)\|^2dt-r(x_0)\right]. hminE[2λ01h(xt,t)2dtr(x0)].

这里:

  • v b a s e ( x t , t ) v_{\mathrm{base}}(x_t,t) vbase(xt,t) 是基准流的原始速度;
  • h ( x t , t ) h(x_t,t) h(xt,t) 是额外施加的残差速度,新流为 v b a s e + h v_{\mathrm{base}}+h vbase+h
  • ∫ 0 1 ∥ h ∥ 2 d t \int_0^1\|h\|^2dt 01h2dt 是沿整条生成路径累计的“控制能量”;
  • − r ( x 0 ) -r(x_0) r(x0) 是终点代价,因为公式采用最小化写法:回报越高,代价越低;
  • λ \lambda λ 决定路径保持与终点回报之间的权衡。

若某个高回报终点需要从基准流大幅绕行,控制能量会很大;若只需对原速度做轻微修正,代价较小。因此这项平方范数在路径空间中承担了与 KL 正则相似的角色:限制新生成过程偏离基准生成过程。

💡 讲解补注:终点分布公式回答“最终应该更常生成哪些动作”,控制目标回答“怎样改速度场才能到达那些动作,而且不要把原来的生成过程破坏得太严重”。二者是同一保守策略改进原则在分布空间和路径空间中的两种表达。

为什么最优修正沿价值梯度方向

定义 V ( x t , t ) V(x_t,t) V(xt,t) 为从中间状态 x t x_t xt 出发、在后续最优控制下能够取得的软价值。价值梯度 ∇ x t V \nabla_{x_t}V xtV 指向“稍微改变当前 noisy action 后,未来目标最可能改善”的方向。最优控制解满足

h ⋆ ( x t , t ) = β ∇ x t V ( x t , t ) , β = 1 / λ . h^\star(x_t,t)=\beta\nabla_{x_t}V(x_t,t),\qquad \beta=1/\lambda. h(xt,t)=βxtV(xt,t),β=1/λ.

直觉上,残差速度应该沿价值上升最快的方向移动;同时 β = 1 / λ \beta=1/\lambda β=1/λ 表示:越不强调保持基准策略,允许的价值引导越强。这里并不是说 Q-VGM 能直接得到所有 t t t 上的 ∇ x t V \nabla_{x_t}V xtV;恰恰相反,这个理论关系只给出了理想目标,后文的一步前视和 Q 梯度上升正是为了近似它。

由于本文的生成时间从 t = 1 t=1 t=1 的噪声向 t = 0 t=0 t=0 的动作递减,与引用的 VGG-Flow 时间约定相反,clean endpoint 的边界条件写成

∇ x 0 V ( x 0 , 0 ) = − ∇ x 0 r ( x 0 ) . \nabla_{x_0}V(x_0,0)=-\nabla_{x_0}r(x_0). x0V(x0,0)=x0r(x0).

负号主要来自时间方向和“最小化终点代价 − r -r r”的记号选择,并不表示实际动作优化要沿 Q 值下降。Q-VGM 在 clean-action 空间仍明确执行

A ← A + α ∇ A Q ( s , A ) , A\leftarrow A+\alpha\nabla_AQ(s,A), AA+αAQ(s,A),

也就是沿 Q 值上升方向改进动作;随后再根据从噪声到 clean action 的反向时间方向,把终点位移换算成速度修正。

💡 讲解补注:Q-VGM 并不显式计算流策略的动作 likelihood,也没有在代码目标中直接计算上面的 KL。KL 正则化给出理论上想实现的“高回报但不离基准太远”的目标;冻结基准流、局部动作改进、keep-best、动作投影和残差速度惩罚则把这一原则落实成可训练算法。

3. 动作敏感 critic:不只要 Q 值准,还要梯度有用

3.1 用 RLT 压缩 VLA 状态

RLT 到底是什么

RLT 是 RL Token(强化学习读出 token) 的缩写。它不是新的图像编码器,也不是 critic 本身,而是放在冻结 VLA 表征与 RL critic 之间的一个紧凑读出接口。

VLA 的 VLM backbone 已经把图像、语言指令等上下文编码成一长串 prefix token。图 2 中约有 512 个 token,每个 token 为 2048 维,总计超过一百万个标量。完整 token 序列适合 action expert 用 attention 读取,但直接交给一个小型 Q 网络会带来三个问题:

  1. 计算和存储昂贵:每条离线 transition 都携带完整 prefix,critic 训练和 replay 缓存成本很高;
  2. 状态维度压倒动作维度:高维视觉—语言特征容易让 Q 网络忽略只有几十维的动作块,导致 ∇ A Q \nabla_AQ AQ 很弱;
  3. 接口不稳定:若 RL 期间继续改变 VLM 特征,critic 看到的状态表示也会漂移,使离线 Q 学习更困难。

RLT encoder 的作用是把整段 VLA prefix 压缩成一个固定长度向量 z r l z_{\mathrm{rl}} zrl。它试图保留对机器人状态和任务语义有用的信息,例如“看到了什么物体”“语言要求做什么”“场景当前处于哪一步”,同时丢掉 critic 不需要的 token 级冗余。

然后再把 z r l z_{\mathrm{rl}} zrl 与机器人本体状态的投影 e p r o p e_{\mathrm{prop}} eprop 拼接:

c ( s ) = [ z r l ; e p r o p ] . c(s)=[z_{\mathrm{rl}};e_{\mathrm{prop}}]. c(s)=[zrl;eprop].

c ( s ) c(s) c(s) 才是 critic 实际使用的状态表示。其中 z r l z_{\mathrm{rl}} zrl 提供视觉—语言任务上下文, e p r o p e_{\mathrm{prop}} eprop 提供关节位置等精确本体信息,动作块 A A A 则通过后续 Q head 单独注入。

RLT 是怎样训练和使用的

论文附录把 RLT 实现为一个 2 层 Transformer 自编码器,token 维度为 2048、包含 8 个 attention head。训练时:

  1. 冻结 VLA/VLM backbone,提取原始 prefix embedding;
  2. RLT encoder 将完整 prefix 压缩为紧凑的 z r l z_{\mathrm{rl}} zrl
  3. decoder 尝试从 z r l z_{\mathrm{rl}} zrl 重建原始 prefix embedding;
  4. 使用 MSE 训练重建,在留出数据上达到 0.95 余弦相似度。

训练完成后,VLA backbone 和 RLT encoder 都被冻结。对 rollout buffer 中的状态,可以预先计算并缓存 z r l z_{\mathrm{rl}} zrl,之后 critic 训练和 Q-VGM 策略微调都使用同一套固定状态坐标系。

图像 + 语言指令
       ↓
冻结 VLM → 大量 prefix tokens
       ↓
冻结 RLT encoder → 单个紧凑向量 z_rl
       ↓
与本体状态 e_prop 拼接 → critic 状态 c(s)
       ↓
再结合动作块 A → Q(s, A) 与 ∇_A Q

💡 讲解补注:RLT 的价值不是简单“降维以加速”。它还隔离了 VLA 表征学习与离线 Q 学习:critic 始终在一个冻结、可缓存的状态空间中训练,从而更容易把建模能力集中到“同一状态下不同动作哪个更好”。

需要注意,0.95 的重建余弦相似度只说明 RLT 能较好恢复 VLA prefix 的整体表征,不等于它必然保留了所有与长期回报有关的信息。消融中用 ResNet 状态特征替代 RLT 后,LIBERO 平均成功率从 92.5% 降到 82.5%,说明 VLA 派生的语义状态确实重要,但还不能单独证明 RLT 表示是最优或充分的。

3.2 动作块级 Cal-QL

critic 不评价单步动作,而是评价整段动作块。离线数据中的 transition 可写成 ( s , A , R , s ′ , A ′ ) (s,A,R,s',A') (s,A,R,s,A),Bellman target 直接使用数据里记录的下一个动作块 A ′ A' A

L T D = E D [ ( Q m ( s , A ) − R − γ Q ˉ ( s ′ , A ′ ) ) 2 ] . \mathcal L_{\mathrm{TD}}=\mathbb E_{\mathcal D}\left[\left(Q_m(s,A)-R-\gamma\bar Q(s',A')\right)^2\right]. LTD=ED[(Qm(s,A)RγQˉ(s,A))2].

保守正则项为

L C Q L = E s ∼ D [ log ⁡ ∑ A exp ⁡ Q m ( s , A ) − E A ∼ D [ Q m ( s , A ) ] ] , \mathcal L_{\mathrm{CQL}}=\mathbb E_{s\sim\mathcal D}\left[\log\sum_A\exp Q_m(s,A)-\mathbb E_{A\sim\mathcal D}[Q_m(s,A)]\right], LCQL=EsD[logAexpQm(s,A)EAD[Qm(s,A)]],

总目标为

L c r i t i c = L T D + α c q l L C Q L . \mathcal L_{\mathrm{critic}}=\mathcal L_{\mathrm{TD}}+\alpha_{\mathrm{cql}}\mathcal L_{\mathrm{CQL}}. Lcritic=LTD+αcqlLCQL.

Cal-QL 进一步用数据轨迹的 Monte Carlo return 校准保守惩罚,只压制超过该 return 的 Q 值,避免无谓低估分布内动作。

3.3 为什么动作要在每层重新注入

高维状态特征远大于扁平动作块。若只在输入处拼一次,MLP 很可能主要依据场景预测 Q,忽略动作的局部变化。可它即使标量 Q 误差不大, ∇ A Q \nabla_AQ AQ 也可能几乎为零或方向错误。
因此每个 Q head 都执行

h 0 = g 0 ( [ c ( s ) ; A ] ) , h ℓ + 1 = g ℓ + 1 ( [ h ℓ ; A ] ) , Q m ( s , A ) = q m ( h L ) . h_0=g_0([c(s);A]),\qquad h_{\ell+1}=g_{\ell+1}([h_\ell;A]),\qquad Q_m(s,A)=q_m(h_L). h0=g0([c(s);A]),h+1=g+1([h;A]),Qm(s,A)=qm(hL).

动作在每层重新拼接。图 2 显示使用 5-head 集成;每个 head 约 3.9M 参数。7-DoF、chunk 长度 5 的设置中,动作扁平后是 35 维。

💡 讲解补注:Q-VGM 需要的是 critic 关于动作的“局部斜率”,不是只会给轨迹打分的分类器。逐层动作注入的本质,是改善 critic 的动作条件数与梯度## 4. Q-Guided Value-Gradient Matching

在这里插入图片描述

图 2:完整训练管线。 左侧冻结 VLM 和 RLT,底部冻结 Cal-QL critic;顶部只训练 flow-matching action expert。中间动作经一步 clean-action 估计、若干步 Q 梯度上升和 keep-best 后,产生残差速度目标;推理时不再需要 critic 或搜索。

4.1 一步前视:把 noisy state 投影到 clean action

对离线状态 s s s 采样初始噪声,并用当前策略产生 stop-gradient 的去噪状态序列。在第 k k k 步,当前 noisy action 为 x k x^k xk、剩余时间为 t k t_k tk。使用冻结基准速度做一次 Euler 外推:

A ^ b a s e k = x k − t k   s g  ⁣ [ v b a s e ( x k , t k , s ) ] . \hat A_{\mathrm{base}}^k=x^k-t_k\,\mathrm{sg}\!\left[v_{\mathrm{base}}(x^k,t_k,s)\right]. A^basek=xktksg[vbase(xk,tk,s)].

这里的 s g \mathrm{sg} sg 表示 stop-gradient。冻结基准策略来自少样本 SFT 初始化,它把 clean-action 估计锚定在 rollout 数据附近,也就是 critic 相对可信的区域。

💡 讲解补注:如果让正在更新的策略自己定义锚点,策略漂移会同时移动训练输入和监督目标,容易形成自我强化的分布外误差。消融中取消冻结锚点后,LIBERO 从 92.5% 降到 86.5%。

4.2 在 clean-action 空间做 Q 梯度上升

A ^ k , 0 = A ^ b a s e k \hat A^{k,0}=\hat A_{\mathrm{base}}^k A^k,0=A^basek 初始化,执行 J J J 步:

A ^ k , j + 1 = Π A  ⁣ [ A ^ k , j + α   c l i p G  ⁣ ( ∇ A Q ( s , A ) ∣ A = A ^ k , j ) ] . \hat A^{k,j+1}=\Pi_{\mathcal A}\!\left[\hat A^{k,j}+\alpha\,\mathrm{clip}_G\!\left(\nabla_AQ(s,A)|_{A=\hat A^{k,j}}\right)\right]. A^k,j+1=ΠA[A^k,j+αclipG(AQ(s,A)A=A^k,j)].

各符号含义:

  • α \alpha α:动作空间上升步长;
  • ∇ A Q \nabla_AQ AQ:critic 对完整动作块的梯度;
  • c l i p G \mathrm{clip}_G clipG:限制梯度幅值,避免一次跳太远;
  • Π A \Pi_{\mathcal A} ΠA:投影/裁剪到有效动作范围。

算法不直接采用最后一个候选,而是在 j = 0 , … , J j=0,\ldots,J j=0,,J 中选择 Q 值最高的 j ⋆ j^\star j。由于原始动作也参与选择,只要梯度上升没有带来预测价值改善,目标就回退到基准动作。

keep-best 同时发挥两种作用:它是防止过冲的安全阀,也是一种离散线搜索,使不同样本自动得到不同幅度的有效 β \beta β

4.3 从终点位移构造速度修正

clean-action 目标从 A ^ b a s e k \hat A_{\mathrm{base}}^k A^basek 移到了 A ^ k , j ⋆ \hat A^{k,j^\star} A^k,j。将终点位移除以剩余去噪时间,得到

h e f f k = A ^ b a s e k − A ^ k , j ⋆ t k . h_{\mathrm{eff}}^k=\frac{\hat A_{\mathrm{base}}^k-\hat A^{k,j^\star}}{t_k}. heffk=tkA^basekA^k,j.

符号方向看起来是“基准减改进动作”,原因是论文采用从 t = 1 t=1 t=1 t = 0 t=0 t=0 积分的时间方向。 t k t_k tk 越小,同样的终点位移对应越强的瞬时速度修正,因此必须结合时间门与可信区间控制。

4.4 残差速度匹配

当前动作专家相对基准专家的残差为 v θ − v b a s e v_\theta-v_{\mathrm{base}} vθvbase。训练目标是

L a l i g n = ∑ k s ( t k ) ∥ ( v θ ( x k , t k , s ) − v b a s e ( x k , t k , s ) ) − s g [ h e f f k ] ∥ 2 2 . \mathcal L_{\mathrm{align}}= \sum_k s(t_k)\left\| \left(v_\theta(x^k,t_k,s)-v_{\mathrm{base}}(x^k,t_k,s)\right) -\mathrm{sg}[h_{\mathrm{eff}}^k] \right\|_2^2. Lalign=ks(tk) (vθ(xk,tk,s)vbase(xk,tk,s))sg[heffk] 22.

s ( t k ) s(t_k) s(tk) 是时间门,将指导集中在 clean-action 前视较可靠的去噪阶段。所有去噪步都设为 1 时,成功率由 92.5% 降到 86.0%,说明“指导越多越好”并不成立。

梯度只通过本地预测 v θ ( x k , t k , s ) v_\theta(x^k,t_k,s) vθ(xk,tk,s) x k x^k xk v b a s e v_{\mathrm{base}} vbase、critic 和 h e f f h_{\mathrm{eff}} heff 都不接收梯度。这是方法避开完整链反传的关键。

4.5 训练与推理的数据流

训练分为两个阶段:

  1. critic 阶段:SFT 策略生成固定 rollout;冻结 VLM 与 RLT;训练动作敏感 Cal-QL 集成。
  2. 策略阶段:冻结 VLM、RLT、基准流和 critic;用 Q 梯度构造速度修正;只更新 flow action expert。

推理阶段只运行更新后的 v θ v_\theta vθ,不需要 critic,不需要候选排序,不需要动作梯度上升,也不需要沿去噪链反传。

5. 实验:控制变量比单个 SOTA 数字更重要

三组实验都从少样本 SFT 出发,用 SFT 策略收集固定数据,训练 Cal-QL critic 后完全离线微调。所有 critic 基线共享相同的初始化、数据、RLT 特征和 critic,只改变使用 critic 的方式。

5.1 LIBERO:40 项桌面操作

LIBERO 包含 Spatial、Object、Goal、Long 四个 suite,共 40 项任务,使用 7-DoF EEF 动作空间。每个 suite 收集 300 条 SFT rollout,每个任务评估 50 次。

方法 Spatial Object Goal Long 平均
少样本 SFT 82.0 84.0 78.0 56.0 75.0
测试时 Q Selection 88.0 91.0 85.0 64.0 82.0
测试时 Q Guidance 91.0 93.0 88.0 68.0 85.0
Q-Improved Action Distillation 91.0 92.0 88.0 74.0 86.3
Diffusion-QL 73.0 78.0 74.0 53.0 69.5
Q-VGM 96.0 95.0 95.0 84.0 92.5

Q-VGM 相对 SFT 提升 17.5pp,最大增益出现在 Long:56.0% → 84.0%。相同 critic 下,测试时选择、测试时引导和动作蒸馏依次为 82.0%、85.0% 和 86.3%,说明把 critic 信息写进速度场比部署时临时使用更充分。

Diffusion-QL 降到 69.5%,比初始化还低 5.5pp。这是论文关于“大型流匹配 VLA 上完整链 Q 反传不稳定”的直接经验支持,但它仍是方法—设置相关证据,不能推广为所有 diffusion/flow policy 都必然失败。

5.2 RoboTwin 2.0:双臂 14-DoF

RoboTwin 2.0 评估 10 个双臂任务,每项 50 次 rollout:

任务 SFT Q-Sel. Q-Guid. Q-Distill. Q-VGM
adjust_bottle 80 84 86 88 94
shake_bottle 88 92 90 92 94
lift_pot 54 56 58 60 70
place_container_plate 86 88 90 90 94
stack_bowls_two 84 86 88 88 92
handover_mic 70 72 76 76 86
place_empty_cup 86 90 88 90 94
beat_block_hammer 78 82 84 82 90
place_shoe 50 52 54 56 66
click_bell 88 90 90 92 92
平均 76.4 79.2 80.4 81.4 87.2

提升最大的 lift_pot、handover_mic、place_shoe 都是 +16pp,恰好是初始 SFT 较弱的任务。这提示价值梯度修正的收益更可能出现在协调、接触和失败恢复有改进空间的场景,而非已经接近饱和的任务。

5.3 真机:两真机使用 7-DoF 机械臂与两台面向机械臂的 RGB-D 相机。每项任务先用 30 条遥操作示范做 SFT,再收集 100 条 rollout;每种策略评估 20 次

主题标签在这里插入图片描述

在这里插入图片描述

图 3b:Stack Bowls。 机械臂需要操作两个碗完成堆叠。

任务 SFT Q-VGM 提升
Pick Peach 9/20(45.0%) 15/20(75.0%) +30.0pp
Stack Bowls 7/20(35.0%) 12/20(60.0%) +25.0pp
平均 40.0% 67.5% +27.5pp

方向与模拟器一致,但样本量很小。20 次试验中一次成败就对应 5 个百分点,因此这些数字更适合视为真机可行性证据,而不是精确的泛化收益估计。

5.4 消融:方法为何有效

变体 LIBERO 平均成功率 相对完整方法
完整 Q-VGM 92.5
ResNet 替代 RLT 82.5 -10.0
不做逐层动作注入 87.5 -5.0
单 critic head 89.5 -3.0
无 keep-best 88.5 -4.0
所有去噪步都对齐 86.0 -6.5
无冻结基准锚点 86.5 -6.0

可以分成两类解释:

  • critic 侧:RLT 的 VLA 语义状态最重要;逐层动作注入保证 ∇ A Q \nabla_AQ AQ 对动作敏感;集成让梯度和排序更平滑。
  • 策略侧:keep-best 避免梯度上升过冲;时间门避免在不可靠时刻强行对齐;冻结基准锚点把估计留在离线数据支持范围附近。

最关键的经验不是“用了 Q 梯度”,而是 给不完全可信的 Q 梯度加上分布锚点、幅值限制、候选回退和时间门

6. 与相邻工作的关系

Diffusion-QL / Q-score matching

这些方法直接把 Q 或 Q-score 与生成策略连接起来,理论上信用传递直接,但通常需要穿过更多生成步骤。Q-VGM 用 stop-gradient 的局部目标换取训练稳定性和 VLA 规模可行性。

测试时 Q selection / guidance

测试时方法不承担策略训练风险,适合快速外挂,但每次部署都要多采样或做动作优化。Q-VGM 在训练期支付 critic guidance 成本,把它摊销到 action expert,部署路径更短。

PA-RL 式动作蒸馏

两者都会先用 Q 改动作再写回策略。差别是动作蒸馏把改进后的 clean action 当作监督终点;Q-VGM 将同一终点位移按去噪时间转成残差速度,保持 flow matching 原生参数化。

VGG-Flow 与 Adjoint Matching

VGG-Flow 提供“最优残差速度与价值梯度成正比”的最优控制解释;Adjoint Matching 也避免把奖励梯度直接穿过完整生成过程。Q-VGM 的具体工程化是 clean-action critic、一步前视、多步 Q 梯度上升、keep-best 和残差速度匹配。

Q-learning with Adjoint Matching

这是最接近的同时期方向,同样面向 flow/diffusion policy 的 Q-learning 和无完整链反传。Q-VGM 强调用显式动作空间上升构造目标,并用离散 keep-best 选择自适应修正幅度。

7. 局限、未解问题与复现实务

7.1 critic 梯度可靠性是核心瓶颈

离线 critic 在数据附近通常最可靠,分布外动作的 Q 值和梯度都可能错误。Cal-QL、冻结锚点、动作投影、梯度裁剪和 keep-best 能减轻风险,却没有形成严格的 path-space trust region。未来可把信赖域直接内化到采样动力学中。

7.2 keep-best 仍可能被同一个 critic 欺骗

候选生成和候选选择都依赖同一 critic。如果 critic 对某个分布外候选过度乐观,keep-best 会把错误自信当作改善。更稳健的方案可能需要不确定性门控、保守集成下界、OOD 检测或真实 rollout 校验。

7.3 长时域与多任务扩展

任务时域和环境多样性增大时,Q-learning 更难扩展。论文提出把世界模型和价值估计结合:用 learned dynamics 的多步 rollout 缩短 TD 的有效时域,再继续用价值函数提供梯度场。

7.4 证据边界

  • 真机只有两个任务,每项 20 次试验。
  • 主文没有系统报告训练算力、墙钟时间或超参数敏感性。
  • 没有单独诊断 ∇ A Q \nabla_AQ AQ 的方向准确率、平滑性或校准。
  • 数据来自初始 SFT 策略,自生成经验仍受初始覆盖范围限制。
  • 只更新 action expert 带来稳定性,但视觉—语言 backbone 无法随 RL 信号适应。

7.5 复现时最该检查什么

  1. clean/noise 的时间方向和式(7)的符号,避免把修正方向写反。
  2. 动作归一化、 Π A \Pi_{\mathcal A} ΠA 的边界与执行器动作范围一致。
  3. Q 梯度只对 clean action 求导,critic 参数保持冻结。
  4. 去噪 trajectory 与目标构造 stop-gradient,只有局部 v θ v_\theta vθ 接收梯度。
  5. keep-best 必须包含 j = 0 j=0 j=0 的基准候选。
  6. critic 集成在动作排序和梯度计算时如何聚合;论文使用集成均值。
  7. 训练时的时间门 s ( t ) s(t) s(t) 与采样 schedule 对齐。

8. 后续值得追问的问题

  1. 若用 critic 集成方差给 h e f f h_{\mathrm{eff}} heff 加不确定性权重,能否优于固定时间门?
  2. 动作梯度的质量能否通过有限差分、真实短 rollout 或局部 ranking accuracy 单独评估?
  3. 把 keep-best 从同一 critic 的均值改为保守下界,会牺牲多少性能、换来多少 OOD 稳定性?
  4. 在线迭代“收集新 rollout → 重训 critic → 再做 VGM”是否会持续改进,还是出现 critic/policy 共漂移?
  5. 世界模型若提供多步价值梯度,怎样避免模型误差被速度场摊销?
  6. 方法能否迁移到 variable-length chunk、离散—连续混合动作或接触事件显式建模?

9. 最值得记住的结论

Q-VGM 把一个很难训练的端到端目标拆成了可控的局部接口:critic 只在它熟悉的 clean-action 空间提出改进,算法把这个改进折算成 noisy-state 上的速度修正,动作专家再用普通回归学习残差场。

它成功的关键不是单一公式,而是一组互相配合的约束:RLT 提供语义状态、逐层动作注入保证梯度敏感、冻结基准流限制分布漂移、梯度裁剪与动作投影控制步长、keep-best 允许回退、时间门只在可信阶段施加强监督。最终,critic 的昂贵指导被摊销进策略,推理路径恢复为纯粹的 flow-matching VLA。

最值得记住的一句话: 对流匹配策略做价值微调,不一定要让 Q 梯度穿过生成链;更自然的做法,是把 clean action 的价值改进翻译成中间速度场的监督。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐