Q-VGM:适用于流匹配VLA的真机强化学习方法
#论文阅读 #具身智能 #VLA #FlowMatching #OfflineRL #ValueGradient #RobotLearning
Q-VGM:让 Q 梯度教会流匹配 VLA 的速度场
一句话总结: Q-VGM 不把 critic 梯度穿过整条多步去噪链,而是在每个去噪时刻先估计 clean action、用 Q 梯度局部改进该动作,再把终点位移转换成残差速度监督,从而仅凭固定 rollout 离线提升流匹配 VLA,并在推理时彻底移除 critic。
论文信息
- 英文标题:Q-VGM: Q-Guided Value-Gradient Matching for Flow-Matching VLA Policies
- 作者:Ziqian Wang、Jiayu Sun、Xingjian Mao、Minqian Wang、Yao Mu
- 机构:上海交通大学、密歇根大学安娜堡分校、电子科技大学
- 版本:arXiv:2606.08015v1,2026-06-06
- 链接:arXiv HTML|PDF
- 本地来源:[[source_2606.08015v1.html]]、[[source_2606.08015v1.pdf]]
- 代码/项目页:当前版本未提供
摘要:忠实翻译
本文提出 Q-Guided Value-Gradient Matching(Q-VGM),一种离策略强化学习方法,目标是解决流匹配视觉—语言—动作策略后训练中的长期难题:如何利用学到的 Q Q Q 函数,高效改进表达能力很强的流匹配动作专家。
有效的策略改进应使用 critic 的一阶梯度信息,但流策略使这件事格外困难。把价值直接穿过多步去噪过程反向传播,在 VLA 规模下会数值不稳定;策略梯度需要的可处理动作似然,在迭代去噪过程中又不可得。已有价值方法或沿完整去噪链反传,或只在测试时使用 critic 而不更新策略,或把 critic 改进后的动作作为终点监督标签蒸馏,没有直接监督中间速度场。
Q-VGM 借助 VGG-Flow 的价值梯度视角,把价值梯度转换为随去噪时间变化的价值梯度场,避开不稳定的端到端目标。它不需要动作 likelihood,不需要穿过整条去噪链反传,并能在固定 replay buffer 上训练。其 critic 是建立在紧凑 RLT 特征上的动作敏感 Cal-QL 集成,并在每个隐藏层重新注入动作。
Q-VGM 支持“少样本初始化,再从经验中学习”的范式:从少样本 SFT 的 VLA 出发,只利用模型自己产生的 rollout 数据,在不增加专家监督的情况下提升任务性能。它把 LIBERO 平均成功率从 75.0% 提高到 92.5%,RoboTwin 2.0 从 76.4% 提高到 87.2%,两项真机桌面任务从 40.0% 提高到 67.5%,在三类设置中都超过共享相同 backbone 和 critic 的对照方法。
1. 真正的难点:critic 与流策略说着两种语言
VLA 接收视觉观测、语言指令和机器人本体状态,输出一段连续动作。流匹配 VLA 不直接回归唯一动作,而是学习一个速度场,将高斯噪声逐步运输到动作分布。这种参数化能表达多峰动作,也适合灵巧操作和长时序任务。
但 critic 和 flow action expert 的接口天然错位:
- critic 评价的是能执行的 clean action chunk;
- 策略训练和采样经历的是多个 noisy intermediate state;
- 策略梯度需要 log π ( A ∣ s ) \log\pi(A|s) logπ(A∣s),流 ODE 的迭代生成没有现成 likelihood;
- 直接最大化 Q ( s , A ) Q(s,A) Q(s,A),又要让梯度穿过所有去噪步。
已有方案各自只解决一部分:
- Diffusion-QL 类链式反传:直接、端到端,但长梯度路径在大型 VLA 上不稳定。
- 测试时 Q 选择/引导:不改训练,却在部署时要多次采样、排序或优化动作。
- Q 改进动作蒸馏:把测试时优化摊销进策略,但只告诉模型“最终答案是什么”,没有告诉流在中间时刻应如何改变速度。
Q-VGM 的重新表述是:不要让 critic 直接监督最终采样链,而要把 clean action 上的改进方向改写为 去噪时间中的速度修正。

图 1:Q-VGM 总览。 左:用 rollout buffer、冻结 VLM 与 RLT 特征训练 Cal-QL critic 集成。中:把 ∇ A Q \nabla_AQ ∇AQ 转成价值梯度诱导的流速度修正。右:LIBERO、RoboTwin 2.0 和真机任务的成功率提升。
2. 基础:流匹配与 KL 正则化策略改进
2.1 动作块与线性流路径
第 k k k 个动作块含 H H H 个连续动作:
A k = [ a k , 0 , a k , 1 , … , a k , H − 1 ] . A_k=[a_{k,0},a_{k,1},\ldots,a_{k,H-1}]. Ak=[ak,0,ak,1,…,ak,H−1].
设 clean action 为 A k A_k Ak,高斯噪声为 ϵ \epsilon ϵ。论文约定 t = 0 t=0 t=0 是干净动作, t = 1 t=1 t=1 是噪声,线性插值路径为
x k t = ( 1 − t ) A k + t ϵ , t ∈ [ 0 , 1 ] . x_k^t=(1-t)A_k+t\epsilon,\qquad t\in[0,1]. xkt=(1−t)Ak+tϵ,t∈[0,1].
动作专家 v θ ( x t , t , s ) v_\theta(x^t,t,s) vθ(xt,t,s) 学习沿该路径从噪声走回动作的速度。推理时从 x 1 ∼ N ( 0 , I ) x^1\sim\mathcal N(0,I) x1∼N(0,I) 出发,用若干个 Euler 步积分到 t = 0 t=0 t=0。
💡 讲解补注:这里的“速度”不是机械臂关节速度,而是生成过程在动作张量空间中的变化率。一个动作块本身仍可编码 EEF delta、qpos 等控制量。
2.2 高回报与不偏离基准之间的平衡
为什么不能只做“让 Q Q Q 尽可能大”
最直接的策略改进似乎是:让新策略只生成 critic 认为 Q Q Q 值最高的动作。但在离线 RL 中,这通常很危险。critic 只在 rollout buffer 覆盖的动作附近接受过训练;如果优化把动作推到数据分布之外,critic 可能因为外推误差而给某些不合理动作虚高的分数。策略随后追逐这些“虚假高价值动作”,形成典型的 critic exploitation。
对 VLA 而言,少样本 SFT 策略还有一个重要作用:它已经学会生成大体合法、平滑并符合机器人动作结构的动作块。若 RL 更新完全抛弃这个先验,即使 critic 的局部分数提高,也可能破坏原有的多模态动作分布和基本操作能力。
因此策略改进同时需要两个目标:
- 提高回报:增加高 Q Q Q 动作的概率;
- 限制漂移:不要离生成合法动作的基准策略太远。
💡 讲解补注:可以把基准策略想成一条已经能通行的山路,critic 梯度告诉我们哪一侧可能更接近山顶。策略可以沿山路附近修正,但不能因为一张不完整的价值地图就直接冲下悬崖。
从优化目标推导指数倾斜分布
设基准策略在 clean action 上的分布为 p b a s e ( x 0 ) p_{\mathrm{base}}(x_0) pbase(x0),待优化的新分布为 p ( x 0 ) p(x_0) p(x0)。一种标准的 KL 正则化策略改进目标是
max p E x 0 ∼ p [ r ( x 0 ) ] − λ D K L ( p ∥ p b a s e ) , \max_p\quad \mathbb E_{x_0\sim p}[r(x_0)] -\lambda D_{\mathrm{KL}}\!\left(p\,\|\,p_{\mathrm{base}}\right), pmaxEx0∼p[r(x0)]−λDKL(p∥pbase),
并满足 ∫ p ( x 0 ) d x 0 = 1 \int p(x_0)dx_0=1 ∫p(x0)dx0=1。其中
D K L ( p ∥ p b a s e ) = E x 0 ∼ p [ log p ( x 0 ) p b a s e ( x 0 ) ] . D_{\mathrm{KL}}\!\left(p\,\|\,p_{\mathrm{base}}\right) =\mathbb E_{x_0\sim p}\left[\log\frac{p(x_0)}{p_{\mathrm{base}}(x_0)}\right]. DKL(p∥pbase)=Ex0∼p[logpbase(x0)p(x0)].
第一项希望新策略选择高回报动作,第二项惩罚新策略相对基准策略的分布漂移。对带归一化约束的目标做变分优化,可得到
p ⋆ ( x 0 ) = 1 Z p b a s e ( x 0 ) exp ( r ( x 0 ) / λ ) , p^\star(x_0) =\frac{1}{Z} p_{\mathrm{base}}(x_0) \exp\!\left(r(x_0)/\lambda\right), p⋆(x0)=Z1pbase(x0)exp(r(x0)/λ),
其中归一化常数
Z = ∫ p b a s e ( x 0 ) exp ( r ( x 0 ) / λ ) d x 0 . Z=\int p_{\mathrm{base}}(x_0) \exp\!\left(r(x_0)/\lambda\right)dx_0. Z=∫pbase(x0)exp(r(x0)/λ)dx0.
这就是文中的指数倾斜分布:新策略不是凭空寻找高回报动作,而是在基准分布已有概率质量的地方重新加权。若两个动作在基准策略下概率相近,但动作 1 比动作 2 的回报高 Δ r \Delta r Δr,那么最优分布中的概率比会额外乘上
exp ( Δ r / λ ) . \exp(\Delta r/\lambda). exp(Δr/λ).
λ \lambda λ 是“保守程度”或温度参数:
- λ → ∞ \lambda\to\infty λ→∞:回报重加权趋近于 1,新策略几乎等于基准策略;
- λ \lambda λ 较大:只做温和、局部的策略改进;
- λ \lambda λ 较小:更激进地集中到高回报动作,批外 critic 误差也更容易被放大;
- λ → 0 \lambda\to0 λ→0:趋向只选择回报最大的动作,几乎失去对基准策略的约束。
在 Q-VGM 中,状态 s s s 固定时,可以把终点回报理解为 critic 给 clean action 的评价,即 r ( x 0 ) = Q ( s , x 0 ) r(x_0)=Q(s,x_0) r(x0)=Q(s,x0)。因此这个公式表达的是“对基准 VLA 的动作分布做受约束的 Q 改进”。
为什么又变成了去噪路径上的控制问题
上式描述的是最终 clean-action 分布应该变成什么样,却没有告诉流匹配模型每个中间去噪状态应该怎样移动。流策略真正学习的是速度场,所以需要把“终点分布不要偏离太远”翻译成“整条生成路径不要改得太猛”。在 VGG-Flow 的最优控制视角下,对应目标写成
min h E [ λ 2 ∫ 0 1 ∥ h ( x t , t ) ∥ 2 d t − r ( x 0 ) ] . \min_h\;\mathbb E\left[\frac{\lambda}{2}\int_0^1\|h(x_t,t)\|^2dt-r(x_0)\right]. hminE[2λ∫01∥h(xt,t)∥2dt−r(x0)].
这里:
- v b a s e ( x t , t ) v_{\mathrm{base}}(x_t,t) vbase(xt,t) 是基准流的原始速度;
- h ( x t , t ) h(x_t,t) h(xt,t) 是额外施加的残差速度,新流为 v b a s e + h v_{\mathrm{base}}+h vbase+h;
- ∫ 0 1 ∥ h ∥ 2 d t \int_0^1\|h\|^2dt ∫01∥h∥2dt 是沿整条生成路径累计的“控制能量”;
- − r ( x 0 ) -r(x_0) −r(x0) 是终点代价,因为公式采用最小化写法:回报越高,代价越低;
- λ \lambda λ 决定路径保持与终点回报之间的权衡。
若某个高回报终点需要从基准流大幅绕行,控制能量会很大;若只需对原速度做轻微修正,代价较小。因此这项平方范数在路径空间中承担了与 KL 正则相似的角色:限制新生成过程偏离基准生成过程。
💡 讲解补注:终点分布公式回答“最终应该更常生成哪些动作”,控制目标回答“怎样改速度场才能到达那些动作,而且不要把原来的生成过程破坏得太严重”。二者是同一保守策略改进原则在分布空间和路径空间中的两种表达。
为什么最优修正沿价值梯度方向
定义 V ( x t , t ) V(x_t,t) V(xt,t) 为从中间状态 x t x_t xt 出发、在后续最优控制下能够取得的软价值。价值梯度 ∇ x t V \nabla_{x_t}V ∇xtV 指向“稍微改变当前 noisy action 后,未来目标最可能改善”的方向。最优控制解满足
h ⋆ ( x t , t ) = β ∇ x t V ( x t , t ) , β = 1 / λ . h^\star(x_t,t)=\beta\nabla_{x_t}V(x_t,t),\qquad \beta=1/\lambda. h⋆(xt,t)=β∇xtV(xt,t),β=1/λ.
直觉上,残差速度应该沿价值上升最快的方向移动;同时 β = 1 / λ \beta=1/\lambda β=1/λ 表示:越不强调保持基准策略,允许的价值引导越强。这里并不是说 Q-VGM 能直接得到所有 t t t 上的 ∇ x t V \nabla_{x_t}V ∇xtV;恰恰相反,这个理论关系只给出了理想目标,后文的一步前视和 Q 梯度上升正是为了近似它。
由于本文的生成时间从 t = 1 t=1 t=1 的噪声向 t = 0 t=0 t=0 的动作递减,与引用的 VGG-Flow 时间约定相反,clean endpoint 的边界条件写成
∇ x 0 V ( x 0 , 0 ) = − ∇ x 0 r ( x 0 ) . \nabla_{x_0}V(x_0,0)=-\nabla_{x_0}r(x_0). ∇x0V(x0,0)=−∇x0r(x0).
负号主要来自时间方向和“最小化终点代价 − r -r −r”的记号选择,并不表示实际动作优化要沿 Q 值下降。Q-VGM 在 clean-action 空间仍明确执行
A ← A + α ∇ A Q ( s , A ) , A\leftarrow A+\alpha\nabla_AQ(s,A), A←A+α∇AQ(s,A),
也就是沿 Q 值上升方向改进动作;随后再根据从噪声到 clean action 的反向时间方向,把终点位移换算成速度修正。
💡 讲解补注:Q-VGM 并不显式计算流策略的动作 likelihood,也没有在代码目标中直接计算上面的 KL。KL 正则化给出理论上想实现的“高回报但不离基准太远”的目标;冻结基准流、局部动作改进、keep-best、动作投影和残差速度惩罚则把这一原则落实成可训练算法。
3. 动作敏感 critic:不只要 Q 值准,还要梯度有用
3.1 用 RLT 压缩 VLA 状态
RLT 到底是什么
RLT 是 RL Token(强化学习读出 token) 的缩写。它不是新的图像编码器,也不是 critic 本身,而是放在冻结 VLA 表征与 RL critic 之间的一个紧凑读出接口。
VLA 的 VLM backbone 已经把图像、语言指令等上下文编码成一长串 prefix token。图 2 中约有 512 个 token,每个 token 为 2048 维,总计超过一百万个标量。完整 token 序列适合 action expert 用 attention 读取,但直接交给一个小型 Q 网络会带来三个问题:
- 计算和存储昂贵:每条离线 transition 都携带完整 prefix,critic 训练和 replay 缓存成本很高;
- 状态维度压倒动作维度:高维视觉—语言特征容易让 Q 网络忽略只有几十维的动作块,导致 ∇ A Q \nabla_AQ ∇AQ 很弱;
- 接口不稳定:若 RL 期间继续改变 VLM 特征,critic 看到的状态表示也会漂移,使离线 Q 学习更困难。
RLT encoder 的作用是把整段 VLA prefix 压缩成一个固定长度向量 z r l z_{\mathrm{rl}} zrl。它试图保留对机器人状态和任务语义有用的信息,例如“看到了什么物体”“语言要求做什么”“场景当前处于哪一步”,同时丢掉 critic 不需要的 token 级冗余。
然后再把 z r l z_{\mathrm{rl}} zrl 与机器人本体状态的投影 e p r o p e_{\mathrm{prop}} eprop 拼接:
c ( s ) = [ z r l ; e p r o p ] . c(s)=[z_{\mathrm{rl}};e_{\mathrm{prop}}]. c(s)=[zrl;eprop].
c ( s ) c(s) c(s) 才是 critic 实际使用的状态表示。其中 z r l z_{\mathrm{rl}} zrl 提供视觉—语言任务上下文, e p r o p e_{\mathrm{prop}} eprop 提供关节位置等精确本体信息,动作块 A A A 则通过后续 Q head 单独注入。
RLT 是怎样训练和使用的
论文附录把 RLT 实现为一个 2 层 Transformer 自编码器,token 维度为 2048、包含 8 个 attention head。训练时:
- 冻结 VLA/VLM backbone,提取原始 prefix embedding;
- RLT encoder 将完整 prefix 压缩为紧凑的 z r l z_{\mathrm{rl}} zrl;
- decoder 尝试从 z r l z_{\mathrm{rl}} zrl 重建原始 prefix embedding;
- 使用 MSE 训练重建,在留出数据上达到 0.95 余弦相似度。
训练完成后,VLA backbone 和 RLT encoder 都被冻结。对 rollout buffer 中的状态,可以预先计算并缓存 z r l z_{\mathrm{rl}} zrl,之后 critic 训练和 Q-VGM 策略微调都使用同一套固定状态坐标系。
图像 + 语言指令
↓
冻结 VLM → 大量 prefix tokens
↓
冻结 RLT encoder → 单个紧凑向量 z_rl
↓
与本体状态 e_prop 拼接 → critic 状态 c(s)
↓
再结合动作块 A → Q(s, A) 与 ∇_A Q
💡 讲解补注:RLT 的价值不是简单“降维以加速”。它还隔离了 VLA 表征学习与离线 Q 学习:critic 始终在一个冻结、可缓存的状态空间中训练,从而更容易把建模能力集中到“同一状态下不同动作哪个更好”。
需要注意,0.95 的重建余弦相似度只说明 RLT 能较好恢复 VLA prefix 的整体表征,不等于它必然保留了所有与长期回报有关的信息。消融中用 ResNet 状态特征替代 RLT 后,LIBERO 平均成功率从 92.5% 降到 82.5%,说明 VLA 派生的语义状态确实重要,但还不能单独证明 RLT 表示是最优或充分的。
3.2 动作块级 Cal-QL
critic 不评价单步动作,而是评价整段动作块。离线数据中的 transition 可写成 ( s , A , R , s ′ , A ′ ) (s,A,R,s',A') (s,A,R,s′,A′),Bellman target 直接使用数据里记录的下一个动作块 A ′ A' A′:
L T D = E D [ ( Q m ( s , A ) − R − γ Q ˉ ( s ′ , A ′ ) ) 2 ] . \mathcal L_{\mathrm{TD}}=\mathbb E_{\mathcal D}\left[\left(Q_m(s,A)-R-\gamma\bar Q(s',A')\right)^2\right]. LTD=ED[(Qm(s,A)−R−γQˉ(s′,A′))2].
保守正则项为
L C Q L = E s ∼ D [ log ∑ A exp Q m ( s , A ) − E A ∼ D [ Q m ( s , A ) ] ] , \mathcal L_{\mathrm{CQL}}=\mathbb E_{s\sim\mathcal D}\left[\log\sum_A\exp Q_m(s,A)-\mathbb E_{A\sim\mathcal D}[Q_m(s,A)]\right], LCQL=Es∼D[logA∑expQm(s,A)−EA∼D[Qm(s,A)]],
总目标为
L c r i t i c = L T D + α c q l L C Q L . \mathcal L_{\mathrm{critic}}=\mathcal L_{\mathrm{TD}}+\alpha_{\mathrm{cql}}\mathcal L_{\mathrm{CQL}}. Lcritic=LTD+αcqlLCQL.
Cal-QL 进一步用数据轨迹的 Monte Carlo return 校准保守惩罚,只压制超过该 return 的 Q 值,避免无谓低估分布内动作。
3.3 为什么动作要在每层重新注入
高维状态特征远大于扁平动作块。若只在输入处拼一次,MLP 很可能主要依据场景预测 Q,忽略动作的局部变化。可它即使标量 Q 误差不大, ∇ A Q \nabla_AQ ∇AQ 也可能几乎为零或方向错误。
因此每个 Q head 都执行
h 0 = g 0 ( [ c ( s ) ; A ] ) , h ℓ + 1 = g ℓ + 1 ( [ h ℓ ; A ] ) , Q m ( s , A ) = q m ( h L ) . h_0=g_0([c(s);A]),\qquad h_{\ell+1}=g_{\ell+1}([h_\ell;A]),\qquad Q_m(s,A)=q_m(h_L). h0=g0([c(s);A]),hℓ+1=gℓ+1([hℓ;A]),Qm(s,A)=qm(hL).
动作在每层重新拼接。图 2 显示使用 5-head 集成;每个 head 约 3.9M 参数。7-DoF、chunk 长度 5 的设置中,动作扁平后是 35 维。
💡 讲解补注:Q-VGM 需要的是 critic 关于动作的“局部斜率”,不是只会给轨迹打分的分类器。逐层动作注入的本质,是改善 critic 的动作条件数与梯度## 4. Q-Guided Value-Gradient Matching

图 2:完整训练管线。 左侧冻结 VLM 和 RLT,底部冻结 Cal-QL critic;顶部只训练 flow-matching action expert。中间动作经一步 clean-action 估计、若干步 Q 梯度上升和 keep-best 后,产生残差速度目标;推理时不再需要 critic 或搜索。
4.1 一步前视:把 noisy state 投影到 clean action
对离线状态 s s s 采样初始噪声,并用当前策略产生 stop-gradient 的去噪状态序列。在第 k k k 步,当前 noisy action 为 x k x^k xk、剩余时间为 t k t_k tk。使用冻结基准速度做一次 Euler 外推:
A ^ b a s e k = x k − t k s g [ v b a s e ( x k , t k , s ) ] . \hat A_{\mathrm{base}}^k=x^k-t_k\,\mathrm{sg}\!\left[v_{\mathrm{base}}(x^k,t_k,s)\right]. A^basek=xk−tksg[vbase(xk,tk,s)].
这里的 s g \mathrm{sg} sg 表示 stop-gradient。冻结基准策略来自少样本 SFT 初始化,它把 clean-action 估计锚定在 rollout 数据附近,也就是 critic 相对可信的区域。
💡 讲解补注:如果让正在更新的策略自己定义锚点,策略漂移会同时移动训练输入和监督目标,容易形成自我强化的分布外误差。消融中取消冻结锚点后,LIBERO 从 92.5% 降到 86.5%。
4.2 在 clean-action 空间做 Q 梯度上升
以 A ^ k , 0 = A ^ b a s e k \hat A^{k,0}=\hat A_{\mathrm{base}}^k A^k,0=A^basek 初始化,执行 J J J 步:
A ^ k , j + 1 = Π A [ A ^ k , j + α c l i p G ( ∇ A Q ( s , A ) ∣ A = A ^ k , j ) ] . \hat A^{k,j+1}=\Pi_{\mathcal A}\!\left[\hat A^{k,j}+\alpha\,\mathrm{clip}_G\!\left(\nabla_AQ(s,A)|_{A=\hat A^{k,j}}\right)\right]. A^k,j+1=ΠA[A^k,j+αclipG(∇AQ(s,A)∣A=A^k,j)].
各符号含义:
- α \alpha α:动作空间上升步长;
- ∇ A Q \nabla_AQ ∇AQ:critic 对完整动作块的梯度;
- c l i p G \mathrm{clip}_G clipG:限制梯度幅值,避免一次跳太远;
- Π A \Pi_{\mathcal A} ΠA:投影/裁剪到有效动作范围。
算法不直接采用最后一个候选,而是在 j = 0 , … , J j=0,\ldots,J j=0,…,J 中选择 Q 值最高的 j ⋆ j^\star j⋆。由于原始动作也参与选择,只要梯度上升没有带来预测价值改善,目标就回退到基准动作。
keep-best 同时发挥两种作用:它是防止过冲的安全阀,也是一种离散线搜索,使不同样本自动得到不同幅度的有效 β \beta β。
4.3 从终点位移构造速度修正
clean-action 目标从 A ^ b a s e k \hat A_{\mathrm{base}}^k A^basek 移到了 A ^ k , j ⋆ \hat A^{k,j^\star} A^k,j⋆。将终点位移除以剩余去噪时间,得到
h e f f k = A ^ b a s e k − A ^ k , j ⋆ t k . h_{\mathrm{eff}}^k=\frac{\hat A_{\mathrm{base}}^k-\hat A^{k,j^\star}}{t_k}. heffk=tkA^basek−A^k,j⋆.
符号方向看起来是“基准减改进动作”,原因是论文采用从 t = 1 t=1 t=1 往 t = 0 t=0 t=0 积分的时间方向。 t k t_k tk 越小,同样的终点位移对应越强的瞬时速度修正,因此必须结合时间门与可信区间控制。
4.4 残差速度匹配
当前动作专家相对基准专家的残差为 v θ − v b a s e v_\theta-v_{\mathrm{base}} vθ−vbase。训练目标是
L a l i g n = ∑ k s ( t k ) ∥ ( v θ ( x k , t k , s ) − v b a s e ( x k , t k , s ) ) − s g [ h e f f k ] ∥ 2 2 . \mathcal L_{\mathrm{align}}= \sum_k s(t_k)\left\| \left(v_\theta(x^k,t_k,s)-v_{\mathrm{base}}(x^k,t_k,s)\right) -\mathrm{sg}[h_{\mathrm{eff}}^k] \right\|_2^2. Lalign=k∑s(tk) (vθ(xk,tk,s)−vbase(xk,tk,s))−sg[heffk] 22.
s ( t k ) s(t_k) s(tk) 是时间门,将指导集中在 clean-action 前视较可靠的去噪阶段。所有去噪步都设为 1 时,成功率由 92.5% 降到 86.0%,说明“指导越多越好”并不成立。
梯度只通过本地预测 v θ ( x k , t k , s ) v_\theta(x^k,t_k,s) vθ(xk,tk,s); x k x^k xk、 v b a s e v_{\mathrm{base}} vbase、critic 和 h e f f h_{\mathrm{eff}} heff 都不接收梯度。这是方法避开完整链反传的关键。
4.5 训练与推理的数据流
训练分为两个阶段:
- critic 阶段:SFT 策略生成固定 rollout;冻结 VLM 与 RLT;训练动作敏感 Cal-QL 集成。
- 策略阶段:冻结 VLM、RLT、基准流和 critic;用 Q 梯度构造速度修正;只更新 flow action expert。
推理阶段只运行更新后的 v θ v_\theta vθ,不需要 critic,不需要候选排序,不需要动作梯度上升,也不需要沿去噪链反传。
5. 实验:控制变量比单个 SOTA 数字更重要
三组实验都从少样本 SFT 出发,用 SFT 策略收集固定数据,训练 Cal-QL critic 后完全离线微调。所有 critic 基线共享相同的初始化、数据、RLT 特征和 critic,只改变使用 critic 的方式。
5.1 LIBERO:40 项桌面操作
LIBERO 包含 Spatial、Object、Goal、Long 四个 suite,共 40 项任务,使用 7-DoF EEF 动作空间。每个 suite 收集 300 条 SFT rollout,每个任务评估 50 次。
| 方法 | Spatial | Object | Goal | Long | 平均 |
|---|---|---|---|---|---|
| 少样本 SFT | 82.0 | 84.0 | 78.0 | 56.0 | 75.0 |
| 测试时 Q Selection | 88.0 | 91.0 | 85.0 | 64.0 | 82.0 |
| 测试时 Q Guidance | 91.0 | 93.0 | 88.0 | 68.0 | 85.0 |
| Q-Improved Action Distillation | 91.0 | 92.0 | 88.0 | 74.0 | 86.3 |
| Diffusion-QL | 73.0 | 78.0 | 74.0 | 53.0 | 69.5 |
| Q-VGM | 96.0 | 95.0 | 95.0 | 84.0 | 92.5 |
Q-VGM 相对 SFT 提升 17.5pp,最大增益出现在 Long:56.0% → 84.0%。相同 critic 下,测试时选择、测试时引导和动作蒸馏依次为 82.0%、85.0% 和 86.3%,说明把 critic 信息写进速度场比部署时临时使用更充分。
Diffusion-QL 降到 69.5%,比初始化还低 5.5pp。这是论文关于“大型流匹配 VLA 上完整链 Q 反传不稳定”的直接经验支持,但它仍是方法—设置相关证据,不能推广为所有 diffusion/flow policy 都必然失败。
5.2 RoboTwin 2.0:双臂 14-DoF
RoboTwin 2.0 评估 10 个双臂任务,每项 50 次 rollout:
| 任务 | SFT | Q-Sel. | Q-Guid. | Q-Distill. | Q-VGM |
|---|---|---|---|---|---|
| adjust_bottle | 80 | 84 | 86 | 88 | 94 |
| shake_bottle | 88 | 92 | 90 | 92 | 94 |
| lift_pot | 54 | 56 | 58 | 60 | 70 |
| place_container_plate | 86 | 88 | 90 | 90 | 94 |
| stack_bowls_two | 84 | 86 | 88 | 88 | 92 |
| handover_mic | 70 | 72 | 76 | 76 | 86 |
| place_empty_cup | 86 | 90 | 88 | 90 | 94 |
| beat_block_hammer | 78 | 82 | 84 | 82 | 90 |
| place_shoe | 50 | 52 | 54 | 56 | 66 |
| click_bell | 88 | 90 | 90 | 92 | 92 |
| 平均 | 76.4 | 79.2 | 80.4 | 81.4 | 87.2 |
提升最大的 lift_pot、handover_mic、place_shoe 都是 +16pp,恰好是初始 SFT 较弱的任务。这提示价值梯度修正的收益更可能出现在协调、接触和失败恢复有改进空间的场景,而非已经接近饱和的任务。
5.3 真机:两真机使用 7-DoF 机械臂与两台面向机械臂的 RGB-D 相机。每项任务先用 30 条遥操作示范做 SFT,再收集 100 条 rollout;每种策略评估 20 次
主题标签

图 3b:Stack Bowls。 机械臂需要操作两个碗完成堆叠。
| 任务 | SFT | Q-VGM | 提升 |
|---|---|---|---|
| Pick Peach | 9/20(45.0%) | 15/20(75.0%) | +30.0pp |
| Stack Bowls | 7/20(35.0%) | 12/20(60.0%) | +25.0pp |
| 平均 | 40.0% | 67.5% | +27.5pp |
方向与模拟器一致,但样本量很小。20 次试验中一次成败就对应 5 个百分点,因此这些数字更适合视为真机可行性证据,而不是精确的泛化收益估计。
5.4 消融:方法为何有效
| 变体 | LIBERO 平均成功率 | 相对完整方法 |
|---|---|---|
| 完整 Q-VGM | 92.5 | — |
| ResNet 替代 RLT | 82.5 | -10.0 |
| 不做逐层动作注入 | 87.5 | -5.0 |
| 单 critic head | 89.5 | -3.0 |
| 无 keep-best | 88.5 | -4.0 |
| 所有去噪步都对齐 | 86.0 | -6.5 |
| 无冻结基准锚点 | 86.5 | -6.0 |
可以分成两类解释:
- critic 侧:RLT 的 VLA 语义状态最重要;逐层动作注入保证 ∇ A Q \nabla_AQ ∇AQ 对动作敏感;集成让梯度和排序更平滑。
- 策略侧:keep-best 避免梯度上升过冲;时间门避免在不可靠时刻强行对齐;冻结基准锚点把估计留在离线数据支持范围附近。
最关键的经验不是“用了 Q 梯度”,而是 给不完全可信的 Q 梯度加上分布锚点、幅值限制、候选回退和时间门。
6. 与相邻工作的关系
Diffusion-QL / Q-score matching
这些方法直接把 Q 或 Q-score 与生成策略连接起来,理论上信用传递直接,但通常需要穿过更多生成步骤。Q-VGM 用 stop-gradient 的局部目标换取训练稳定性和 VLA 规模可行性。
测试时 Q selection / guidance
测试时方法不承担策略训练风险,适合快速外挂,但每次部署都要多采样或做动作优化。Q-VGM 在训练期支付 critic guidance 成本,把它摊销到 action expert,部署路径更短。
PA-RL 式动作蒸馏
两者都会先用 Q 改动作再写回策略。差别是动作蒸馏把改进后的 clean action 当作监督终点;Q-VGM 将同一终点位移按去噪时间转成残差速度,保持 flow matching 原生参数化。
VGG-Flow 与 Adjoint Matching
VGG-Flow 提供“最优残差速度与价值梯度成正比”的最优控制解释;Adjoint Matching 也避免把奖励梯度直接穿过完整生成过程。Q-VGM 的具体工程化是 clean-action critic、一步前视、多步 Q 梯度上升、keep-best 和残差速度匹配。
Q-learning with Adjoint Matching
这是最接近的同时期方向,同样面向 flow/diffusion policy 的 Q-learning 和无完整链反传。Q-VGM 强调用显式动作空间上升构造目标,并用离散 keep-best 选择自适应修正幅度。
7. 局限、未解问题与复现实务
7.1 critic 梯度可靠性是核心瓶颈
离线 critic 在数据附近通常最可靠,分布外动作的 Q 值和梯度都可能错误。Cal-QL、冻结锚点、动作投影、梯度裁剪和 keep-best 能减轻风险,却没有形成严格的 path-space trust region。未来可把信赖域直接内化到采样动力学中。
7.2 keep-best 仍可能被同一个 critic 欺骗
候选生成和候选选择都依赖同一 critic。如果 critic 对某个分布外候选过度乐观,keep-best 会把错误自信当作改善。更稳健的方案可能需要不确定性门控、保守集成下界、OOD 检测或真实 rollout 校验。
7.3 长时域与多任务扩展
任务时域和环境多样性增大时,Q-learning 更难扩展。论文提出把世界模型和价值估计结合:用 learned dynamics 的多步 rollout 缩短 TD 的有效时域,再继续用价值函数提供梯度场。
7.4 证据边界
- 真机只有两个任务,每项 20 次试验。
- 主文没有系统报告训练算力、墙钟时间或超参数敏感性。
- 没有单独诊断 ∇ A Q \nabla_AQ ∇AQ 的方向准确率、平滑性或校准。
- 数据来自初始 SFT 策略,自生成经验仍受初始覆盖范围限制。
- 只更新 action expert 带来稳定性,但视觉—语言 backbone 无法随 RL 信号适应。
7.5 复现时最该检查什么
- clean/noise 的时间方向和式(7)的符号,避免把修正方向写反。
- 动作归一化、 Π A \Pi_{\mathcal A} ΠA 的边界与执行器动作范围一致。
- Q 梯度只对 clean action 求导,critic 参数保持冻结。
- 去噪 trajectory 与目标构造 stop-gradient,只有局部 v θ v_\theta vθ 接收梯度。
- keep-best 必须包含 j = 0 j=0 j=0 的基准候选。
- critic 集成在动作排序和梯度计算时如何聚合;论文使用集成均值。
- 训练时的时间门 s ( t ) s(t) s(t) 与采样 schedule 对齐。
8. 后续值得追问的问题
- 若用 critic 集成方差给 h e f f h_{\mathrm{eff}} heff 加不确定性权重,能否优于固定时间门?
- 动作梯度的质量能否通过有限差分、真实短 rollout 或局部 ranking accuracy 单独评估?
- 把 keep-best 从同一 critic 的均值改为保守下界,会牺牲多少性能、换来多少 OOD 稳定性?
- 在线迭代“收集新 rollout → 重训 critic → 再做 VGM”是否会持续改进,还是出现 critic/policy 共漂移?
- 世界模型若提供多步价值梯度,怎样避免模型误差被速度场摊销?
- 方法能否迁移到 variable-length chunk、离散—连续混合动作或接触事件显式建模?
9. 最值得记住的结论
Q-VGM 把一个很难训练的端到端目标拆成了可控的局部接口:critic 只在它熟悉的 clean-action 空间提出改进,算法把这个改进折算成 noisy-state 上的速度修正,动作专家再用普通回归学习残差场。
它成功的关键不是单一公式,而是一组互相配合的约束:RLT 提供语义状态、逐层动作注入保证梯度敏感、冻结基准流限制分布漂移、梯度裁剪与动作投影控制步长、keep-best 允许回退、时间门只在可信阶段施加强监督。最终,critic 的昂贵指导被摊销进策略,推理路径恢复为纯粹的 flow-matching VLA。
最值得记住的一句话: 对流匹配策略做价值微调,不一定要让 Q 梯度穿过生成链;更自然的做法,是把 clean action 的价值改进翻译成中间速度场的监督。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)