26年8月来自乔治亚理工的论文“Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning”。

行为克隆(BC)在机器人操控领域取得显著进展,但其根本局限在于无法自我改进:失败的策略无法在没有额外人类演示的情况下从失败中学习。强化学习(RL)的微调提供一条自我改进的途径,但事实证明,它难以扩展到支撑现代机器人策略的数十亿参数模型。Q-规划,为大型视觉运动行为克隆(BC)策略配备一个小型的离线策略Q-函数。由于Q-函数估计的是价值而非模仿动作,因此它可以与行为克隆(BC)策略一样,基于相同的成功演示进行训练,并在后续的部署过程中吸收成功和失败的经验,而行为克隆(BC)则不具备这种不对称性。利用这种不对称性,在推理阶段实现基于价值引导的动作选择(对边界条件抽取结果进行单步Q-加权平均),并实现仅微调Q-函数而不改变边界条件权重的在线自改进。


Q-规划由三个部分组成:基于动作块的非策略Q-函数、基于BC动作块抽取的单步Q-加权平均以及仅微调Q-函数的自改进循环。在每个阶段,基础BC策略都被冻结。如图 1 所示,左图:在推理阶段,冻结的边界条件策略对 N 个候选动作块进行采样;Q- 函数对这些动作块进行评分,执行的动作块是单步 Q -加权平均值。右图:所有展开(成功和失败)都被添加到回放缓冲区,仅用于微调 Q -函数。更新后的 Q_φ 返回到下一次推理迭代;边界条件策略本身不再更新。
请添加图片描述

1 问题设定

研究部分观测马尔可夫决策过程(MDP)中的语言条件操作问题,该过程包含动作 a_t、观测 o_t(来自一个或多个摄像头的 RGB 图像)、自然语言指令 l 以及每步的终端指示符 d_t ∈ {0, 1},同时还包含稀疏终端奖励 r_t ∈ {0, 1},该奖励仅在任务成功完成的时间步为 1。
目标是在尽可能少的人工监督下提升策略性能:可以使用自己的规划器收集展开数据并更新价值侧参数,但不会重新收集演示数据,也不会更新 πBC

2 基于动作块的离策略 Q-函数

动机。稀疏终端奖励下的标准标量 Q 回归不稳定 [44]:大多数转移不携带奖励信号,并且操作任务的长时域会放大引导误差。因此(i)将长度为 H 的动作块视为单个超动作,以便有效自举范围缩小 H 倍(Q 分块 [45]),(ii)用 HL-Gauss 分类回归 [44] 代替标量回归,该回归通过高斯核将每个标量目标投影到固定的箱网格上,并使用交叉熵目标训练 Q 网络。

模块设计。Q-函数拥有独立的视觉和语言编码器,其参数与 BC 策略不相交。Q-网络Q_φ(o_t, l, a_t:t+H)是一个Transformer解码器,它交叉关注[zvis_t; ztxt],并将候选动作块作为查询token序列。解码器输出投影到 B 个 HL-Gauss logits l_φ;预测的标量值是 bin 网格 {v_b} 上 softmax 分类分布的期望值,其中 bin 中心均匀分布在 [v_min, v_max] 范围内。

如图 5所示Q-函数架构。Q-函数 Q_φ 拥有独立的 DinoV2 视觉编码器和 T5 语言编码器(参数与 BC 策略不相交)。Transformer 解码器交叉处理视觉标记 zvis_t 和语言标记 ztxt(键/值对),并将候选动作块 a_t:t+H 作为查询标记序列。HL-Gauss 头输出基于折扣收益的 B 个 bin logits,标量 Q_φ 是 softmax bin 分布的期望值。
请添加图片描述

训练。根据 Q-分块方法 [45],用从缓冲区 D 中采样的分块转换 (o_t, a_t:t+H, r_t:t+H, o_t+H, a_t+H:t+2H) 训练 Q_φ。缓冲区 D 初始化为演示数据集 D_BC,之后通过在线展开进行扩展。在训练时,不向 πBC 查询引导动作:直接从缓冲区使用下一个分块 a_t+H:t+2H。由于从 DBC 中抽取的分块正是 πBC 训练要模仿的对象,因此目标值仍然是 QπBC 的无偏估计。实际上,并不直接最小化这个平方误差:根据 HL-Gauss [44],将标量目标值投影到 bin 网格上,并最小化预测 bin 分布的交叉熵,这可以稳定稀疏双峰返回下的学习。失败的展开仅仅是一条全零奖励轨迹,其末端数据块无法自举,导致目标值被锁定为零。关键在于,当 D 后续包含包含失败的在线展开时,此损失保持不变,因为无论数据来源如何,QπBC 对于任何状态-动作输入都是定义良好的。正是这种不对称性能够使用 πBC 本身无法训练的数据来训练 Q_φ。

保持 Q-函数编码器的参数与 πBC(DinoV2 和 T5 骨干网络)不相交,是确保自改进循环安全的关键:一个网络中的故障不会影响另一个网络,因此 Q 函数可以自由更新,而无需触及 BC 权重。

3 Q-加权动作选择

动机。给定 Q_φ,自然的推理时策略是在每个规划步骤中采样 N 个动作块,用 Q_φ 对其进行评分,并执行基于值的聚合。现代 BC 头的两个特性使得在 VLA 规模下,一个非常简单的选择器就足够了:流匹配抽样是多模态的,因此 N 个候选动作覆盖不同的动作模式,而不是位于围绕单个均值的 Gaussian 包络内;并且它们位于 BC 已认为合理的流形上,因此每个候选动作都在 Q_φ 的训练支持范围内。多模态对于自我改进至关重要:BC 头部能够以不可忽略的概率产生的任何行为都是规划器可以选择的候选行为,并且循环可以对其进行放大,因此探索并不局限于 BC 模式周围的单个高斯球。因此,完全避免基于样本的迭代搜索(例如,MPPI),而是对原始 BC 抽样进行单步 Q-加权平均。
Q-网络在一次批量前向传播中对所有 N 个候选对象进行评估:视觉和文本tokens在每个规划步骤中编码一次(总共约 25 毫秒),N 个候选对象作为 N 个并行查询序列进入解码器,因此只有约 5 亿的 Q-解码器开销随 N 增加(每个候选对象大约 2-3 毫秒)。在 N=32 的双手动 RoboTwin 设置上,一个完整的规划步骤(包括 BC 抽取、编码、评分和聚合)耗时 400 毫秒。这比单次 10 步 BC 推理快 1.6 倍,并且完全在 960 毫秒的重新规划预算之内,即当前块执行部分耗尽之前的时间。

4 自改进循环

仅基于成功演示训练的 BC 策略从未遇到过自主执行下出现的故障模式。 Q-Planning 通过部署规划器、收集成功和失败的部署结果,并仅基于这些结果优化 Q 函数(如算法 1所示)来闭合这一循环。每次迭代对每个任务运行 M 个回合的规划器,将收集到的转换添加到回放缓冲区 D 中,并对 D 进行 S 次梯度迭代来优化 Q_φ。由于仅更新 Q_φ,因此单次迭代的成本远低于一次完整的策略梯度迭代。
请添加图片描述

实验设置

在两个模拟操作基准测试集上进行评估:四个 LIBERO [46] 测试集(空间、物体、目标以及 LIBERO-10 的 10 个难度较高的长时域任务),以及 47 个 RoboTwin [47] 任务(已完成评估的完整 RoboTwin 测试集的一个子集)。所有报告的成功率和回合长度均基于每个任务 20 个回合的平均值。对于边界条件策略,用公开的 FastWAM [5] 权重,并在整个测试过程中保持不变。Q 函数的训练基于与 FastWAM 相同的成功演示数据(没有额外数据),在 LIBERO 上训练 12k 个梯度步,在 RoboTwin 上训练 45k 个梯度步,使用 4 个 H200 GPU,直至每个任务的 Q 值收敛。LIBERO 的评估采用标准的回合预算,即 540 个环境步(而不是 FastWAM 论文中使用的 700 个步)。因此,LIBERO 的绝对成功率比 FastWAM 报告的数字低几个百分点,并且该协议同样适用于基线行和 Q-Planning 行。

问题1:规划时应选择哪种动作源?

比较三种用于计算N个数据块Q_φ分数的候选方法:1)模型预测路径积分/Model Predictive Path Integral(MPPI)[16],在BC均值附近添加零均值高斯噪声(T=3次迭代);2)MPPI+时间平滑,即在MPPI的基础上,使用一维高斯核对噪声进行卷积,使受扰动的数据块保持时间一致性;3)提出的基于多模态三步流匹配抽样的单步Q加权平均方法。所有方法均具有相同的Q_φ值和N=64;还纳入无引导的FastWAM策略作为参考。所有方法均在LIBERO-10数据集上进行评估。

基于 Q-Planning 的在线自我改进

Q2:自改进循环提升了所有基准测试的成绩。在每次迭代每个任务执行 100 个回合,每次迭代执行 200 个仅包含 Q 的梯度步骤(算法 1)的情况下,该循环将每个基准测试的成功率提升至更高水平:LIBERO-Spatial 从 91.5% 提升至 98.5%,LIBERO-10 从 93% 提升至 99%,RoboTwin 从 83.8% 提升至 91.4%,平均成功率从 92.1% 提升至 97.6%(比冻结基准测试提升 5.5 个百分点,比离线 Q 规划提升 4.2 个百分点)。对于离线规划器下成功率已接近上限的两个测试套件(LIBERO-Object 和 LIBERO-Goal),成功率已无提升空间,因此该循环改为缩短成功回合数(从 139 步减少到 120 步,从 110 步减少到 99 步)。

Q3:Q-规划是实现这种自我改进的关键。最佳 N 集的增益稳定在 95%,因此仅基于价值的选择可以获得部分增益,而只有 Q-加权平均值加上自我改进才能使 Q 规划的增益达到 99%。滤波 SFT 的增益稳定在 93.5%,这证实了仅重新模拟成功部署无法吸收失败信号 Q_φ。 IBRL 崩溃,DSRL 在 69% 到 91% 之间剧烈波动,而 DAWR 则徘徊在冻结边界条件以下。在相同的在线预算下,Q-Planning 是唯一一种能够从失败中稳定改进的方法。

真实机器人的自我改进

Q4:自我改进转化为现实世界的应用。将 Q-Planning 应用于两个需要大量接触的双手任务:叠杯(堆叠塑料杯)和插入钱包(将信用卡插入钱包)。在 100 次基础演示和每次迭代 20 次在线测试(共 5 次迭代)的基础上,在边界条件 (BC) 固定且无人为干预的情况下,Q-Planning 将叠杯任务的 BC 基线从 40% 提升至 90%,并将难度更高的插入钱包任务的 BC 基线从 25% 提升至 80%。

平台和控制。两个6自由度YAM机械臂,安装在桌面上,朝向前方。观测数据为来自三个摄像头的RGB图像,一个位于顶部,另外两个分别位于每个机械臂的手腕上,这些图像由边界条件(BC)策略和Q函数共享。动作是两个机械臂的关节空间指令;边界条件发出H=30个动作块(30 Hz,1秒),规划器在重新规划之前执行完整的动作块,重新规划的预算为1秒。策略推理在单个RTX 5090显卡上运行。

数据和评估协议。每个任务从100次演示开始。初始条件在演示分布中随机化:杯子的位置在不同回合中变化,对于插入钱包的任务,卡片的起始位置变化,而钱包本身保持不变。每次自改进迭代收集每个任务的20个回合,图4中的每次迭代成功率是基于这些收集的回合测量的。在部署过程中,机器人始终不进行远程操作。循环期间的人工输入仅限于每集之间的场景重置以及提供最终奖励的每集成功标签。

SFT 基线。SFT 对比在相同的episode预算下,对收集到的成功部署进行策略的完全微调,并舍弃失败部署;而 Q-Planning 则将所有部署集整合到仅包含 Q 的更新中。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐