26年7月来自新加坡南阳理工、清华、中南大学和北邮的论文“WorldSample: Closed-loop Real-robot RL with World Modelling”。

强化学习(RL)能够克服模仿学习(IL)在演示数据覆盖范围上的局限性,允许机器人在演示数据所涵盖的状态之外,通过试错交互不断改进。然而,将RL应用于真实机器人仍面临高昂交互成本的制约,因为每一次物理环境下的运行(rollout)不仅代价高昂,而且仅能反映单一的动作-结果路径。为应对这一挑战,WorldSample作为一种面向真实机器人RL的、基于物理特性的数据增强框架,构建物理运行、世界模型生成与策略改进之间的“真实-合成”闭环。WorldSample 以真实运行数据为基础,利用经后训练的世界模型生成高保真的合成状态转移数据,从而显著降低了视觉幻觉现象。具体而言,WorldSample 并未简单地将这些合成数据视为真实经验,而是引入了“策略步调学习”(Policy-Paced Learning, PPL)机制,通过样本选择与调度来调控训练过程;该机制在利用有效增强数据与避免价值高估之间取得平衡,并缓解了由合成数据伪影引起的噪声干扰。

针对涉及高频接触与高精度操作的机器人任务进行的实验表明,与基线方法相比,WorldSample 将策略成功率提升了 28%,同时将训练步数减少了 59%。此外,相较于仅基于演示数据的后续训练,WorldSample 将世界模型的视觉保真度分别提升了 19.4dB(PSNR 指标)和 0.47(SSIM 指标),从而验证了“真实-合成”闭环在提升策略与世界模型性能方面的有效性。


WorldSample,是一个面向在线真实机器人学习的、基于物理特性的世界模型增强框架。如图 1 所示,WorldSample 通过“真实-合成”数据循环,将真实机器人的运行轨迹扩展为多条与任务相关的合成轨迹:在线运行过程使世界模型适应目标任务分布,而适应后的模型则生成基于真实视觉观测和动作序列的轨迹。同时,为了缓解世界模型伪影带来的合成噪声并防止生成数据导致学习过程不稳定,WorldSample 引入“策略步调学习”(Policy-Paced Learning,简称 PPL),通过 Q 值选择和不确定性引导的调度机制来调控合成数据的使用。结合异步世界模型生成机制,WorldSample 能够在不替代物理交互或阻碍实时控制的前提下,有效扩展真实世界的经验。在涉及高频接触式插入和精密装配的机器人操作任务上对 WorldSample 进行评估。结果表明,与纯真实环境下的强化学习(RL)基线相比,WorldSample 实现更快的收敛速度和更高的成功率,同时减少物理交互和人工干预的需求。
请添加图片描述

1 WorldSample 流水线

如图 2 所示,WorldSample 包含两个紧密耦合的组件:真实与合成数据循环(real-synthetic data loop)以及策略步调学习(Policy-Paced Learning,简称 PPL)。
请添加图片描述

真实与合成数据循环始于在线交互过程中收集的物理机器人运行轨迹(rollouts)。这些轨迹同时发挥双重作用:既为策略学习提供训练数据,又通过一个“动作条件世界模型”为合成数据的生成提供物理依据(grounding)。该世界模型基于真实观测和反事实采样轨迹,生成由奖励模型进行标注的合成状态转移数据。随着新的运行轨迹不断积累,它们会被进一步用于对世界模型进行后续训练,从而形成物理交互与合成数据生成之间的闭环。

PPL 负责调控生成数据如何融入策略学习过程。它包含“Q 值-觉察样本选择”(控制生成状态转移数据的构成)和“不确定性引导调度”(决定在 RL 训练中引入多少合成数据)两个机制。这些组件协同工作,使 WorldSample 能够在抑制价值高估和“幻觉”噪声的同时,扩大有效的训练分布范围。

总体而言,WorldSample 利用真实交互来锚定世界模型的生成过程,并通过 PPL 安全地利用合成数据进行机器人在线学习。这种设计在不取代真实交互或违反实时部署约束的前提下,提升了 RL 训练的效果。

2 真实-合成数据循环

反事实轨迹生成。WorldSample 通过在物理执行的轨迹片段(rollouts)周围采样反事实轨迹片段,来生成合成的状态转移数据。其并非从随机动作先验中抽取动作,而是基于真实的轨迹分布并施加局部扰动来采样轨迹片段。这种反事实采样方式既保留机器人策略的时间结构和动作统计特性,又扩大数据覆盖范围,从而使生成的轨迹比无约束生成的轨迹更具物理可行性。

此外,世界模型负责预测未来的视觉状态,而奖励模型则提供任务反馈。由于视觉和动作条件均源自物理环境中的实际运行(rollouts),所生成的数据既保持与物理动力学及真实几何结构的契合,又具备轨迹层面的多样性。

异步调度。WorldSample 采用异步方式执行反事实数据生成,以确保机器人控制的实时性。机器人学习流程持续采集物理运行数据并更新策略,同时世界模型并行生成合成轨迹。这种解耦机制避免耗时的视频生成过程阻塞策略执行,并允许在在线训练期间利用多个世界模型工作进程来提高数据吞吐量。最后,通过利用在线运行数据异步调整世界模型,形成闭环。随着新运行数据的积累,世界模型流程将其纳入后续训练,使生成内容与高多样性的数据分布保持一致。由此,真实的交互不断优化世界模型,而经调整的世界模型又为后续的策略学习提供了更高质量的合成经验。

3 策略步调学习 (Policy-Paced Learning)

尽管合成数据扩展了物理经验的分布,但若简单地将生成的转移数据注入机器人学习过程,可能会导致价值学习变得不稳定。

由于训练完成后的世界模型仅是对真实动力学的近似,且存在缺陷,因此每一条合成转移数据都带有残余误差。当评论器(critic)基于此类数据进行训练时,局部误差可能会通过贝尔曼回溯(Bellman backups)不断累积放大。因此,简单地注入合成转换可能会导致严重的 Q 值高估和外推误差。

为了稳定强化学习训练,提出策略驱动学习(PPL),它将合成数据的使用分为样本级值平衡和策略级调度两个部分。随着 Actor(动作)在已学习的 Critic(评价)指导下进行优化,稳定合成数据的评价目标也有助于稳定后续的 Actor 更新过程。

Q-觉察样本选择(Q-Aware Sample Selection)。该机制通过 Q-觉察选择策略,控制由生成数据所引发的价值信号。正向合成轨迹能够扩充稀缺的成功样本并加速价值传播;反之,负向轨迹则能约束那些视觉上看似合理却未能成功的行为,从而抑制过于乐观的外推预测。每条生成的轨迹均由独立的奖励模型进行标注,进而形成正向样本集和负向样本集。PPL 算法通过筛选合成数据,确保正负样本之间维持价值平衡的对比关系。这能防止合成数据导致 Critic(评价)的估值发生偏移,使其倾向于一味乐观或过于保守。

基于不确定性引导的数据调度。即便采用价值平衡的选择策略,合成转移样本的噪声仍高于真实环境下的轨迹采样(rollout)。因此,PPL 根据策略的不确定性来调度合成数据的影响力,而该不确定性通过 Actor(动作)在真实状态下的熵值来衡量。较高的影响力表明策略在真实状态上的不确定性依然存在,这使得 Actor-Critic 学习对有偏的合成目标更为敏感。由于PPL合成项直接干扰 Critic 的学习,而 Actor 又是基于已学习的 Critic 进行优化的,因此由合成监督引入的有效价值偏差可总结如下:它促成一种基于熵的调度机制,即在策略不确定性较高时抑制合成项的影响。

因此,当策略不确定时,会保守地使用合成转换,并随着策略更加集中于真实的机器人状态而逐渐引入。同时,Q 觉察选择和不确定性引导调度将哪些合成轨迹被允许与何时被信任分开,提高了样本效率,同时减轻 Q 值高估和合成噪声。


1 实验设置

实验装置。在配备二值夹爪(binary gripper)的 Galaxea A1X 机械臂上进行实验。机器人通过两台 Intel RealSense D435i 相机观察场景:一台侧视相机用于第三人称感知,另一台安装在手腕上的相机用于自我中心(egocentric)感知。在五类现实世界操作任务上评估 WorldSample,这些任务在接触复杂度、精度要求和动作空间难度方面各不相同,包括:推(Pushing)、插入(Insertion)、分拣(Sorting)、抓取与放置(Pick & Place)以及组装(Assemble)。

基线与训练细节。将 WorldSample 与基于 HIL-SERL [21] 的“人在回路”(human-in-the-loop)真实机器人强化学习(RL)基线,以及最先进的世界模型联合训练方法 VLAW [7] 和 WMPO [5] 进行了比较。所有方法均采用相同的机器人平台、观测设置、动作空间、奖励定义、干预协议以及用于初始化的 20 条人类演示数据;其中 VLAW 额外使用了 50 条合成演示数据。策略训练的总批次大小(batch size)为 256。对于世界模型分支,我们采用受动作条件控制的 Cosmos-Predict2.5 模型作为基础视频世界模型。该模型首先利用特定任务的人类演示数据进行适配,随后通过在线强化学习的轨迹采样(rollouts)进行进一步微调。为确保公平比较,所有基于模型的方法均使用同一个适配后的世界模型。

2 真实世界实验设置

本文在如图6所示的一系列真实世界操作任务上,对WorldSample及所有基线方法进行评估。实验平台由一台配备二值夹爪(binary gripper)的6自由度Galaxea A1X机械臂,以及两台分别提供腕部视角和第三人称视角的Intel RealSense D435i相机组成。这些任务旨在涵盖多种操作挑战,包括富含接触的交互、精密对齐、视觉辨别以及长程操作。
请添加图片描述

3 WorldSample框架

WorldSample 基于 HIL-SERL 真实机器人学习框架构建。其中的“真实经验回放缓冲区”(real replay buffer)包含在线环境交互产生的轨迹数据,而“演示缓冲区”(demonstration buffer)则存储专家演示及人工引导的修正动作。除非另有说明,其底层的 SAC/RLPD 学习器、Actor-Critic 架构及优化超参数均沿用基线实现;WorldSample 仅通过合成数据生成与“策略步调学习”(Policy-Paced Learning)机制来增强数据流。为了组织生成的数据,WorldSample 仿照真实经验回放缓冲区的结构,构建了相应的合成数据缓冲区。

4 反事实轨迹生成

每个动作表示为 7 维末端执行器增量指令:a_t = [d_x, d_y, d_z, d_r_x, d_r_y, d_r_z, d_{gripper}]。

给定实际动作序列 A_{0:T-1},WorldSample 在已执行轨迹周围采样局部的反事实动作序列。这种扰动在引入有限局部变化的同时,保持实际执行过程(rollout)的时间结构。未激活的动作维度保持为零,且所有动作均被投影回有效动作范围内。这种轨迹层面的扰动会生成反事实动作,这些动作既具有多样性,又在物理层面与真实的机器人行为保持相近。

5 世界模型适配

基于 Cosmos-Predict2.5(一个在海量视频数据上预训练的开源动作条件视频世界模型)来初始化该世界模型,随后利用特定任务的机器人轨迹对其进行适配。演示轨迹提供任务的初始基础,而在线运行产生的轨迹则进一步使模型与策略诱导的状态分布、物体外观及接触动力学特性相一致。在线训练期间,世界模型分支基于真实的视觉观测和反事实动作序列,异步生成候选轨迹。为了评估生成保真度,利用保留的真实轨迹片段及其对应的动作序列进行回放,并计算预测视频与真实视频之间的 PSNR、SSIM 和 LPIPS 指标。

内循环自适应。将 u_h 传播经过 L 个 TTT 增强模块,从而生成最终的视频潜变量 z(L);其中 Lhuman_vg 是标准的 LDA 视频预测损失,而定义的 L_adapt 对 W 的依赖正是源于这一传播过程。从 W(l)_0 = W(l)_init 开始,利用针对人类侧联合目标的内循环 SGD(随机梯度下降)来更新快速权重,即L_adapt(W_i)。残差读出(residual readout)使用的是经调整的权重 W(l)_N。L_adapt中的两项均仅依赖于不涉及动作的人类侧信息,因此在测试阶段,同样的内循环信号依然可用。

外循环损失。更新后的快速权重 W(l)_N 在机器人端由 Q(l)_r 进行查询,从而产生残差。外循环训练目标是针对成对机器人数据的标准 WAM 多任务损失;该损失结合了针对机器人视频潜表示(latents)的视频扩散目标以及针对机器人动作片段(chunks)的动作扩散目标,这些目标继承自底层的 LDA 主干网络 [23]。

梯度通过 TTT 残差和内部快速权重更新过程进行反向传播。待优化的参数包括 WAM 参数、TTT 慢速投影参数 theta_{K,V,Q,O} 以及初始化参数 W_{init}。在处理每个训练样本后,适配后的快速权重会被丢弃,并重新从 W_{init} 进行初始化。

人机数据同步。为了支持基于对齐的训练,对人机数据对进行离线同步处理。对于长度为 T_r 的片段中机器人端的某个时间步 t,计算归一化相位 phi = t / T_r,并从长度为 T_h 的配对人类视频中选取相位最接近的帧。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐