发表期刊

Robotics: Science and Systems (RSS) 2025

摘要

        非抓取操作(例如受控的推/戳)虽然构成了一项基础的机器人技能,但由于其对涉及摩擦和恢复系数的复杂物理交互高度敏感,其学习仍然具有挑战性。为了实现鲁棒的策略学习和泛化,我们选择学习一个非抓取操作中涉及的3D刚体动力学世界模型,并将其用于基于模型的强化学习。我们提出了 PIN-WM,一个基于物理信息的世界模型(Physics-Informed World Model),能够从视觉观测中以端到端的方式高效地辨识3D刚体动力学系统。采用可微分物理仿真,PIN-WM 仅需少样本且任务无关的物理交互轨迹即可进行学习。此外,PIN-WM 通过高斯泼溅(Gaussian Splatting) 产生的观测损失进行学习,无需状态估计。为了弥合仿真到现实(Sim2Real)的差距,我们将学习到的 PIN-WM 通过物理感知的随机化转化为一组数字表亲(Digital Cousins),扰动物理和渲染参数,生成多样且有意义的 PIN-WM 变体。在仿真和真实世界测试上的广泛评估表明,PIN-WM 通过物理感知的数字表亲增强了学习鲁棒的非抓取操作技能并进行 Sim2Real 迁移的能力,显著超越了当前的 Real2Sim2Real 最先进方法。

Note:

引言

        非抓取机器人操作 [50, 23, 86] 涉及通过推或戳来移动物体,在现实世界的许多场景中有着广泛的应用——当物体因重量、尺寸、形状或易碎性等原因而无法被抓取时,非抓取操作尤为适用。机器人推动可以通过更简单的末端执行器来实现,使系统在某些环境中更具成本效益且更易于部署 [18, 67]。然而,由于难以完全控制被推动物体的运动和姿态,这带来了重大挑战。由摩擦、恢复系数和惯性等因素引起的复杂底层动力学,使得运动预测变得困难,也使运动规划和控制变得复杂。

        一些研究通过模仿学习 [11, 77] 来应对非抓取操作,但对昂贵专家演示的依赖限制了其可扩展性。另一些研究探索深度强化学习(DRL)[69],利用仿真中的试错来学习策略 [39, 80]。然而,仿真与现实之间的差距阻碍了学习策略向真实环境的迁移 [12, 45]。一种有前景的替代方案是以数据驱动的方式学习环境动态的世界模型 [25],该模型可用于预测控制或用于基于模型的强化学习,以提高数据效率和 Sim2Real 泛化能力 [26, 28]。然而,纯数据驱动的世界模型严重依赖于训练数据的数量和质量,并且难以泛化到分布外(OOD)场景 [79]。

        众所周知,在学习算法中融入结构化先验可以提高有限训练样本下的泛化能力 [63]。许多研究 [53, 5, 67] 试图将物理原理整合到世界模型的开发中。在此过程中,有两个关键方面需要特别考虑。第一是物理参数辨识过程的可微性。 ASID [53] 使用无梯度优化 [65] 为已建立的模拟器辨识物理参数。Baumeister 等人 [5] 采用类似方法来学习用于模型预测控制(MPC)[73] 的动力学。梯度反馈的缺失使得这些方法严重依赖数据质量。然而,收集高质量的真实世界轨迹本身就是一个具有挑战性的任务 [53]。Song 和 Boularias [67] 采用可微分的 2D 物理模拟器来学习平面滑动动力学。然而,2D 物理不足以捕捉诸如通过戳来翻转物体等复杂运动。第二是优化世界模型时进行状态估计的必要性。 虽然大多数现有方法涉及带有额外模块的状态估计 [53, 5, 67],但最近可微分渲染 [42, 75, 57] 的进展使得直接针对观测损失进行优化成为可能,从而节省了状态估计的工作。

        我们提出了 PIN-WM,一个基于物理信息的世界模型,能够从视觉观测中以端到端的方式辨识 3D 刚体动力学系统。首先,PIN-WM 是一种可微分的 3D 物理参数辨识方法,仅需少量且任务无关的物理交互轨迹。我们的方法系统地辨识非抓取操作中关键的动力参数,包括惯性属性、摩擦系数和恢复系数特性 [67, 53, 21]。其次,PIN-WM 通过优化由 3D 高斯泼溅 [34] 场景表示产生的渲染损失 [56] 来学习物理参数,促进了从 RGB 图像直接学习,无需额外的状态估计模块。因此,学习到的世界模型具备辨识出的物理和渲染属性,可以轻松应用于使用 RL 训练非抓取操作的视觉控制策略。

        学习到的 PIN-WM 代表了真实世界刚体系统的数字孪生 [24],但由于观测的不准确和不完整,仍可能与现实存在偏差 [43]。为弥合 Sim2Real 差距,我们通过物理感知的扰动,将辨识出的数字孪生转化为大量数字表亲 [15]——在辨识值作为均值附近扰动物理和渲染参数。这种有目的的随机化创建了一组遵循物理定律的物理感知数字表亲,同时引入足够的多样性来解释未建模的偏差。由此产生的世界模型组允许学习具有 Sim2Real 迁移能力的鲁棒非抓取操作策略。

        通过在多样化任务场景中的广泛评估,我们证明了 PIN-WM 学习速度快且准确,使其在学习具有强 Sim2Real 迁移能力的鲁棒非抓取操作技能方面非常有用。整体性能显著超越了最近的 Real2Sim2Real 最先进方法 [67, 53, 45]。我们的真实世界实验进一步表明,PIN-WM 无需真实世界微调即可实现 Sim2Real 策略迁移,在推动(Push)和翻转(Flip)任务中分别达到了 75% 和 65% 的高成功率。我们的贡献包括:

  • 我们提出了 PIN-WM,用于从视觉观测中以端到端的方式准确高效地辨识 3D 刚体动力学系统的世界模型。

  • 我们通过在辨识出的均值附近扰动物理和渲染参数,将辨识出的数字孪生转化为一组物理感知的数字表亲,以支持学习具有鲁棒 Sim2Real 迁移能力的非抓取操作技能。

  • 我们进行了真实机器人部署,证明我们的方法能够以最少的任务无关交互数据学习控制策略,并在无需真实世界微调的情况下实现高性能的 Real2Sim2Real。

Note:

1. 非抓取操作又难又重要,推/戳物体是机器人基础技能,但摩擦、恢复系数、惯性让运动预测极难。

2. 现有方法的不足:模仿学习需要大量专家演示。纯强化学习Sim2Real差距大。纯数据驱动世界模型(Dreamer等)靠海量数据硬背,泛化差。已有的物理辨识方法要么不可微分,依赖高质量数据;要么是2D物理,换个面就失效;要么需要额外的状态估计模块,流程复杂。

3. 自身优势:端到端可微;少样本,只要一条“任务无关”的随机推动视频就能学会;数字表亲:在辨识出的参数附近做物理感知的扰动,生成一群“表亲”,让策略在仿真里练出鲁棒性,直接部署到真实机器人——零微调。

相关工作

A. 非抓取操作

        非抓取操作 [50, 23, 86] 指的是在不完全抓取物体的情况下控制物体。虽然它提供了灵活性,但其运动对接触配置高度敏感 [78],需要精确的动态描述和控制策略。Mason [50] 提出了推动力学的理论框架,并通过预测点接触推动物体的旋转和平移来推导规划。Akella 和 Mason [3] 使用具有理论保证的线性规划算法来解决姿态转移问题,并生成无传感要求的开环推计划。Dogar 和 Srinivasa [17] 采用动作库和受人类策略启发的组合搜索。该库可以使用推动、滑动和扫掠等动作重新排列杂乱环境。Zhou 等人 [85] 使用粘滞接触和极限表面的椭球近似来建模推动机制,通过将粘滞接触约束转换为曲率约束来实现路径规划。然而,这些方法依赖于简化假设——要么已知物理参数,要么理想化的物理模型——这些假设在实践中经常被违反 [60]。

        深度学习方法最近被应用于训练非抓取策略。一些研究专注于模仿学习 [35],即模仿特定任务的专家行为。Young 等人 [77] 强调了多样化演示数据对于泛化非抓取操作任务的重要性,并引入了一种高效的视觉模仿接口,在真实世界的机器人推动中实现了高成功率。Chi 等人 [11] 利用扩散模型的多模态动作分布能力 [32] 来模仿推动 T 形物体,展示了令人印象深刻的鲁棒性。虽然模仿学习很有效,但它严重依赖于真实世界数据的数量。否则,它在序列决策过程中容易出现状态-动作分布偏移 [6],这是需要精确接触点选择和控制 [86] 的非抓取任务中的关键问题。Hu 等人 [33] 得出结论,模仿泛化遵循环境-物体对数量的规模定律 [41],建议每个环境-物体对使用 50 个演示。这样的数据需求可能成本高昂且对可扩展性造成阻碍。另一种选择是,深度强化学习(DRL)可以通过仿真环境中的试错来学习策略 [39, 80]。然而,仿真与现实之间的大差距给将这些策略迁移到现实世界带来了重大挑战 [12, 45]。构建一个能准确捕捉现实世界物理规律的交互模型,对于学习现实世界中可行的非抓取操作策略至关重要。

B. 用于策略学习的世界模型

        世界模型 [25] 以数据驱动的方式学习环境动态,为有效的策略训练提供交互环境 [26, 28]。Hafner 等人 [26] 提出了 Dreamer,一个学习环境动态的紧凑潜在表示的世界模型。后续工作 [74] 将 Dreamer 应用于机器人操作任务,展示了在物理机器人上的快速策略学习。DINO-WM [84] 利用 DINOv2 预训练的空间块特征来学习世界模型,并通过将目标特征视为预测目标来实现任务无关的行为规划。TD-MPC [28, 29] 使用任务导向的潜在动力学模型进行局部轨迹优化,并使用学习的终端价值函数进行长期回报估计,在基于图像的控制上展现了优越性。建立在从大规模数据集 [7, 61] 学习的成功基础上,Mendonca 等人 [54] 利用互联网规模的视频数据学习了一个以人类为中心的动作空间扎根的世界模型。然而,纯数据驱动的世界模型严重依赖于训练数据的数量和质量,且难以泛化到分布外(OOD)场景 [79, 62]。这降低了迁移到现实世界的学习策略的鲁棒性。

        众所周知,在学习算法中融入结构化先验可以提高有限训练样本下的泛化能力 [63, 8]。最近可微分物理的进展为将物理知识融入世界模型开辟了新的可能性。Lutter 等人 [48] 引入了一个基于拉格朗日力学的深度网络框架,高效地学习运动方程同时确保物理合理性。Heiden 等人 [31] 通过神经网络增强了一个可微分的刚体物理引擎,以捕捉动态量之间的非线性关系。其他工作 [16] 展示了通过线性互补问题定义的物理模拟器的解析反向传播。∇Sim∇Sim [59] 结合了可微分物理 [16, 68] 和渲染 [9, 37, 38, 76] 来联合建模场景动态和图像形成,实现了从视频像素到物理属性的反向传播。这一方法随后被先进渲染技术 [46, 8] 或增强物理引擎 [40] 的改进所跟进。

        尽管有这些进展,但只有少数研究 [53, 5, 67] 将物理属性估计整合到非抓取操作的世界模型中,且依赖于无梯度优化或简化的物理模型,无法有效处理复杂的交互。无梯度方法依赖高质量轨迹进行系统辨识;缺乏这样的数据,它们容易陷入局部最优,正如 ASID 使用 CEM [53] 所证明的那样。简化的物理模型,如 Song 和 Boularias [67] 采用的 2D 物理引擎,本质上难以捕捉真实世界交互的完整 3D 动力学,导致预测不准确。相比之下,PIN-WM 能够从视觉观测中,使用少量、任务无关的交互数据,实现 3D 刚体动力学的端到端辨识,这有助于训练基于视觉的操作策略与强化学习。PIN-WM 与世界模型 [25] 的原始、狭义定义一致:一个为特定环境量身定制的动力学模型,用于精确的基于模型的控制。这与 Cosmos [2] 等通用世界基础模型形成对比。

C. 域随机化

        域随机化在一系列环境参数上训练单一策略,以实现测试时的鲁棒性能。Peng 等人 [60] 通过随机化环境的动态参数来增强策略对变化环境动态的适应性。Miki 等人 [55] 在多样化的模拟物理环境中训练四足机器人。在测试期间,机器人首先通过物理接触探测地形,然后预判性地规划和调整步态,实现了高鲁棒性和高速度。Tobin 等人 [71] 在模拟环境中引入随机化渲染(例如纹理、光照和背景),以增强现实世界的视觉检测。Yue 等人 [81] 使用辅助数据集中的真实图像风格来随机化合成图像,以学习域不变表示。Dai 等人 [15] 引入了一个自动化流程,将真实世界场景转化为多样化的交互式数字表亲环境,与数字孪生 [24] 相比,展示了显著更高的迁移成功率。

        虽然这些随机化方法为将仿真训练的策略高效迁移到现实世界提供了一种简单方法,但它们对环境参数的均匀采样缺乏适当的约束。这导致生成的空间远大于真实世界空间,增加了学习负担 [52],并且常常产生保守策略,导致性能下降 [19]。相比之下,我们在辨识出的均值附近扰动物理和渲染参数。这种有目的的随机化创建了一组遵循物理定律的物理感知数字表亲,同时引入足够的多样性来解释未建模的偏差。所开发的世界模型有助于学习鲁棒的非抓取操作策略,并能有效地从仿真迁移到真实世界环境。

方法

Note:一句话总结,先用2DGS和已知物体网格重建物体,再录制真机推动物体的视频,接着仿真模拟推的动作,利用LCP拟合物理参数,得到参数后再做小范围扰动,生成数字表亲。

        对于ContactGaussian-WM的一句话总结:

        先通过静态多视角图像构建兼顾外观与碰撞几何的球形 3DGS,再录制物体自由落体或机械手操作的接触运动视频;仿真端输入相同初始状态和动作,利用可微碰撞检测与闭式的 complementarity-free 接触动力学预测未来状态并渲染图像;通过预测图像与真实视频的误差,同时优化物体的质量—惯量、摩擦、刚度、阻尼及部分 Gaussian 碰撞几何,最后将学到的模型用于长时预测、仿真数据生成和 MPC 控制。

        对于GWM的一句话总结:

        先用前馈式重建网络将当前的单视角或双视角 RGB 图像提升为 3D Gaussian 场景,再通过 3D Gaussian VAE 将大量 Gaussian 压缩为固定长度的 latent tokens;随后利用以历史状态和机器人动作为条件的 Diffusion Transformer,从噪声中生成未来 Gaussian latent,解码得到未来 3DGS 并渲染未来多视角图像;最后将学到的 Gaussian 表征用于模仿学习,或把整个预测模型作为神经仿真器用于模型式强化学习。

Note:数字表亲存在的意义是什么?

        

结果与分析

Note:从四个方面进行试验:

  1. 和别的Real2Sim2Real方法比,它强不强?

  2. 物理参数辨识准不准?

  3. “数字表亲”有没有用?

  4. 真机上能不能打?

结论

        我们提出了一种从视觉观测中端到端学习 3D 刚体动力学的物理信息世界模型的方法。我们的方法能够利用少样本且任务无关的交互轨迹,辨识出对非抓取操作至关重要的 3D 物理参数。为了实现 Sim2Real 迁移,我们通过在以辨识出的均值为中心附近扰动物理和渲染参数,将辨识出的数字孪生转化为一组物理感知数字表亲。实验表明,与不同类型的基线方法相比,我们的方法具有鲁棒性和有效性。

        局限性与未来工作: 我们看到了未来研究的几个机会。首先,我们使用视觉观测来指导物理参数的优化,因此渲染对齐在这里起着关键作用。我们发现,机器人运动产生的各种阴影会扭曲渲染损失估计,从而损害所学物理属性的准确性。这个问题可能通过将可微分重光照 [22] 融入高斯泼溅来更好地建模光照条件而得到解决。此外,我们当前的框架专注于刚体动力学,探索将更先进的可微分物理引擎(如物质点法 MPM [59])集成进来,以扩展 PIN-WM 处理可变形物体的能力,将会很有意义。我们还致力于将 PIN-WM 应用于工业自动化中的真实世界应用 [70, 82, 83]。

全文总结

一句话总结,先用2DGS和已知物体网格重建物体,再录制真机推动物体的视频,接着仿真模拟推的动作,利用LCP拟合物理参数,得到参数后再做小范围扰动,生成数字表亲。

1. 论文要解决的问题

传统方法主要有两类不足:

  • Dreamer等数据驱动世界模型依赖大量轨迹,且预测结果不一定符合真实物理规律。
  • PyBullet等物理仿真器虽然符合物理,但真实物体的质量、摩擦、惯量等参数通常未知,且普通仿真器难以直接通过图像误差反向优化参数。

PIN-WM希望只用少量、任务无关的推动视频,从视觉观测中辨识真实场景的三维物理参数。

2. 核心方法

完整流程是:

3. 主要贡献

论文的核心贡献可以压缩成三点:

  1. 提出一种从少量RGB交互视频中辨识三维刚体物理参数的世界模型。
  2. 将可微LCP物理模拟和2DGS渲染连接起来,使图像误差能够反向传播到物理参数。
  3. 在辨识出的世界模型附近生成数字表亲,用于训练更稳健的Sim2Real机器人策略。

4. 局限性

PIN-WM仍存在明显限制:

  • 假设物体mesh已知,不是完整的从视频自动恢复几何。
  • 主要处理刚体以及相对简单的推动、翻转接触。
  • 论文主要评价单步预测,没有充分验证长期rollout。
  • 没有充分验证未见动作、不同初始姿态和更长预测时域下的泛化。
  • 公开代码可以复现仿真辨识流程,但完整PPO训练和真机实验信息仍不齐全。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐