摘要:

        开发能够理解复杂物理交互的世界模型,对于推进机器人规划与仿真至关重要。然而,现有方法在数据稀缺且接触丰富的动态运动场景下,往往难以精确地对环境进行建模。为应对这些挑战,我们提出了 ContactGaussian-WM,一个可微分的基于物理的刚体世界模型,能够直接从稀疏且富含接触的视频序列中学习复杂的物理规律。我们的框架包含两个核心组件:(1)一种统一的 Gaussian 表示,同时用于视觉外观和碰撞几何;(2)一个端到端的可微分学习框架,通过封闭形式的物理引擎进行微分,从稀疏视觉观测中推断物理属性。大量的仿真和真实世界实验表明,ContactGaussian-WM 在学习复杂场景方面优于现有最先进方法,并展现出强大的泛化能力。此外,我们还展示了该框架在下游应用中的实用价值,包括数据合成和实时 MPC。项目页面:ContactGaussian-WM

引言:

        世界模型[1]已成为自主机器人的认知引擎,作为内部模拟器使智能体能够对物理环境进行推理。通过将高维视觉观测综合为预测性表示,这些模型使机器人能够在其“心智之眼”中预判复杂的物理行为——如运动、相互作用和变形——从而无需代价高昂的真实世界试错即可实现高效规划。然而,直接从稀疏且富含接触的视频序列中学习这样的世界模型仍然是一个巨大的挑战。

Note:具身智能的一大难题就是数据集的问题,无论是遥操真机采集还是仿真模拟都有其相应的缺点,世界模型的出现可能是解决这一问题的有效方法。

        当前主流的世模范式,主要是纯粹数据驱动的方法,如视频生成 [2,3,4,5] 和潜在动力学模型 [6,7,8,9,10],在实际应用中面临重大障碍。这些方法以数据饥饿著称,且在数据稀疏或少样本演示的场景下往往无法泛化。更关键的是,由于缺乏明确的物理基础,这些模型优先考虑视觉合理性而非物理严谨性,导致幻觉现象,如物体相互穿透或自发消失。这种内在约束的缺失进一步导致其根本无法保持长时程一致性,而这对于规划等下游任务至关重要。

Note:数据驱动的方法泛化性差,计算资源大,黑盒,拟合视觉。

        为克服这些局限并减轻对大规模数据集的依赖,研究界正转向基于物理的世界模型,这些模型内化了不变的自然规律以确保长时程可靠性。利用高性能模拟器(如 MuJoCo [11]、Bullet [12])可以严格模拟物理定律,再结合渲染器,可扩展到图像级世界模型。然而,这些框架通常不可微分;因此,为了与现实世界对齐,一些方法 [13,14,15,16] 必须采用无梯度优化进行参数辨识。然而,这种范式严重依赖数据质量,同时面临巨大的搜索空间和收敛困难。

Note:不可微分的模型想优化的话只能穷举抽奖,可微分模型可以溯源精确调整。梯度 = 损失函数对参数的偏导数梯度指向损失上升最快的方向

        此外,越来越多的研究工作致力于构建可微分的世界模型,旨在通过梯度下降 [17,16,18,19,20] 实现稳定高效的系统辨识。然而,实现稳定的端到端学习仍然具有挑战性。例如,[17] 中的方法使用集成的模拟器进行碰撞检测,使得碰撞过程不可微分。在接触丰富的交互中,物体轨迹对精确的接触流形高度敏感,这种“梯度脱离”使模型无法有效纠正几何误差。因此,优化景观变得非常崎岖且病态,难以从稀疏且富含接触的视频序列中恢复精确的动态参数。虽然 [18,19,20] 等方法在理论上实现了端到端可微,但它们本质上依赖于数值近似且缺乏解析梯度,因此不适用于高质量世界模型的学习和应用。此外,由于感知和动力学在结构上解耦,这些方法往往被迫维护两种不同的表示:一种用于视觉渲染(3DGS [21] 或 NeRF [22]),另一种用于物理仿真(如显式网格或粒子)。在实践中,强制这两种表示之间实现精确的几何对齐并非易事,导致从视觉重建误差反向传播的梯度是间接的,并且与底层物理参数在空间上存在错位。

        在本工作中,我们引入了一种新颖的可微分框架,称为 ContactGaussian-WM,用于从少量交互视频中学习基于物理的世界模型。该框架能够实现视觉真实且物理合理的预测,并弥合机器人规划任务中的仿真到现实的鸿沟。具体来说,我们统一了视觉和几何表示,采用解耦优化方法训练 3DGS [21] 以初始化场景,从而得到一种兼顾视觉和几何方面的表示。为确保碰撞检测的可微性,我们将 3DGS [21] 强制约束为各向同性球体。为适应接触丰富场景,我们选择了一个轻量级且强大的接触动力学模型 [23],该模型足以处理不同的接触模式(滑动、分离、粘滞)[24,25]。该模型与 3DGS 可微分渲染器结合,用于构建 ContactGaussian-WM,从而实现世界模型的可微分学习、预测和规划控制。

        大量的仿真和真实环境实验表明,我们提出的框架能够在复杂且接触丰富的场景中,从稀疏观测学习到基于物理的世界模型。所得模型支持长时程、准确且物理一致性的预测,有效弥合了仿真到现实的鸿沟。此外,我们还展示了其在与模型预测控制(MPC)集成时实现实时规划的能力。我们的主要贡献总结如下:

  • 我们提出了 ContactGaussian-WM,一个端到端可微分的框架,采用统一的几何与视觉世界表示,实现在接触丰富场景中从稀疏视频高效学习世界模型;

  • 我们进行了广泛的仿真和真实世界实验,验证了我们的方法在多种复杂交互场景中的泛化能力,并证明其优于现有方法 [17,7]。

相关工作

A. 世界模型

        1) 数据驱动的世界模型: 近年来,生成式人工智能重振了基于像素的方法,像 [26, 2, 3, 27, 4, 5] 这样的基础模型被用作通用视频模拟器。为了提高控制效率,基于潜在状态的方法 [28, 6, 7, 8, 9, 10] 将观测结果压缩为紧凑的状态表示。然而,这两种范式都将动力学视为概率分布的“黑箱”转换。由于缺乏明确的物理约束,它们会出现物理幻觉(例如物体变形或消失),因为它们本质上是在模仿数据的统计规律,而非强制执行因果物理定律。

        2) 基于物理的世界模型: 为了提高物理合理性,一些工作通过粒子表示上的图神经网络 [29, 30] 来引入结构先验。虽然这些方法提供了更好的泛化能力,但它们仍然是“黑箱”模型,缺乏对非穿透或摩擦的严格保证。另外,有些方法将显式物理引擎与渲染器结合 [13, 14],但依赖于无梯度优化,这在搜索空间增大时扩展性很差。

        因此,近年来的研究开始探索可微分的世界模型。PIN-WM [17] 通过 LCP(线性互补问题)求解器的隐式微分实现了局部可微性,而其他方法 [18, 19, 20] 则使用数值近似。然而,这些方法通常会在接触边界和可见性变化处遭遇梯度不连续的问题,导致训练不稳定。此外,像 PIN-WM 这类模型中不可微分的碰撞检测阻碍了几何优化,使其不适用于接触丰富的场景——因为几何误差无法被纠正。相比之下,ContactGaussian-WM 实现了真正的端到端可微性,能够同时优化物理参数和碰撞几何。

B. 刚体动力学仿真

        1) 碰撞检测: 主流的物理引擎(如 Bullet、MuJoCo、DART 和 Drake)主要依赖基于网格的离散表示,并使用 GJK [31] 和 EPA [32] 等算法来计算分离距离。虽然这些方法在前向仿真中很精确,但它们是不可微分的,不适合基于梯度的优化。

        为了解决这个问题,近期的框架转向了连续几何表示。像 gradSim [20]、D-REX [19] 和 ContactSDF [33] 等方法利用体积场(SDF 或密度网格)来支持通过场穿透进行梯度传播。类似地,近期工作 [18] 采用 3DGS [21] 来建模用于物理交互的几何形状。然而,这些方法在接触求解过程中往往依赖于空间和时间上的离散化及近似。这些数值近似会引入梯度不连续或不准确,限制了检测精度,无法达到精确解析解所提供的高保真度。

        2) 接触模型: 传统的刚体接触模型通常被表述为非线性互补问题(NCP)[34, 35, 36],在高维空间中计算效率低下。一种常见的简化方法是使用多面锥体 [36, 11] 来近似库仑摩擦锥,从而将问题转化为线性互补问题(LCP),可由高效求解器求解。另一种方法是通过将接触速度约束在对偶摩擦锥内来松弛 NCP 公式 [37],将问题转化为凸互补问题(CCP)。这种做法带来了显著的计算优势,例如快速收敛和理论解保证 [38, 39]。此外,上述 CCP 可以表述为二阶锥约束凸优化问题的 Karush-Kuhn-Tucker (KKT) 最优性条件 [37, 40, 41, 11]。

        为了赋予模型可学习性,一些方法 [42, 43, 44, 45, 46] 提出了可微分的近似方案来替代基于互补性的模型。这些方法通过不同方式实现可微性,例如引入惩罚函数 [42, 45, 46]、松弛互补约束 [43] 或采用隐式互补公式 [44]。这些方法的共同特点是,它们最终都需要迭代求解一个残差方程来求解接触约束,可微性通常通过隐函数定理 [47] 获得。因此,一些研究者 [48, 49, 45, 46, 23] 探索了封闭形式的接触动力学模型。虽然某些工作 [48, 49, 45, 46] 尝试通过解耦法向接触力和库仑摩擦力来获得封闭解,但这往往会引入额外的超参数和潜在的非物理伪影。相比之下,文献 [23] 中的方法在对偶摩擦锥内使用了一种近似,允许在单一项中统一处理法向接触力和摩擦力,从而灵活捕捉不同的接触模式,并自动满足库仑摩擦定律。

        在本工作中,我们的刚体模拟器实现了可微分的碰撞检测,并集成了封闭形式的接触模型 [23],从而构建出更高效的可微分仿真,并提供稳定的解析梯度。

方法

A. 我们的框架概述

        图 2 勾勒了 ContactGaussian-WM 框架,主要包括两个阶段:场景初始化物理-几何优化。场景初始化使用解耦优化来获得统一的球形高斯表示,兼顾视觉和几何方面。物理-几何优化通过 ContactGaussian-WM 世界模型实现,该模型主要由一个可微分的碰撞检测器、一个显式的接触动力学模型和一个 3DGS 渲染器组成。所有这些组件将在下文中详细讨论。

Note:解耦优化就是分开两步走,第一步(只画骨架):先不管颜色和透明度,只调整高斯球的位置和大小。第二步(只涂颜色):固定骨架,调整透明度和颜色。

B. 问题表述

Note:可以把公式 (1) 理解为:输入是一个视频帧,输出是下一帧的预测图。模型要干的事,就是让“预测图”和“真实下一帧”尽可能像。

C. 阶段 I:基于球体几何高斯泼溅的场景初始化(SG-GS)

Note:作者把传统 3DGS 里可以随意拉伸、旋转的“椭球体”强制变成“正球体”。原因极其现实:计算两个椭球的碰撞距离需要解高次方程,而计算两个球心之间的距离只需要一个减法。为了让后面的碰撞检测能“可微分”(能算梯度),牺牲一点视觉灵活性,换取物理计算的简便性。

D. 阶段 II:物理-几何优化

Note:

  Note:

Note:

实验结果

        我们在仿真和真实世界场景中对所提出的框架进行了评估。我们旨在回答以下问题:

  1. 所提出的框架能否通过稀疏且接触丰富的场景视频学习底层的物理规律,从而比现有方法做出更准确的预测?

  2. 该方法能否泛化到多样化的真实世界场景,并支持有效的仿真到现实(sim-to-real)控制迁移?

  3. 所提出的框架在下游任务中有什么实用价值?

        我们利用仿真环境来严格基准测试我们方法的预测精度。延伸到真实世界,我们验证了模型在多种真实场景中的泛化能力以及仿真到现实的控制迁移能力。最后,为了展示其实用价值,我们探索了所提出框架在支持多样化下游机器人应用中的潜力。详细设置和结果见附录。

A. 仿真评估

        实验设置: 我们首先通过将物体的精确网格模型使用我们的 SG-GS 方法转换为 3DGS 表示来初始化实验。设计了两种交互场景:

  • 推-滑-停(Push-slide-settle):各种物体被虚拟手推动,记录图像、真实轨迹和末端执行器速度。

  • 下落-反弹(Fall-and-rebound):各种物体的完整自由下落和反弹过程,记录图像和真实轨迹。

        这两种场景在 MuJoCo [11] 中设计,用于生成轨迹及其 RGB 渲染图。这两种场景代表了两种不同的运动模式:前者涉及准静态、连续接触,而后者具有高动态、离散接触。为了验证框架在不同几何形状和物理属性上的泛化能力,我们采用了一组多样化的物体(例如相机、斯坦福兔子、存钱罐和橡皮鸭)。模型在一条短的交互轨迹上进行训练,并在多个未见过的测试集上进行评估。具体来说,对于下落场景,物体从不同的初始姿态和位置释放;对于推动场景,机械臂以不同的末端执行器速度操作。为了评估长时程预测的稳定性,测试序列明显比训练时使用的序列更长,同时保持一致的采样率。

        实验指标: 我们的评估侧重于模型在开环方式下的学习能力和预测准确性(即仅提供第一帧的真实状态)。为了评估学习性能,我们在训练过程中跟踪渲染图像的 PSNR,以监控模型拟合训练数据的能力。此外,我们通过在整个测试集上计算真实姿态与预测姿态之间的平均平移误差和旋转误差来量化预测准确性。

        基线方法: 我们将我们提出的世界模型与各种现有基线进行比较,分类如下:

  • 数据驱动世界模型。 我们选择 DreamerV3 [7] 作为该类别的代表基线。作为一个通用世界模型,DreamerV3 纯粹从视觉观测中学习潜在动力学,但通常需要大量数据才能收敛。我们使用与测试集不同的 100 条轨迹数据集对其进行训练,同时我们也遵循其闭环训练模式(在每个时间步以真实状态为条件)。

  • 基于物理的世界模型。 我们选择两种代表性方法,以覆盖基于物理的优化谱系。第一种本质上是一个无梯度的系统辨识基线。我们将标准 MuJoCo 模拟器与我们的 3DGS 渲染器 RR 集成,并采用来自 TwinTrack [54] 的无梯度优化策略 CEM 来最小化 L1 图像误差,我们在后文中称之为 CEM+MuJoCo+RCEM+MuJoCo+R。第二种方法是 PIN-WM [17],代表了可微分的基于物理的方法,它构建了一个具有线性互补问题(LCP)的物理基础世界模型,并利用隐式微分进行高效的基于梯度的优化。

        值得注意的是,我们为 CEM+MuJoCo+RCEM+MuJoCo+R 和 PIN-WM 提供了真实网格作为碰撞几何,并利用高保真物理模拟器进行精确碰撞检测。我们还为 PIN-WM 训练了高质量的 2DGS 物体,以防止渲染伪影成为性能瓶颈。为了公平比较,我们对 PIN-WM 和 DreamerV3 使用了官方实现及其默认超参数。对于 CEM+MuJoCo+RCEM+MuJoCo+R,我们使用 MJX [11] 实现了 100 组并行参数,其余设置与 TwinTrack 保持一致。所有基于物理的基线与我们的模型在相同的轨迹数据集上进行训练和评估,每种方法都训练到收敛以报告其最优性能。

        训练性能对比: 图 3 展示了学习性能曲线。可以看出,所有四个模型在两种场景中都能收敛。由于 DreamerV3 采用闭环训练范式,其 PSNR 显著优于其他模型是合理的。然而,其在下落-反弹场景中的收敛性略低于推-滑-停场景,这是由于前者的视觉复杂性更高,尽管它没有显式考虑接触动力学。

        对于三个基于物理的模型,在推-滑-停场景中学习性能相当。原因在于这种准静态任务提供了平滑且连续的梯度,且运动轨迹主要受摩擦系数控制。这种受限的搜索空间和稳定的约束使得无梯度的 CEM+MuJoCo+RCEM+MuJoCo+R 和基于梯度的方法(PIN-WM 和我们)都能轻松找到最优解。

        相比之下,下落-反弹场景更具挑战性。碰撞仅发生在少数几帧内,提供的有效信息有限。此外,离散接触导致梯度不连续。PIN-WM 本就难以处理离散和不准确的梯度,在这些条件下无法达到令人满意的收敛。对于 CEM+MuJoCo+RCEM+MuJoCo+R,并行搜索使它们能够很好地拟合图像损失。相比之下,我们的模型实现了更稳定和准确的梯度流。通过有效利用稀疏且不连续的碰撞信息,我们的框架能够以更少的计算资源识别精确的梯度方向,最终收敛到更优的值。

测试性能对比: 为了评估四个模型的预测准确性,我们记录了测试集上的累积平移误差和旋转误差(表 I 和表 II),定性结果见附录。基于性能表现,我们得出以下结论:

  1. 纯粹数据驱动的 DreamerV3 在泛化到新状态和动作时性能急剧下降,无法在长时程预测中保持基本的场景一致性或物理合理性。

  2. 虽然 CEM+MuJoCo+RCEM+MuJoCo+R 在推-滑-停和下落-反弹场景中表现良好,但其在高动态和离散的下落场景中泛化性能显著下降,表明当场景发生较大变化时,该模型无法捕捉这些场景中的底层物理规律,而是过拟合了训练损失。

  3. 像 PIN-WM 这样依赖于隐函数微分和不可微分碰撞检测的框架,不适合高动态场景。其梯度估计固有地不准确且缺乏平滑性,难以从稀疏且高动态的信号中推导出可靠的更新方向。因此,这类方法可能在具有连续接触的准动态场景(如推动)中有效。

  4. 相比之下,我们提出的 ContactGaussian-WM 框架实现了端到端的可微分学习。这使得模型即使在具有挑战性的条件下,如不准确的几何、不完美的动力学、稀疏的接触信息和复杂的碰撞交互,也能从图像中准确捕捉底层的物理规律。因此,我们的框架实现了稳定的泛化性能。此外,它在各种场景中也能很好地促进学习和泛化,这进一步证明了我们学习范式的鲁棒性和通用性。

B. 真实世界评估

        虽然我们的模型在仿真中已经相对于各种基线建立了定量和定性的性能优势,但在这一部分,我们将重点转向验证其在复杂、多样化环境中的实际可行性以及仿真到现实迁移的有效性。

        实验设置: 我们设计了两种动态场景:自由下落和机器人操作。在后者中,我们使用 LEAP Hand [55],它施加高冲击力以引发滑动和翻转等复杂行为,如图 4 所示。遵循 [41] 的方法,我们将手建模为阻抗控制 [56] 下的弹簧系统以简化接触动力学。此外,我们变化地面材料(橡胶、PVC 和木材)以测试对不同物理属性(如刚度和摩擦)的鲁棒性。我们使用 SG-GS 从手机拍摄的多视角图像初始化 3DGS 表示。我们使用 RealSense D456 RGBD 相机为每次试验捕获运动视频,将其划分为训练集和测试集(比例为 1:4)。与依赖外部状态跟踪的方法不同,我们将初始状态视为可学习参数。为了将其与几何和物理优化解耦,我们使用前几帧预估计初始状态。最后,我们实施开环的仿真到现实迁移策略,执行基于模型在 LEAP Hand 上规划的轨迹,以验证其是否支持有效的控制迁移。

        实验指标: 由于缺乏可靠的现实世界状态信息,我们使用长时程预测的累积峰值信噪比(PSNR)作为主要指标。长时程开环预测的高视觉保真度强烈表明模型已正确捕捉底层物理规律并实现了准确的动态预测。对于测试集上的预测实验,我们计算开环预测的平均累积 PSNR。对于每个场景,我们使用不同材料进行多次实验,然后计算平均值。类似地,对于开环轨迹迁移实验,我们针对每个物体使用不同材料进行多次实验,并计算实际图像与规划图像之间的平均 PSNR。

        基线方法: 为了突出参数学习对模型预测和仿真到现实迁移的影响,我们在保持所有其他变量不变的情况下,将其与不进行参数学习的 ContactGaussian-WM 进行对比。

        结果: 在表 III 和表 IV 中,我们分别报告了两种方法在测试集和实际开环轨迹迁移中的性能。图 5 可视化了两种方法在开环控制轨迹迁移实验中的实际表现。可以发现,我们的世界模型参数学习提高了世界模型的预测保真度,同时缩小了仿真到现实的差距。

C. 应用

        仿真数据合成: 世界模型的一个关键应用在于仿真数据合成。在仿真和真实环境中的广泛评估表明,我们的模型在理解复杂物理交互和预测动力学方面具有强大的能力,特别是在接触丰富和高动态场景中。因此,训练好的 ContactGaussian-WM 可作为生成物理准确且视觉逼真的仿真数据的强大引擎,从而构建高保真的 4D 环境。此外,我们的框架在 RTX 4090 上实现了约 40Hz的图像生成速率。这一计算效率凸显了其在实时仿真到现实交互中的潜力。

        实时 MPC 控制: ContactGaussian-WM 框架的可微性和显式特性使其能够无缝集成到现有的 MPC 求解器中。在本实验中,我们首先基于目标物体使用 MuJoCo 合成交互数据训练一个世界模型,然后实现一个实时 MPC 框架。如图 6 所示,我们的框架使 LEAP Hand 能够在 MuJoCo 中成功执行手内重定向任务,准确规划和执行操纵物体所需的控制序列。

Note:

结论与未来工作

        我们提出了 ContactGaussian-WM,一个端到端可微分的框架,用于从稀疏视频中重建世界模型。与其他方法相比,我们的世界模型更适合从高度动态、接触丰富的视频中学习,并且我们已在多种场景中证明了框架的有效性。此外,我们还展示了其在仿真数据合成以及与实时 MPC 集成方面的应用价值。

局限性与未来工作

        我们识别出几个有前景的未来研究方向。

  1. 首先,所提出的统一场景表示在一定程度上可能会降低渲染质量。

  2. 其次,基于高斯球体的碰撞检测在深度相互穿透的情况下,可能无法提供准确的穿透距离和接触法线。

  3. 最后,我们当前的框架仅限于刚体系统,不包括可变形物体。

        未来工作将探索视觉上更逼真且几何上更精确的统一表示更准确的可微分碰撞检测,以及超越刚体的更通用的世界模型

全文总结:

        一句话概括:这篇论文造了一台“物理透视仪”。给它看一段十几帧的短视频,它不仅能预测下一秒画面,还能反推出物体的质量、摩擦系数、刚度,并据此做精准的实时控制。

核心逻辑链条(四步走)

  1. 痛点(现状很糟):纯AI模型(如Sora、DreamerV3)预测视频全凭“感觉”,不懂物理,物体动不动就穿模或消失;传统物理引擎虽然准,但不可微分,没法用神经网络的反向传播去调参,只能靠暴力搜索。

  2. 解法(统一表示):用3D高斯泼溅(3DGS)里的小球同时当“像素”和“物理骨架”。为了让碰撞能算梯度,强制小球必须是正球形。

  3. 关键创新(全链路可微)

    • 碰撞检测:用数学上的平滑函数(LogSumExp)代替“是否穿透”的硬判断,让梯度能流过去。

    • 接触力:放弃复杂的方程组求解(互补性问题),改用弹簧-阻尼闭式公式算力,速度快且解析可微。

    • 训练策略:解耦初始化(先定骨架后上色),且梯度分流(图像模糊信号只改物理参数,穿透惩罚信号才改几何位置)。

  4. 验证(降维打击):在仿真和现实中,只给15帧稀疏视频,轻松击败了用100条轨迹训练的纯数据模型,以及用完美网格百倍并行算力的传统物理调参方法。

思考:

        论文号称学了“物理规律”,但本质上,它用弹簧-阻尼模型泛化了所有接触力。它学的不是牛顿力学公式,而是“视觉表现上的物理等价物”

        把任意物体强制拆解成球体,物理上极不精确。

        这篇工作的真正价值不在于“省数据”,而在于“提供了强先验(物理约束)”。它保证在极度缺乏数据时,模型不会乱猜。但在大数据时代,这种优势可能会被稀释。

        为了实现可微,作者用了:SAM2提特征、3DGS渲染、闭式接触模型、LogSumExp平滑、Sigmoid惩罚......整个流水线极其臃肿。如果未来出现一个直接端到端的神经网络,能隐式地拟合这些物理梯度,这篇论文的方法可能会迅速被淘汰。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐