GWM: Towards Scalable Gaussian World Models for Robotic Manipulation (面向可扩展的高斯世界模型用于机器人操作 ICCV 2025)
一句话概括:
GWM学习“机器人执行某个动作后,三维场景会怎样变化”,并把预测出的未来场景用于训练机器人策略。
摘要
由于真实世界交互的低效性,在已学习的世界模型(world model)内部训练机器人策略正成为一种趋势。已有的基于图像的世界模型和策略已经展现出一定的成功,但它们缺乏鲁棒的几何信息,而这对三维世界的一致空间和物理理解至关重要——即便这些模型已经在互联网规模的视频源上进行了预训练。
Note:基于3D的世界模型让机器人从“看图说话”升级为“空间推演”,所以就算换环境、换光照,它依然能精准地规划动作。
为此,我们提出了一种用于机器人操作的新型世界模型分支,命名为高斯世界模型(GWM)。它通过推断在机器人动作影响下高斯基元(Gaussian primitives)的传播来重建未来状态。其核心是一个结合了3D变分自编码器(3D VAE)的潜在扩散Transformer(DiT),从而能够利用高斯泼溅(Gaussian Splatting)实现细粒度的场景级未来状态重建。
GWM 不仅能通过自监督的未来预测训练来增强模仿学习(Imitation Learning)智能体的视觉表示,还能作为一个神经模拟器(Neural Simulator),支持基于模型的强化学习(Model-based Reinforcement Learning,MBRL)。
Note:GWM一边给模仿学习提供“看得懂3D空间”的视觉特征,一边给强化学习提供“不用物理引擎也能脑补后果”的虚拟沙盘。
仿真和真实世界实验均表明,GWM 能够精确预测以不同机器人动作为条件的未来场景,并可进一步用于训练策略,其性能以显著的幅度超越了当前最先进的方法,充分展示了其在机器人操作学习中的巨大潜力。
引言
人类通过有限的感官输入构建预测性的世界模型,从而能够预测未来结果并适应新情况 [12, 18]。受此能力启发,世界模型学习已成为推动智能体取得重大进展的核心动力,在自动驾驶 [14, 26, 27, 81, 99] 和游戏 [1, 18-22, 67, 90] 领域展现出强劲性能。随着智能体越来越多地参与到物理世界中,推进用于机器人操作的世界模型学习成为一个至关重要的研究方向,因为它理想情况下能使机器人具备推理交互、预测物理动态并适应各种未知环境的能力。
这自然引出了以下问题:如何有效地表示、构建和利用世界模型来增强机器人操作? 这样的需求对现有表示和模型构成了重大挑战。
3D 表示的必要性 高容量架构 [25, 78] 和互联网规模的预训练已将基于视频的生成模型确立为捕捉世界动态信息的强大工具,这显著增强了策略学习 [83, 88]。然而,它们对图像输入的依赖使其容易受到未见过的视觉变化(如光照、相机位姿、纹理等)的影响 [40],因为它们缺乏 3D 几何和空间理解。虽然 RGB-D 和多视角 [16, 17] 设置试图弥合这一差距,但在连贯的 3D 空间中隐式地对齐图像块特征仍然具有挑战性 [62, 101],导致鲁棒性问题仍未解决。这凸显了需要一种能够将精细视觉细节与 3D 空间信息相集成的表示,以增强机器人操作的世界建模。
效率和可扩展性 为了找到一种既能保留 3D 几何结构又能保留 2D 图像精细视觉细节的 3D 表示,多视角 3D 重建方法如神经辐射场(NeRF)[57] 和 3D 高斯泼溅(3D-GS)[35] 提供了自然的解决方案。其中,3D-GS 因其对 3D 场景的逐高斯显式建模而特别有吸引力,将点云等高效的 3D 表示与高保真渲染相结合。然而,由于这些方法主要依赖于离线的逐场景重建,它们的计算需求对将其应用于机器人操作(尤其是基于模型的强化学习 MBRL)构成了重大挑战 [49, 92],限制了其可扩展性。
为此,我们提出了高斯世界模型(GWM),一种新颖的 3D 世界模型,将 3D-GS 与高容量生成模型相结合,用于机器人操作。具体来说,我们的方法结合了前馈 3D-GS 重建和扩散Transformer(DiT)的最新进展,通过基于当前观测和机器人动作条件的高斯渲染,实现细粒度的未来场景重建。为了实现实时训练和推理,我们设计了一个 3D 高斯变分自编码器(VAE),从 3D 高斯中提取潜在表示,使基于扩散的世界模型能够在紧凑的潜在空间中高效运行。通过这一新颖设计,我们证明了 GWM 能够增强视觉表示学习,提升其作为模仿学习视觉编码器的能力,同时也可作为基于模型的强化学习(RL)的鲁棒神经模拟器。
Note:3D高斯VAE就是一个压缩和还原3D Gaussian场景的模型。

前馈网络极度依赖大规模训练数据,在机器人领域,收集带动作标签的3D数据远比收集2D图片难得多。它把“计算瓶颈”转化成了“数据瓶颈”。
为了全面评估 GWM,我们在动作条件视频预测、模仿学习和基于模型的 RL 设置中进行了广泛实验,涵盖 3 个领域的 31 个多样化机器人任务。对于真实世界评估,我们引入了一个 Franka PnP 任务套件,包含 20 种变体,涵盖域内和域外设置。在消融研究中,我们评估了感知指标和成功率,以验证每个构建模块的有效性。GWM 在各项任务中持续优于之前的基线方法,包括最先进的基于图像的世界模型,展现出显著的优势,并凸显了其数据扩展潜力。
总之,我们的主要贡献有三点:
-
我们提出了 GWM,一种新颖的 3D 世界模型,通过高斯扩散Transformer和高斯 VAE 实例化,用于高效的动态建模。GWM 以可扩展的端到端方式学习预测准确的未来状态和动态,无需人工干预。
-
GWM 可以轻松集成到离线模仿学习和在线强化学习中,具有卓越的效率,在基于学习的机器人操作中展现出令人瞩目的扩展潜力。
-
我们通过在两个具有挑战性的仿真环境中的大量实验证明了 GWM 的有效性,将之前的最先进基线方法大幅提升了 16.25%。此外,我们在真实世界场景中验证了其实用性,在 20 次试验中,GWM 将典型的扩散策略提升了 30%。
相关工作
世界模型 世界模型通过基于当前观测和动作预测未来状态来捕获场景动态,并实现高效学习。它们已在自动驾驶 [14, 26, 27, 81, 99, 103]、游戏智能体 [1, 18-22, 67, 90] 和机器人操作 [23, 68, 84] 中得到了广泛探索。早期工作 [18-23, 56, 66-68, 90, 97] 学习用于未来预测的潜在空间,在仿真和真实世界环境中均取得了强劲成果 [84]。然而,虽然在建模上有所简化,潜在表示难以捕获世界的精细细节。最近扩散模型 [24, 72, 73] 和Transformer [64, 78] 的进展已将世界建模转向直接的像素空间建模 [1, 50, 51, 88],实现了细粒度细节捕获和来自互联网视频的大规模学习。然而,基于图像的模型通常缺乏物理常识 [4],从而限制了其在机器人操作中的适用性。
高斯泼溅 3D-GS [35] 使用 3D 高斯表示场景,通过可微分溅射高效地投影到 2D 平面上。与 NeRF [57] 等隐式表示相比,它提供了更高的效率,惠及侵入式手术 [46]、SLAM [34] 和自动驾驶 [100] 等应用。这一优势扩展到 4D 动态建模 [28, 52, 85],因为 3D 高斯类似于点云,具有空间意义。然而,这些方法所需的离线逐场景重建对机器人操作等实时应用带来了计算挑战。近期工作 [6, 13, 75, 86, 87, 95, 98, 102] 通过学习从像素到高斯的生成映射,使用大规模数据集解决了这一问题,但仍然依赖已知的相机位姿,限制了可扩展性。另一并行工作 [8, 37, 71, 80] 探索了从无位姿图像进行前馈新视角合成,利用预测的点图作为显式多视角对齐的代理。基于这些进展,本工作开发了一种从无位姿图像构建的可扩展高斯世界模型,确保策略训练的空间感知能力和可扩展性。
视觉操作 构建具有人类级能力的视觉驱动机器人是一个长期挑战。视觉模仿学习方法 [5, 36, 39, 45, 76] 使用各种视觉表示来模仿专家示教,如点云 [7, 15]、体素 [44, 70]、NeRF [11, 32, 41, 43, 69, 92] 和 3D-GS [49]。虽然这些方法在已学任务上有效,但在未见过的真实世界场景中表现不佳 [53, 54]。强化学习通过试错来优化策略,弥补了这一差距,但需要昂贵的真实世界交互。因此,许多方法采用仿真到现实(sim-to-real)迁移,即在世界的数字孪生体中学习 RL 策略并部署执行。尽管如此,由于依赖预定义资源 [3, 58, 79] 或将真实世界物体转换为仿真所需的劳动密集型转换 [10, 38, 42, 47, 48, 63],可扩展性仍然是一个挑战。为解决这些限制,GWM 专注于为模仿学习提供更强的视觉表示,并为视觉 RL 提供高效的神经模拟器,以实现更有效和可扩展的机器人操作。
Note:漏掉了“可微分物理引擎”这一整条技术路线,本质是用Splat3R(前馈)解决速度,用VAE解决高斯数量不一致,用DiT解决生成质量。但前馈Splat3R本身就有重建误差,VAE压缩又有信息丢失,DiT生成又有幻觉。三级误差串联,长时序预测极容易漂移。
高斯世界模型
我们的 GWM 方法的整体流程如图 2 所示,其中我们构建了一个高斯世界模型,用于推断以 3D 高斯基元表示的未来场景重建。具体来说,我们将现实世界的视觉输入编码为潜在的 3D 高斯表示(第 3.1 节),并利用基于扩散的条件生成模型,在给定机器人状态和动作的条件下学习表示上的动态(第 3.2 节)。我们证明了 GWM 可以灵活地集成到离线模仿学习和在线基于模型的强化学习中,用于多样化的机器人操作任务(第 3.3 节)。

世界状态编码

Note:Transformer要求每批输入的特征尺寸基本一致。

基于扩散的动力学建模


Note:简单来说,在训练阶段,历史状态是你看了前5秒的视频(已知信息),动作是你按下的手柄按钮。你想让AI猜出第6秒的3D画面(未来状态)。第一步给真实拍摄的第6秒清晰画面(Ground Truth)施加高斯噪声。第二步把“第6秒的带噪画面”扔给AI,同时给它看“前5秒历史”和“动作命令”。让AI尝试从这团雪花里,把原图恢复出来。第三步就是训练好后直接推理,但这有一个问题,这需要海量的数据进行训练。
GWM 用于策略学习


实验
在我们的实验中,我们重点关注以下问题:
-
在不同领域中,动作条件的视频预测结果的质量如何?
-
高斯世界模型是否有利于下游的模仿学习和强化学习?与基于图像的世界模型相比,它是否展现出更强的鲁棒性?
-
高斯世界模型如何帮助典型策略(例如扩散策略 [9])在真实世界的机器人操作任务中发挥作用?
在以下章节中,我们将详细描述模型在这些关键主题上的性能表现。具体来说,我们在实验中采用了以下三个测试环境和四个任务:
环境 为了全面分析 GWM 的能力,我们在两个仿真环境和一个真实世界环境中评估我们的方法:(1) MetaWORLD [91],一个用于学习机器人操作 RL 策略的仿真环境;(2) ROBOCASA [59],一个大规模的、多尺度的仿真模仿学习基准,包含厨房环境中多样化的机器人操作任务;以及 (3) FRANKA-PNP,一个使用 Franka Emika FR3 机械臂的真实世界抓取-放置环境。
任务 我们精心设计了四个任务,以系统地评估 GWM 在不同测试环境中的表现:(1) 动作条件场景预测评估 GWM 在世界建模和未来预测方面的有效性;(2) 基于 GWM 的模仿学习考察表示质量及其对基于模仿学习的机器人操作的益处;(3) 基于 GWM 的强化学习探索其用于基于模型的强化学习的潜力;以及 (4) 真实世界任务部署评估 GWM 在真实世界机器人操作中的鲁棒性。
动作条件场景预测
实验设置 世界模型生成高保真且与动作对齐的展开(rollouts)的能力,对于有效的策略优化至关重要。为了评估这一能力,我们在所有考虑的仿真和真实环境中,使用可用的人类演示数据训练 GWM,并通过以验证集中采样的未见动作轨迹为条件,评估未来预测的质量。对于定量评估,我们采用了生成质量的常用指标,包括 FVD [77] 用于测量时序一致性,以及基于图像的指标 PSNR [29] 用于像素级精度,SSIM [82] 和 LPIPS [96] 用于感知质量。
结果与分析 我们在表 1 中提供了我们的方法与 iVideoGPT 之间的定量比较。如表 1 所示,我们的方法在仿真和真实环境上均持续优于当前最先进的基于图像的世界建模方法 iVideoGPT,证明了我们基于扩散的高斯世界模型学习流程的有效性。值得注意的是,如图 3 所示,像 iVideoGPT 这样的基于图像的模型在捕捉动态细节(例如夹爪)方面容易失败。尽管这些细节可能不会在视觉指标上造成大的差异,但它们会显著影响策略学习,正如我们将在第 4.3 节中讨论的那样。我们在图 4 中提供了 GWM 在 ROBOCASA 和 FRANKA-PNP 上预测结果的更多定性可视化。


基于 GWM 的模仿学习
实验设置 如第 3.3 节所述,GWM 可用于从图像观测中提取信息丰富的表示,这预计将有益于模仿学习。我们通过在 ROBOCASA 上测试 GWM 在模仿学习中的有效性来验证这一特性。ROBOCASA 中的任务套件包含 24 个原子任务,带有相关的语言指令,用于厨房环境,包括抓取-放置、打开和关闭等操作。每个任务提供有限的一组 50 个人类演示和一组 3000 个由 MimicGen [55] 生成的演示。我们在这些演示上训练 GWM,并将其作为最先进的 BC-Transformer [59] 的状态编码,以成功率指标进行定量比较。
结果与分析 我们在 ROBOCASA 基准上的实验结果见表 2,展示了我们的方法在多任务模仿学习场景中的有效性。在 24 个厨房操作任务中,我们的方法持续优于 BC-Transformer 基线。在有限的人类演示(H-50)下,我们的方法在成功率上平均提升了 10.5%。在使用生成演示(G-3000)训练时,我们的方法保持了可扩展的性能,平均增益为 7.6%。值得注意的是,我们的方法在复杂的操作任务(如抓取-放置操作)和交互式任务(如打开/关闭电器)中表现出特别的优势,这些任务的性能提升最为显著。这些结果证实了我们的方法从视觉观测中提取信息丰富的表示的能力,能有效增强实际机器人操作场景中的模仿学习能力。

基于 GWM 的强化学习
实验设置 我们在 MetaWORLD [91] 的 6 个复杂度递增的机器人操作任务上评估 GWM 用于 RL 策略的能力。我们实现了一种受 MBPO [31] 启发的基于模型的 RL 方法,使用 GWM 生成合成展开(synthetic rollouts),以扩充 DrQ-v2 [89] actor-critic 算法的回放缓冲区。我们纳入了最先进的基于图像的世界模型 iVideoGPT [83] 作为强基线。为了公平比较,我们不对两种方法使用预训练初始化。所有比较方法使用相同的上下文长度、预测范围,并训练到最大 1 × 10^5 步。
结果与分析 图 5 显示,GWM 在所有 6 个 MetaWORLD 任务上持续优于 iVideoGPT。平均而言,GWM 的收敛速度比 iVideoGPT 快约 2 倍,并在复杂操作任务上达到了更高的渐近性能。优越的性能源于 GWM 的 3D 高斯表示,它允许更准确地预测接触动力学和操作下的物体运动,相比于纯粹的基于图像的方法。结果证实,显式的 3D 表示为需要精确空间推理的机器人控制任务提供了显著优势。

真实世界部署
实验设置 我们部署了一台 Franka Emika FR3 机械臂和一个 Panda 夹爪进行真实机器人实验。我们专注于拾取一个彩色杯子并将其放到桌子上的盘子中的真实世界任务。我们使用 MuJoCo AR 远程操作接口 [65] 收集了 30 个演示的小规模数据集。我们还设置了一台第三视角的 RealSense D435i 相机,仅提供无位姿的 RGB 图像用于观测。我们在图 6 中提供了真实世界任务设置的概览。与第 4.2 节中的实验设置类似,我们比较了最先进的基于 RGB 的策略 Diffusion Policy [9] 在使用或不使用我们的 GWM 表示时的任务成功率,用于定量分析。
结果与分析 如表 3 所示,在 20 次试验(不同的初始起始位置和物体位置,即干扰物)中,GWM 以 65% 的成功率优于 Diffusion Policy 的 35%。对于新的干扰物,性能差距进一步扩大,证明了 GWM 卓越的泛化能力。我们的方法在不同任务变体中保持了一致的性能,这得益于其有效的世界模型,该模型捕获了任务相关的动态,同时对视觉差异具有鲁棒性。真实世界展开在补充文件中展示,优势主要源于更精确的物体定位和准确的放置操作。结果证明了 GWM 在真实世界机器人操作任务中具有鲁棒的时空理解能力。

消融分析
我们在 ROBOCASA 上进行了额外的实验,以进一步验证我们的设计选择。
高斯泼溅的选择 如表 4 所示,与直接在 [1] 的基础上构建基于图像的扩散Transformer世界模型相比,引入高斯泼溅将成功率(SR)从 4% 显著提升至 18%。虽然 PSNR 略有下降,但 SSIM 和 LPIPS 指标均有改善,表明高斯泼溅在不同时间步长上提供了更好的 3D 一致性。这验证了我们的假设:与纯 2D 方法相比,显式的 3D 表示增强了机器人学习的空间理解能力。
3D 高斯 VAE 的选择 进一步引入 3D VAE 组件在所有指标(包括 PSNR)上带来了一致的改进。成功率从 18% 进一步提升至 24%。结果证实,我们的 3D 高斯 VAE 高效地捕获了场景的潜在结构,在保持空间理解的同时实现了更紧凑的场景表示。

Note:5个实验。





结论
在本文中,我们提出了一种新颖的高斯世界模型(GWM)用于机器人操作,通过融入鲁棒的几何信息,解决了基于图像的世界模型的局限性。我们的方法通过建模在机器人动作作用下高斯基元的传播来重建未来状态。该方法结合了扩散Transformer(DiT)和一个3D感知的变分自编码器,通过高斯泼溅实现精确的场景级未来状态重建。我们开发了一个可扩展的数据处理流水线,以促进在基于模型的强化学习框架中的测试时更新,能够从未经标定相机位姿(unposed)的图像中提取对齐的高斯泼溅表示。仿真和真实世界的实验均证明了 GWM 在预测未来场景和训练更优策略方面的有效性。
全文总结
一句话概括:
GWM学习“机器人执行某个动作后,三维场景会怎样变化”,并把预测出的未来场景用于训练机器人策略。
它与ContactGaussian-WM不同:
- ContactGaussian-WM:物理模型路线,重点辨识摩擦、质量等参数。
- GWM:数据驱动路线,使用Diffusion Transformer直接学习动作与三维场景变化的关系。
1. 要解决的问题
传统视频世界模型在二维图像中预测未来,容易受到相机视角、纹理和光照变化影响,并且缺少稳定的三维空间信息。
另一方面,传统3DGS需要针对每个场景单独优化,速度慢,不适合机器人在线训练。
GWM希望做到:
- 从普通RGB图像快速建立3D Gaussian场景;
- 根据机器人动作预测未来的3D Gaussian场景;
- 用预测结果减少机器人真实交互数据的需求。
2. 方法流程

核心模块包括:
- Splatt3R:不需要已知相机位姿,从RGB图像快速重建3D Gaussian;
- 3D Gaussian VAE:把数量不固定的Gaussian压缩成固定长度的潜变量;
- Diffusion Transformer:以当前三维状态和机器人动作为条件,预测下一状态;
- 奖励预测头:在强化学习中同时预测动作奖励。
单步关系可以表示为:
![]()
连续递推后得到完整的未来三维场景和视频。
3. 输入和输出
输入:
- 当前单视角或双视角RGB图像;
- 历史场景状态;
- 机器人动作序列。
输出:
- 下一时刻的3D Gaussian场景;
- 从不同视角渲染的未来图像;
- 连续预测得到的未来视频;
- 强化学习时还可以预测奖励。
它不直接输出机器人动作。机器人动作由模仿学习或强化学习策略输出,GWM负责预测这些动作的结果。
4. 主要贡献
这篇论文最重要的意义是:
它把3DGS从“针对单个场景进行离线重建的表示方法”,变成了“能够跨场景、根据机器人动作预测未来的可训练世界模型”。
它同时展示了3D Gaussian世界模型的三种用途:
- 预测动作条件下的未来三维视频;
- 为模仿学习提供空间感更强的视觉特征;
- 作为强化学习的神经模拟器,生成虚拟交互数据。
5. 局限性
- 它是数据驱动模型,并不显式估计质量、摩擦和接触力;
- 不能保证预测结果严格满足真实物理规律;
- 实验中每次只预测下一步,长视频依靠递归生成,容易累积误差;
- 真实实验只有30条演示和20次测试,规模仍然较小;
- 真实任务仅验证了杯子抓取放置,尚未证明复杂接触任务的通用性。
因此,最准确的评价是:
GWM不是精确物理模拟器,而是一个具有三维空间结构的数据驱动神经模拟器。它的主要价值是利用三维未来预测提升策略特征,并为强化学习生成低成本的虚拟交互数据。
6. 数据集、算力、开源程度
第一层:DROID大规模预训练
官方仓库要求先下载DROID:
- 完整版:约1.7TB;
- 测试版:100个episode,约2GB;
- 先训练3D Gaussian VAE,再训练Diffusion Transformer。
DROID完整数据包含大量机器人交互轨迹、外部/腕部RGB图像、机器人状态、动作、语言指令和奖励等;官方资料统计约7.6万条演示、350小时交互数据。
预训练流程是:


第二层:下游训练和评价
预训练后,再针对具体任务使用:
- RoboCasa:模仿学习;
- Meta-World:强化学习;
- Franka-PNP:真实机器人抓取放置。
因此,更完整的训练结构是:

论文没有公开完整算力配置,目前能确认的是官方预训练脚本默认使用单机4张CUDA GPU,但没有说明具体是A100、H100还是其他显卡。
公开配置如下:

截至2026年9月,GWM的官方代码开源程度大约可以评价为 4/10:核心模型代码已开源,但还不能完整复现论文实验。
开源了什么
官方仓库已经包含:
- 3D Gaussian VAE;
- Diffusion Transformer;
- Gaussian预测器和奖励模型;
- DROID数据读取与配置;
- VAE、DiT的多GPU预训练脚本;
- Splatt3R依赖和安装说明;
- MIT许可证。
可以用来研究模型结构,并尝试训练核心世界模型。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)