主题边界

        机器人操作;3D Gaussian Splatting(3DGS)、动态/4D Gaussian、Gaussian–particle 混合表示;动作后果预测、物理仿真、预测—校正或训练期未来监督

摘要

        本综述系统梳理 2023—2026 年把 3DGS 或动态 Gaussian 表示用于机器人世界模型的代表性研究,并围绕预测表征、动作条件机制、动态建模、接触处理、数据集、计算资源、评测指标和闭环实验进行比较。检索显示:2023 年主要是 3DGS 表示本身的奠基期,明确面向机器人未来预测的工作从 2024 年出现;到 2025—2026 年迅速分化为三条路线:(1)学习式 Gaussian 未来预测;(2)Gaussian 与显式物理引擎/粒子系统耦合;(3)仅在训练阶段以当前/未来 Gaussian 重建作为策略表征监督。纳入的 16 项核心工作中,真正让世界模型在部署时参与滚动规划或在线校正的仍是少数;多数方法以策略成功率证明“预测监督有用”,而没有直接验证长期动作条件预测的因果正确性。接触通常被埋在演示数据或仿真器中,只有 PIN-WM、DreMa、Embodied Gaussians、GSWorld 和 GaussTwin 等显式物理路线对摩擦、碰撞或形变约束作出较强处理。由此,最值得研究的空白是:显式、可校准的接触状态;多模态不确定未来;拓扑变化和非刚体;统一的闭环动作对齐基准;以及等算力、等数据条件下“训练期辅助预测”与“部署期想象/规划”的严格比较。

1. 研究问题

 本文回答四个问题:

        1. Gaussian 世界模型预测的究竟是什么:可渲染 Gaussian、物体位姿、速度场、潜在几何令牌,还是物理仿真状态?
        2. 机器人动作如何进入模型,预测又如何影响策略:监督表征、动作修正、失败检测、模型预测控制(MPC)、模型式强化学习(MBRL)还是合成数据?
        3. 现有论文对动态、接触、算力和闭环真实性的证据有多强?
        4. 哪些未解决问题既有科学价值,也能形成可验证的机器人研究课题?

2. 技术谱系:三种不同含义的“Gaussian 世界模型”

2.1 路线 A:可渲染的学习式动作后果预测

        ManiGaussian 首先把单帧 RGB-D 回归成带语义特征的 Gaussian 集合,再以机器人动作预测 Gaussian 的位置与旋转变化,用未来视图重建损失训练操作表征;它假设物体刚性,颜色、尺度、不透明度和语义在短时段不变。[ManiGaussian(ECCV 2024)]

        Self-Correcting 将这一思路从“辅助监督”推进到在线验证:执行动作后,将预测 Gaussian 点云与真实深度点云做 Chamfer 距离比较,超阈值则回退并加入扰动重试。它因此是少数把预测误差直接用于闭环恢复的工作,但仍采用刚体位姿变换,并不估计接触力。[Self-Correcting(AAAI 2025)]

        GAF 将运动属性嵌入 4D Gaussian,统一当前重建、未来帧预测和初始动作估计,再用渲染出的动作—视觉对齐信号修正扩散策略。它在真机失败分析中明确指出:抓取苹果和门把手的失败与缺少力反馈有关,这为“视觉几何并不等于接触理解”提供了直接证据。[GAF(2025)]

        GWM 将 Gaussian 压入 3D VAE 潜变量,再用动作条件 DiT 预测下一状态;它既可作为模仿学习的自监督编码器,也可作为 MBRL 的神经模拟器,是当前“学习式 Gaussian 世界模型”中用途最完整的一项。[GWM(ICCV 2025)]

        MRO-GWM 则转向物体中心:每个物体在规范坐标系中保存 Gaussian,时空 Transformer 根据历史物体/末端执行器状态与未来动作预测刚体 SE(3) 运动,并把它接入采样式 MPC。该设计改善身份保持和遮挡下的组合性,但明确局限于刚体。[MRO-GWM(2026)]

2.2 路线 B:Gaussian + 显式物理/数字孪生

        Embodied Gaussians 将可渲染 3D Gaussian 附着到受粒子物理约束的粒子上;物理系统向前预测,渲染误差产生“视觉力”在线校正状态。其强项是 30 Hz 的预测—校正闭环,弱项是论文主要验证跟踪与重建,并未展示任务级操作策略闭环。[Embodied Gaussians(CoRL/PMLR)]

        DreMa 从少量真实 RGB-D 视频构建物体级 Gaussian 数字孪生,把动作放入物理模拟器而非学习的 Gaussian 变形器中;通过等变场景变换“想象”新演示,再训练模仿策略。它展示了真实 Franka 的 one-shot 任务学习,但世界模型主要用于离线数据扩展,而非部署时持续滚动规划。[DreMa(ICLR 2025)]

        PIN-WM 用 Gaussian 渲染损失从少量交互中辨识刚体动力学参数,并围绕辨识结果生成物理“数字表亲”做 MBRL/Sim2Real。与纯学习变形相比,它显式面对摩擦与恢复系数;代价是对象、接触模型和刚体假设更受限。[PIN-WM(2025)]

        GSWorld 把 Gaussian-on-Mesh、URDF、碰撞网格和物理引擎封装为 GSDF 资产,支持 IL、RL、DAgger、虚拟遥操作及策略评测。它是闭环仿真基础设施,而不是从数据学习未知动力学的预测器,因此应与 GWM/MRO-GWM 区分。[GSWorld(2025)]

        GaussTwin 进一步将 PBD、离散 Cosserat rod 与 Gaussian 视觉校正统一起来,覆盖刚体与绳索,并在 Franka Research 3 上演示跟踪和推式规划;它是“可纠正数字孪生”路线中接触与形变建模最明确的代表之一。[GaussTwin(ICRA 2026)]

        PhysMani 不直接以机器人动作驱动场景,而是在线估计满足散度为零约束的 per-Gaussian 速度场,预测快速运动目标,再把未来运动特征注入动作策略。它解决的是动态目标拦截/放置,不是一般的接触后果模型;无散度只约束流场,并不等于摩擦、碰撞或抓取稳定性。[PhysMani(2026)]

2.3 路线 C:训练期 Gaussian 监督,部署时不再显式预测

        DP4 从单视角 RGB-D 构造当前 Gaussian,并用策略生成的动作轨迹预测 Gaussian 变化;未来 RGB-D 重建只用于训练。部署时执行扩散策略,不进行 Gaussian 渲染或滚动想象。[DP4(ICCV 2025)]

        ManiGaussian++ 用 leader–follower 层级 Gaussian 世界模型处理双臂:先预测稳定臂造成的变形,再预测操作臂的后果。它扩大了多实体动作条件建模,但主要作用仍是训练视觉表征。[ManiGaussian++(2025)]

        GaussianDream 以当前 Gaussian 重建、短期未来 Gaussian、RGB、深度  和伪 3D scene flow 监督 VLA 前缀;部署时丢弃解码头,不进行 Gaussian 预测或规划。[GaussianDream(2026)] GaussianDream++ 又把状态/预测压缩为 20 个世界令牌,静态—动态耦合解码仅用于训练,部署延迟从基线 286 ms 增至 330 ms/动作块。[GaussianDream++(2026)]

        GSP-3D 以单帧 RGB-D 回归 Gaussian、以 Transformer 预测未来 Gaussian 集合,并把误差作为双臂扩散策略的时间一致性辅助损失。论文已被 Frontiers 接收,但最终排版版本在检索时仍标为待发布,因此实现与结果应谨慎看待。[GSP-3D(Frontiers 2026)]

3. 核心方法对照

3.1 表征、动作条件、动态与接触

3.2 数据、算力、指标与闭环证据

4. 跨论文综合发现

4.1 “世界模型”标签掩盖了使用阶段差异

最重要的区分不是模型是否能渲染漂亮的未来,而是预测在何时被使用:

1. 训练期辅助表征:ManiGaussian、DP4、ManiGaussian++、GaussianDream、GSP-3D、GaussianDream++。它们证明未来重建损失能改善策略,却不能证明部署时预测足以支持反事实规划。
2. 执行期监测/修正:Self-Correcting、Embodied Gaussians、GaussTwin。预测误差直接触发状态校正或动作恢复,闭环意义更强。
3. 执行期规划或策略学习环境:GWM 的 MBRL、MRO-GWM 的 MPC、PIN-WM 的 MBRL、GSWorld 的仿真训练。只有这一类真正把模型误差暴露给策略优化,但也最容易遭遇模型利用(model exploitation)和累计漂移。
4. 离线想象/数据合成:DreMa、GSWorld。它们可以降低真机数据成本,但性能收益同时来自场景变换、物理引擎和数据量,不能全部归因于 Gaussian 表示。

因此,把所有策略成功率都解释为“世界模型预测更准确”是不成立的;训练目标、视觉编码器、策略容量、数据增强与动作头常同时改变。

4.2 表征从场景级稠密 Gaussian 向物体中心与令牌化演进

早期方法以场景级 Gaussian 集合换取渲染可解释性,但高基元数使注意力、匹配与长期 rollout 昂贵。MRO-GWM 用物体规范坐标和刚体 SE(3) 保持身份;GWM 以 VAE 压缩;GaussianDream++ 只保留 20 个世界令牌。趋势清晰:Gaussian 越来越像训练监督或可解释解码器,而不是部署时完整维护的状态。

这一趋势带来一个关键张力:压缩提高速度,却可能丢失接触面、薄结构、遮挡物体和不确定性。现有论文通常只用任务成功率或渲染指标间接检验,没有建立“压缩率—几何误差—接触失败率”的因果曲线。

4.3 接触是最薄弱的共同环节

学习式路线大多把接触隐藏在 RGB-D 变化或动作演示中。PSNR/SSIM/LPIPS 即使很好,也不能判断抓取法向、摩擦锥、滑移或碰撞冲量是否正确。GAF 的真机失败直接指向缺少力反馈;ManiGaussian/Self-Correcting 假设刚体;GWM、DP4 和 GaussianDream 系列没有显式接触变量。

显式物理路线处理得更直接,但仍有边界:PIN-WM 适合低自由度刚体推/翻;DreMa、GSWorld 依赖碰撞几何和参数校准;GaussTwin 可处理杆/绳,却未覆盖广泛材料和高复杂抓取;PhysMani 的无散度速度场保证体积流动性质,不会自动产生正确摩擦或夹持力。

4.4 数据与评测高度碎片化

RLBench 被频繁使用,但相同“RLBench”可能采用不同任务子集、演示数、相机视角、训练步数和测试姿态,数字不可直接横比。RoboCasa/LIBERO 更适合大规模策略比较,却几乎没有世界模型专门的动作对齐标注。MRO-GWM 和 PIN-WM 有动力学/规划指标,但任务范围窄;PhysMani 专注动态目标;GaussTwin 专注数字孪生跟踪。

当前常见指标分为三类:

- 视觉:PSNR、SSIM、LPIPS、FVD;容易奖励外观而非物理因果。
- 状态:位置/姿态误差、Chamfer、轨迹误差;比视觉更接近控制需求,但通常忽略多模态未来和置信度。
- 任务:成功率、RL 回报、样本效率;最有用,却把感知、模型、规划器与控制器误差混在一起。

缺失的关键指标包括:动作敏感性、反事实排序准确率、接触事件 F1、滑移/穿透误差、概率校准、rollout 漂移随时间的斜率、模型规划时延、能耗/显存、以及仿真策略排序与真机排序的相关性。

4.5 计算资源报告不足

只有少数论文给出足以复现的硬件和时长。ManiGaussian 报告 2×4090;Self-Correcting 报告 2×A800;GAF 给出约 24 h 的 A800 训练和 1.5 d 的 4090 动作模型;DP4 使用 H100 80GB;MRO-GWM 报告 A40 约 22 h,但其 MPC 每场景 45–90 min;PhysMani 报告约 200 ms 世界模型更新。GWM、DreMa、GaussianDream 系列、GSWorld、GaussTwin 的总训练成本或峰值显存并不完整。这使“Gaussian 更高效”的跨论文结论目前证据不足。

5. 值得研究的空白与可操作课题

以下优先级是本综述基于证据缺口作出的研究判断,而非论文作者的一致结论。

P0:直接决定该方向能否成为可靠闭环模型

1. 接触感知的 Gaussian 状态 
在 Gaussian 中联合编码几何、物体身份、局部 SDF/接触面、摩擦后验和触觉/腕力观测;用接触事件、滑移、穿透和任务成功共同监督。可从“刚体 SE(3) 主干 + 非刚体/接触残差”开始,避免全场景自由变形。

2. 动作对齐与反事实基准
对同一初态执行成组候选动作,记录真实多视角 RGB-D、物体位姿、力/触觉和成功标签。评价模型能否正确排序动作,而不只是重建执行过的那一条轨迹。该基准应同时包含无接触、首次接触、持续接触和接触切换。

3. 训练期预测 vs 部署期 rollout 的等预算实验
固定数据、视觉骨干、策略头、参数量与训练算力,只改变世界模型用法:无预测、辅助预测、一步验证、多步 MPC、合成 rollout。当前文献没有完成这一关键消融,因此无法回答测试时“想象”是否真的值得延迟与误差风险。

4. 不确定且多模态的未来 
遮挡、摩擦和柔性物体使未来天然多模态。现有多数方法输出单一 Gaussian 状态。应引入概率化对象轨迹/接触模式、校准置信区间或粒子式 Gaussian 假设,并让规划器规避高不确定动作。

P1:提升通用性与可部署性

5. 拓扑变化与材料泛化:处理布料折叠、绳结、颗粒、液体、破碎和工具—物体耦合,而不是只平移/旋转现有基元。
6. 物体中心—场景级混合模型:刚体对象用规范 Gaussian + SE(3),柔性区域用局部动态 Gaussian,背景用静态压缩表示;同时显式维护遮挡下的身份。
7. 跨机器人动作规范化:把关节动作、末端位姿、速度、双臂协同和灵巧手动作映射到统一的接触意图/空间作用表示,检验世界模型能否跨 embodiment 迁移。
8. 闭环失败数据:收集错误动作、恢复、卡住、滑移和安全停止,而不只收集成功示范。Self-Correcting 已显示错误后的观测很有价值,但恢复策略仍很简单。
9. 算力与实时性标准:统一报告 GPU、训练小时、峰值显存、Gaussian 数、预测视界、每步/每动作块延迟、控制频率和能耗;同时区分“渲染 FPS”与“端到端控制 FPS”。
10. 真实世界规模与独立复现:多场景、多材料、多相机扰动、多批次对象,预注册成功标准;真机至少报告重复次数和置信区间。当前许多真机结果只有几十次试验,难以判断稳健性。

6. 结论

2024—2026 年的进展已经证明,Gaussian 表示能把视觉细节、显式 3D 几何与高效渲染带入机器人世界模型,并在策略表征、失败检测、数字孪生、MBRL 和 MPC 中产生收益。但该领域尚未证明“更好的 Gaussian 渲染”普遍等于“更好的物理预测”。最可靠的进展来自两端:一端是 GWM/MRO-GWM/Self-Correcting 这类让预测真正进入闭环决策的系统;另一端是 PIN-WM/GaussTwin/Embodied Gaussians 这类把物理约束明确写入状态转移的系统。下一阶段的关键不是继续增加渲染保真度,而是建立接触可观测、未来有不确定性、动作可反事实比较、算力可复现的闭环评价体系。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐