写在前面:此博客为3DGS & 世界模型方向论文工作介绍(暂未开通新的GitHub仓库)。如果想了解此前关于3DGS的加速压缩新工作,可以关注笔者的Github仓库:Awesome-3DGS-Compress-Accelerate

一、论文简介 🌟

1.1 基本信息

  • 📖 题目:GWM: Towards Scalable Gaussian World Models for Robotic Manipulation
  • 🏫 单位: Tsinghua University;BIGAI;Nanyang Technological University
  • 🌍 主页:https://gaussian-world-model.github.io
  • 🀄️ 论文摘要:在学习到的世界模型中训练机器人策略正逐渐受到关注,因为真实世界交互效率低下。已有的基于图像的世界模型和策略已经取得了一定成功,但缺乏稳健的几何信息,因此难以保持对三维世界的一致空间理解和物理理解,即使这些模型已经在互联网规模的视频数据上进行了预训练。为此,论文提出一种面向机器人操作的新型世界模型分支,即高斯世界模型。该模型通过推断机器人动作作用下高斯基元的传播过程,重建未来状态。其核心是将潜空间扩散Transformer与3D变分自编码器相结合,从而基于高斯溅射实现细粒度的场景级未来状态重建。高斯世界模型不仅能够通过自监督未来预测训练增强模仿学习智能体的视觉表示,还能够作为神经模拟器支持基于模型的强化学习。仿真环境和真实世界实验均表明,高斯世界模型可以在不同机器人动作条件下准确预测未来场景,并进一步用于训练策略,使其以显著幅度超过现有最先进方法。这些结果展示了3D世界模型在数据规模扩展方面的潜力。

在这里插入图片描述
图1。高斯世界模型是一类用于机器人操作的新型世界模型。该模型基于3D高斯泼贱表示,通过预测动态未来状态实现机器人操作。它能够支持动作条件3D视频预测,增强模仿学习中的视觉表示学习,并作为稳健的神经模拟器用于基于模型的强化学习。

1.2 论文引言 & 主要贡献

  人类能够根据有限的感知输入构建预测性的世界模型,从而预判未来结果并适应新的情境。受这一能力启发,世界模型学习已经推动智能体取得了重要进展,应用领域包括自动驾驶和游戏智能体。随着智能体越来越多地与物理世界交互,面向机器人操作发展世界模型成为一个重要研究方向,因为理想的世界模型能够帮助机器人理解交互过程、预测物理动力学,并适应各种未见过的环境。

  因此,一个自然的问题是:如何有效表示、构建并利用世界模型来增强机器人操作?这一需求给现有表示和模型带来了若干挑战。

  3D表示的必要性(Necessity of 3D Representation) 高容量架构和互联网规模的预训练已经使基于视频的生成模型成为捕获世界动态信息的强大工具,并显著增强了策略学习。然而,由于这类模型依赖图像输入,因此容易受到未见视觉变化的影响,例如光照、相机位姿和纹理变化。这是因为它们缺少三维几何和空间理解能力。尽管RGB-D和多视角设置试图缓解这一问题,但要将图像块特征隐式对齐到一致的三维空间中仍然十分困难,因此鲁棒性问题依然存在。这说明机器人操作需要一种能够融合精细视觉细节与三维空间信息的表示。

  效率与可扩展性(Efficiency and Scalability) 为了寻找一种同时保留三维几何结构和二维图像精细视觉细节的三维表示,多视角三维重建方法,例如神经辐射场和3D高斯溅射,提供了自然的解决方案。其中,3D高斯溅射尤其具有吸引力。它对每个高斯进行显式三维建模,在高保真渲染的同时保留了点云等高效三维表示的优点。然而,这些方法通常依赖离线的逐场景重建,其计算需求给机器人操作中的应用带来了巨大挑战,尤其是在基于模型的强化学习中,从而限制了其可扩展性。

  为此,论文提出高斯世界模型,一种将3D高斯溅射与高容量生成模型相结合的三维世界模型,用于机器人操作。具体而言,论文结合前馈式3D高斯重建方法与扩散Transformer,使模型能够在当前观测和机器人动作的条件下,通过高斯渲染重建细粒度的未来场景。为了实现实时训练和推理,论文设计了3D高斯变分自编码器,用于从3D高斯中提取潜表示,使基于扩散的世界模型能够在紧凑的潜空间中高效运行。基于这一设计,论文证明高斯世界模型能够增强视觉表示学习,在模仿学习中充当视觉编码器,同时也能够作为稳健的神经模拟器服务于基于模型的强化学习。

  为了全面评估高斯世界模型,论文在动作条件视频预测、模仿学习和基于模型的强化学习设置下进行了大量实验,覆盖三个领域中的31项不同机器人任务。在真实世界评估中,论文引入了包含20种变化的Franka PnP任务套件,其中包括域内和域外设置。在消融实验中,论文同时评估感知指标和成功率,以验证各个构建模块的有效性。高斯世界模型始终优于包括最先进图像世界模型在内的已有基线,表现出显著优势,并体现出良好的数据规模扩展潜力。

  论文的主要贡献包括三点。

  • 第一,论文提出高斯世界模型,一种由高斯扩散Transformer和高斯变分自编码器构成的新型三维世界模型。该模型能够以可扩展的端到端方式,在无需人工干预的情况下学习预测准确的未来状态和动态。

  • 第二,高斯世界模型能够方便地集成到离线模仿学习和在线强化学习中,并在学习型机器人操作任务中表现出更高的效率和更好的性能。

  • 第三,论文在两个具有挑战性的仿真环境中进行了广泛实验。相较于此前的最先进方法,论文将性能平均提升了16.25%。此外,真实世界实验表明,在20次试验中,高斯世界模型能够使典型扩散策略的性能提升30%。

  

  

二、方法论 🍀

  论文的整体流程如图2所示。论文构建了一个高斯世界模型,用于推断由3D高斯基元表示的未来场景重建结果。具体而言,论文首先将真实世界视觉输入编码为潜在的3D高斯表示,然后利用基于扩散的条件生成模型,在给定机器人状态和动作的情况下学习这些表示的动态。论文进一步证明,高斯世界模型能够灵活集成到离线模仿学习和在线基于模型的强化学习中,用于多种机器人操作任务。

在这里插入图片描述

图 2。GWM 的整体流程,主要由一个 3D 变分编码器和一个潜在扩散 Transformer 组成。3D 变分编码器将基础重建模型估计得到的 Gaussian Splats 嵌入到紧凑的潜在空间中,扩散 Transformer 则在潜在图块上运行,并以机器人动作和去噪时间步为条件,交互式地想象未来的 Gaussian Splats。

  

2.1 世界状态编码(World State Encoding)

  前馈式3D高斯溅射(Feed-forward 3D Gaussian Splatting) 给定一个世界状态的单视图或双视图图像输入 I = { I i } i = 1 , 2 I=\{I_i\}_{i=1,2} I={Ii}i=1,2,目标是首先将场景编码为3D高斯表示,用于动态学习和预测。3D高斯溅射使用多个无结构的3D高斯核表示三维场景: G = { x p , σ p , Σ p , C p } p ∈ P G=\{x_p,\sigma_p,\Sigma_p,C_p\}_{p\in P} G={xp,σp,Σp,Cp}pP, 其中, x p x_p xp σ p \sigma_p σp Σ p \Sigma_p Σp C p C_p Cp分别表示高斯基元的中心、透明度、协方差矩阵和球谐系数。为了从给定视点获得每个像素的颜色,3D高斯溅射将3D高斯投影到图像平面,并计算像素颜色:

C ( G ) = ∑ p ∈ P α p S H ( d p ; C p ) ∏ j = 1 p − 1 ( 1 − α j ) ( 1 ) C(G)=\sum_{p\in P}\alpha_p SH(d_p;C_p)\prod_{j=1}^{p-1}(1-\alpha_j) \quad(1) C(G)=pPαpSH(dp;Cp)j=1p1(1αj)(1)

  其中, α p \alpha_p αp表示按照 z z z轴深度排序后的有效透明度,即由 Σ p \Sigma_p Σp 导出的二维高斯权重与整体透明度 σ p \sigma_p σp 的乘积; d p d_p dp 表示从相机指向 x p x_p xp 的视线方向; S H ( ⋅ ) SH(\cdot) SH() 表示球谐函数。由于原始3D高斯溅射依赖耗时的逐场景离线优化,论文采用可泛化的3D高斯溅射方法,学习从图像到3D高斯的前馈映射,以加速该过程。具体而言,论文使用Splatt3R获得3D高斯世界状态。Splatt3R首先利用MASt3R立体重建模型从输入图像中生成3D点图,然后通过额外的预测头,根据这些点图预测每个3D高斯的参数。

  3D高斯变分自编码器(3D Gaussian VAE) 由于不同场景和任务中学习到的3D高斯数量可能存在显著差异,论文采用3D高斯变分自编码器 ( E θ , D θ ) (E_\theta,D_\theta) (Eθ,Dθ),将重建得到的3D高斯 G G G 编码为固定长度的 N N N 个潜嵌入 x ∈ R N × D x\in\mathbb{R}^{N\times D} xRN×D。具体而言,论文首先通过最远点采样,将重建得到的3D高斯 G G G 下采样为固定数量的 N N N 个高斯: G N = F P S ( G ) G_N=FPS(G) GN=FPS(G)。随后,论文使用采样得到的高斯 G N G_N GN 作为查询,通过交叉注意力从所有高斯 G G G 中聚合信息,得到潜嵌入 x x x。该过程采用一个由 L L L 层交叉注意力构成的编码器 E θ E_\theta Eθ

X = E θ ( G N , G ) = E θ ( L ) ∘ ⋯ ∘ E θ ( 1 ) ( G N , G ) E θ ( l ) ( Q , G ) = L a y e r N o r m ( C r o s s A t t n ( Q , P o s E m b e d ( G ) ) ) ( 2 ) X=E_\theta(G_N,G)=E_\theta^{(L)}\circ\cdots\circ E_\theta^{(1)}(G_N,G) \\ E_\theta^{(l)}(Q,G)=LayerNorm(CrossAttn(Q,PosEmbed(G))) \quad(2) X=Eθ(GN,G)=Eθ(L)Eθ(1)(GN,G)Eθ(l)(Q,G)=LayerNorm(CrossAttn(Q,PosEmbed(G)))(2)

  给定潜编码 x x x,论文使用镜像式Transformer解码器 D θ D_\theta Dθ 传播并聚合潜代码集合中的信息,从而获得重建高斯 G ^ \hat{G} G^

G ^ = D θ ( x ) = L a y e r N o r m ( S e l f A t t n ( x , x ) ) ( 3 ) \hat{G}=D_\theta(x)=LayerNorm(SelfAttn(x,x)) \quad(3) G^=Dθ(x)=LayerNorm(SelfAttn(x,x))(3)

  为了训练3D高斯变分自编码器 ( E θ , D θ ) (E_\theta,D_\theta) (Eθ,Dθ),论文使用重建高斯 G ^ \hat{G} G^ 与原始高斯 G G G 的中心之间的Chamfer损失进行监督。论文还加入重建高斯 G ^ \hat{G} G^ 的渲染损失,以获得高保真渲染结果,从而服务于基于图像的策略:

L V A E = C h a m f e r ( G ^ , G ) + ∥ C ( G ^ ) − C ( G ) ∥ 1 ( 4 ) \mathcal{L}_{VAE}=Chamfer(\hat{G},G)+\|C(\hat{G})-C(G)\|_1 \quad(4) LVAE=Chamfer(G^,G)+C(G^)C(G)1(4)

  

3.2 基于扩散的动态建模(Diffusion-based Dynamics Modeling)

  给定时间 t t t 的编码世界状态嵌入 x t x_t xt 及其未来状态 x t + 1 x_{t+1} xt+1,目标是学习世界动态: p ( x t + 1 ∣ x ≤ t , a ≤ t ) p(x_{t+1}\mid x_{\leq t},a_{\leq t}) p(xt+1xt,at),其中, x ≤ t x_{\leq t} xt a ≤ t a_{\leq t} at 分别表示历史状态和动作。具体而言,论文采用基于扩散的动态模型,将动态学习转化为条件生成问题:在历史状态和动作的条件下,从噪声中生成未来状态 x t + 1 x_{t+1} xt+1,其中条件为: y t = ( x ≤ t , a ≤ t ) y_t=(x_{\leq t},a_{\leq t}) yt=(xt,at)

  扩散形式(Diffusion Formulation) 为了生成未来状态,论文首先定义扩散过程。具体而言,论文向真实未来状态 x t + 1 0 = x t + 1 x^0_{t+1}=x_{t+1} xt+10=xt+1中加入噪声,从而得到带噪未来状态样本 x t + 1 τ x^\tau_{t+1} xt+1τ

p 0 → τ ( x t + 1 τ ∣ x t + 1 0 ) = N ( x t + 1 τ ; x t + 1 0 , σ 2 ( τ ) I ) ( 5 ) p^{0\rightarrow\tau}(x^\tau_{t+1}\mid x^0_{t+1}) = \mathcal{N}(x^\tau_{t+1};x^0_{t+1},\sigma^2(\tau)I) \quad(5) p0τ(xt+1τxt+10)=N(xt+1τ;xt+10,σ2(τ)I)(5)

  其中, τ \tau τ表示噪声步索引, σ ( τ ) \sigma(\tau) σ(τ)表示噪声调度。该扩散过程可以表示为随机微分方程:

d x = f ( x , τ ) d τ + g ( τ ) d w ( 6 ) dx=f(x,\tau)d\tau+g(\tau)dw \quad(6) dx=f(x,τ)dτ+g(τ)dw(6)

  其中, w w w 表示标准Wiener过程, f f f 表示漂移系数, g g g 表示扩散系数。在这一形式下,扰动核的作用等价于令: f ( x , τ ) = 0 f(x,\tau)=0 f(x,τ)=0 以及: g ( τ ) = 2 σ ˙ ( τ ) σ ( τ ) g(\tau)=\sqrt{2\dot{\sigma}(\tau)\sigma(\tau)} g(τ)=2σ˙(τ)σ(τ) 。为了从噪声中生成样本,可以利用反向时间随机微分方程对式进行反向采样:

d x = [ f ( x , τ ) − g ( τ ) 2 ∇ x log ⁡ p τ ( x ) ] d τ + g ( τ ) d w ˉ ( 7 ) dx= \left[ f(x,\tau)-g(\tau)^2\nabla_x\log p_\tau(x) \right]d\tau + g(\tau)d\bar{w} \quad(7) dx=[f(x,τ)g(τ)2xlogpτ(x)]dτ+g(τ)dwˉ(7)

  其中, w ˉ \bar{w} wˉ 表示反向时间Wiener过程, ∇ x log ⁡ p τ ( x ) \nabla_x\log p_\tau(x) xlogpτ(x) 表示分数函数,即相对于 x x x 的边缘概率对数的梯度。由于分数函数可以由神经网络估计,论文通过最小化采样得到的未来状态 x ^ t + 1 0 = D θ ( x t + 1 τ , y t ) \hat{x}^0_{t+1}=D_\theta(x^\tau_{t+1},y_t) x^t+10=Dθ(xt+1τ,yt) 与真实未来状态 x t + 1 0 x^0_{t+1} xt+10 之间的差异来学习条件去噪模型 D θ D_\theta Dθ

L ( θ ) = E [ ∥ D θ ( x t + 1 τ , y t τ ) − x t + 1 0 ∥ 2 2 ] ( 8 ) \mathcal{L}(\theta) =\mathbb{E}\left[\left\|D_\theta(x^\tau_{t+1},y^\tau_t)-x^0_{t+1}\right\|_2^2\right] \quad(8) L(θ)=E[ Dθ(xt+1τ,ytτ)xt+10 22](8)

  使用EDM进行学习(Learning with EDM) 正如已有研究指出的那样,直接学习去噪器 D θ ( x t + 1 τ , y t ) D_\theta(x^\tau_{t+1},y_t) Dθ(xt+1τ,yt) 可能会受到噪声幅度变化等问题的影响。因此,论文遵循相关工作,采用EDM中的预条件方法学习网络 F θ F_\theta Fθ。论文通过以下方式对去噪器 D θ D_\theta Dθ 进行参数化:

D θ ( x t + 1 τ , y t ) = c s k i p τ x t + 1 τ + c o u t τ F θ ( c i n τ x t + 1 τ , y t ; c n o i s e τ ) ( 9 ) D_\theta(x^\tau_{t+1},y_t)=c^\tau_{skip}x^\tau_{t+1}+c^\tau_{out}F_\theta\left(c^\tau_{in}x^\tau_{t+1},y_t;c^\tau_{noise}\right) \quad(9) Dθ(xt+1τ,yt)=cskipτxt+1τ+coutτFθ(cinτxt+1τ,yt;cnoiseτ)(9)

  其中,预条件器 c i n τ c^\tau_{in} cinτ c o u t τ c^\tau_{out} coutτ分别用于缩放输入和输出幅度, c s k i p τ c^\tau_{skip} cskipτ用于调节跳跃连接, c n o i s e τ c^\tau_{noise} cnoiseτ将噪声水平映射为额外的条件输入。论文在附录B.1中给出了这些预条件器的具体细节。经过上述转换后,式(8) 的优化目标可以改写为:

L ( θ ) = E [ ∥ F θ ( c i n τ x t + 1 τ , y t τ ) − 1 c o u t τ ( x t + 1 0 − c s k i p τ x t + 1 τ ) ∥ 2 2 ] ( 10 ) \mathcal{L}(\theta)=\mathbb{E}\left[\left\|F_\theta\left(c^\tau_{in}x^\tau_{t+1},y^\tau_t\right)- \frac{1}{c^\tau_{out}}\left(x^0_{t+1}-c^\tau_{skip}x^\tau_{t+1}\right)\right\|_2^2\right] \quad(10) L(θ)=E[ Fθ(cinτxt+1τ,ytτ)coutτ1(xt+10cskipτxt+1τ) 22](10)

  这一转换的关键在于,它通过根据噪声调度自适应地混合信号与噪声,为学习网络 F θ F_\theta Fθ构造了新的训练目标。直观而言,在高噪声水平下,即 σ ( τ ) ≫ σ d a t a \sigma(\tau)\gg\sigma_{data} σ(τ)σdata 时,有: c s k i p τ → 0 c^\tau_{skip}\rightarrow 0 cskipτ0,此时网络主要学习预测干净信号。相反,在低噪声水平下,即 σ ( τ ) → 0 \sigma(\tau)\rightarrow 0 σ(τ)0时,有: c s k i p τ → 1 c^\tau_{skip}\rightarrow 1 cskipτ1,此时目标转变为噪声成分,从而避免优化目标变得过于简单。

  实施(Implementation) 在实现方面,论文使用DiT实现网络 F θ F_\theta Fθ。给定一系列真实世界状态潜嵌入 { x t 0 = x t } t = 1 T \{x^0_t=x_t\}_{t=1}^{T} {xt0=xt}t=1T,论文首先按照式生成带噪潜嵌入 { x t τ } t = 1 T \{x^\tau_t\}_{t=1}^{T} {xtτ}t=1T。随后,论文将这些带噪潜嵌入与旋转位置编码结合,并将其输入DiT。条件输入为: y t = ( x ≤ t 0 , a ≤ t , c n o i s e τ ) y_t=(x^0_{\leq t},a_{\leq t},c^\tau_{noise}) yt=(xt0,at,cnoiseτ)。时间嵌入通过自适应层归一化进行调制,当前机器人动作则作为交叉注意力层中的键和值,用于条件生成。为了在各种注意力机制中提升训练稳定性和效率,论文采用带有可学习缩放参数的均方根归一化,以稳定在处理空间表示并融合时间动作序列时的训练过程。
在这里插入图片描述

  

2.3 使用高斯世界模型进行策略学习(GWM for Policy Learning)

  高斯世界模型用于强化学习(GWM for Reinforcement Learning) 论文证明,高斯世界模型能够无缝集成到现有的基于模型的强化学习方法中。形式上,马尔可夫决策过程由以下元组定义: ( S , A , p , r , γ , ρ 0 ) (\mathcal{S},\mathcal{A},p,r,\gamma,\rho_0) (S,A,p,r,γ,ρ0)。其中, S \mathcal{S} S A \mathcal{A} A 分别表示状态空间和动作空间, γ \gamma γ 表示折扣因子, r ( s , a ) r(s,a) r(s,a) 表示奖励函数。目标是学习最大化折扣奖励总和期望的策略 π \pi π π ∗ = arg ⁡ max ⁡ π E π [ ∑ t = 0 ∞ γ t r ( s t , a t ) ] \pi^*=\arg\max_\pi\mathbb{E}_\pi\left[\sum_{t=0}^{\infty}\gamma^t r(s_t,a_t)\right] π=argmaxπEπ[t=0γtr(st,at)]。同时,利用策略轨迹构建动态模型: p θ ( s t + 1 , r t ∣ s t , a t ) p_\theta(s_{t+1},r_t\mid s_t,a_t) pθ(st+1,rtst,at)。论文在高斯世界模型上增加了一个奖励预测头,用于参数化动态模型: p θ ( s t + 1 , r t ∣ s t , a t ) p_\theta(s_{t+1},r_t\mid s_t,a_t) pθ(st+1,rtst,at)。为了提升视觉操作任务中的性能,论文根据已有研究中的设计选择构建基础强化学习策略。

  高斯世界模型用于模仿学习(GWM for Imitation Learning) 在模仿学习中,论文将高斯世界模型作为更加有效的编码器,从图像观测中提取有利于策略学习的特征。具体而言,论文使用扩散过程中的第一个去噪步骤之后的特征向量,作为下游策略模型的输入,例如行为克隆Transformer和扩散策略。第一个去噪步骤仍然包含丰富的空间信息,能够处理严重噪声水平下的观测。在实现中,论文以连续动作块的方式预测动作,以提升机器人控制的一致性。

  

2.4 结论

  论文提出了一种面向机器人操作的高斯世界模型,通过引入稳健的几何信息,解决基于图像的世界模型存在的局限性。该方法通过对机器人动作作用下高斯基元的传播过程进行建模,重建未来状态。该模型将DiT与具有三维感知能力的变分自编码器相结合,从而通过高斯溅射实现精确的场景级未来状态重建。论文还设计了一套可扩展的数据处理流程,使模型能够在基于模型的强化学习框架中进行测试时更新,并从无位姿图像中提取对齐的高斯溅射表示。仿真环境和真实世界环境中的实验均证明,高斯世界模型能够有效预测未来场景,并训练出性能更优的机器人策略。

  

三、论文实验部分 🧪

3.1 实施细节

  实验重点关注以下问题。

  • 第一,在不同领域中,动作条件视频预测结果的质量如何?
  • 第二,高斯世界模型是否能够提升下游模仿学习和强化学习的性能?相较于基于图像的世界模型,高斯世界模型是否具有更好的鲁棒性?
  • 第三,高斯世界模型能否帮助典型策略,例如扩散策略,在真实世界机器人操作任务中取得更好表现?

  论文使用以下三个测试环境和四类任务。

  环境 为了全面分析高斯世界模型的能力,论文在两个合成环境和一个真实世界环境中进行评估。

  • 第一,Meta-World,这是一个用于学习机器人操作强化学习策略的合成环境。
  • 第二,RoboCasa,这是一个大规模、多尺度的合成模仿学习基准,包含厨房环境中的多种机器人操作任务。
  • 第三,Franka-PnP,这是一个使用Franka Emika FR3机械臂构建的真实世界抓取放置环境。

  任务 论文精心设计了四类任务,以系统评估高斯世界模型在不同测试环境中的能力。

  • 第一,动作条件场景预测,用于评估高斯世界模型进行世界建模和未来预测的能力。
  • 第二,基于高斯世界模型的模仿学习,用于研究其表示质量以及对模仿学习的帮助。
  • 第三,基于高斯世界模型的强化学习,用于探索其在基于模型的强化学习中的潜力。
  • 第四,真实世界任务部署,用于评估其在真实机器人操作中的鲁棒性。

  

3.1 动作条件场景预测(Action-conditioned Scene Prediction)

  实验设置 世界模型生成高保真且与动作一致的轨迹,对于有效的策略优化至关重要。为了评估这一能力,论文在所有真实和合成环境中使用人类示范数据训练高斯世界模型,并通过验证集中的未见动作轨迹作为条件,评估未来预测质量。在定量评估中,论文采用多种常见的生成质量指标,包括用于衡量时间一致性的FVD,以及用于衡量像素级准确性的PSNR,同时还使用SSIM和LPIPS评估感知质量。

  结果与分析 论文在表1中给出了高斯世界模型与iVideoGPT之间的定量比较。结果表明,在合成环境和真实世界环境中,高斯世界模型均稳定优于当前最先进的基于图像的世界建模方法iVideoGPT,证明了基于扩散的高斯世界模型学习流程的有效性。如图3所示,基于图像的模型,例如iVideoGPT,容易在捕获动态细节时失败,例如机械夹爪的运动。尽管这些细节可能不会导致视觉指标出现很大差异,但它们会显著影响策略学习,后文将进一步讨论这一点。

在这里插入图片描述

  

3.2 基于高斯世界模型的模仿学习

  实验设置 如第2.3节所述,高斯世界模型能够从图像观测中提取信息更加丰富的表示,这预计能够提升模仿学习性能。论文在RoboCasa上测试高斯世界模型在模仿学习中的有效性。RoboCasa任务套件包含24项原子任务,并为厨房环境中的任务提供相关语言指令,包括抓取放置、打开和关闭等动作。每项任务包含50条人类示范,以及由MimicGen生成的3000条示范。论文在这些示范上训练高斯世界模型,并将其作为状态编码输入最先进的行为克隆Transformer,以在成功率指标上进行定量比较。

  结果与分析 论文在表2中给出了RoboCasa基准上的结果,结果展示了高斯世界模型在多任务模仿学习场景中的有效性。在24项厨房操作任务中,论文的方法始终优于行为克隆Transformer基线。在人类示范数量有限的H-50设置下,论文的方法使平均成功率提升10.5%。在使用生成示范的G-3000设置下,论文的方法仍然保持可扩展性能,平均提升7.6%。值得注意的是,论文的方法在复杂操作任务,例如抓取放置,以及打开和关闭设备等交互式任务上尤其具有优势,性能提升最为显著。这些结果证明,高斯世界模型能够从视觉观测中提取信息丰富的表示,并有效增强实际机器人操作中的模仿学习能力。

在这里插入图片描述

3.3 基于高斯世界模型的强化学习

  实验设置 论文在六项复杂程度逐渐增加的Meta-World机器人操作任务上评估高斯世界模型用于强化学习策略的能力。论文实现了一种受MBPO启发的基于模型的强化学习方法,使用高斯世界模型生成合成轨迹,并将其加入DrQ-v2演员—评论家算法的回放缓冲区中。论文将最先进的基于图像的世界模型iVideoGPT作为强基线。为了保证公平比较,两种方法均不使用预训练初始化。所有比较方法使用相同的上下文长度和预测范围,并且最多训练 1 × 10 5 1\times10^5 1×105步。

  结果与分析 图5展示了高斯世界模型和iVideoGPT在Meta-World上的结果。高斯世界模型在全部六项任务中均稳定优于iVideoGPT。平均而言,高斯世界模型的收敛速度约为iVideoGPT的两倍,并且在复杂操作任务上达到了更高的渐近性能。这一性能优势源于高斯世界模型的3D高斯表示。相较于纯图像方法,该表示能够更加准确地预测机器人操作过程中的接触动态和物体运动。结果证明,在需要精确空间推理的机器人控制任务中,显式三维表示能够带来显著优势。图5。高斯世界模型与iVideoGPT在Meta-World上的基于模型的强化学习结果。阴影区域表示三个随机种子下的95%置信区间。每个数据点均通过20个回合进行评估。

在这里插入图片描述

4.4 真实世界部署

  实验设置 论文使用Franka Emika FR3机械臂和Panda夹爪进行真实机器人实验。实验聚焦于一个真实世界任务:抓取一个彩色杯子,并将其放置到桌面上的盘子中。论文通过MuJoCo AR远程操作接口采集了少量数据,共包含30条示范。实验设置了一个位于第三视角的Realsense D435i相机,为机器人提供无位姿RGB图像观测。图6展示了真实世界任务设置。与第4.2节的实验设置类似,论文比较了最先进的基于RGB图像的扩散策略在是否使用高斯世界模型表示时的任务成功率。

  结果与分析 如表3所示,在20次包含不同初始位置和物体位置的试验中,高斯世界模型的成功率为65%,而扩散策略的成功率为35%。对于新的干扰物,高斯世界模型与扩散策略之间的性能差距进一步扩大。由于高斯世界模型能够捕获与任务相关的动态,同时对视觉差异保持鲁棒性,论文的方法在不同任务变化下保持了稳定性能。真实世界轨迹显示,性能优势主要来自更加精确的物体定位和更加准确的放置操作。这些结果证明,高斯世界模型在真实世界机器人操作任务中具备稳健的时空理解能力。

在这里插入图片描述

  

3.5 消融分析

  论文在RoboCasa上进一步进行实验,以验证设计选择。

  • 高斯溅射的选择 如表4所示,与直接使用扩散Transformer构建基于图像的世界模型相比,引入高斯溅射后,模仿学习成功率从4%显著提升至18%。虽然PSNR略有下降,但SSIM和LPIPS指标均得到改善,这说明高斯溅射能够在不同时间步之间提供更好的三维一致性。这一结果验证了论文的假设:与纯二维方法相比,显式三维表示能够增强机器人学习中的空间理解能力。
  • 3D高斯变分自编码器的选择 进一步加入3D高斯变分自编码器后,所有指标均得到稳定改善,包括PSNR。成功率也从18%进一步提升至24%。这些结果证明,3D高斯变分自编码器能够高效捕获场景的潜在结构,在保持空间理解能力的同时,提供更加紧凑的场景表示。

在这里插入图片描述

四、论文代码解读 💻

  代码尚未开源,待补充。

  

写在最后

  由于笔者🖊️精力有限且本文更多的目的是通过📒博客记录学习过程并分享更多知识,因此文中部分描述不太具体,如有不太理解💫的地方可在评论区👀留言。非特殊赶deadline⏰或假期⛱️期间,笔者会经常上线回复💬。如有不便之处,请海涵~

  如果想了解更多关于3DGS的加速⏰压缩⚡️新工作,可以关注笔者的Github仓库:Awesome-3DGS-Compress-Accelerate

  另外,创造不易,转载请注明出处💗💗💗~

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐