GaussianWAM:将三维高斯场中的几何和语义提炼到世界-行动模型中
26年8月来自Tuojing Intelligence、中科院大学、自动化所、清华大学、深朴智能、哈工大(深圳)、上海交大、浙大、清华AIR研究所和港大的论文“GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models”。
世界-动作模型(WAM)利用视频动态作为表征学习信号,联合学习未来的视觉预测和动作生成,用于机器人操作。然而,它们的视频潜信息主要针对视觉预测进行优化,并未明确鼓励保留跨视角几何结构或空间局部化的、与对象相关的语义信息。GaussianWAM,一个训练时表征增强框架,它通过三维高斯场组织几何和语义监督。给定同步的多视角观测,冻结几何和视觉基础模型提供深度、相机参数和密集语义特征。GaussianWAM 将这些异构信号绑定到共享的高斯基元,并渲染空间对齐的语义、深度和覆盖目标,这些目标被提炼到 WAM 的当前观测表征中。训练完成后,所有教师模型、高斯分量和辅助预测头都会被移除,从而保留原始的 WAM 推理路径,无需额外的模块或前向计算。
近年来,世界-动作模型(WAM)和视频动作模型为机器人控制引入了一种新的建模范式。与主要直接从当前观测数据预测机器人动作的传统视觉-语言-动作(VLA)模型(Brohan et al., 2022; Kim et al., 2024)不同,WAM利用视频生成模型学习到的时间动态和隐物理先验信息,联合学习未来的视觉动态和动作生成(Ye et al., 2026b)。如图1所示,这种范式超越纯粹的被动式动作预测,并将未来场景的演变作为额外的表征学习信号。从这个意义上讲,未来预测不仅是视觉生成的目标,也是动作生成的时间监督。

尽管取得了这些进展,但现有WAM学习的视频潜表征主要针对视觉重建或预测进行优化,并未明确约束以保持跨视角几何结构。大多数WAM主要在RGB图像空间或二维视频潜空间中对世界进行建模。虽然此类表征能够有效地捕捉外观变化、运动连续性和隐动态,但视觉一致性并不一定意味着几何可靠性。机器人操作本质上发生在三维空间中,精确控制需要对场景几何形状和物体间的空间关系有可靠的理解。因此,仅通过RGB重建或视频预测学习到的潜表征可能在几何约束方面不足,从而限制WAM在精确空间交互和动作生成方面的能力(Li et al., 2026b; Zhang et al., 2026; Ma et al., 2026; Yan et al., 2026; Zhao et al., 2026; Yuan et al., 2026a; Yang et al., 2026)。
此外,WAM视频潜表征并未针对保留空间局部化的、与物体相关的语义信息进行显式优化。尽管语言指令可以影响视频生成和动作预测,但这种影响并不一定能确保视觉token始终与任务相关的物体及其空间位置相对应。换句话说,任务层面的语言条件反射并不一定能转化为视觉潜空间中与物体相关的语义结构。视觉基础模型,例如 CLIP(Radford ,2021)、DINO(Oquab ,2023)和 SAM(Kirillov ,2023),提供了丰富的对象和区域级语义先验信息;而几何基础模型,例如 VGGT(Wang ,2025),则提供了深度和相机线索。因此,用于机器人操作的有效 WAM 表示不仅应捕捉对象在三维空间中的位置,还应捕捉相应视觉区域所代表的内容。
一个看似简单的解决方案是将来自多个预训练教师模型的几何和语义知识提炼到 WAM 主干模型中,或者显式地将 WAM 扩展到三维/四维世界建模(Guo ,2026;Li ,2026b)。然而,这两种方法都存在重要的局限性。独立的几何和语义教师模型通常会在不同的表示空间、视角和置信度下产生异构特征。因此,应用单独的特征损失会将几何和语义视为彼此独立的监督信号,缺乏一个共享的空间载体,无法在不同视图中将语义信息与相同的物理三维结构一致地关联起来。另一方面,显式的三维/四维世界模型通常需要额外的三维编码器、解码器、渲染模块、几何标注或未来的三维扩展,这会增加训练复杂度和推理成本。这些限制引出了两个关键问题:1)如何将异构的几何和语义知识统一为一个空间连贯的表示,用于广义世界模型(WAM)?以及,2)能否在不牺牲原始策略推理效率的前提下引入这种结构化监督?
1 概述
GaussianWAM,是一个用于世界动作模型的通用训练时三维高斯增强框架。如图 2 所示,GaussianWAM 首先基于当前的多视图观测构建一个离线三维高斯教师模型。该高斯场提供一个统一的空间表示,它结合了三维几何、视觉语义特征和渲染得到的覆盖信息。这些信号被渲染到与 WAM 视觉表示对齐的空间网格上,并在策略训练过程中被提炼成与动作相关的视觉表示。

高斯教师模型仅在训练阶段使用。在推理阶段,所有基础模型教师模型、高斯构建和渲染模块以及辅助预测头都会被移除。因此,增强后的策略与原始 WAM 遵循完全相同的前向传播路径。在 FastWAM 风格的双专家 MoT 架构(Yuan,2026b)和 Cosmos-Policy 风格的统一 DiT 架构(Kim,2026)上实例化 GaussianWAM。
2 高斯教师模型构建
对于每个训练样本,从同步的多视图观测数据 {Iv} 构建一个密集的 3D 高斯教师模型。该教师模型仅以视觉观测数据作为输入,而语言指令和本体感觉状态仍然是策略的输入。
几何提取。采用冻结几何基础模型 VGGT-Omega(Wang,2025)来估计密集深度、深度置信度和相机参数。对于每个视图,估计的深度图和置信度图被调整到相同的 14 × 14 教师网格,相机内参也相应地进行缩放。无效或低置信度的估计值被过滤掉,以获得几何有效的掩码 Mgeo_v。然后,使用相应的深度和相机参数将剩余的有效像素反投影到 3D 空间。
视觉语义特征提取。还使用冻结的 CLIP 图像编码器(Radford,2021)提取密集视觉语义特征。具体来说,在所有实验中都使用 CLIP ViT-B/16。
图像块(patch)tokens被重塑为空间特征图,并调整大小到相同的教师网格。生成的 CLIP 特征被投影到 64 维表示,从而为每个视图生成 Fsem_v。通过将几何线索和视觉语义特征放置在同一个空间网格上,在将它们提升到高斯场之前,将这两种类型的信息关联到相应的图像位置。在实现中使用 CLIP,而相同的构造原则上与其他密集视觉基础编码器兼容,例如 DINO(Oquab,2023)或 SAM(Kirillov,2023)。
高斯场初始化。利用几何有效的 3D 点,初始化高斯场 G = {g_i}。在教师网格上采用空间步长为 1 的密集初始化,使得每个几何有效的位置都初始化一个高斯图元。这种构造将显式的 3D 几何信息和视觉语义信息绑定到同一 3D 坐标系中的相同高斯图元上。
多视图高斯拟合。用可微分的深度感知高斯渲染器 R 将高斯场渲染到每个观测到的相机视图中。投影的高斯贡献被聚合以获得渲染的特征图和深度图,而它们的累积权重定义覆盖图 ˆAv。
用以下公式联合优化所有观测视图上的高斯场:
L_fit = λ_s Lfit_sem + λ_d Lfit_depth + λ_c L_cov + L_reg ,
其中,Lfit_sem 使用余弦距离将 ˆFv 与 Fv_sem 对齐,Lfit_depth 使用 l1 损失将 ˆDv 与 Dv 对齐。覆盖率目标 L_cov 鼓励在几何有效位置实现高高斯覆盖率,同时抑制有效区域之外的虚假覆盖。L_reg 表示对高斯参数的轻量级正则化,包括尺度正则化以及对过度中心漂移的惩罚,并在优化时惩罚语义特征与其初始化值的偏差。拟合阶段优化所选的高斯参数,包括它们的中心、旋转、尺度和不透明度,语义特征可以在拟合过程中选择性地进行细化。每个样本的高斯场都针对 Nfit 迭代进行优化,其中 N_fit = 50。
离线教师缓存。拟合完成后,渲染优化后的高斯场并存储 T = {T_sem, T_depth, T_α, T_valid}。其中,T_sem 是从优化的高斯场渲染的视觉语义特征图,T_depth 是渲染的深度,T_α 表示累积的高斯覆盖率。T_valid 是最终的有效掩码,定义为
T_valid = M_geo ∩ M_render
对于联合处理多个摄像头视图的 WAM,每个视图渲染的目标会根据策略表示所使用的多视图空间布局进一步调整大小和组合。生成的语义图、深度图、透明度图和有效性图会被离线缓存,并在策略训练期间直接重用,从而避免重复进行基础模型推理和高斯拟合。
3 高斯蒸馏
GaussianWAM 将缓存的高斯表示蒸馏成 WAM 的内部视觉表示。高斯蒸馏的目标是 L_G = λ_sem L_sem + λ_depth L_depth + λ_α L_α,其中所有损失仅在 T_valid 上进行评估。
高斯教师模型和辅助预测头仅在训练阶段使用。在推理阶段,它们会被完全移除,从而保持原始WAM前向路径和推理代价不变。
4 FastWAM 式双-专家 MoT
FastWAM 式模型(Yuan,2026b)采用独立的视频专家和动作专家,并通过 Mixture-of-Transformer (MoT) 架构耦合。视频专家维护视觉世界表示,动作专家通过 MoT 交互访问该表示。因此,对最终层的视频表示应用高斯蒸馏。
令 LL_cur 表示对应于当前视觉观测的最终层隐tokens,HL_vid 表示最终层的视频隐状态。选择对应于当前视觉观测的空间tokens:HL_cur = Select_cur (HL_vid ),根据视觉token网格恢复它们的空间组织,并应用之前定义的高斯蒸馏目标。
通过 MoT 交互,经过几何和语义增强的视频表示可以直接提供给动作专家。因此,高斯监督可以在不引入额外的动作路径或修改原始 FastWAM 推理过程的情况下影响动作学习。
5. Cosmos-Policy 风格的统一 DiT
Cosmos-Policy 风格的模型(Kim,2026)在一个统一的扩散 Transformer 中处理视觉观测、世界相关变量和动作相关tokens。由于没有单独的视频专家,高斯蒸馏直接应用于与当前视觉观测对应的最终层隐tokens。
令 HL 表示 Transformer 的最终隐状态。提取当前观测tokens HL_cur = Select_cur (HL),恢复它们的空间组织,并应用相同的高斯蒸馏机制。
由于这些视觉tokens属于共享的 Transformer 主干网络,高斯监督直接塑造世界建模和动作建模共享的潜表示。与 FastWAM 类似,所有与高斯相关的模块在训练后都会被移除,从而保留原始的 Cosmos Policy 推理路径。
实验设置
基准测试。在 LIBERO (Liu et al., 2024)、LIBERO-Plus (Fei et al., 2025)、RoboTwin 和真实世界的机器人操作任务上评估 GaussianWAM。LIBERO 评估标准的语言条件化操作,而 LIBERO-Plus 则在相机视角、机器人外观、语言指令、光照、背景、视觉噪声和场景布局等方面引入多种分布变化。RoboTwin 是一个双手操作基准测试,分别在 Clean 和 Random 设置下进行评估,其中 Random 设置引入更强的场景和视觉随机化,以测试其在分布变化下的鲁棒性。真实世界实验进一步评估学习的表征改进是否能够迁移到模拟环境之外。以任务成功率 (%) 作为主要评估指标。
骨干网络和训练。在两种具有代表性的WAM架构上实例化GaussianWAM:基于双-专家混合Transformer(MoT)架构的FastWAM(Yuan,2026b)和基于统一扩散Transformer的Cosmos Policy(Kim,2026)。对于这两种架构,都对对应于当前观测值的最后一层视觉表示应用高斯蒸馏。
对于FastWAM,在8个NVIDIA A100 GPU上训练基线模型及其GaussianWAM变体,训练7万个优化步骤,每个GPU的批大小为2,梯度累积2步,有效批大小为32。用1 × 10⁻⁴的学习率(余弦衰减)和1 × 10⁻²的权重衰减。高斯蒸馏损失的权重分别为 λ_sem = 0.01、λ_depth = 0.01 和 λ_α = 0.005。
对于 Cosmos Policy,用 8 个 GPU,局部批大小为 30,梯度累积 8 步,有效批大小为 1920,遵循其 LIBERO 训练配置。基线模型及其 GaussianWAM 变体均训练 5000 次迭代。对于每个骨干网络,基线模型和 GaussianWAM 变体使用相同的训练数据、骨干网络配置和优化预算,仅在训练过程中引入高斯蒸馏。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)