PAIWorld:面向机器人操作的 3D 一致性世界基础模型
26年6月来自中科院的工业AI研究所的论文“PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation”。
世界基础模型(WFMs)已成为物理环境的强大模拟器,但它们主要在单视角环境下运行,缺乏机器人操作任务所需的多视角三维一致性。机器人系统本质上依赖多个摄像头(包括第一人称视角、手眼视角和腕部安装视角)来获取互补的视点,从而进行策略学习。然而,现有的多视角世界模型往往只是简单地拼接视角 Token,而缺乏显式的几何推理,导致出现跨视角的物体漂移、深度不一致和纹理错位等问题,并将这些误差传递给下游的规划与控制环节。这些失效归因于两个根本缺陷:(1) 缺乏显式的跨视角通信机制,迫使各视角独立生成;(2) 缺乏三维几何先验,导致模型无法获知何为物理上正确的跨视角结构。解决这两个问题既是必要的也是充分的:跨视角的通信通路与引导该通路的几何信号必须协同工作——因为缺乏几何引导的通信会退化为简单的捷径学习,而缺乏跨视角通路的几何先验则无法在不同视角间传递约束。基于此分析,提出 PAIWorld 框架,通过三个核心组件,在两个技术维度上增强基于 Diffusion-Transformer 的世界模型。为了构建跨视角通信通路,“几何-觉察跨视角注意”(Geometry-Aware Cross-View Attention)模块建立显式的跨视角交互路径,同时“几何旋转的位置编码”(Geometric Rotary Position Embedding)利用旋转位置编码技术,将相机射线方向和外参位姿信息融入注意机制中。为了提供几何学习信号,“潜三维 REPA”(Latent 3D-REPA)从冻结的三维基础模型中提取具备三维-觉察能力的特征,确保交互内容保持三维一致性。PAIWorld 基于 DiT 架构的世界基础模型构建,在机器人操作基准测试中实现了业界领先的多视角三维一致性。
如图1所示:

1 面向物理AI的世界基础模型
学习环境内部模型(通常称为“世界模型”)的概念在强化学习和认知科学领域由来已久 [1]。早期的研究方法(如 Dreamer [2] 和 DayDreamer [10])学习紧凑的潜状态动力学模型,通过“想象”出的轨迹推演(imagined rollouts)实现规划,从而证明了基于模型学习在物理机器人控制中的可行性。近期,大规模生成模型的成功推动了范式向“世界基础模型”(WFMs)的转变,这些模型直接在像素或视频空间进行操作。
Sora [5] 展示了视频扩散模型能够生成在时间上连贯且符合物理规律的视觉模拟。Cosmos 平台 [3] 进一步确立了这一方向,通过在互联网规模的数据上训练基于 DiT [14] 的视频生成模型来服务于物理AI应用;而 Cosmos 3 [4] 则将其扩展为一个全模态框架,统一了语言、图像、视频、音频和动作等多种模态。CogVideoX [6]、HunyuanVideo [8]、Stable Video Diffusion [25] 和 Wan [9] 在多个领域实现了高保真视频生成。DIAMOND [26] 证明了基于扩散的世界模型能够捕捉对决策至关重要的精细视觉细节。Pelican-Unified [15] 倡导一种统一范式,将世界建模与理解、推理及动作执行相结合,以实现具身智能。然而,这些模型本质上是单视角的:它们生成单一连贯的视频流,但缺乏确保多视角一致性的显式机制。
交互式世界模型是另一个重要方向。UniSim [27] 利用多样化数据源学习真实世界模拟器;Genie [20] 和 Genie 2 [28] 实现了基于单张图像的交互式环境生成;iVideoGPT [21] 将自回归世界模型扩展到了复杂环境。在机器人操作领域,GR-2 [29] 构建了一个融合网络规模知识的生成式视频-语言-动作模型;IRASim [30] 利用真实机器人数据学习动作条件下的视频模拟器;EnerVerse [31] 构想了用于操作规划的具身未来空间;LaDi-WM [13] 则采用基于潜在扩散的世界模型来实现预测性操作。 AgiBot World [32] 提供了一个大规模多视角操作平台,而 WorldArena [33] 则为评估具身世界模型提供了一个统一的基准。尽管其中一些系统通过 Token 拼接(token concatenation)支持多视角,但没有一个系统引入显式的跨视角几何推理;对于机器人应用而言,这是一个关键局限,因为 3D 一致性直接决定了策略的质量。
2 多视角与具备 3D -觉察能力的视觉生成
在基于单张图像进行 3D 内容生成的背景下,多视角生成已得到广泛研究。Zero-1-to-3 [34] 通过利用相对相机变换微调 2D 扩散模型,开创了视点条件扩散(viewpoint-conditioned diffusion)的先河。SyncDreamer [35] 引入了结合 3D 感知注意力机制的同步多视角去噪方法,以确保生成视角间的几何一致性。MVDream [36] 将多视角扩散扩展到了文本条件下的 3D 生成,而 MVDiffusion [37] 则通过引入对应关系感知注意力机制(correspondence-aware attention),实现了整体性的多视角图像生成。SV3D [38] 利用潜视频扩散(latent video diffusion)进行环绕式多视角合成,SV4D [39] 进一步将其扩展至动态 3D 内容,同时保持了多帧与多视角的一致性。CAT3D [40] 证明了多视角扩散模型能够根据任意输入生成高质量的 3D 资产。
PAIWorld与上述研究在三个方面存在差异,这些差异共同界定了一个上述方法未曾涉足的领域。首先是场景范围:上述方法以物体为中心,在干净背景下生成单个前景物体的视图;而机器人操作则需要对包含机械臂、物体及动态背景的复杂场景进行建模。其次是动态特性:上述方法合成的是静态物体或短程环绕轨迹,而世界模型必须能够推演由文本或动作驱动的、随时间演变的动态过程。最后是相机配置:上述方法假设围绕物体存在密集且平滑变化的视点,而机器人系统通常仅配备少量固定且基线较宽(wide-baseline)的相机(如第一人称视角、手眼视角、腕部视角),这些视点间的重叠区域极小,使得隐式对应关系学习变得异常困难。 PAIWorld 专为这种动态、宽基线、场景级的生成场景而设计;它通过显式通信路径和 3D 监督目标来引入几何信息,而非依赖密集的视点采样。
CameraCtrl [23] 探索了视频生成中的相机控制技术,该方法利用 Plücker 射线坐标表示相机位姿,并将其注入视频扩散模型中。ViewCrafter [41] 进一步优化了视频扩散模型,以实现高保真的新视点合成。这些研究为感知相机的生成技术奠定了基础,但它们主要侧重于单视点下的相机轨迹控制,而非多视点一致性。
3 三维表征与几何重建
几何三维视觉领域的最新进展为评估和强制实现三维一致性提供了强有力的工具。神经辐射场(NeRF)[42] 和三维高斯溅射(3D Gaussian Splatting)[43] 为可微三维场景表征奠定了基础。DUSt3R [44] 及其后续版本 MASt3R [45] 能够学习从图像对中预测稠密三维点图,且无需预先获知相机参数,从而实现了跨视图几何一致性的直接度量。Depth Anything 系列 [46–48] 为单目深度估计提供了基础模型,通过大规模训练捕捉到了鲁棒的三维感知特征。VGGT [49] 进一步推动了这一方向的发展,它将视觉几何构建于统一的 Transformer 架构之上,能够从任意图像集合中联合预测相机位姿、深度及三维点图。这些模型编码了丰富的几何先验信息,可作为追求三维一致性的世界模型的监督目标。
REPA 框架 [24] 提出了将扩散 Transformer 的中间表征与预训练编码器表征进行对齐的理念,证明了该方法能加速训练并提升图像扩散生成的质量。PAIWorld定义的 Latent 3D-REPA 将这一原理从二维图像生成扩展到了多视图视频世界模型,利用 Depth Anything 3 提取的三维感知特征作为对齐目标,从而将几何一致性直接注入到扩散过程中。
4 提出的PAIWorld
PAIWorld 是一个基于两个技术支柱(架构通信路径和几何训练目标)构建的框架,由 DiT 主干上的三个轻量级模块化组件实现(图 2所示)。第一个支柱,即视图间路径,由两个协作组件实现:在 DiT 内交错的几何-觉察跨视图注意((Cross-View Attention) )块,为视点交换特征打开路径,而共享的几何旋转位置嵌入 (Geo-RoPE) 通过旋转位置编码将摄像机光线方向和外在姿势编码到此注意中 [22, 23],使路径沿着几何对应tokens去路由(route)信息。第二个支柱,即几何目标,由Latent 3D-REPA 实现,它将中间 DiT 特征与从冻结 3D 基础模型中提取的 3D -觉察表示对齐,这些模型在显式 3D 几何监督下进行训练,从而通过 REPA 框架 [24] 编码真正的 3D 结构,提供使交换内容 3D 一致的监督信号。简而言之,几何-觉察的跨视图注意和 Geo-RoPE 让几何信息跨视图流动,而 Latent 3D-REPA 则监督该信息保持 3D 一致,因此只有它们的组合才能产生连贯的多视图 3D 结构。
1 问题表述
考虑一个配备 V 个摄像头的机器人操作系统,每个摄像头提供一路视频流。在时间步 t,系统观测到一组图像 {I_tv},以及相应的相机内参 {Kv} 和外参 {[Rv | tv]} ∈ SE(3)。给定条件信号 c(文本描述或动作序列)和上下文帧 {I_1V},多视图视频生成的目标是对条件分布进行建模。
除了单视图层面的保真度外,生成的多视图视频还必须满足多视图三维一致性要求:即在每一时间步,各视图应当能够对应于一个连贯的三维场景表征。形式化而言,这意味着存在一个一致的三维场景 S_t,使得所有视图 I_tv 均可通过在各自相机位姿下渲染 S_t 得到;等价地说,不同视图中对应于同一三维位置的点必须符合底层的对极几何约束。现有的单视图模型及简单的平面拼接(flat-concatenation)模型均无法满足这一要求,而这正是设计方案两大核心支柱的立足点。
2 用于视频生成的 Flow Matching DiT
采用一种基于 Flow Matching 目标 [50, 51] 训练的 Diffusion Transformer (DiT) [14],该模型在预训练视频 VAE 的潜空间中运行。参考 Wan2.1 [9] 的做法,利用其时空 VAE 将每个视频在空间和时间维度上压缩为紧凑的潜表示;这大幅减少 Token 数量,从而使得多视角视频建模变得可行。对于输入的视频,VAE 编码器会生成一个潜表示 z_0。模型学习一个速度场 u_theta(z_s, s),该速度场沿线性插值路径将样本从噪声分布输运至数据分布。目标函数L_diff 是最小化速度预测的损失。
条件信号注入。条件信号 c 通过自适应层归一化(AdaLN)[14] 注入到每个 DiT 块中。对于文本条件生成,c 是文本嵌入(text embedding),用于调节层归一化的缩放和平移参数,从而在全局层面上引导生成过程以符合描述的场景。对于动作条件生成,不将机器人动作表示为原始向量,而是遵循 EVAC [52] 的做法,将动作渲染为空间动作图(spatial action maps),并将其与带噪潜向量(noisy latent)在通道维度上进行拼接。这种空间表示保留了动作的几何结构(例如,投影到每个摄像机视图中的末端执行器轨迹),使模型能够在像素空间中建立动作语义的对应关系,而无需从抽象动作向量学习隐式映射。
多视图 Token 拼接。对于多视图生成,一种简单的方法是在序列维度上拼接所有视图的 Token,从而得到 zconcat_0。虽然标准的时序自注意力机制作用于这一拼接后的序列,但它将多视图 Token 与时序 Token 视为同等对待,并未引入任何几何归纳偏置。这意味着模型必须完全从数据中发现跨视图的对应关系,而这对于实现一致性的 3D 生成来说是不够的。
3 几何旋转位置编码 (Geometric Rotary Position Embedding)
为了将三维几何信息融入注意力机制,引入几何旋转位置编码(Geo-RoPE);该方法利用旋转位置编码 [22],分别对像素级的射线方向和视图级的相机位姿进行编码。
双分量设计。对于维度为 d 的每个注意头,将查询(query)向量和键(key)向量拆分为两个相等的子空间:维度为 d_r = d/2 的射线子空间和维度为 d_p = d/2 的位姿子空间。每个子空间分别通过 RoPE 接收其对应的几何编码。
射线分量。对于视图 v 中位于空间位置 (h, w) 的每个 token,通过相机内参 K_v 对像素进行反投影,并利用相机旋转矩阵的逆 (Rv)−1 进行旋转,从而计算出世界坐标系下的射线方向。该3D 射线方向 dv(h,v) 经循环扩展以填充 d_r / 2 个频率槽,并用作 q 和 k 射线子空间上 RoPE 旋转的位置坐标。
位姿分量。对于每个视图 v,提取一个 12 维位姿特征向量,用以捕捉完整的相机几何信息。
Split-RoPE 的应用。这种Geo-RoPE设计,确保射线子空间能够捕捉细粒度的像素级几何对应关系(即观测同一 3D 点的 Token 会获得相似的旋转),而位姿子空间则编码视图级的身份信息(即来自同一相机的 Token 共享相同的位姿旋转)。将两者分离,避免空间变化的射线信号与空间一致的位姿信号之间产生干扰。
4 几何-觉察跨视图注意机制
每个 DiT 模块中的标准时间维度自注意机制在各视图间独立运行(在将视图维度 V 合并至批次维度之后),因此无法提供显式的跨视图交互。为了建立视图间的通信路径,引入两种互补的注意机制:专用的跨视图注意模块和周期性的空间拼接自注意机制。
多视图自注意模块。在选定的 DiT 层中插入一个专用的跨视图注意子模块。对于每个时间帧 t(不同于光流时间步 s),令 {Zv_t} 表示来自所有视图的特征图。每个视图的查询(Query)和键(Key)首先经过投影,随后利用该视图自身的相机几何信息通过 Geo-RoPE 进行旋转;这意味着施加于视图 v 的旋转取决于相机 v 的射线(rays)与位姿(pose)。由于每个视图都根据其自身的几何特性进行旋转,视图 v 的查询(query)与视图 v’ 的键(key)仅在它们的 token 对应于同一个 3D 点时才会产生高内积;因此,不同视图间几何上对应的 token 自然会获得更高的注意力权重。该门控机制通过 AdaLN-Zero 初始化为零,从而在初始化阶段保留预训练单视图模型的状态。
空间拼接自注意(Spatial-Concat Self-Attention)。定期采用一种替代方案,不再使用逐视图的时间注意力,而是将视图维度和空间维度展平为长度为 V * H * W 的单一 token 轴,并对所有这些 token 同时执行联合时空-视图自注意力。这种方法提供更广阔的感受野,使得每个 token 都能关注同一时间上下文中所有视图的所有空间位置,从而与专门的跨视图模块形成互补。
为何仅靠该路径不足以解决问题。跨视图注意力(Cross-View Attention)与 Geo-RoPE 共同构建视点间信息交换的架构路径,并倾向于关注几何上对应的 token。然而,架构上的偏置仅决定信息的流动方式,却无法界定何种内容才符合 3D 一致性。若缺乏明确的几何目标,该路径可能会陷入“简单捷径”——例如跨视图复制纹理或对特征取平均值——这些操作虽能最小化生成损失,却违背了真实的 3D 结构。这促使引入几何学习信号。
5 潜 3D-REPA(3D 几何先验)
为了给跨视图交互提供几何学习信号,引入Latent 3D-REPA,这是一种 token 关系蒸馏目标,旨在将 DiT 的中间表征与冻结的 3D 基础模型的特征进行对齐。
3D -觉察的特征提取。采用 Depth Anything 3 [48] 作为感知 3D 的特征提取器。关键在于,Depth Anything 3 是在直接 3D 几何监督下训练的,能够预测多视图下的深度、点图(point maps)和相机位姿;因此,其中间特征内化了明确的 3D 结构信息,而不仅仅是 2D 外观信息。正是这一特性使得与其特征对齐成为一种有意义的几何监督来源:通过蒸馏其表征,模型能够获取 3D 知识——而仅基于重构目标训练的生成主干网络原本无法获得这些知识。对于每一组多视图帧 Iv_t,Depth Anything 3 都会生成密集特征,这些特征编码了丰富的几何先验信息,包括深度、3D 点图以及相机相对空间结构。此外,它还能恢复相机外参和内参,这些参数供 Geo-RoPE 使用,并用于 3D 点图重建。
Token 关系蒸馏。不逐个 token 直接回归 3D 特征,而是蒸馏 token 之间的关系结构。在 DiT 选定的中间层 l 处,提取特征图 Hl,并通过轻量级 3D 卷积投影器 g_φ 将其投影到 VGGT 特征维度,从而得到每个 token 的特征 FDiT = g_φ(H_l);来自 Depth Anything 3 的相应冻结特征记为 FDA3。监督这些 token 之间的成对关系,而非其绝对值,因为关系结构对于两个编码器之间特征空间的差异具有不变性。
计算完整的 token 间相似度矩阵代价极高(每帧包含 N = V·H·W 个 token,且涉及 T 帧)。因此,通过锚点采样来估计这些关系:随机抽取 K 个 token 作为锚点,并计算每个 token 与各锚点之间的余弦相似度。对于 token 集合 F = {f_i } 以及采样的锚点索引集 A ⊂ {1, . . . , M}(其中 |A| = K),定义采样相似度矩阵 S(F)。
蒸馏损失在两个粒度上对齐这种关系结构,即将算子 S(·) 应用于空间和时间两组不同的 Token。该空间项在每个帧内发挥作用:设 F_frame 表示单个帧中的 N 个tokens(涵盖所有视角和空间位置),并从中采样 K_s 个锚点。令 S_intra := S(F_frame),该项用于对齐 DiT 与 Depth Anything 3 的关系。其时间项作用于整个片段:设 F_clip 表示包含T * N 个 token 的完整集合,从中跨所有帧采样出 K_t 个锚点(anchors),S_inter := S(F_clip)。
S_{intra} 和 S_{inter} 均源自同一个采样相似度算子 S(·),二者的区别仅在于所使用的 token 集合与锚点数量:S_{intra} 捕捉帧内几何关系(即在单个时间步内,跨越不同视角与空间位置的关系),而 S_{inter} 则捕捉跨越时间维度的帧间关系。随机锚点采样策略将计算开销从二次复杂度降低至 O(MK),同时保留了有效的梯度信号。
为何仅靠几何先验不足以解决问题:Latent 3D-REPA 旨在促使 DiT 的 token 关系与具备几何-觉察能力的编码器保持一致,从而提供关于正确 3D 结构的显式信号。然而,这种逐帧先验无法单独确保跨视角的一致性:尽管各个视角能独立提升其 3D -觉察能力,但若缺乏视角间的交互路径,各视角便无法协同生成在几何上相容的输出结果。
6 联合机制
如前所述,这两个支柱单独使用均不足以奏效;它们的价值在于相互耦合。当两者结合时,便形成一个增强回路:
- 路径(架构)。“几何-觉察跨视图注意”(Geometry-Aware Cross-View Attention)开辟视图间信息交换的通道,而 Geo-RoPE 则引导该通道沿几何对应 Token 传输信息,同时将所有视图置于统一的 3D 坐标系中。
- 目标(监督)。“Latent 3D-REPA” 确保交换的内容具有几何意义,使 DiT 的 Token 关系与涵盖所有视图的 3D 感知先验保持一致;由于 Geo-RoPE 确立公共参考系,这些监督约束能在视图间连贯地传播,而不会退化为仅针对单个视图的“捷径”解。
路径,负责承载信息,而目标,则赋予其 3D 一致性;由于两者分别弥补对方无法解决的缺陷,它们的结合带来了 3D 一致性方面的非线性(非简单叠加)提升。
7 训练目标
总训练目标结合流匹配(flow matching)损失与Latent 3D-REPA 蒸馏损失:
L_total = L_diff + λ · L_REPA,
其中 L_diff 是流匹配速度预测损失,λ = 0.5 用于平衡生成质量与 3D 对齐效果。
Depth Anything 3 编码器在整个训练过程中保持冻结,作为固定的 3D 先验。跨视图注意力模块采用 AdaLN-Zero 门控机制进行初始化(初始门控值为 0),从而确保预训练的主干网络权重在训练初始阶段(第 0 步)得以完全保留,并随着训练的进行,新模块的作用逐渐显现。
1 实现细节
基础模型。将 PAIWorld 构建于 Cosmos-Predict2.5 [53] 之上,这是一个基于流匹配(flow-matching)扩散 Transformer (DiT) 架构的世界基础模型,在预训练视频 VAE 的潜空间中运行。完整模型拥有约 140 亿(14B)个参数。采用 Cosmos-Reason1 [54](一种物理 AI 视觉-语言模型)作为文本编码器,以提供基于物理特性的条件信息。将“几何-觉察跨视图注意”(Geometry-Aware Cross-View Attention)模块和 Geo-RoPE 模块插入到预训练的主干网络中,同时随机初始化 REPA 投影头。
数据集。整理一个大规模多视图机器人操作数据集,包含约 250 万个视频片段,这些片段来自五个来源:AgiBot-World [32] (35%)、RoboMIND [55] (20%)、Galaxea [56] (15%)、RoboTwin [57] (15%) 和 RoboCOIN [58] (15%)。这些数据集提供机器人操作的多相机视频流,并附带文本描述或动作标注。它们涵盖多样的机器人形态、操作任务和相机配置,为训练具有泛化能力的多视图世界模型提供广泛的数据覆盖。针对动作条件生成任务,进一步在 AgiBot-Challenge2026 和 WorldArena 基准测试的任务特定数据上进行微调。
训练配置。训练总共进行 30,000 次迭代,批次大小(batch size)与 GPU 数量成正比。用 AdamW 优化器,并采用余弦学习率调度策略。学习率在前 3,000 次迭代中线性预热(warm-up)至峰值 3 × 10⁻⁵,随后按余弦曲线衰减。所有训练实验均在 NVIDIA H200 GPU 上进行,耗时约 3 万 GPU 小时。REPA 对齐损失的权重设为 λ = 0.5。3D 基础模型编码器(Depth Anything 3 [48])在整个训练过程中保持冻结状态。
2 动作条件视频生成
首先在动作条件设置下评估 PAIWorld,即模型根据一系列机器人动作生成未来的观测结果。该设置直接衡量了模型作为用于机器人规划与控制的世界模拟器的效用。报告在 WorldArena 和 AgiBot-Challenge2026 这两个基准测试上的结果。
3 文本条件多视图生成
在 AgiBot-World 基准上评估文本条件生成性能,并将其与三种最先进的基线模型进行比较:Genie-Envisioner [60]、Cosmos-Predict2.5 [53] 和 Wan2.1 [9]。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)