PhysMani:物理原理驱动的 3D 世界模型用于动态物体操作
26年7月来自香港理工和星尘智能的论文“PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation”。
在非结构化三维环境中操控快速且动态移动的目标,对于具身智能(Embodied AI)而言仍是一项挑战。现有的视觉-语言-动作(VLA)模型及世界模型,往往难以准确表征三维几何结构或进行符合物理规律的预测。为此,提出 PhysMani 框架,该框架将基于物理原理的三维高斯世界模型与具备未来感知能力的动作策略模型相结合。其中的世界模型通过在线优化学习无散度高斯速度场,从而实现快速且符合物理规律的未来动态预测;策略模型则利用基于可学习 Token 的交叉注意机制,整合预测三维场景未来动态信息。此外,还推出包含 16 项任务的动态操控基准测试集 PhysMani-Bench,并在仿真及真实机器人实验中证明该方法相比强基线模型具有更高的成功率。
随着视觉-语言-动作模型(VLA)[29, 48] 和世界模型 [17, 39, 68] 的发展,具身智能(Embodied AI)近年来取得了巨大进步,使机器人能够跨越多种任务学习复杂的行为。尽管这些模型表现优异,但它们主要侧重于静态或准静态任务,对于动态物体操作的研究尚显不足。
迄今为止,仅有少数研究开始探讨动态物体操作的挑战,例如打乒乓球 [16]、踢足球 [33],或抓取传送带 [3, 65, 67] 及桌面 [61] 上的移动物体 [49, 52] 等。尽管这些研究取得了令人鼓舞的成果,但往往局限于特定或过于简单的场景。因此,它们未能提供一个通用的框架来应对开放且非结构化环境中的动态物体操作,而在这些环境中,物体或目标可能呈现出复杂的运动模式。
面向机器人的视觉物理学习:获取复杂动态三维环境的精确物理模型,对于具身操作(尤其是高交互场景下的操作)至关重要。既有研究 [7,38,40] 依赖物理仿真器 [15],利用已知的物理属性计算以物体为中心的动力学特性;然而,此类方法通常局限于特定类别的物体,缺乏针对不同物体的通用性。近期,另一类研究 [35–37] 致力于直接从视频中学习三维动力学(特别是三维速度场),无需额外的先验知识;这为机器人预测符合基本物理定律的未来动态提供了一条极具前景的途径。
在一般的动态交互场景中——例如接住抛出的球、将物品装入移动的容器,或将盘子放置在旋转的桌面上——机器人必须在三维空间中快速且准确地预测受物理定律支配的未来动态,并利用这些预测来指导精确的动作。为了完成此类任务,一种潜在的策略是利用现有的强大 VLA [55] 或基于视频的世界模型 [17] 来联合预测未来状态和动作策略。然而,这些模型目前在三个关键方面存在不足:1) 它们学习的世界表征往往缺乏对三维场景几何结构的明确感知;2) 它们生成的未来帧虽然视觉上逼真,却往往无法捕捉具有物理意义的动态特征 [51];3) 它们所采用的大型视觉与语言模型的级联结构往往导致显著的推理延迟,这对于时间敏感的动态操作而言是难以接受的。
为了解决这些问题,提出 PhysMani,这是一个用于在通用环境中操作动态目标的新框架。如图 1 所示,该框架包含两个关键设计:1) 一个基于物理原理的三维高斯世界模型,它能够持续优化并预测受基本物理定律支配的未来三维场景动态; 2) 一种具备未来-觉察能力的动作策略模型,能够将预测的未来动态无缝整合到决策过程中。这两个组件通过一个轻量级流水线实现,从而支持快速的未来预测与低延迟的动作执行。
针对基于物理原理的3D世界模型,借鉴基于3D高斯(3D Gaussian)的物理学习领域的最新进展,特别是FreeGave [37] 的方法。具体而言,其引入一种在线优化机制,能够高效预测每个高斯图元(Gaussian)的无散度(divergence-free)速度场,从而确保预测的未来场景动态符合基本物理定律。
对于具备未来-觉察能力的动作策略模型,本文采用一种简单而有效的、包含可学习Token的交叉注意机制,将预测的3D场景未来动态无缝融入决策过程。具体来说,针对动态环境中的每一个3D高斯,将来自其局部空间邻域的估计速度信息通过注意机制整合到策略网络中;这样,机器人预测的未来动作便能显式地基于动态目标的预期未来运动进行规划。
鉴于现有的机器人基准测试主要集中于静态或准静态操作任务,而针对动态目标操作的研究尚处于起步阶段,其推出PhysMani-Bench——一个包含16项任务的中等规模动态操作基准测试。该基准的设计灵感源自广泛使用的静态基准RLBench [27],旨在用于评估本文方法。
1 概述
该框架由两个并行模型组成。基于物理原理的 3D 高斯世界模型旨在持续学习目标动态环境的 3D 几何结构、外观以及(最关键的)物理动力学特性。为了保持通用性,将具身主体(机器人)视为动态环境的一个内在组成部分,而非对其进行单独建模。在世界模型预测 3D 场景未来动态的同时,“未来-觉察”的动作策略模型将当前的视觉观测与预测的未来动态作为输入,推断出机器人待执行的未来动作。
2 基于物理原理的 3D 高斯世界模型
针对机器人操作任务中的动态环境,世界模型旨在同时学习 3D 场景的结构与动态特性。设计灵感源自近期的 FreeGave [37] 方法;该方法的核心创新在于利用无散度(divergence-free)高斯速度场进行未来帧预测,同时遵循基本的物理定律。然而,FreeGave 复杂的流程——依赖于独立的形变网络和离线优化——使其难以应用于实时动态操作场景。为此,对 FreeGave 的架构进行大幅改进,并将其重构为一种在线优化模型。
规范态 3D 高斯模块:如图 2 左侧模块所示,在时刻 t = 0,给定来自 C 个相机的 RGB/D 图像(记为 {(I0_c,D0_c)})——这些相机通常安装在 RLBench [27] 和 CALVIN [50] 等标准机器人操作环境中的固定且已知位姿处——首先根据从 C 个深度视图反投影得到的稀疏点云,初始化一组 3D 高斯核 G_0,以表征时刻 t = 0 时的规范态场景几何与外观。每个高斯核由以下参数定义:3D 位置 g_0、缩放 s_0、由四元数 r_0 转换而来的协方差矩阵、不透明度 σ 以及颜色 c。随后,参照 3DGS [31] 的做法,利用时刻 t = 0 时的 C 张 RGB 图像,通过 3DGS 中使用的 L1 损失和 L_SSIM 损失来优化这些规范态高斯核。
基于物理原理的高斯速度模块:如图2右上方的模块所示,对于当前时刻 t 的每个高斯(Gaussian),沿用 FreeGave 的做法,利用多层感知机(MLP,记为 f_vel)来学习六个基本速度分量:V_t ← [v^x_t, v^y_t, v^z_t, w^z_t, w^y_t, w^x_t],其中 vx_t/vy_t/v^z_t 表示线速度,wz_t/wy_t/w^x_t 表示角速度。速度场(记为 v(g_t, t))的构成如下:
v(g_t, t) = V_t · B(g_t), V_t = f_vel(g_0, t)
该高斯速度模块的一个关键优势在于,它强制满足无散度(divergence-free)特性,这一点已在 FreeGave 论文中得到证明。
未来动态的在线优化:在动态操作场景下,系统持续接收 RGB/D 数据流;因此,世界模型必须进行快速的在线优化,以便捕捉目标与环境的实时动态变化,并准确预测未来的演变过程。为此,摒弃 FreeGave [37] 中的辅助形变场及基于形变的优化策略,转而提出下文所述的在线优化算法(算法 1所示),旨在学习时刻 t 每一个高斯分量精确的速度分量 V_t 及其对应的速度场 v(g_t, t)。

3 具备未来-觉察能力的动作策略模型
动作策略模型旨在利用当前的视觉观测和预测的未来动态来推断未来的动作。为了保持通用性,采用现有的 3D FlowMatch Actor (3DFA) [20] 作为策略网络的主干,当然也可以使用其他模型。实际上,3DFA 是在 3D Diffuser Actor (3DDA) [30] 的基础上构建的,它将基于 DDPM 的扩散过程替换为 Rectified Flow [46] 以实现快速训练和推理,同时保持网络架构不变。策略模型包含以下组件:
编码 3D 视觉几何、外观和语言信息:如图 3 左侧模块所示,沿用 3DFA [20] 的方法处理当前时刻 t 的带位姿 RGB/D 图像,将 2D 视觉特征提升(lifting)为由深度视图转换而成的稀疏 3D 场景点云 P_t,从而获得特征点云(或视觉 Token 点云),记为 Fvis_t。还将语言任务指令编码为一组 Token,记为 Flan_t。最后,这两组 Token 通过交叉注意机制(cross-attention)进行融合,得到一组新的 Token,记为 F ̃vis_t。
融合 3D 场景未来动态:在当前时刻 t,世界模型预测每个高斯(Gaussian)的六个基本速度分量 V_t,从而得出整个 3D 场景的未来动态 D_t(其中 H 为 3D 场景高斯 G_t 的总数)。在所有实验中,设定 H = 30000。
如图 3 右侧模块所示,将场景动态 D_t 融合到稀疏 3D 场景点云 P_t 的视觉 Token F ̃vis_t 中,具体步骤如下:
步骤 #1:对于 3D 场景点云 P_t 中的每个点 p_t,根据点与高斯坐标之间的欧几里得距离,利用 KNN(K-近邻)算法从世界模型中检索其 K 个最近邻的 3D 高斯。
步骤 #2:对于与中心点 p_t 相关的 K K K 个最近高斯分布 {g1_t, · · ·, gk_t, · · ·, gK_t} 中的每一个,计算相对偏移量:Delta p = p_t - gk_t。
步骤 #3:针对整个 3D 场景点云 P_t,同样计算其相对于所有 K 个邻近高斯(Gaussian)分量的相对偏移量,得到 Delta P,并获取它们的基本速度分量(记为 Dˆ_t)。
步骤 #4:将 Delta P 和 Dˆ_t分别输入两个独立的 MLP,以获得两组 token,分别记为 ∆P ̄ 和 D ̄_t。
步骤 #5:引入一个可学习向量 L 作为查询(query)token,并将 ∆P ̄ 和 D ̄_t 分别视为键(key)token 和值(value)token。将这些键、查询和值 token 输入三个注意模块,从而得到最终的值 token D ̃ _t。本质上,D ̃ _t 充当对应于 3D 场景点云 P_t 的未来动力学 token。
步骤 #6:最后,将动力学 token D ̃ _t 与视觉 token F ̃vis_t 相加,得到具备未来-觉察能力的 token A_t,该 token 将用于推断机器人动作。
利用修正流(Rectified Flow)对末端执行器关键姿态进行去噪:沿用 3DFA [20] 的神经架构,动作模型也旨在预测末端执行器的关键姿态,这也是先前研究 [21, 28, 43, 56] 中常用的做法。具体而言,每个动作关键姿态 a 包含 3D 位置、3D 朝向以及末端执行器的开/关二值状态:a = {a{pos}, a{rot}, a{open}}。在当前时间步 t,目标是预测相应的末端执行器轨迹τ_t = (aposz_t ,arot)。
给定一条干净的训练轨迹 tau_0(为简化起见,此处省略时间步 t),在去噪步骤 i 中,通过线性插值构建带噪轨迹:tau_i = (1 − i) epsilon + i tau_0,其中 epsilon 为采样噪声。
模型以带噪轨迹 tau_i、本体感知信息 o、语言任务指令 l 以及至关重要的“具备未来-觉察能力的 3D 场景 Token” A(同样省略时间下标 t)作为输入,并分别输出用于流匹配(flow matching)的速度场 V_{flow} 以及夹爪开度 f_{open}。
在训练过程中,参照 3DFA [20] 的做法,在训练轨迹中均匀采样动作时间步 t,并采样去噪时间步 i ~ sigma(N(0,1)) 及噪声 epsilon ~ {N}(0, 1)。用 L2 损失监督流匹配的速度场,并使用二元交叉熵(BCE)损失监督夹爪开度。
在推理阶段,其框架根据视觉观测持续预测三维场景的未来动态,并利用这些动态推断未来的动作关键姿态;随后,这些关键姿态通过逆运动学转换为关节指令以供执行。
4 高效计算实现
为了加速框架的整体计算过程,在针对未来动态进行在线优化时复用静态计算图。在设定中,3D 高斯(3D Gaussians)的数量在各帧间保持不变,这使得优化过程能够在静态计算图中执行。通过避免动态构建计算图,显著降低 CUDA 核函数启动的开销,并提高 GPU 利用率。
鉴于目前缺乏针对通用动态环境下目标操作任务的基准测试,对广泛使用的 RLBench [27] 进行扩展,构建 8 组通用动态任务。每组任务均包含常速和高速两种变体,总计 16 项具有挑战性的任务(简述如下,并如图 4 所示)。这些任务涵盖动态到达、抓取、放置、插入、推动及工具使用等多种操作,涉及的目标呈现出线性、圆形和旋转等复杂的动态轨迹。尽管在包含数百甚至数千项任务的超大规模基准上进行评估固然理想,但这并非易事。虽然近期的 PhysInOne [66] 已在视觉物理推理领域实现了这一规模,但将基于物理原理的评估框架扩展至同等量级仍留待未来工作完成。
– 避开旋转金属环(常速/高速):机器人必须抓取圆环并引导其沿旋转金属丝移动,在保持相对位置的同时避免发生接触。
– 将圆环套入旋转立柱(常速/高速):机器人必须拾取圆环,将其对准并套入安装在旋转底座上的垂直立柱。
– 将篮球投入移动篮筐(常速/高速):机器人必须拾取篮球,并将其投入安装在移动篮板上的篮筐中。
– 拾取桌面上移动的立方体(常速/高速):机器人必须从桌面上的多个立方体(其中包含静止立方体)中拾取那个正在移动的立方体。
– 按下移动按钮(常速/高速):机器人必须按下桌面上正在移动的按钮。
– 将垃圾投入移动垃圾桶(常速/高速):机器人必须从多种物品中拾取垃圾,并将其投入移动垃圾桶。
– 将杯子挂在旋转架上(常速/高速):机器人必须拾取杯子并将其挂在旋转架上。
– 从旋转架上取下杯子(常速/高速):机器人必须从旋转架上抓取杯子并将其放置在桌面上。
对于每一项任务,在桌子周围布置 4 个固定摄像机,这与 RLBench 的设置相同。移动目标的速度设定为与机器人末端执行器的最大速度相当(例如,Franka Emika Panda 7自由度机械臂的最大速度可达2米/秒)。这种动态场景极具挑战性,仅靠反应式控制是无法胜任的。
针对每项任务,收集160条成功轨迹,并按100:20:40的比例将其随机划分为训练集、验证集和测试集。这些轨迹是通过预设的专家策略采集的,确保执行过程无碰撞且有效。所有方法均在相同的训练集上进行训练,并在测试集配置下于仿真环境中进行在线评估。
系统采用安装在桌面工作空间内的双指机械臂,并由四台固定式 RGB-D 相机进行观测(图 7所示)。所有图像均以 240 × 320 的分辨率记录,控制频率设定为 5 Hz,这遵循近期现实世界操作基准测试中的常见做法 [59]。
机器人设置:用一款具有7自由度(7-DoF)的双指机械臂进行真实环境实验。如图7所示,在桌面工作区周围安装四台RealSense D435i RGBD相机。这些相机以30 Hz的频率采集分辨率为240×320的RGB图像和深度数据。在推理阶段,控制频率设定为5 Hz。
数据采集:演示数据通过远程操作机器人进行采集,使用的是基于6自由度惯性测量单元(IMU)的控制器;这种方式既能实现精确且可重复的演示,又能让操作员针对动态目标做出实时反应。针对每项任务,采集180条轨迹用于训练,60条轨迹用于验证。
训练细节:基准模型3DFA使用AdamW优化器进行训练,迭代次数为110,000次,学习率恒定为1×10⁻⁴。训练在3块GPU上进行,每块GPU的批大小(batch size)为18。在训练PhysMani时,利用3DFA在85,000次迭代时的检查点(checkpoint)初始化网络,随后进行25,000次迭代的微调;此阶段使用4块GPU,每块GPU的批大小为12。在微调阶段,采用针对不同参数的学习率策略:继承自3DFA的参数以基础学习率的十分之一(1×10⁻⁵)进行更新,而PhysMani新增的参数则使用完整的基础学习率(1×10⁻⁴)进行训练。最终的模型检查点是根据在预留验证集上获得的最低损失值来选取的。
评估:为了全面评估机器人在动态场景下的操作性能,每项任务包含4个测试变量,每个变量有两个不同的取值,从而构成16种独特的测试工况。在每种工况下进行4次试验,以降低单次实验的随机性。仅当满足以下所有标准时,试验才被视为成功:
– 机器人能够稳定抓取目标物体,且未发生掉落或抓取失败的情况。 – 物体被放置于目标区域,且未发生位移或倾倒。
– 机器人与传送带、旋转货架、目标区域或其他组件之间未发生严重碰撞。
– 操作在预定的合理时限(60秒)内完成。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)