MV-WAM:值增强的流形-觉察世界行动模型
26年6月来自北大和北京人形机器人创新中心的论文“MV-WAM: Manifold-Aware World Action Model with Value Augmentation“。
在具身机器人领域,实现跨多种环境的稳健且可泛化的操作仍然是一项根本性的挑战。近期的世界动作模型在领域内取得了优异的性能,但其优势并未成比例地扩展到分布外场景。这是由于视觉和动作模态之间存在结构性不匹配,二者固有的异质流形导致联合优化在分布偏移下不成比例地降低了动作的鲁棒性。为了解决这个问题,提出了MV-WAM,这是一个端到端框架,它联合建模视觉预测、动作生成和值估计,旨在有效地利用视频先验信息进行训练和推理,从而增强动作的泛化能力。这种统一的关键在于一个跨模态因果掩码,它将动作分层地锚定在预测的视频帧和两种模态中的值函数tokens上。为了进一步缩小泛化差距,MV-WAM采用一种流形-觉察优化方案,该方案明确地考虑了跨模态的结构异质性。最后,MV-WAM引入一种进度值调节机制,该机制能够估计任务完成情况并检测预测帧与生成动作之间的偏差,从而使策略能够自主识别执行偏差并通过值引导回滚进行恢复。在RoboTwin仿真中,MV-WAM在没有任何随机动作监督的随机场景下实现55.7%的平均成功率,比最强的基线策略高出29.3%。在双臂机器人上,MV-WAM在四个难度各异的真实世界任务中实现77.5%的平均成功率。
如图 1 所示,提出的MV-WAM(基于价值增强的流形-觉察世界动作模型),在一个统一的架构中联合生成未来的视觉想象、机器人动作和价值估计。MV-WAM 的核心采用了 MoTs 骨干网络 [27],其中每个 Transformer 层都包含两个模态专家,一个处理视觉tokens,另一个处理动作-价值tokens。模态专家共享一个全局注意空间,同时保持各自独立的参数。视觉专家由一个大规模预训练视频生成模型 [10] 初始化,这使得 MV-WAM 能够继承丰富的视觉先验信息,包括物理动力学、物体交互和场景几何,而这些信息仅靠演示数据是无法获得的。
基于此框架,三个核心组件共同作用,使得无动作视频能够直接作为策略泛化的来源。
首先,模态自适应优化方案将普通的模态感知任务(MoT)扩展为流形-觉察的多目标MoT,其中每个模态都根据其目标流形的固有结构进行监督。这消除了跨模态优化干扰并缓解了梯度不平衡,防止每个模态的学习信号相互干扰。
其次,跨模态因果掩码以分层方式在不同模态间路由信息,将每个动作token锚定在其对应的预测视觉帧中,并将每个价值token锚定在视觉和动作上下文中,从而确保动作生成始终以预测的视觉未来为条件,同时保留模态特定的结构。
第三,进度价值调节机制使用通过蒙特卡罗任务返回值训练的价值token,联合估计任务进度并检测执行过程中的视觉-动作错位。在在线执行期间,当预测值低于学习的阈值时,MV-WAM会触发价值引导的回滚(rollback),使策略能够自主识别并从执行偏差中恢复。
1. 端到端框架
为了弥合视觉模态和动作模态之间结构不匹配导致的泛化能力差距,提出一种名为 MV-WAM 的流形-觉察统一框架。该框架将视频世界建模、机器人动作预测和价值估计统一到一个基于 Transformer 的扩散骨干网络中。如图 2 所示,其模型构建于堆叠的扩散Transformer (DiT) 模块之上,这些模块包含视频专家和动作价值专家,并通过混合Transformer (MoT) [27] 机制耦合,从而实现跨模态交互。其没有采用普通的 MoT,而是将其扩展为流形-觉察的多目标 MoT。
双分支专家架构 视频专家和动作价值专家均采用具有相同深度和标准内部配置的 DiT 骨干网络。任务指令 L 通过 umT5 [11] 文本编码器进行统一编码,并通过交叉注意机制注入到两个专家中。具体而言,视频专家模型基于 WoW-1.3B [10] 实现。它首先采用时空 VAE 将原始视觉观测帧压缩成紧凑的潜表示,然后将这些潜表示与通道维度上的掩码tokens连接起来,拼接成视觉tokens,并输入到 DiT 主干网络进行视频扩散建模。相比之下,动作-值专家模型以 SigLIP2 [38] 编码的多视角视觉状态 st 作为视觉条件,并将语言嵌入注入到奇数层 Transformer 中,将 SigLIP2 视觉嵌入注入到偶数层。在该专家模型中,动作tokens和状态 tokens共享一个统一的编码器-解码器架构进行动作生成,而值tokens则由一个独立的编码器-解码器进行单独值估计。
为了在联合建模过程中实现精确的时间对齐,动作-值专家模型的旋转位置嵌入 (RoPE) 缩放因子设置为视频专家模型所用缩放因子的 1/4。这种同步机制在动作tokens和视频潜信息之间建立了一个统一的时间网格,从而实现了时间上连贯的跨模态交互。进一步采用一种结构化的因果注意掩码来调节信息流,同时保留特定模态的先验信息。视频tokens的注意仅限于视觉流内的自身信息,以维持高保真度的视频生成;而动作tokens和状态tokens则可以同时关注视频上下文和其他动作tokens。值tokens则同时关注视觉、动作和状态tokens,从而能够对任务进度和视觉-动作对齐进行整体评估。这种非对称掩码确保动作生成始终基于视觉预测,而视频生成不受动作信号的干扰;同时,值估计能够获取可靠的任务评估所需的完整跨模态上下文信息。
流形-觉察双重预测目标 没有采用单一的统一扩散目标来处理两种模态,而是根据它们的固有几何特性定制了两种不同的流形-觉察预测损失。视觉数据和动作数据位于曲率显著不同的黎曼流形上,使用同一个目标函数同时优化两者会导致严重的几何不匹配和次优泛化。该框架为每个分支采用独立的流匹配变换函数。视频专家定义在高曲率的视觉流形上,直接预测速度场,遵循标准的流匹配算法,即L_v。
对于动作-值专家,动作和值tokens都位于具有相似几何结构的低曲率流形上。以动作为例,其优化目标等价于直接回归干净的动作潜变量 a_0,即L_a。
整个框架通过 L = λ_v L_v + λ_a L_a 进行联合优化,其中所有平衡权重 λ_v 和 λ_a 均经验性地设置为 1。在推理过程中,视频专家对预测的速度场进行去噪,而动作-值专家则直接输出优化后的动作表示。得益于流形-觉察的双重目标,MV-WAM 能够同时实现高保真度的视觉世界建模和鲁棒的机器人动作生成。
2. 进度值调节
虽然流形-觉察目标能够确保训练期间的几何对齐,但它们无法提供明确的信号来评估任务进度或在推理时检测视觉动作的错位。在缺乏此类反馈的情况下,执行偏差将无法被检测到且无法恢复,从而直接削弱了策略在分布偏移下的泛化能力。为此,引入一种进度值调节机制,该机制为动作值专家配备专门的值预测能力,使模型能够将去噪轨迹偏向于高进度结果。
蒙特卡罗值估计。受 Cosmos Policy [24] 范式的启发,用从已执行轨迹计算出的蒙特卡罗 (MC) 回报来估计任务价值函数 c。对于轨迹中的每个状态-动作对,价值目标定义为从当前步骤 t 到轨迹结束所累积的经验折扣回报。该 MC 目标将稀疏的任务结果转换为沿演示轨迹的密集进度信号,作为价值tokens的监督目标。
价值引导的在线执行回滚。在闭环执行期间,预测的价值tokens用作动态进度监视器,以实时检测和纠正执行偏差。具体而言,维护一个最近状态-动作-价值三元组的滚动缓冲区,并跟踪迄今为止达到的峰值 c_peak = max_i < t cˆ_i。在每个控制步骤中,如果新预测值显著低于峰值(即 cˆ_t < c_peak − δ,其中 δ 是一个与任务相关的阈值),系统会将当前动作块标记为可能存在错误。触发后,策略会启动回滚和重采样协议:将执行状态恢复到与 cpeak 对应的缓存检查点,从而有效地丢弃错误的动作序列。从恢复后的高值状态开始,扩散过程会被重新初始化,以便有条件地重采样一个新的动作块。利用扩散采样固有的随机性,这种校正可以高效地执行,而无需重新生成整个轨迹或进行额外的环境查询。这种值触发的回溯机制充当了一个自校正循环,可以防止在长周期任务中错误累积,确保模型能够持续地从执行偏差中恢复,并向动作流形的高进展区域导航。
如图 5 所示,MV-WAM 的物理部署采用专为灵巧双手操作而设计的天宫双臂机器人平台。感知系统由三台 Orbbec Gemini 330 RGB-D 相机组成:两台腕戴式相机提供每个末端执行器的近距离视图,用于精细的接触推理;一台固定的第三人称相机提供全局工作空间视角,用于空间规划和任务进度监控。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)