JEPA-WAM:基于联合嵌入世界建模的VLA策略学习
26年8月来自人大、星源智(XYZ Embodied AI)、数据工程知识工程重点实验室、数据库商务智能研究中心、深圳高级技术研究中心和清华AIR研究所的论文“JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling”。
鲁棒的机器人控制受益于对状态转换的显式建模,但视频生成的世界-动作模型(WAM)会带来巨大的部署成本。现有的潜在WAM避免了显式的未来生成,但通常会压缩预测表征,或者将预测建模与用于动作生成的表征分离。JEPA-WAM,是一种构建在预训练的V-JEPA空间中的潜在WAM,它通过共享预测器将潜在转换预测与连续动作生成相结合。JEPA-WAM预测一个空间结构化的联合当前-未来目标,该目标捕捉当前和未来观测之间任务共享的视觉时间结构,同时保留密集的块级(patch-level)对应关系。通过共享预测器,转换监督直接塑造骨干网络,从中提取出用于动作预测的专用表征。同样的设计也可以在预训练的VLA策略中实例化,同时保留其原始的感知和动作路径。
如图 1 所示,JEPA-WAM 在分布内 (ID) 性能方面保持竞争力,同时在视觉和空间分布外 (OOD) 偏移下展现出强大的泛化能力。在 LIBERO-Plus 数据集上,JEPA-WAM 取得 79.2 的成绩,是未进行机器人策略预训练方法中的最佳结果。当应用于预训练的 π0.5 中的转移目标时,其平均成绩从 84.5 提升至 86.3,取得了最佳的总体结果。JEPA-WAM 在 RoboTwin 2.0 上的随机双手动操作以及在视觉和空间偏移下的真实世界操作中也表现出良好的泛化能力。受控消融支持联合当前-未来目标、块级空间监督以及通过共享骨干网络进行的直接转移预测。

潜世界动作模型(Lotanent WAMs)通过将预测性世界建模转移到学习的表征中,避免显式的帧生成。现有方法大致可分为三个方向。一些方法重用生成世界模型中的中间表征作为动作预测的上下文(Kim et al. 2026; Ye et al. 2026a; Li et al. 2026c)。另一些方法将未来的观测结果压缩成潜tokens,并训练策略来预测这些表征,从而鼓励策略在生成动作时预测未来状态(Zheng et al. 2025; Zhao et al. 2026; Luo et al. 2026a)。第三种方法使用专门的潜动态模型来预测未来的表征或潜子目标,然后利用这些表征来指导动作生成(Chen et al. 2026)。如图 2 所示潜WAM范式的比较。JEPA-WAM通过一个共享的预测器将转换预测和动作生成结合起来。

如图 3 所示,JEPA-WAM 是一个基于预训练 V-JEPA 表示空间构建的潜世界-动作模型。它使用 V-JEPA 表示当前视觉状态并定义过渡目标,同时通过一个共享预测器将过渡建模与连续动作生成相结合。它在生成动作条件表示的同时,预测一个空间结构化的联合当前-未来目标。

用预训练的 V-JEPA 2.1 作为 JEPA-WAM 的潜表征空间,它同时表征当前视觉状态和联合的当前-未来目标,以实现时间上的视觉监督。冻结的 V-JEPA 2.1 编码器 E_J 提供的是密集的块级表征,而非全局池化表征。将这些表征称为空间结构化的,因为tokens在每个视图内保持其块级结构,并且在不同视图之间按照固定的相机顺序排列。将得到的当前表征记为 Z_t。在训练过程中,通过在同一表征空间中同时编码 t 时刻和 t + δ 时刻的观测值,构建联合的当前-未来目标 Y_t,t+δ。
V-JEPA 2.1 并不要求重建完整或唯一的未来观测结果,而是强调视觉关系:哪些区域保持稳定或发生变化,以及局部物体和空间关系如何随时间变化。结合其密集的块级组织结构,这提供任务共享的视觉时间监督,而无需将过渡压缩成少量全局潜tokens。
在定义联合的当前-未来目标之后,通过一个共享预测器将其预测与动作生成耦合起来。用 Qwen2.5-0.5B 实例化共享预测器 F_θ,该预测器处理视觉表征和任务指令,并生成用于动作条件反射的专用表征。同一个预测器也用于预测联合的当前-未来目标,从而允许时间监督直接优化用于动作生成的主干网络。
在策略训练过程中,联合优化潜转移(transition)预测和动作生成。部署时,移除目标分支和预测头。
同一个当前-未来联合目标可以监督预训练的 VLA,而无需改变其原始感知或行动路径(图 4所示)。

给定一个预训练的VLA策略,引入一组未来tokens,并利用它们的输出隐状态来预测联合的当前-未来目标。
首先将未来tokens的表示重塑为一个粗略的二维特征图,然后应用轻量级投影和空间上采样,使其特征维度和空间分辨率与联合的当前-未来目标相匹配。
这种对齐方式使得预训练策略能够从当前-未来联合目标获得相同的补丁级监督,同时保留其原始动作路径。
实验设置
基准测试。在 LIBERO (Liu et al. 2023)、LIBERO-Plus (Fei et al. 2025)、RoboTwin 2.0 (Chen et al. 2025) 以及一个真实的 AgileX COBOT Magic 双臂机器人平台上进行评估。联合训练 LIBERO 的四个测试套件,并在 LIBERO-Plus 上直接评估相同的策略,而无需进行 OOD 微调。在 RoboTwin 2.0 上,用来自 20 个任务的 Clean 演示进行训练,并在 Clean 和 Random 设置下评估相同的 20 个任务。
训练和评估。JEPA-WAM 使用一个冻结的 300M 参数 V-JEPA 2.1 编码器、一个 Qwen2.5-0.5B 预测器和一个基于 DiT 的流匹配动作专家。遵循每个基准测试的标准评估协议,并报告任务成功率(%)。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)