26年9月来自京东集团研究院的论文“WLA³: WORLD LATENT ACTION MODELING FOR SEMANTICS, DYNAMICS, AND KINEMATICS”。

这篇论文 WLA³ 的核心价值,是将异构数据中的“状态变化”转化为统一监督,同时用于视觉语言理解、动力学建模和机器人控制。它提供有价值的系统设计和初步实机证据,但尚未充分证明学到跨具身、可干预的通用动作空间。

如图 1 所示 WLA3 概览。WLAM 从异构的世界状态转换中学习紧凑的局部潜动作及片段级(segment-level)转换特征。这些表征支持基于潜动作条件的动力学学习、针对 VLM 的直接 SLA 监督,以及潜动作与机器人动作的联合生成。
请添加图片描述

一、方法要点:一个共享表征,服务三个层次

作者要解决的问题是:人类视频很多,但缺少可靠的机器人动作标签;不同机器人又有不同控制接口,难以直接混合训练。

其基本思路是:不强求所有数据使用相同动作坐标,而是先学习“这段交互使世界发生了什么变化”。

  1. WLAM:从状态转移提取潜动作。

输入前后两个时刻的多视角图像,以及可用的机器人本体状态,先得到 1024 维转移特征 g,再通过变分瓶颈压缩成 32 维潜动作 z。

解码器结合初始状态与动作 z,重建终点图像和状态。监督不仅包含像素,还包含感知、光流、语义、深度和几何特征。因此,其表征能力也来自多个预训练视觉模型提供的监督。

两项关键约束是:
跨模态随机丢弃:只给部分视角或状态,仍要求重建所有已记录目标,避免模型依赖某一种输入。
重叠窗口一致性:时间上重叠的两段转移,其潜在动作方向应接近。

  1. Dynamics:用潜在动作训练世界模型 LAC-WM。

世界模型根据当前观察、语言和潜在动作序列,预测未来视觉特征,使用 Flow Matching 训练。

需要注意:策略使用的是冻结世界模型提供的特征。本文并未展示部署时通过世界模型搜索、比较候选动作的规划过程。 因而,更准确地说,这是把动力学学习得到的特征注入策略。

  1. Semantics:用 SLA 直接监督视觉-语言模型。

将连续 30 步的 1024 维转移特征取均值,构成片段级目标。视觉语言模型根据当前图像和指令预测这个目标。

这样,视觉语言模型除了接收动作损失间接传来的梯度,还直接学习“该指令对应怎样的一段物理变化”。不过,这个“语义”主要是转移特征的语义,并非显式语言推理监督。

  1. Kinematics:用 LARA 联合预测潜动作和真实控制。

每一步同时预测 32 维潜动作 + 32 维机器人动作接口,一次生成 30 步:
人类视频只监督潜在动作分支;
机器人及适用的 UMI 数据监督两个分支;
不同机器人的原生控制保留各自含义,通过补零和掩码统一维度。

后训练阶段移除 SLA 监督,保留双动作分支;部署时只执行有效的机器人动作坐标。

如图 2 所示世界潜动作建模(WLAM)将相机变换以及(若可用时的)具身状态变换联合编码为紧凑的潜动作,进而重构终点观测。跨模态转换丢弃(Cross-modal transition dropout)机制促进跨视角与跨具身状态的物理变换共享表征的形成。为确保重叠一致性,两个长度为 h 的变换窗口以 δ 步为间隔启动(其中 0 < δ < h),从而产生 h − δ 步的重叠。
请添加图片描述

二、创新在哪里,证据有多强

创新重点在于共享转移表征的组织与使用方式,而不是某个全新的基础学习算法。

请添加图片描述

最有说服力的结果是内部消融:

72.1% → 加世界模型76.3% → 加LARA 79.8% → 加SLA 81.9%。

相对于内部基线,完整方案提升 9.8 个百分点;相对于外部 π₀.₅ 的66.2%,提升15.7个百分点。评估架构贡献时,前者更有参考价值。

另一个值得重视的发现是:去掉跨模态丢弃后,潜动作分类准确率从67.89%下降到60.46%。这提示,多模态信息能否在输入缺失时迁移到单视角路径,可能比简单增加输入更关键。

如图 3 所示LAC-WM 预训练与通用策略模型的中期训练过程。在 LAC-WM 预训练阶段,冻结的 WLAM 从世界状态转移中提取潜动作,并结合当前观测与指令对 LAC-WM 进行条件化。在通用策略模型的中期训练阶段,经池化处理的 WLAM 特征构成 SLA 目标,用于 VLM 的直接监督,同时局部潜动作用于监督 LARA。动作专家模块结合 VLM 特征与冻结的 LAC-WM 特征,联合预测潜动作与机器人动作。火焰与雪花符号分别标识可训练模块与冻结模块。
请添加图片描述

如图 4 所示 84,100小时训练语料库概览。左侧:按数据类别和数据集划分的构成。中间:来自真实机器人、UMI、仿真及人类视频数据的代表性样本。右侧:物体、动作及子任务的统计数据。底部:代表性的机器人形态。
请添加图片描述

如图 5 所示具有代表性的真实场景评估设置。从左至右依次为:标准配置(Standard);改变物体摆放位置及相对空间关系的“空间泛化”设置(Spatial);改变环境光照条件的“光照泛化”设置(Illumination);以及采用未见过的桌布纹理的“背景泛化”设置(Background)。
请添加图片描述

三、主要问题:结论还缺哪些环节

  1. “状态转移编码”不等于“可控的动作表征”。

前后图像变化可能来自机器人动作,也可能来自相机运动、外部扰动或物体自发运动。重建这些变化,并不能自动分辨哪些变化由主体控制。

同样,不同动作可能产生相似终点,相同动作在不同接触条件下也可能产生不同结果。因而,本文的 z 更稳妥的解释是包含动作信息的转移编码,其可辨识性与因果含义仍需验证。

图8的跨场景生成仅有四组定性例子,而且各方法使用自己的解码器,无法将画质差异完全归因于潜在动作质量。

  1. 跨具身对齐有所改善,但远未解决。

表6中,WLAM域内平均分类准确率为 48.38%,跨人类—机器人平均只有 20.98%。虽然优于比较方法,但域间落差仍很大。

对于12类任务,均匀随机猜测的参考值约为8.33%;20.98%说明存在可迁移信号,却不足以支持“已建立统一动作语义空间”的强结论。
此外,最终机器人动作仍是各具身原生坐标。接口维数统一,并不意味着控制语义已经统一。

  1. 两个时序设计存在潜信息损失。

重叠窗口不必具有相同动作方向。 抓取、接触、释放和运动反向附近,即使窗口高度重叠,也可能对应不同控制阶段。一致性约束可能抹平关键变化。

SLA均值池化缺少显式顺序表达。 它不能可靠区分包含相似局部变化、但执行顺序不同的任务。

当前观察和指令可能对应多个合理未来,用均方误差预测单一SLA目标,存在将不同未来平均化的风险。

这些是方法层面的风险;本文没有通过专门实验确认或排除。

  1. 平均收益掩盖明显的任务负迁移。

图6中,从“+LARA”到“+SLA”:
Book由 88.6%降至66.5%;
Stapler由 100%降至83.0%;
同时其他任务的改善使总体平均分上升。

这说明SLA并非稳定增益。可能涉及多任务梯度冲突、监督权重或统计波动,但当前报告无法区分。相比平均提升2.1个百分点,这些单任务退化更值得追查。

  1. 实验范围与统计报告不足。

实机只覆盖一个平台、六个主要以抓取和放置为主的任务。位置、光照、背景变化有价值,但不足以覆盖新技能、新机器人、接触丰富操作和长程任务。

正文及附录未充分报告试验次数、随机种子、置信区间等细节,因此难以判断小幅收益的稳定性。累积消融也不能独立识别各模块贡献及其交互作用。

  1. 数据规模、迁移与复现结论需要更谨慎。

84.1K小时是整体数据池规模,不同阶段使用的数据不同;不能理解为全部数据都参与了最终策略训练。

5K、10K、20K小时结果支持“该范围内更多中训练数据有益”,尚不足以建立普遍的规模规律;还需厘清训练计算量和数据混合比例。

人类补充实验只在Eraser任务进行,且人类示范数量未充分说明。40%→60%是积极信号,但不能据此计算机器人数据替代率。

模型配置、训练超参数、数据处理、推理延迟等细节披露不足,影响复现和部署成本判断。

四、下一步工作:建议按“验证机制—修复弱点—扩展能力”推进

请添加图片描述

如果只选一个后续研究方向,建议聚焦:

“具有接触事件感知和可干预一致性的跨具身潜动作学习”。

这个方向直接针对本文最核心的未解问题:让共享编码更明确地表达主体可控制的变化。先用受控实验排除相机和背景干扰,再检验同一潜在动作在不同机器人上能否产生一致的对象运动或接触效果,最后验证它是否真正减少新任务所需的机器人示范量。这样的证据链,比单纯继续扩大数据量更能支撑方法上的进一步创新。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐