WALA:从带动作标签的演示和无动作视频中学习可执行
26年7月来自中科院自动化所、无界动力、中科院大学、新加坡国立和西交利物浦大学的论文“WALA:Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos”。
具有泛化能力的机器人策略通常依赖于带有动作标注的机器人演示数据,但此类数据收集成本高昂且难以规模化。相比之下,大规模且易于获取的人类视频记录了丰富的物理交互过程,却缺乏可直接用于机器人控制的动作标注。为此,提出 WALA 框架,该框架能够联合利用带有动作标注的演示数据和无动作标注的视频,学习可执行的潜动作(latent actions)。WALA 首先在无动作标注的视频上预训练一个语义-几何潜动作模型,使其能够通过当前观测与多个稀疏采样的未来观测之间的场景演变,学习与动作相关的表征。具体而言,WALA 构建语义和几何层面的未来变化量(deltas),编码器从中提取潜动作目标,而解码器则在 DINOv3 特征空间和稠密深度空间中预测这些未来变化量。
这种方法避免原始像素重建,在保留任务相关的语义和几何结构的同时,降低外观细节的干扰。在策略训练阶段,预训练的编码器保持冻结以提供稳定的潜动作目标,解码器则作为可训练的潜世界模型发挥作用。由视觉-语言主干网络生成的潜动作,受到机器人动作预测、潜动作目标匹配以及未来动力学预测的联合监督。带有动作标注的演示数据同时提供可执行控制信号和动力学监督,而无动作标注的视频无需机器人动作标签,仍可通过潜动作和未来动力学监督参与训练。通过这种方式,WALA 将视频中的物理场景演变与可执行的机器人控制联系起来。实验表明,WALA 在 RoboTwin 上表现优异,并在 RoboCasa 上达到 75.2% 的平均成功率,刷新该领域的最佳性能记录。针对真实机器人的进一步实验也验证其在多种操作任务中的泛化能力。
1 概述
WALA 从带有动作标签的演示数据和不含动作标签的视频中学习可执行的潜动作。该框架包含两个阶段。在第一阶段,预训练一个语义-几何潜动作模型(如图 1 所示)。该模型利用当前帧以及基于多个稀疏采样帧计算出的未来变化量(deltas),学习能够解释未来语义和几何变化的潜动作。
在第二阶段,将预训练模型整合到策略学习中(如图 2 所示)。此时,预训练编码器被冻结以提供稳定的潜动作目标,而解码器则作为可训练的潜世界模型使用。
2 语义几何潜动作模型
该潜动作模型包含一个编码器和一个解码器。编码器接收当前观测值以及观测的未来变化量,并从场景演化中推断潜动作tokens。RGB分支捕获DINOv3特征空间中的语义变化,而深度分支捕获稠密深度空间中的几何变化。这两个分支融合以生成统一的潜动作表示。
其使用增量而非绝对的未来状态,促使 z_t 表示基于当前状态的相对场景演变。输出 z_t 是一组潜动作tokens。相同的未来增量被用作预测目标。解码器根据当前状态和潜动作预测这些语义和几何变化。
RGB 解码器预测 DINOv3 特征空间的变化。深度解码器预测密集的深度变化。未来状态是通过将预测的变化添加到当前状态来获得的。
RGB 预测损失使用 l1 项和余弦项。余弦项是基于预测的 DINOv3 特征增量与目标 DINOv3 特征增量计算得出的。深度预测损失包含密集深度回归项和深度梯度一致性项,其中的梯度项用于匹配预测深度变化与真实深度变化之间的水平及垂直深度梯度。
在上述损失计算中,Delta X 和 Delta D 表示所有采样的未来增量,且损失值是在未来时间步和空间位置上取平均计算得出的。预训练目标函数为 L_{LAM} = L_{rgb} + lambda_{dep} L_{dep}。该目标函数促使潜动作编码与任务相关的语义及几何变化,从而避免将模型容量消耗在像素级的图像重建上。
3. 基于潜世界监督的策略学习
预训练后,WALA 使用潜动作模型来监督策略学习。预训练的编码器被冻结。给定当前观测值和观测到的未来变化量,它生成潜动作目标。其中冻结编码器可以确保策略训练期间潜目标空间的稳定性。
视觉语言骨干网络(在实现中采用 Qwen3-VL-4B [22] 实例化)接收多视角 RGB 观测值、语言指令、机器人状态和已学习的动作查询。它生成统一的潜动作,动作头则预测机器人动作。
生成的潜动作受到两种方式的监督。首先,利用 L1 损失和余弦相似度损失,将这些动作与冻结的潜动作目标进行对齐。其次,将这些动作输入潜世界模型解码器,以预测未来的语义和几何变化量。这种监督机制将策略生成的潜动作与未来的场景演变联系起来,而机器人动作损失则确保这些动作与可执行的控制指令保持一致。
最终的策略训练目标为:
L_policy = m L_act + λ_align L_align + λ_wm L_wm。
其中,L_act 是机器人动作预测损失,L_align 是潜动作目标匹配损失,L_wm 是潜世界模型的未来动态预测损失。二元变量 m 表示是否存在真实机器人动作。对于已标注动作的演示视频,所有三个损失函数均被使用。对于无动作视频,动作损失函数被屏蔽,而潜动作目标匹配和未来动态预测仍然有效。
4. 训练和推理
在潜动作模型预训练期间,DINOv3 [1] 编码器和深度估计器 [2] 被冻结,仅对潜动作编码器、融合模块和解码器进行优化。在策略训练期间,预训练的潜动作编码器保持冻结状态,以提供稳定的目标。解码器、适配器、视觉语言骨干网络和动作头进行联合训练,使潜世界模型能够适应策略生成的潜动作。
在推理阶段,WALA 仅使用视觉语言骨干网络和动作头。未来观测数据、冻结的潜动作编码器、DINOv3 编码器、深度估计器和潜世界模型解码器均不需要。该推理路径将当前的多视图观测数据、语言指令、机器人状态和动作查询直接映射到可执行的机器人动作。
实验设置
在 RoboTwin 2.0 [5] 和 RoboCasa-GR1-Tabletop [6] 上评估 WALA。RoboTwin 用于衡量“干净”(Clean)和“随机”(Random)设置下的策略性能,而 RoboCasa-GR1-Tabletop 包含 24 项桌面操作任务,涉及多种物体、容器和空间关系。
采用成功率作为主要评估指标。除非另有说明,基准策略(Base Policy)使用与 WALA 相同的视觉-语言主干网络,但仅利用机器人动作监督进行训练;相比之下,WALA 在训练过程中引入潜动作目标匹配和潜世界监督。在部署阶段,WALA 仅使用视觉-语言主干网络和动作头,无需运行 LAM 编码器或潜世界模型。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)