26年7月来自北大、银河通用、中科院自动化所和清华的论文“WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time”。

引导机器人基础模型(RFM)适应新的任务变体或用户偏好的行为仍是一项挑战,通常需要额外的机器人演示、针对特定任务的微调或长上下文条件设定。 WAM-TTT,是一个利用原始人类视频来引导“世界动作模型”(World Action Models, WAM)的测试时训练(test-time training)框架。WAM-TTT 并不将人类视频仅仅视为需要模仿的轨迹,而是通过自监督的视频预测,将这些视频信息整合进冻结的 WAM 内部一个轻量级自适应记忆模块中。为了使该记忆模块能有效用于控制,其引入一个元-训练阶段,利用成对的人类-机器人数据及“键-值”(KV对)记忆重构目标,将人类演示与机器人行为进行对齐。在测试阶段,仅需无标签的人类视频即可调整记忆模块,而预训练的 WAM 保持冻结状态。这种方法实现了高效且可复用的模型引导,无需机器人动作数据、人工标注或针对特定任务的微调,同时保留了基础模型的泛化能力。大量实验表明,在各种操作任务和泛化场景下,WAM-TTT 的表现始终优于基于上下文人类视频条件设定的基线方法。

WAM-TTT概述如图1所示:

请添加图片描述


如图 2所示:WAM-TTT 流水线。首先使用配对的人机演示对快速权重记忆进行元训练,通过KV记忆重建目标鼓励人类视觉线索与机器人行为保持一致。在测试时,记忆通过视频预测根据未标记的人类视频进行调整,而预训练的 WAM 保持冻结状态。然后,适应的记忆通过 WAM 共享的视觉动作动态来引导机器人执行。
请添加图片描述

1 架构

世界-动作模型(World Action Model)。在 LDA [23](一种预训练的世界-动作模型)的基础上构建 WAM-TTT。LDA 中的每个扩散 Transformer 模块都包含两个耦合的专家:一个作用于视觉潜 Token 的视频专家,以及一个作用于机器人动作 Token 的动作专家。这两个专家通过联合注意力机制进行交互。

视频 TTT 层。保持预训练 WAM 架构不变,仅在视频专家(video expert)模块中增加 TTT 残差分支。

每个 TTT 层均遵循既有 TTT 研究 [46, 47, 50, 52, 51] 中的“快速权重记忆”(fast-weight memory)范式。该层包含慢速投影(slow projections)和一个快速权重网络 f(l)。在接收上下文 Token 时,该层构建键(Keys)和值(Values);在接收当前视频 Token 时,则构建查询(Queries)。在利用特定阶段的 TTT 目标函数更新快速权重后,该层将快速权重网络应用于视频查询(video Queries)。

2 人-机元-训练

元训练目标。给定成对的人-机演示数据,将不包含动作信息的人类视频片段记为 u_h,并将同步的机器人轨迹表示为一系列动作与观测值。由于每个 TTT 模块的视频输出都经过残差项的偏移,快速 OWQ 权重 W(l) 会进入各模块的视频流中,并由此传播至:(i) 最终模块的视频隐变量 z(L)(基于该变量计算人类视频预测损失 Lhumanvg;以及 (ii) 下文定义的逐层键值(Key-Value)记忆重构损失 L(l){KVM}(该损失用于评估 f_W 将人类“键”(Keys)映射为人类“值”(Values)的效果)。利用这两个目标合并后的内循环信号来调整快速权重。

键值记忆重构损失。对于每个 TTT 层 l,同步的人类 Token 被映射为键(keys)和值(values),而机器人视频 Token 则被映射为查询(queries)。逐层记忆重构损失衡量当前快速权重根据人类“键”重构人类“值”的效果。

3 基于人类视频的测试时训练

在部署阶段,WAM 参数、TTT 慢投影(slow projections)及 W_{init} 均保持固定。测试时训练的输入是来自目标域的一小批不含动作信息的人类视频 B_h。其以视频生成模式运行模型,并仅针对视频侧的 TTT 快权重(fast weights)进行优化,所采用的目标函数形式与元训练阶段相同。

L_vg 和 L(l)_KVM 均仅基于人类侧的数据计算,因此无需机器人侧的监督信号。在此过程中,WAM 参数、TTT 慢速投影、初始化参数或动作专家参数均不进行更新。经过 N 次测试阶段更新后,调整后的快速权重 W_N 在机器人执行任务(rollout)期间保持固定。


1 实验设置

机器人与任务。在三种真实的机器人形态上评估 WAM-TTT——分别是 Unitree G1(人形机器人)、Galbot 夹爪(双臂双指)和 Galbot Sharpa(双臂灵巧手)——共涉及 9 项操作任务:转移瓶子、清理桌面、递送饮料、互换位置、倒水、盖章、翻牛排、金字塔堆叠以及多步骤牛排制作。每项任务分配给特定的机器人形态,并在两种设置下进行评估。如图3 所示:

请添加图片描述

原始设置(Orig.):在用于记录训练数据的标准化机器人工作间内进行评估试验,保持光照、桌面高度和物体实例的一致性。新设置(New):将机器人部署在未见过的家庭环境中,其中光照、桌面高度和被操作物体均相对于训练阶段发生了变化——即一种分布外(OOD)的复合扰动,而非单一因素的变动。

报告每种“任务-设置”组合下 25 次试验的完成进度(%)。进度是近期 VLA模型评估中常用的标准部分得分指标:完全完成任务得 1.0 分,未完全完成则根据达成预定义子目标的数量,在 [0, 1] 范围内获得相应比例的分数。

数据集与指标。收集一个包含 2,286 组人类与机器人配对交互片段的元训练数据集,涵盖 9 种不同的操作任务。机器人和人类的数据均从第一人称视角(egocentric perspective)采集。具体而言,人类演示数据通过 GoPro 摄像机记录,过程中不涉及任何形式的姿态估计。

2 与基线相比

基线。与五个基线以及 WAM-TTT 进行比较。 LDA [23]:预训练的 WAM 主干,没有人类数据,没有 TTT 分支。 WAM-COTRAIN:通过 WAM 多任务目标(协同训练;无 TTT 分支),使用配对的人类游戏数据对同一 WAM 进行进一步训练。 WAM-ICL:与提取部署时人类视频作为上下文演示相同的 WAM,没有快速权重适应。 EGOSCALE [10]:最近的一个基于各种以自我为中心的人类数据的 VLA;由于原始模型不是开源的,评估一个重实现版本。 π0.5 [56]:物理智能的开放世界泛化 VLA。

3 泛化能力的保持

一个潜在的担忧是,基于短时人类视频进行的测试时自适应(test-time adaptation)可能会导致 WAM 过拟合演示轨迹,从而牺牲预训练基础模型所具备的泛化能力。为了评估这一点,首先利用目标任务的人类操作视频对 WAM-TTT 进行自适应调整,随后在改变执行条件(包括光照、物体位置以及与具身形态相关的外观变化)的扰动环境下测试该自适应策略。

关键的对比在于 WAM-ICL 与 WAM-TTT 之间。这两种方法接收相同的人类演示,但使用方式各异:WAM-ICL 在推理阶段基于演示对冻结模型进行条件化处理,而 WAM-TTT 则通过测试时训练将人类视频转化为视频侧的快速权重。由于 WAM 主干网络和动作专家模型保持冻结状态,WAM-TTT 能够引导用于动作生成的视觉动力学,同时不覆盖预训练的动作先验知识。

如图5所示各种泛化:高度、光照和具身形态
请添加图片描述

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐