26年7月来自英伟达、斯坦福和德州奥斯丁分校的论文“RoboTTT: Context Scaling for Robot Policies”。

现有的机器人基础模型通常使用单步或短历史的视觉运动上下文。本文提出一种名为“测试时训练机器人策略”(RoboTTT)的机器人模型和训练方法,它将视觉运动上下文扩展到8K时间步,比现有最佳策略高出三个数量级,且不会增加推理延迟。在这种上下文长度下,解锁机器人的全新能力:从人类视频演示中一次性进行上下文模仿、实时改进策略、增强对扰动的鲁棒性,以及在多阶段、长时域任务中表现更佳。此外,随着预训练上下文长度的增加,闭环性能也稳步提升。RoboTTT的核心是将测试时训练集成到视觉-语言-动作策略等机器人基础模型中,从而生成一个序列模型。该模型的循环状态包含快速权重,参数在训练和推理过程中均通过梯度下降法更新,从而将历史信息压缩到权重空间,并检索上下文信息以进行长上下文条件化。为了扩展训练上下文的长度,该方法结合了序列动作强制和截断反向传播算法。在具有挑战性的真实机器人操作任务中,RoboTTT 的整体性能比单步上下文基线模型提升 87%,并且能够完整完成一项耗时五分钟、包含十个阶段的组装任务,这是任何基线模型都无法做到的。使用 8000 个时间步长的上下文训练的 RoboTTT 模型比使用 1000 个时间步长预训练的同一模型性能提升了 62%,这表明上下文长度可以作为机器人基础模型的一个新扩展维度。


测试时训练机器人策略(RoboTTT,图 1)是一种机器人模型和训练方案,它将视觉运动上下文扩展到 8K 个时间步(称为 RoboTTT-8K),比最先进的机器人基础模型(5;51;75)高出三个数量级,且推理延迟并未增加。在这种上下文长度下,RoboTTT 展现出新的机器人能力。通过长上下文条件化,它能够从单个上下文人类视频演示中一次性模仿,在 10 次试验中成功 6 次,而基线方法则完全失败。它还展现出动态策略改进能力,性能比未针对此能力进行训练的相同模型提高了 36%。在外部扰动下,它的试验成功率为 83%,而最佳短上下文基线模型的成功率仅为 53%。在多阶段、长时域任务中,RoboTTT 的整体任务性能比单步上下文基线模型提升了 87%,并且能够完全完成一项持续超过五分钟、跨越十个阶段的装配任务,这是任何基线模型都无法做到的。此外,扩展预训练上下文长度能够稳定地提升闭环性能:RoboTTT-8K 的任务完成率比使用 1K 时间步上下文预训练的相同模型高出 63%,并且比最佳短上下文基线模型高出 57%,这表明上下文长度可以作为机器人基础模型的一个新的扩展维度。
请添加图片描述

RoboTTT 的核心是将测试时训练 (TTT) (64; 78) 集成到视觉-语言-动作 (VLA) 策略 (51) 等机器人基础模型中。RoboTTT 是一种序列模型,其循环状态由快速权重 (58) 组成:与在推理阶段冻结的慢速权重不同,快速权重在训练和推理过程中都通过梯度下降进行更新。该设计旨在解决长上下文视觉运动策略的三大挑战:以足够的容量编码长历史记录、利用条件上下文(12)以及保持推理成本随上下文长度的变化。

首先,由快速权重参数化的快速模型(例如,多层感知器)比循环神经网络的向量值状态具有更大的容量。
其次,在部署期间训练快速模型可以保留机器人观测和动作密集重复流中的显著特征并丢弃冗余特征。
第三,随时间传播快速权重可以保持推理成本恒定,而即使使用键值缓存,Transformer 的推理成本也会随着历史记录的增长而增加。

至关重要的是,通过在部署期间学习,RoboTTT 实现了新形式的上下文内适应和策略改进。例如,它利用演示新任务配置的人类视频进行条件化,从而实现一次性模仿。通过 DAgger 蒸馏(一种将 DAgger 式 (57) 错误纠正映射提炼为快速权重的训练过程),该方法能够实时学习并改进自身性能。为了扩展训练上下文的长度,该方法结合了序列动作强制和TBPTT,从而允许上下文在不增加 GPU 内存的情况下增长。

1. 模型架构

RoboTTT 将 TTT 层集成到机器人基础模型(例如 VLA 模型)中,同时保持与底层架构的兼容性,因此适用于多种骨干网络。本文在 GR00T N1.7 (51) 之上实例化 RoboTTT。

如图 2所示RoboTTT模型架构、训练和推理。TTT层位于DiT动作头的注意力层之后:注意力层在每个时间步内运作,而TTT层则跨时间步运作。训练采用序列流匹配损失函数,并强制执行序列动作,对每个动作块的噪声水平进行独立采样。推理从学习的初始值W0开始,对每个观测值更新快速权重并将其向前传播。
请添加图片描述

为了保留预训练模型的能力,RoboTTT 从基础模型权重初始化,并采用学习的 tanh 门控机制 (1),以在训练初期保持 TTT 的贡献较小。如图3所示使用 tanh 门控的计算流程:TTT 的输出在添加到注意力输出之前,会根据学习到的门控 tanh(α) 进行加权。

请添加图片描述

2. RoboTTT序列训练

在机器人轨迹序列上训练 RoboTTT,以便在每个训练序列中快速更新权重,从而学习合适的快速权重初始化及其更新动态。

在长序列上使用完全反向传播(BPTT)进行训练时,GPU内存会存储每个时间步的激活值,因此GPU内存会随着序列长度的增加而增长。采用截断反向传播(TBPTT)方法:将输入序列分割成若干段,梯度仅在每段内流动(图4所示)。关键在于,快速权重会跨越段边界传递,因此TTT可以遍历整个序列,而它们的梯度会在边界处分离。这样,GPU内存由段长度而非序列总长度决定,从而在固定内存预算下支持任意长的训练环境。需要注意的是,快速权重初始化W0仍然会接收来自第一段的梯度,该段的更新直接源自W0。
请添加图片描述

如图 2 所示,RoboTTT 从学习到的初始化 W0 开始每次展开,更新当前观测值的快速权重,并将其传播到下一个时间步。在每个时间步,都会生成经过 k 步去噪的动作块。

3. 从上下文中有效学习

RoboTTT 将快速权重更新与慢速权重更新解耦:通过屏蔽选定时间步的流匹配损失,这些时间步充当纯粹的上下文,在不提供模仿目标的情况下更新快速权重。这种灵活性使 RoboTTT 能够从异构上下文中学习,例如人类视频演示或机器人自身次优的滚动轨迹。

从上下文视频演示中进行模仿。将人类视频演示序列 𝜉video 与执行相同任务的机器人轨迹 𝜉robot 配对:视频序列仅更新快速权重(其流匹配损失被屏蔽),而动作损失则在更新后的快速权重条件下,基于机器人轨迹进行计算。通过对这样的配对进行训练,模型能够学习从上下文视频中提取任务信息;在测试阶段,仅使用一个未见过的任务配置的人类视频进行训练,即可实现单次模仿。

DAgger蒸馏。考虑一个机器人部署过程,其中收集如DAgger (57) 所示的人工纠正信息:每当机器人犯错时,人工操作员都会进行干预并采取纠正措施,从而得到一个轨迹𝜉DAgger = {(𝑙, 𝑜_𝑡, 𝑞_𝑡, 𝐴_𝑡)},其中每个执行的动作块𝐴_t要么是机器人动作𝐴R_𝑡,要么是人工纠正𝐴H_𝑡。这种交错部署展现一种自然的在线策略改进模式。标准的DAgger算法基于人工纠正进行微调,并舍弃次优的机器人动作;然而,正是这些次优动作揭示每次纠正措施所针对的错误类型。 RoboTTT 则同时运用这两种方法,但角色并不对称:在序列训练期间,快速权重会根据完整的交互历史进行更新,不仅包括已执行的修正操作,还包括次优的机器人动作本身;而流程匹配损失则仅针对人类的修正操作进行掩蔽。

将此过程称为 DAgger 蒸馏(图 6所示)。这种不对称性——将失败作为上下文,将修正操作作为目标——正是人类从失败到修正的映射关系被提炼到快速权重中的方式:模型学习如何根据失败情况生成修正操作,而不是孤立地模仿修正操作,从而更充分地利用了相同的数据。将其视为机器人领域中算法蒸馏 (39) 的一个实例:由人类干预引起的改进过程被提炼到策略的快速权重调整中。在测试阶段,模型无需人类干预即可在线执行此类修正操作;其自身的修正操作随后会进入历史并被吸收到快速权重中,正如人类在训练期间所做的修正操作一样。DAgger 蒸馏比标准 DAgger 训练具有更强的故障恢复能力和更高的任务性能。
请添加图片描述

基线模型:对于 GR00T N1.7 和 GR00T N1.7 Hist. 基线模型,用官方实现 (51),并对其进行扩展以支持 GR00T N1.7 Hist. 的历史帧输入。对于 GDN 基线模型,将每个 TTT 层替换为 Flash Linear Attention 库 (73) 中的 Gated DeltaNet 层,并保持层位置、门控和参数数量与 RoboTTT 一致。

评估:将训练好的模型部署在 YAM 双手动桌面机器人上。为了确保不同方法的初始条件一致,记录每个任务的初始物体位置,并在评估时重现这些位置。由于单次人机视频设置下的评估时间较长,分别评估 Pup Go Car 和 Circuit 任务的 20 次运行,以及 Gear Bot 任务和 Circuit 任务的 10 次运行。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐