作者团队与单位分析

作者与单位

本文由 11 位作者组成,横跨三大机构:

NVIDIA(8人):Yevgen Chebotar、Ruijie Zheng、Fengyuan Hu、Yunhao Ge、Jimmy Wu、Tianyuan Dai、Scott Reed、Yuke Zhu、Linxi "Jim" Fan

斯坦福大学(2人):Yunfan Jiang(第一作者)、Li Fei-Fei(李飞飞,共同通讯)

德克萨斯大学奥斯汀分校(2人):Tianyuan Dai、Yuke Zhu(共同通讯)

核心人物

Yunfan Jiang(江云帆) — 第一作者,斯坦福大学计算机科学三年级博士生,师从李飞飞教授,隶属于斯坦福视觉与学习实验室(SVL)。同时为 NVIDIA GEAR 实验室研究实习生,获 NVIDIA 研究生奖学金资助。此前主导 VIMA[56,32,67,22](A generalist agent,2022;Vima,2022;Octo,2024;In-context imitation learning via,2024)(多模态提示通用机器人操作)等代表性工作,研究聚焦于通过混合数据源构建可扩展的机器人基础模型。

Li Fei-Fei(李飞飞) — 共同通讯作者,斯坦福大学计算机科学教授,斯坦福视觉与学习实验室(SVL)主任,斯坦福人类中心人工智能研究所(HAI)联合主任。计算机视觉与具身智能领域的先驱,ImageNet 创始人。

Yuke Zhu(朱玉可) — 共同通讯作者,NVIDIA 研究科学家兼德克萨斯大学奥斯汀分校助理教授。机器人学习领域的知名学者,在机器人操作、强化学习和基础模型方面有大量贡献。

Linxi "Jim" Fan(凡林立) — 共同通讯作者,NVIDIA GEAR(Generalist Embodied AI Research)实验室负责人。主导 NVIDIA 在通用具身智能方向的研究,此前推动了 MineDojo、Voyager、GR00T 等项目。

NVIDIA GEAR 实验室

本文的主力研究团队来自 NVIDIA GEAR 实验室,该实验室是机器人基础模型领域的核心研究力量,此前已产出一系列代表性工作:

VIMA[56,32,6,22,40](A generalist agent,2022;Vima,2022;Robocat,2024;In-context imitation learning via,2024;Causal world modeling for,1998):多模态提示驱动的通用机器人操作;

GR00T:人形机器人基础模型平台;

Cosmos:世界基础模型;

RoboTTT(本文):将上下文长度扩展至 8K 时间步,引入测试时训练机制。

团队研究脉络

从 VIMA[7,32,8,67,36,5,29,72,51,80,19](Rt-1,2022;Vima,2022;Rt-2,2023;Octo,2024;OpenVLA,2024;π \pi 0: A,2024;π 0.5 \pi_0.5,2025;Magma,2025;Gr00t n1,2025;TraceVLA,2025;Molmoact2,2026) 到 RoboTTT,体现了 NVIDIA GEAR 团队在机器人基础模型上的清晰演进路径:从"多模态条件化"到"长上下文+在线适应",不断拓展机器人策略的上下文窗口和自适应能力。第一作者 Yunfan Jiang 从 VIMA 时期即参与其中,RoboTTT 是其在该方向上的持续深入。

论文发表信息

本文于 2026 年 7 月 16 日发布于 arXiv(v1),项目网站托管于 NVIDIA 官方研究平台。三位共同通讯作者的配置(李飞飞 + 朱玉可 + 凡林立)体现了学术界与工业界的深度合作,也是 NVIDIA 与斯坦福在具身智能领域长期合作的延续。

RoboTTT: Context Scaling for Robot Policies 机器人策略的上下文扩展

摘要

近期的机器人基础模型均采用单步或短历史的视觉运动上下文。我们提出了测试时训练机器人策略(Test-Time-Training Robot Policies,RoboTTT),这是一种机器人模型与训练方案,能够将视觉运动上下文扩展至8K个时间步,超越当前最优策略三个数量级,且不增加推理延迟。在这一上下文长度下,我们解锁了全新的机器人能力:从人类视频演示中进行一次性上下文内模仿、即时策略改进、对扰动的鲁棒性,以及在多阶段长时序任务上更优的性能。我们还首次观察到,随着预训练上下文长度的扩展,闭环性能稳步提升。RoboTTT的核心在于将测试时训练(Test-Time Training)集成到视觉-语言-动作(Vision-Language-Action)等机器人基础模型中,产生一种序列模型,其循环状态由快速权重(fast weights)构成——这些参数在训练和推理期间均通过梯度下降更新,将历史压缩至权重空间,并检索上下文信息以实现长上下文条件化。为扩展训练上下文长度,该方案将序列动作强制(sequence action forcing)与截断沿时间反向传播(truncated backpropagation through time)相结合。在具有挑战性的真实机器人操作任务上,RoboTTT的整体性能较单步上下文基线提升87%,并完整完成了一项耗时五分钟、包含十个阶段的装配任务,而所有基线均未能完成。以8K时间步上下文训练的RoboTTT较以1K时间步预训练的同一模型性能高出62%,表明上下文长度是机器人基础模型的一个新的扩展维度。视频见 research.nvidia.com/labs/gear/robottt。

Keywords: Long-Context Policies, Test-Time Training, Robot Foundation Models

关键词:长上下文策略、测试时训练、机器人基础模型

图1:RoboTTT,一种将测试时训练(TTT)集成到机器人基础模型中的长上下文视觉运动策略,上下文扩展至8K时间步。oboTTT展现出从人类视频进行一次性上下文内模仿和即时策略改进等能力

1 引言

        大多数当前最优的机器人基础模型均采用单步或短历史的视觉运动上下文。相比之下,上下文长度已成为大语言模型的重要扩展维度。虽然机器人中的长期推理可以委托给外部记忆库,但长视觉运动上下文对于诸如从人类视频演示进行一次性上下文内模仿、从机器人自身部署历史中即时改进,以及在多阶段长时序任务上获得更强闭环性能等能力仍然至关重要。这自然引出一个问题:我们如何构建能够从任意长上下文中学习并加以利用的视觉运动策略?

        为回答这一问题,我们提出了测试时训练机器人策略(RoboTTT,图1),这是一种机器人模型与训练方案,将视觉运动上下文扩展至8K个时间步(称为RoboTTT-8K),超越当前最优机器人基础模型三个数量级,且不增加推理延迟。在这一上下文长度下,RoboTTT展现出全新的机器人能力。通过长上下文条件化,它能从单段上下文内人类视频演示中进行一次性模仿,在10次试验中成功6次,而基线方法完全失败。它还展现出即时策略改进能力,性能比未针对该能力训练的同一模型高出36%。在外部扰动下,它在83%的试验中成功,而最佳短上下文基线仅为53%。在多阶段长时序任务上,它较单步上下文基线将整体任务性能提升87%,并完整完成了一项耗时超过五分钟、跨越十个阶段的装配任务,而所有基线均未能完成。最后,我们首次证明扩展预训练上下文长度可带来闭环性能的稳步提升:RoboTTT-8K的任务完成分数比以1K时间步上下文预训练的同一模型高出63%,比最佳短上下文基线高出57%,表明上下文长度是机器人基础模型的一个新的扩展维度。

        RoboTTT的核心在于将测试时训练(TTT)集成到视觉-语言-动作(VLA)策略等机器人基础模型中。RoboTTT是一种序列模型,其循环状态由快速权重构成:与在推理时冻结的慢速权重不同,快速权重在训练和推理期间均通过梯度下降更新。这一设计解决了长上下文视觉运动策略的三大挑战:以足够容量编码长历史、利用条件化上下文、以及保持推理成本不随上下文长度增长。首先,由快速权重参数化的快速模型(如MLP)比循环神经网络的向量值状态具有更大容量。其次,在部署期间训练快速模型,可在密集、重复的机器人观测与动作流中保留显著特征并丢弃冗余特征。第三,随时间传播快速权重可保持推理成本恒定,而Transformer推理即使使用KV缓存也会随历史增长。至关重要的是,通过在部署期间学习,RoboTTT实现了全新形式的上下文内适应与策略改进。例如,它以演示新任务配置的人类视频为条件实现一次性模仿。通过DAgger蒸馏(DAgger Distillation)——一种将DAgger风格的"失败到纠正"映射蒸馏到快速权重中的训练过程——它学会了即时改进。为扩展训练上下文长度,我们的方案将序列动作强制与截断沿时间反向传播(TBPTT)相结合,使上下文得以增长而不增加GPU内存。视频见 research.nvidia.com/labs/gear/robottt。

DAgger蒸馏解决序列训练中的分布偏移问题:用专家动作标注策略自己访问的状态,从而缩小训练和测试分布的差距。这是模仿学习中经典的数据聚合方法在长上下文策略中的应用。

截断沿时间反向传播(TBPTT)将长序列分成段,每段内反向传播,段间传递快速权重。这解决了长序列训练的内存问题,同时保持快速权重的时间连续性。

基础原理:(1) BPTT的时间复杂度;(2) 梯度截断的偏差分析;(3) 隐藏状态的传递;(4) 计算图的动态构建。

门控机制用tanh(α)加权TTT输出,再与注意力输出相加。这允许模型学习何时依赖TTT适应、何时依赖标准注意力,避免TTT在不适用的场景中产生干扰。

2 预备知识

测试时训练机制。测试时训练(TTT)引入了快速权重,这些权重在训练和推理期间均被更新,以动态建模上下文信息。这与慢速权重(即模型参数)形成对比,后者仅在训练期间更新,在推理期间保持冻结。形式上,考虑一个d维标记序列X及其查询、键和值序列Q、K、V,由投影矩阵θ_Q、θ_K、θ_V生成,其中Q_t、K_t、V_t表示时间步t处的投影。快速权重W参数化一个小型神经网络f_W(·): ℝ^d → ℝ^d,例如线性层或MLP。在时间步t,快速权重通过下式更新,以将K与其对应的值投影V相关联:

其中通常为均方误差,η表示(可学习的)学习率。更新后的快速权重随后在"应用"步骤中通过下式计算输出O_t:

这种"先更新后应用"的操作在训练和推理期间均发生。直观而言,更新步骤将上下文信息编码到快速模型f_W的参数空间中,应用步骤则将其检索出来用于下游预测。投影矩阵θ_Q、θ_K、θ_V和快速权重初始化W_0通过外部任务损失进行学习,从而使历史机制针对当前任务进行优化。因此在推理时,TTT将先前处理的标记压缩到其快速权重中,而标准全注意力则将所有先前的键和值保留在内存中,并在每一步对其进行注意力计算。

机器人序列模型。在本工作中,我们考虑以其展开历史为条件的机器人策略,也称为机器人序列模型。具体而言,机器人轨迹由图像o_t、本体感觉q_t和动作块A_t的元组组成;为简化起见,我们省略语言模态。我们学习以时间步t之前的历史ξ_{<t}和当前观测为条件的策略π(A_t | ξ_{<t}, o_t, q_t)。对于长上下文策略,我们旨在扩展上下文长度|ξ_{<t}|。

图2:RoboTTT模型架构、训练与推理。TTT层添加在DiT动作头的注意力层之后:注意力在每个时间步内运行,而TTT层跨时间步运行。训练使用带有序列动作强制的序列流匹配损失,每个动作块独立采样噪声水平。推理从学习到的初始化W_0开始,在每个观测上更新快速权重并向前传播。

模型架构在标准Transformer的注意力层之后插入TTT层。TTT层维护快速权重,在每个时间步进行更新和应用。这种设计使策略能在保持基础模型稳定性的同时,获得在线适应能力。

(1) TTT层的最佳插入位置和数量;(2) 稀疏TTT(只在关键时间步更新);(3) TTT层的剪枝和压缩;(4) 多尺度TTT(不同时间分辨率)

相近研究:Adapter、LoRA、Prefix Tuning、以及Test-Time Training layers。

基础原理:(1) 残差连接的梯度流;(2) 层归一化的稳定性;(3) 模块化设计的组合性;(4) 前向传播的计算图。

3 方法:测试时训练机器人策略

        在本节中,我们介绍测试时训练机器人策略(RoboTTT),这是一种用于在长上下文机器人轨迹上学习的机器人模型与训练方案。我们首先描述模型架构以及如何将TTT集成到现代机器人基础模型中,然后介绍一种将序列动作强制与截断沿时间反向传播(TBPTT)相结合以扩展训练上下文长度的训练方案。接着我们描述RoboTTT如何实现长上下文条件化,解锁全新形式的上下文内适应与策略改进:从上下文内人类视频演示进行一次性模仿,以及DAgger蒸馏——一种元学习方法,通过将DAgger风格的纠正过程(将次优机器人动作映射到人类纠正)蒸馏到其快速权重中,教会策略即时改进。最后,我们分享实现细节。

3.1 模型架构

RoboTTT将TTT层集成到VLA模型等机器人基础模型中,同时保持与底层架构的兼容性,因此适用于广泛的骨干网络。在本文中,我们在GR00T N1[51,5,75](Gr00t n1,2025;π \pi 0: A,2024;World action models are,2026).7之上实例化RoboTTT

机器人动作的测试时训练。如图2所示,RoboTTT由视觉-语言模型(VLM)骨干和带有TTT层的扩散变换器(DiT)动作头组成。在时间步t,它预测一个H步动作块。我们在自注意力和交叉注意力层之后添加TTT层,使得注意力处理单步信息,而TTT层处理跨时间维度的信息。具体而言,RoboTTT的DiT输入是跨越T个时间步的机器人轨迹[R_1, Φ_1, q_1, Ã_1, …, R_T, Φ_T, q_T, Ã_T],其中Φ_t是VLM输出的视觉-语言(VL)标记,q_t是编码后的本体感觉标记,Ã_t是加噪动作标记,R_t是在每个时间步前置的N个可学习寄存器标记,它们对所有其他标记进行注意力计算。注意力层在单步标记R_t、q_t和Ã_t上运行,并对该时间步的VL标记Φ_t进行交叉注意力。然后将每个时间步的注意力输出沿时间维度拼接,并通过TTT层进行快速权重更新(式1)和输出(式2)。为提高计算效率,我们避免将VL标记Φ直接通过TTT层,而是依赖数量较少(N=16)的寄存器标记(register tokens)R来跨时间携带VL信息。

用于保留预训练能力的门控。为保留预训练VLA模型的知识,RoboTTT从基础模型权重初始化,并采用可学习的tanh门控机制,在训练开始时保持TTT的贡献较小。具体而言,对于每个DiT层,我们学习α ∈ ℝ^d,初始化为接近零(0.001),并通过下式对TTT贡献进行门控:

其中O_TTT是式2的TTT层输出,O_attn是注意力层输出。通过这种方式,RoboTTT学会调整TTT层的贡献,而不会压过预训练模型的计算

3.2 RoboTTT序列训练

我们在机器人轨迹序列上训练RoboTTT,使快速权重在每个训练序列内更新,同时学习合适的快速权重初始化及其更新动态。TTT投影矩阵θ_Q、θ_K、θ_V和快速权重初始化W_0作为模型参数的一部分进行学习。具体而言,给定一个训练序列,我们在内循环中以快速权重损失L_FW(第2节)在其上运行TTT,在每个时间步计算外部任务损失,并在平均损失上优化整个模型。通过这种方式,投影矩阵直接从外部任务梯度中学习,W_0通过梯度的梯度进行元学习,使快速权重更新针对机器人轨迹进行定制

具体而言,我们的数据集包含N条轨迹,每条轨迹是语言、图像、本体感觉和动作块元组的序列,这里重新引入语言指令l,它在整条轨迹中共享。每个训练序列是一条完整轨迹或一条不超过最大上下文长度的连续子轨迹。记每步流匹配目标为ℓ_t,给定快速权重初始化W_0时,轨迹ξ上的序列损失为:

其中W_{t-1}是进入时间步t的快速权重状态,在TTT层内更新为W_t(式1)。然后每个优化步对L_fm取一个梯度步,同时更新常规模型权重和快速权重初始化

序列动作强制 Sequence Action Forcing 

RoboTTT使用动作的流匹配目标进行训练:DiT动作头学习去噪,其中τ ∈ [0,1]是流匹配时间步,ε ~ N(0, I)是采样的噪声。在序列训练中,我们发现有必要为序列中的每个动作块独立采样噪声水平,我们将这一技术称为序列动作强制。没有它,训练不稳定,可能是因为在序列共享一个噪声水平(全序列扩散)会使整条序列 uniformly 容易(低噪声)或 uniformly 困难(高噪声)学习,这与Chen等人的发现一致

综上所述,记DiT动作头为v_θ,时间步t的元组为,我们通过最小化下式以序列动作强制训练RoboTTT:

其中每个τ_t独立采样为

图4:截断沿时间反向传播(TBPTT)。梯度在段边界处截断;快速权重在段之间传递。

3.3 从上下文中有效学习

RoboTTT将快速权重更新与慢速权重更新解耦:通过在选定时间步屏蔽流匹配损失,这些时间步充当纯上下文,更新快速权重而不提供模仿目标。这种灵活性使RoboTTT能够从异构上下文中学习,例如人类视频演示或机器人自身的次优展开。

从上下文内视频演示中模仿。我们将人类视频演示序列ξ^video与同一任务的机器人轨迹ξ^robot配对:视频序列仅更新快速权重(其流匹配损失被屏蔽),而动作损失在以更新后的快速权重为条件的机器人轨迹上计算。在这样的配对上训练后,模型学会从上下文内视频中提取任务信息;在测试时,以一段未见任务配置的单个人类视频为条件即可实现一次性模仿

DAgger蒸馏 DAgger Distillation。考虑如DAgger中收集的带人类纠正的机器人rollout :每当机器人犯错时,人类操作员以纠正动作介入,产生轨迹,其中每个执行的动作块A_t要么是机器人动作A^R_t,要么是人类纠正A^H_t。这种交错展开描绘了在线策略改进的自然模式。标准DAgger在人类纠正上进行微调并丢弃次优机器人动作;然而恰恰是这些动作揭示了每次纠正所响应的失败。RoboTTT则以非对称角色同时使用两者:在序列训练期间,快速权重在完整交互历史上更新,不仅包括执行的纠正,还包括次优机器人动作本身,而流匹配损失仅屏蔽到人类纠正

图6:DAgger蒸馏。在序列训练期间,直到时间步t的所有已执行动作都用作上下文,而t时刻的专家动作是训练目标。

我们将这一过程称为DAgger蒸馏(图6)。这种非对称性——失败作为上下文、纠正作为目标——正是人类的"失败到纠正"映射被蒸馏到快速权重中的方式:模型学会响应失败产生纠正,而非孤立地模仿纠正,从而更充分地利用相同的收集数据。我们将其视为算法蒸馏(Algorithm Distillation)在机器人学中的实例化:由人类干预引发的改进过程被蒸馏到策略的快速权重适应中。在测试时,模型在线执行此类纠正,无需人类干预;其自身的纠正随后进入历史并被吸收到快速权重中,正如训练期间人类纠正所做的那样。如我们在第4节所示,DAgger蒸馏比标准DAgger训练产生更强的失败恢复和更高的任务性能。

3.4 Implementation Details

我们在预训练的GR00T N1.7上实例化RoboTTT,在其16个DiT层中的每一层添加一个TTT层;每个快速模型是一个两层MLP。我们在桌面双臂机器人数据和第一人称人类数据的混合集上进行预训练,逐渐将预训练上下文长度增加到目标值(例如RoboTTT-8K为8K个时间步),在16块NVIDIA GB200 GPU上训练30K步。然后我们在每个下游任务上以1K上下文长度进行后训练20K步。更多细节见附录A。

4 Experiments

实验设置。我们在三个需要双臂操作和灵巧性的长时序多阶段装配任务上进行评估(图5):Pup Go Car、Circuit和Gear Bot。所有实验使用YAM双臂设置,配备四个RGB摄像头:顶部、底部、左手腕和右手腕。对于每个任务,我们分别收集了8、6和5小时的真实机器人数据,平均回合长度分别为2分钟、1分钟和5分钟。Circuit任务有80种装配配置,变化组件、装配顺序和零件数量;目标配置通过语言提示(或一次性人类视频演示)指定。我们在20种配置上训练,在其余60种上测试。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐