RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步
前言
大模型真真切切的各方面推动了具身模型的发展,包括我司七月(视频号:七月具身july)在2023年起 做了一年多的大模型应用开发,真是值得的
比如之前本博客中解读过的TTT——详见本博客中的解读《一文通透TTT:Learning to “Learn at Test Time”,让RNN的隐藏层变成可学习的函数,把Transformer在长下文上的二次复杂度变为线性复杂度》,这不 便用在了具身模型上
具体而言,如原论文的摘要所述,近期的机器人基础模型通常只利用单步或极短历史的视觉-运动(visuomotor)上下文
而Test-Time-Training Robot Policies(RoboTTT),在不增加推理时延的前提下,将视觉-运动上下文扩展到 8K 个时间步
- RoboTTT 的核心思想是,将 Test-Time Training 融入到机器人基础模型(例如 Vision-Language-Action 策略)中,从而得到一个序列模型,其循环状态由“快权重”(fast weights)构成——这些参数在训练和推理过程中都通过梯度下降进行更新,将历史压缩到权重空间中,并在长上下文条件下检索相关的上下文信息
- 为扩展训练时的上下文长度,该方法结合了“序列动作强制”(sequence action forcing)与“截断式时间反向传播”(truncated backpropagation through time)
在具有挑战性的真实机器人操作任务中,RoboTTT 相比单步上下文基线方法将整体性能提升了 87%,并且能够完整完成一个持续五分钟、包含十个阶段的装配任务,而所有基线方法均未能完成
第一部分 RoboTTT: Context Scaling for Robot Policies
1.1 引言、相关工作、预备知识
1.1.1 引言
如原论文所述
- 目前,大多数最先进的机器人基础模型只在单步或短历史的视觉-运动上下文中运行(5; 7; 8; 29; 36; 37;41; 47; 51; 60; 67; 75; 76)
- 相比之下,上下文长度已经成为大语言模型的一个重要扩展维度(9; 16;27; 46; 53; 71)
尽管机器人中的更长期推理可以交由外部记忆库完成(50; 69),但长时视觉-运动上下文对于以下能力仍然十分关键,例如:
从人类视频示范中进行一次性、基于上下文的模仿学习(18)
在机器人自身的部署历史基础上即时改进(39)
以及在多阶段、长时程任务上实现更强的闭环控制性能
由此产生一个自然问题:如何构建能够从任意长上下文中学习并加以利用的视觉-运动策略?
为了回答这个问题,来自1 NVIDIA、2 Stanford University、3 The University of Texas at Austin的研究者提出了测试时训练机器人策略(RoboTTT)

- 其paper地址为:RoboTTT: Context Scaling for Robot Policies
- 其项目地址为:research.nvidia.com/labs/gear/robottt
其github地址为:截止到26年7月底 尚未开源,且不确定其是否会开源
这是一种机器人模型和训练方法,将视觉运动上下文扩展到8K 时间步(称为RoboTTT-8K),相比当前最先进的机器人基础模型(5; 51;75)在不增加推理延迟的情况下提升了三个数量级

在这种上下文长度下,RoboTTT 展现出新的机器人能力
- 通过长上下文条件化,它能够从单个上下文中的人类视频示范中进行一次性模仿,在10 次试验中成功6次,而基线方法则完全失败
它还展现出即时策略改进能力,比未针对这一能力进行训练的同一模型性能提高了36 % - 在外部扰动下,它在83 % 的试验中取得成功,而最佳短上下文基线的成功率为53 %
在多阶段、长时程任务中,它相较于单步上下文基线将整体任务性能提高了87 %,并完整完成了一个持续超过五分钟、跨越十个阶段的装配任务,而没有任何基线方法能够做到这一点 - 最后,作者声称,他们首次表明,扩展预训练上下文长度能带来稳定的闭环性能提升:RoboTTT-8K 在任务完成得分上比使用1K 时间步上下文预训练的同一模型高出63 %,并且比最佳短上下文基线高出57 %
这表明上下文长度可以作为机器人基础模型的一个新的扩展维度
在其核心,RoboTTT 将测试时训练(Test-Time Training, TTT)(64; 78) 集成到机器人基础模型中,例如视觉-语言-动作(Vision-Language-Action, VLA)策略(51)
RoboTTT 是一个序列模型,其循环状态由快速权重(58) 构成:不同于在推理阶段被冻结的慢速权重,快速权重在训练和推理过程中都通过梯度下降进行更新。该设计解决了长上下文视觉运动策略的三个挑战:以足够的容量编码长历史、利用条件上下文(12)、以及在上下文长度变化时保持推理成本不变
- 首先,由快速权重参数化的快速模型(例如,一个MLP)提供了其容量大于循环神经网络的向量值状态
- 其次,在部署期间训练快速模型,可以在机器人密集且重复的观测与动作流中保留显著特征并丢弃冗余特征
- 再次,随时间传播快速权重能够保持推理成本恒定,而即使使用 KV cache,Transformer 的推理成本仍会随历史长度增长
更为关键的是,通过在部署期间进行学习,RoboTTT 实现了新的上下文内自适应与策略改进形式
例如,它可以以人类演示新任务配置的视频作为条件,实现一次性模仿。通过 DAgger Distillation(一种将 DAgger 风格 (57) 的“失败到纠正”映射蒸馏到快速权重中的训练过程),它能够在运行过程中即时改进
为扩展训练时的上下文长度,作者的方法将 sequenceaction forcing 与截断反向传播通过时间(TBPTT)相结合,使上下文得以增长而不会增加GPU 内存占用
1.1.2 相关工作
首先,对于长上下文策略
大多数最先进的机器人基座模型是在单步或短历史上下文下运行的
- 大多数视觉-语言-动作模型(VLAs)和一些世界动作模型(WAMs)只接收当前观测
5-π₀; 29-π₀.₅; 36-OpenVLA; 37-Cosmos Policy; 51-GR00T N1; 60-SmolVLA; 76-Fast-WAM
或少量连续观测(通常为2 到8 个)
7-RT-1; 8-RT-2
41-Unified Video Action Model,统一视频生成与动作预测的视频-动作模型
47-RDT-1B; 67-Octo
75-World Action Models Are Zero-Shot Policies,提出世界动作模型可直接作为零样本策略使用 - 一些工作通过例如
在视觉上提供运动轨迹,80-TraceVLA
压缩视觉-语言token,31-ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context,通过压缩视觉-语言 token 来摊销多帧上下文成本的 VLA
预测过去的动作,68-Learning Long-Context Diffusion Policies via Past-Token Prediction,用预测过去动作 token 的辅助目标训练长上下文扩散策略
或缓存并门控历史token(23-Gated Memory Policy,通过缓存并门控历史 token 来扩展策略上下文)来扩展观测窗口
然而,这些模型仍然局限于固定的上下文长度
对于更长时域,可以将历史委托给更高层语义,例如
关键帧,50-BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames; 61-MEMER: Scaling Up Memory for Robot Control via Experience Retrieval
和
语言
44-OneTwoVLA
69-MEM: Multi-Scale Embodied Memory for Vision Language Action Models,详见本博客中的解读《MEM——解决VLA长时记忆问题的框架:短时靠高效视频编码抓细节,长线凭文本记忆系统记进度》
但长时视觉运动上下文对于诸如上下文内学习
18-One-Shot Imitation Learning,即OpenAI 早期的单样本模仿学习元学习工作;
22-In-Context Imitation Learning via Next-Token Prediction,即用下一 token 预测实现上下文内模仿学习(ICIL)
即时策略改进,39-In-Context Reinforcement Learning with Algorithm Distillation,即DeepMind 的 Algorithm Distillation,把 RL 改进过程蒸馏进上下文学习
和
适应
38-RMA: Rapid Motor Adaptation for Legged Robots,即四足机器人的快速在线运动自适应方法
55-In-Hand Object Rotation via Rapid Motor Adaptation,即将 RMA 用于灵巧手手内物体旋转
66-Human-Timescale Adaptation in an Open-Ended Task Space (AdA),即DeepMind 的 Adaptive Agent,在开放式任务空间中实现人类时间尺度适应
等能力仍然非常重要 - 另一类相关工作是自回归地处理整个 rollout 历史
6-RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation,DeepMind 可自我改进的通用机器人操作智能体
22-In-Context Imitation Learning via Next-Token Prediction
32-VIMA: General Robot Manipulation with Multimodal Prompts,用多模态 prompt 序列建模实现通用机器人操作
40-Causal World Modeling for Robot Control,自回归因果世界模型用于机器人控制
56-A Generalist Agent (Gato),DeepMind 的通用智能体 Gato,同一模型处理多模态多任务
虽然这类模型能够很好地捕获长上下文依赖,但在真实机器人长时段部署中,其计算代价极高,因为在使用 KVcache 的情况下,解码时延会随上下文长度线性增长
循环神经网络(RNN)策略『49-What Matters in Learning from Offline Human Demonstrations for Robot Manipulation,系统研究离线人类演示模仿学习中的设计选择(含 RNN 策略)』提供了一种推理复杂度为常数的替代方案
但诸如 LSTM(26-Long Short-Term Memory)等传统架构在扩展性上仍不如全注意力模型『34-Scaling Laws for Neural Language Models,Kaplan 等的语言模型缩放定律(用于对比 LSTM 与全注意力的可扩展性)』
RoboTTT 也可以被视为一种 RNN 策略,其循环状态是通过在测试时训练(Test-Time Training, TTT)损失上执行梯度下降来更新的快速权重
关键在于,这种循环结构使得能够扩展可用的上下文长度,并且作者展示了,一旦上下文长度扩展到足够大,RoboTTT 在性能上始终优于最好的单步和短上下文基线方法
要构建能够处理长上下文的策略,必须应对由历史
15-Causal Confusion in Imitation Learning,指出历史条件模仿学习中的因果混淆问题
70-Fighting Copycat Agents in Behavioral Cloning from Observation Histories,研究行为克隆中"复制猫"问题:策略过度复制历史动作
引入的虚假相关性,此时策略会对隐含编码在过去观测中的先前动作发生过拟合
已有工作通过以下方式缓解这一问题
即通过对上下文历史进行摘要,50,61
引入辅助目标(68)
或有选择地跳过部分上下文(23)
而RoboTTT 则通过学习到的 TTT 快速权重来解决这一问题,这些快速权重能够在参数空间中动态编码相关信息,同时抹除冗余特征
其次,对于测试时训练
- 测试时训练(Test-Time Training,TTT)
63-Test-Time Training with Self-Supervision for Generalization Under Distribution Shifts,详见本博客中的解读《一文通透TTT:Learning to “Learn at Test Time”,让RNN的隐藏层变成可学习的函数,把Transformer在长下文上的二次复杂度变为线性复杂度》
是一种范式,其中神经网络在训练和推理阶段都会利用自监督目标快速更新其参数中的一个小子集,这一小子集被称为 fast weights,从而实现对上下文信息的持续存储与检索 - 近期工作提出了更优的测试时优化与在线学习目标
3-Titans: Learning to Memorize at Test Time,即Google 提出的带神经记忆模块、测试时记忆更新的架构
4-It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization,即统一视角梳理测试时记忆化、注意力偏置与在线优化的关系
35-Lattice: Learning to Efficiently Compress the Memory,即高效压缩循环记忆状态的测试时学习方法
78-Test-Time Training Done Right,即系统化改进 TTT 训练配方(LaCT),大幅提升效率与效果
与语言和视觉模型更加紧密的结构集成
20-In-Place Test-Time Training,即In-PlaceTTT:更紧凑地与语言模型架构集成的 TTT 变体
24-ViT³: Unlocking Test-Time Training in Vision,即将 TTT 层引入视觉 Transformer 的工作
作者在论文最后专门提到,宣称,未来工作可以进一步为 TTT 层设计更偏向机器人任务的目标函数,类似于在视觉领域中的探索 (24)
65-End-to-End Test-Time Training for Long Context,即端到端训练 TTT 层以支持长上下文(本文元学习 W₀ 的依据之一)
79-Fast-Weight Product Key Memory,即将快权重与 product key memory 结合的架构
以及更高效的训练策略
42-TNT: Improving Chunkwise Training for Test-Time Memorization,即改进 TTT 分块训练效率的方法,作者在论文最后专门提到,扩展训练时的上下文长度会提高训练成本;未来工作可以采用更为新近的 TTT 训练技术,例如 TNT (42)
43-Parallelizing Non-Linear Sequential Models Over the Sequence Length,即沿序列长度并行化非线性序列模型的训练方法
TTT 最初在语言建模中得到展示
77-Learning to Discover at Test Time,TTT 用于语言建模中测试时"发现"能力的工作
此后在视频生成
13-One-Minute Video Generation with Test-Time Training,即TTT 层用于长视频生成(CVPR 2025)
计算机视觉
24-ViT³: Unlocking Test-Time Training in Vision
和
三维重建 (3D reconstruction) 『11-TTT3R: 3D Reconstruction as Test-Time Training,即将 3D 重建形式化为测试时训练问题』
等领域都展现出良好效果
这些模态本质上是序列性的,而 TTT 在这些领域的成功表明其在机器人领域具有巨大潜力,因为在机器人场景中,智能体同样以连续、流式的方式与环境进行交互 - 尽管一些近期工作
2-Evolve-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models,即借"TTT"之名、实为测试时环境反馈微调的 VLA 工作
45-On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning,即测试时强化学习实现 VLA 在线适应(同样非快权重 TTT)
82-TTT-Parkour: Rapid Test-Time Training for Perceptive Robot Parkour,即测试时快速训练实现感知跑酷机器人(同样非快权重 TTT)
在机器人领域中使用了“test-time training”(测试时训练)这一术语,但它们并未使用 fast weights,而是通过在测试任务上采集额外数据来微调整个模型
与RoboTTT最接近的设定是 Ziakas 和 Russo
83-VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision-Language Models,即最接近本文的设定:给 VLM 加快权重以适配机器人价值函数
但他们为视觉-语言模型(Vision-Language Models, VLMs)配备 fast weights,以便为机器人任务自适应价值函数
相比之下,RoboTTT 则是在 TTT 层之上构建机器人视觉-运动策略
通过扩大训练时的上下文长度,作者展示了 RoboTTT 会呈现出新的能力,例如基于上下文的人类示范视频进行一次性模仿,以及在运行过程中即时改进策略,同时在长时程任务上实现更强的闭环控制性能
最后,对于机器人基础模型
近年来,基于大规模视觉-语言预训练并将其适配到机器人控制的机器人基础模型发展迅速
- 5;7;8;
- 19-MolmoAct2: Action Reasoning Models for Real-World Deployment,即AI2 的动作推理模型,面向真实部署的机器人基础模型
- 29;32;36;51;67;
- 72-Magma: A Foundation Model for Multimodal AI Agents,即微软的多模态智能体基座模型,自回归生成动作
- 80
一种常见范式是从预训练的 VLM(Vision-Language Model,视觉语言模型)初始化,并添加一个动作生成模块,将多模态表征映射为机器人动作
现有方法的主要差异在于动作是如何表示和预测的
- 一类方法将控制建模为自回归序列建模,将动作离散化为通过“下一个 token 预测”生成的 token(36;54-π0_FAST;72)
- 另一类方法则通过将预训练 VLM 与 diffusion 或 flow-matching 策略头相结合(5;17-详见本博客中的解读《π0.5的KI改进版——知识隔离:让VLM在不受动作专家负反馈的同时,输出离散动作token,并根据反馈做微调,而非冻结VLM》;51;67)
保留连续动作空间,从而以更具表达力的方式建模多模态动作分布
虽然 RoboTTT 在原理上可以作为任意机器人基础模型架构的即插即用模块,但在本文中,作者将其具体实例化在 flow-matching 的 GR00T-N1.7(51) 策略上,作为全文的默认骨干网络
值得注意的是,尽管 GR00T-N1.7 仅在单步或短上下文下进行过训练,RoboTTT 将其上下文长度扩展到 8K 个时间步(在 30 Hz 控制频率下约为 5 分钟),并且作者发现,诸如长上下文条件建模等能力只有在上下文长度充分扩展后才会涌现
1.1.3 预备知识
测试时训练机制测试时训练(TTT)(64; 78) 引入了在训练和推理阶段都会更新的快速权重,用于动态建模上下文信息(相当于建立记忆信息)
这与慢速权重(即模型参数)形成对比,后者(慢速权重)只在训练期间更新,并在推理期间保持冻结
- 形式化地,考虑一个由d 维标记组成的序列X,以及其由投影矩阵
诱导得到的查询、键和值序列Q, K, V ,其中
表示时间步t 时的投影
快速权重W 参数化了一个小型神经网络,例如一个线性层或MLP
代表着在时间步,快速权重被更新,用于将K 与其对应的值投影V 关联起来,通过(定义为公式1 Eq. 1)
其中通常是均方误差,且
表示(可学习的)学习率
- 随后,在应用步骤中,更新后的快速权重计算输出
,其方式为(定义为公式 2)
这种” 先更新再应用” 的操作在训练和推理阶段都会发生
直观地说,更新步骤将上下文信息编码到快速模型的参数空间中,而应用步骤则为下游预测从中进行提取
投影矩阵和快速权重初始化
是通过外层任务损失来学习的,从而使历史机制针对当前任务得到优化
在推理阶段,TTT 会将先前处理过的token 压缩到其快速权重中,而标准的完全注意力机制则在内存中保留所有先前的keys 和values,并在每一步对它们进行注意力计算
机器人序列模型在这项工作中,作者考虑在其回滚历史上进行条件化的机器人策略,也称为机器人序列模型(22; 32; 56; 67)
- 具体来说,机器人轨迹
由图像
、本体感受
和动作块
三元组组成;
- 为简化起见,作者省略语言模态
即学习在时间步之前的历史
以及当前观测上进行条件化的策略
对于长上下文策略,目标是扩展上下文长度
1.2 测试时训练的机器人策略
接下来,将
- 首先描述模型架构,以及如何将 TTT 整合到现代机器人基础模型中
接着给出一套训练配方,将
序列动作强制(sequence action forcing)
与
截断时间反向传播(truncated backpropagation through time,TBPTT)
相结合
以扩展训练时的上下文长度 - 随后,说明 RoboTTT 如何实现长上下文条件建模,从而解锁新的上下文内自适应与策略改进形式:
基于上下文的人类视频示范的一次性模仿(one-shot imitation)
以及
DAgger Distillation——一种元学习方法,通过蒸馏 DAgger 风格 (57) 的纠正过程(将次优的机器人动作映射到人类纠正)到其快速权重中,从而教会策略在推理过程中即时自我改进
1.2.1 模型架构
RoboTTT 将 TTT 层集成到机器人基础模型中,例如 VLA 模型,同时保持与底层架构的兼容性,因此可以应用于广泛种类的骨干网络。在本文中,作者在 GR00T N1.7 (51) 之上实例化 RoboTTT
在预训练的GR00T N1.7 (51) 上实例化RoboTTT,该模型由Eagle 模型(59) 作为视觉-语言模型(VLM) 骨干网络和Diffusion Transformer (DiT) (52) 作为动作头组成
原论文中的这个阐述有误,实际上,关于GR00T N1.7,详见本博客中的解读《GR00T N1.7的简介与微调——其中的VLM是“基于Qwen3-VL”的Cosmos-Reason2,且预训练数据中包含2 万小时的 EgoScale人类视频数据(含GR00T N1.6的简介)》
首先,对于测试时训练用于机器人动作
如图2 所示『TTT 层被添加在 DiT 动作头中的注意力层之后:注意力在每个时间步内进行运算,而 TTT 层则跨时间步进行运算。训练阶段使用带有序列动作强制的序列流匹配损失,对每个动作块独立采样噪声水平。推理从学习得到的初始化 开始,在每次观察时更新快速权重并将其向前传播』

- RosoTTT 由视觉-语言模型(VLM)骨干和带有TTT 层的Diffusion Transformer (DiT) (52) 动作头组成。在时间步t ,它预测一个H 步的动作块
且在自注意力和交叉注意力层之后加入TTT 层,使得注意力处理单步信息,而TTT 层处理跨时间维度的信息
————
在其16 个DiT 层中的每一层都加分A入一个TTT 层。原始的DiT 有538M 参数;每个TTT 层大约增加10M 参数,总计为690M
每个TTT层包含一个快速模型,即带有GeLU 激活(25) 的两层MLP,在测试时通过标准梯度下降进行更新;更复杂的测试时优化器,如Muon (33; 78),留待未来工作
且遵循TTT 的标准做法,在0.1 的常数基础学习率之上学习内部测试时学习率(63)。且对位置嵌入使用RoPE (62),其中 - 具体而言,RoboTTT 的DiT 的输入是一个跨越T 个时间步的机器人轨迹,
其中是由VLM 输出的视觉-语言(VL)token
是编码后的本体感知token
是加噪的动作token
而是在每个时间步前置的N 个学习到的寄存器token (14; 30),它们与所有其他token 进行注意力交互
注意力层在单步token,
和
上操作,并与该时间步的VL token
进行交叉注意力
————
这点,跟GR00T的做法 是类似的,因为GR00T也是类似处理:其处理机器人的本体感知状态和(噪声化的)动作,然后与来自Eagle-2 VLM主干网络的图像和文本token进行交叉注意力计算,以输出去噪后的电机动作
————————
每个时间步的注意力输出随后在时间维度上进行拼接
并传入TTT 层
以进行快速权重更新(定义为公式1 Eq. 1)
和
输出(Eq. 2)
为了计算效率,作者避免将VL token直接传入TTT 层,而是依赖数量较少的(N = 16) 个寄存器token R 在时间上携带VL 信息
其次,对于用于保留预训练能力的门控机制
为了保留预训练VLA 模型的知识,RoboTTT 从基础模型权重初始化,并采用一种学习得到的tanh 门控机制(1),在训练开始时保持TTT 的贡献较小
具体来说,对于每一层DiT,学习,初始化为接近零(0.001),并通过以下方式对TTT 的贡献进行门控
其中 是来自公式2
的TTT 层输出,
是注意力层输出。通过这种方式,RoboTTT 学会调整TTT 层的贡献,而不会压倒预训练模型的计算
1.2.2 RoboTTT 序列训练
作者在机器人轨迹序列上训练RoboTTT,使得快权重在每个训练序列内部得到更新,同时学习合适的快权重初始化以及其更新动态。TTT 投影矩阵和快权重初始化
作为模型参数的一部分进行学习
- 具体来说,给定一个训练序列,在内循环中对其运行TTT,并使用快权重损失LFW(
),在每个时间步计算外部任务损失,并在平均损失上优化整个模型
- 通过这种方式,投影矩阵可以直接从外部任务的梯度中学习,而
则通过梯度的梯度(21; 65) 进行元学习,从而使快权重更新适应机器人轨迹
具体而言,他们的数据集包含N 条轨迹,每条轨迹是由语言、图像、本体感受和动作块元组序列
组成,其中重新引入在整条轨迹中共享的语言指令
- 每个训练序列是一条完整轨迹或在最大上下文长度限制下的一段连续子轨迹
将逐步流匹配目标记为,则给定快速权重初始化
时,一条轨迹
上的序列损失为
其中是进入时间步
的快速权重状态,并在TTT 层内部(公式1
)更新为
- 随后,每一步优化都会对
进行梯度更新,同时更新普通模型权重和快速权重的初始化
首先,对于序列动作强制
- RoBoTTT 使用针对动作的流匹配目标进行训练:DiT 动作头学习对
去噪,其中
是流匹配时间步,
是采样的噪声
在序列训练中,作者发现有必要为序列中的每个动作块独立采样噪声水平,然后将这一技术称为序列动作强制
如果没有这一技术,训练会变得不稳定,这可能是因为在整个序列上共享一个噪声水平(全序列扩散)会使整个序列在学习难度上要么均匀简单(低噪声),要么均匀困难(高噪声),这与Chen 等人(10) 的发现相呼应 - 总结来说,将DiT 动作头记作
,将timestep-𝑡 元组记作
,作者通过最小化带有序列动作强制的RoboTTT 进行训练

其中每个都是独立采样的,采样方式为
其次,对于截断的时间反向传播
在长序列上使用完整的时间反向传播(BPTT)进行训练时,需要为每个时间步存储激活值,因此GPU 内存会随着序列长度增长
作者则采用截断的时间反向传播(TBPTT):将输入序列划分为多个片段,并且梯度只在每个片段内部传播(图4,梯度在片段边界处被截断;快速权重会被延续,从而使 TTT 能够在整个序列上持续进行)

- 关键在于,快速权重会在片段之间被保留,从而使TTT 在整个序列上持续进行,而它们的梯度会在片段边界处被截断
- GPU 内存因此由片段长度而非总序列长度决定,从而在固定内存预算下允许任意长的训练上下文
需要注意的是,快速权重初始化仍然会通过第一个片段接收梯度,其更新直接来源于
最后,对于推理
如图2 所示

RooDTTT 从学习到的初始化 开始每次展开,在当前观测上更新快速权重,并将其传播到下一个时间步。在每个时间步,使用
步去噪生成动作块
1.2.3 从上下文中高效学习
RoboTTT 将快速权重更新与慢速权重更新解耦:通过在选定的时间步上对 flow-matching 损失进行掩蔽,这些时间步只作为纯上下文使用,只更新快速权重而不提供模仿目标。这样的灵活性使RoboTTT 能够从异质的上下文中学习,例如人类的视频演示,或者机器人自身的不理想 rollout
首先,对于从上下文视频演示中进行模仿
- 作者将人类视频演示序列
与执行相同任务的机器人轨迹
进行配对:
视频序列只更新快速权重(其流匹配损失被掩蔽)
而动作损失是在以更新后的快速权重为条件的机器人轨迹上计算的
- 在这种配对数据上进行训练后,模型学会从上下文视频中提取任务信息;在测试时,只需对一个从未见过的任务配置的人类视频进行条件化,就可以实现一次性模仿
其次,对于DAgger 蒸馏考虑
- 按照DAgger (57) 收集有人类纠正的机器人rollout:每当机器人犯错时,人类操作员就通过纠正动作进行干预,从而得到一条轨迹
其中每一个执行的动作块要么是机器人动作
,要么是人类纠正
- 这种交错的rollout 形成了一种自然的在线策略改进模式
标准DAgger 仅在有人类纠正的数据上进行微调,并丢弃次优的机器人动作;然而恰恰是这些动作揭示了每个纠正所应对的失败
RoboTTT 则是同时使用两者,但承担不对称的角色:
- 在序列训练过程中,fast weights 会基于完整的交互历史进行更新,不仅包含已经执行的人类纠正,还包括那些次优的机器人动作本身
- 而流匹配损失则仅在有人类纠正的部分上进行掩蔽计算
作者将这一过程称为 DAgger 蒸馏(图 6)

这种不对称性——将失败作为上下文、将纠正作为目标——正是人类从失败到纠正的映射被“蒸馏”进快速权重的方式:模型学习在遇到失败时产生纠正,而不是在脱离上下文的情况下单纯模仿纠正,从而更充分地利用同一批采集到的数据
- 作者将其视为机器人领域中算法蒸馏(39)的一种具体实例:由人工干预引发的改进过程被蒸馏进策略的快速权重自适应之中
在测试阶段,模型会在线执行此类纠正,而无需人工干预;它自身做出的纠正同样会进入历史轨迹,并被吸收到快速权重中 - 方式与训练期间人类纠正被吸收的过程完全相同
正如作者在原论文第 4 节所展示的那样,DAgger 蒸馏(DAggerDistillation)相比标准的 DAgger 训练,能够实现更强的失败恢复能力和更高的任务性能
1.2.4 实现细节
- 作者在预训练的GR00T N1.7 (51) 上实例化RoboTTT
且在其16 个DiT 层中的每一层添加一个TTT 层;每个快速模型是一个两层MLP - 且在由桌面双臂机器人数据和以自我为中心的人类数据(81) 组成的混合数据上进行预训练,逐步将预训练的上下文长度增加到目标长度(例如,对于RooBOTTT-8K 为8K 个时间步),在16 块NVIDIA GB200 GPU 上训练30K 步
然后在每个下游任务上以1 K 的上下文长度进行后训练20K 步。更多细节见附录A
作者在桌面双臂机器人数据和自中心人类视频数据(81) 的混合数据上进行预训练,这些数据经过筛选以强调长轨迹;轨迹长度分布如图A.1 所示
- 且在NVIDIA GB200 GPU 上训练所有模型,每次预训练使用16 块GPU,每次任务特定的后训练使用8 块GPU
预训练仅调整新加入的序列建模层(TTT 或GDN),并冻结GR00T N1.7 的其他组件;
后训练微调所有参数
在预训练期间,对于上下文长度为4K 及以下的情况,使用每设备批大小为4(全局批大小为64);对于更长的上下文长度,使用每设备批大小为1(全局批大小为16)
后训练使用1K 的上下文长度和每设备批大小为1
作者预训练30K 步并后训练20K 步- 所有模型使用带有权重衰减1 × 10−5 的AdamW 优化器(48)
预训练使用Warmup-Stable-Decay (WSD) 学习率调度(28),最大学习率为2 × 10−5;
后训练使用余弦调度,最大学习率为5 × 10−5
1.3 实验
1.3.1 实验设置
作者在三个长时程、多阶段装配任务上进行评估,这些任务需要双手操作与精细操控(如图5 所示):
- Pup Go Car,玩具车辆装配,机器人在多个阶段为一辆模型车组装车顶和第一个车轮,这些阶段包括拧螺丝、钻孔、双手配合传递零件以及翻转整车,平均每个 episode 时长为 2 分钟

如图 A.2 所示
机器人正在组装模型车“小狗出发小车”的黄色车顶和第一只车轮
它先拾取车顶,使螺钉与车身上的孔对齐,并放置车顶
然后它抓取电钻对准屋顶螺钉并将其拧紧后,再把电钻递交给右手
接着,机器人用一只手将汽车翻转过来,用右手拾起一个车轮,将车轮插入车身
然后,它再次拿起电钻并拧紧车轮,最后把电钻递交给左手
评分细则如下:拾起车顶得 0.05 分;将车顶放置到车身上得 0.1 分;
若车顶螺丝正确插入车身得 0.25 分;拾起电钻得 0.3 分;电钻钻头接触到螺丝得 0.35 分;车顶螺丝完全拧紧得0.45 分;将电钻递到右手得 0.5 分;
将车身翻转并保持稳定得 0.55 分;拾起轮胎得 0.6 分;将轮胎插入车身得 0.75 分;拾起电钻得 0.8 分;电钻对准并接触到轮胎螺丝得 0.85 分;车轮完全拧紧得 0.9 分;将电钻递给左手得 1.0 分
且作者在车轮装配环节最多允许两次尝试 - Gear Bot,机器人在底盘两侧安装齿轮和车轮,将底盘翻转两次,安装机器人头部,并通过遥控器驱动车辆

如图A.3 所示,机器人组装整个玩具模型” 齿轮机器人”
它在底盘每一侧安装一个齿轮和两个轮子,两次翻转底盘,使轴朝上


然后,它拾取红色的” 机器人头”,并将其插到底盘上
最后,它拾取遥控器并推动操纵杆,使齿轮机器人移动
评分标准如下:每次翻转底盘得+0.1,每安装一个齿轮或轮子得+0.1,安装” 机器人头” 得+0.1,成功使用遥控器得+0.1 - Circuit,机器人在电路板上组装两个或三个电路元件,并在存在开关或按钮时将电路通电

机器人在一块电路板上组装电路元件。元件包括红色 LED、绿色 LED、七彩LED、灯泡、电机、搭扣导线、按键和开关
机器人一次组装两到三个元件,且左右两侧元件的装配顺序各不相同。综合元件组合与装配顺序,大约存在 80 种配置。如果装配中包含开关或按键按钮,在装配完成后机器人还必须将其打开
————
评分标准如下:对于没有开关或按键按钮的两件式装配,每安装一个部件得 +0.5 分。对于带有开关或按键按钮的两件式装配,每安装一个部件得 +0.33 分,且若电路被打开再得 +0.33 分
对于没有开关或按键按钮的三件式装配,每安装一个部件得 +0.33 分。对于带有开关或按键按钮的三件式装配,每安装一个部件得 +0.25 分,且若电路被打开再得 +0.25 分。如果装配顺序错误,则不给予任何部分分
所有实验均采用 YAM 双臂机器人系统,并配置四个RGB 相机:顶视、底视、左腕视角和右腕视角
即作者将训练好的模型部署在 YAM 双臂桌面机器人上,该平台配备了四个 RealSense D405 相机(顶部、底部、左腕、右腕),以 480p 分辨率实时采集 RGB 观测数据
推理在一台搭载 NVIDIA RTX 5090 GPU 的工作站上运行,控制频率为 30 Hz
- 对于每个任务,作者分别采集了 8 小时、6 小时和 5小时的真实机器人数据,其平均任务回合时长分别为 2 分钟、1 分钟和 5 分钟
- Circuit 任务包含 80种装配配置,在组件、装配顺序以及零件数量上存在差异;
目标配置通过语言提示(或一次性的人类视频示范)进行指定,且在其中 20 种配置上进行训练,并在剩余的 60 种配置上进行测试
作者将 RoboTTT 与三个基线方法进行比较:
- GR00T N1.7 (51) 的单步上下文版本
- GR00T N1.7Hist,即带有一个历史帧的 GR00T N1.7
- 以及 GDN,其中 RoboTTT 的 TTT 层被替换为 GatedDeltaNet 层 (74),这是一种线性复杂度的递归记忆结构,其在测试时更新状态时无需进行梯度下降
————
即于 GDN 基线,作者将每个 TTT 层替换为来自 Flash LinearAttention 库(73)的 Gated DeltaNet 层,同时保持层的位置、门控机制以及参数量与 RoboTTT 相匹配
所有方法都在相同的任务数据上进行后训练:序列模型使用 1K 个时间步的上下文,而非序列模型在匹配的算力预算下进行训练。每个策略在多种配置下进行 20 次试验(Gear Bot 由于其时间跨度明显更长,仅进行 10 次试验)
即作者将训练好的模型部署在 YAM 双臂台式机器人上
- 为保证各方法在完全一致的初始条件下进行,作者预先记录每个任务中物体的初始摆放位置,并在评估时复现这些初始状态
- 对于 Pup Go Car 和 Circuit 任务,各评估 20 次 rollout;
对于 Gear Bot 任务以及在一次性人类视频(one-shot human-video)设置下的 Circuit 任务,由于其评估时间明显更长,各评估 10 次 rollout
且作者报告完全成功试验的次数,以及基于评分细则的任务完成得分,并将其归一化到 [0,1](以百分比形式报告)。超参数和评分细则见附录 B
1.3.2 RooBoTTT 在灵巧且长时间跨度的任务上持续优于基线方法
如图7(在三项装配任务上的任务完成得分。得分基于评分量表,以百分比形式报告;数值越高表示效果越好)

和表1 所示

- RoboTTT 的平均任务完成得分为79 %,比单步上下文基线GR00T N1.7(42 %)高87 %,比最佳基线GDN(56 %)高41 %,并且在每个任务上都有最多的完全成功试验
- 值得注意的是,在Gear Bot 任务上,完成整个任务平均需要五分钟,RoboTTT在10 次中实现了2 次完全成功,而没有任何基线方法做到过这一点
定性来看,RoboOTT 在三个方面表现出色
- 首先,它能够跟踪任务进度
在多阶段装配中,视觉上相似的阶段会导致状态混淆,使得基线方法执行错误的动作或跳过阶段,而快速权重在运行时更新,保留历史中的关键特征,从而消除当前阶段的歧义 - 其次,它展现出策略性的恢复能力
在Pup Go Car 上进行车顶钻孔时,如果钻头错过了车顶螺丝,RoboTTT 会抬起机械臂、重新对齐并再次尝试,而基线方法则会直接进入下一阶段,仿佛上一阶段已经成功完成 - 第三,它在诸如插入和卡扣电路元件等细粒度阶段上更加精确
作者们将此归因于长上下文缓解了部分可观测性问题,因为对目标物体的过去观测在其当前被遮挡时仍然可以为动作提供信息
相关的观测窗口很难事先指定;RoboTTT 则是学习要保留什么,这表明在具有足够表达能力的序列模型中,长上下文的使用可以通过学习获得,而非由人工设计
此外,仅仅依靠历史信息能否匹敌 RoboTTT?
- 作者宣称,他们通过实验发现,简单地将过去观测序列直接拼接在一起并不能稳定带来收益:在 Pup Go Car任务上,GR00T N1.7 Hist. 的成功率为 39.5%,而其无历史版本 GR00T N1.7 为 57%
原因在于,附加的历史可能引入伪相关,并在推理时让机器人处于时间分布外状态 - GDN 将历史压缩为一个递归状态,在 Circuit 和 Gear Bot上优于 GR00T N1.7,但在 Pup Go Car 上则没有提升
值得注意的是,GDN 和 RoboTTT 都维持固定大小的状态;不同之处在于状态更新规则
作者的假设是门控增量规则(gated delta rule)是一种在线性关联更新、且在测试时不进行梯度下降的机制,在抽取信息方面存在困难。从跨越数千时间步的密集、重复的机器人数据流中提取结构;
而 RoboTTT 在测试时通过梯度下降更新的非线性快速模型,则充当更具表达能力的压缩器
1.3.3 在预训练阶段扩大上下文长度,可以在闭环性能上带来持续收益
作者在 128 个时间步(几秒)到8K(四分多钟以上)的多种上下文长度下预训练 RoboTTT 和 GDN,然后对三项任务(图 8)全部进行后训练和闭环性能评测

- 作为参考,Single-Step Context 表示仅以当前观测为条件的 GR00T N1.7
而 ShortContext 表示带有一个额外历史帧的 GR00T N1.7 Hist
RoboTTT 呈现出明显的尺度扩展趋势:闭环性能随之提升 - 随着预训练上下文长度的稳步增加,在8K 时达到71.5 %,比在1K 上预训练的相同模型(43.9 %)高63%,比最佳短上下文基线GR00T N1.7 Hist.(45.6 %)高57 %,且没有任何饱和迹象
GDN 没有表现出这种趋势
作者将这一差异归因于两种更新规则:
RosoTTT 的快速权重通过梯度下降更新,而外层损失通过元学习来学习它们的初始化及其更新动态,而更长的训练序列通过更多的更新步数来塑造这些动态;
GDN 的线性联想状态则不存在这种元学习
低于1K 时,RosoTTT 依然具有竞争力(在相同长度条件下仍优于GDN),但不及其长上下文变体
作者将其归因于展开视野超过了训练上下文:1K 时间步约为半分钟,比最短的任务回合还要短,因此在推理时,快速权重的更新远远超过了训练中见过的窗口,而位置嵌入也被扩展到了未见过的位置
1.3.4 长上下文条件使单次示范模仿和扰动鲁棒性成为可能
如原论文所述,作者首先评估单次示范模仿能力
对于Circuit 任务

- 作者额外收集了一些人类演示视频,其中机器人保持静止,由人类徒手完成电路组装。对于训练集中每一种装配配置,作者收集 5–20 段具有不同初始布局的人类视频
- 在训练过程中,作者对同一配置下的一段人类视频和一条机器人轨迹进行采样,并将它们拼接为一个训练序列,同时在视频部分屏蔽流匹配损失
对于所有配置,作者都使用相同的任务提示语“assemble circuit”,因此目标配置只能从上下文视频中推断。由于 GR00T N1.7 无法基于上下文进行条件建模,且人类视频的长度远超出 GR00T N1.7 Hist. 的历史窗口,作者将其与 GDN 进行对比
- 如表 2 所示

RoboTTT 能够遵循上下文中的示范(图9)
在十次试验中完成六次成功装配,而 GDN 完全失败,要么抓取了错误的部件,要么以错误的顺序进行装配
这表明,尽管具有循环记忆的策略可以编码上下文信息,但它们在利用这些信息方面存在困难
相比之下,RoboTTT 会基于历史数据通过梯度下降更新一个快速模型,并在需要时检索出示范中的配置
接下来,作者评估对扰动的鲁棒性
除了在不同 episode 之间进行条件建模之外,RoboTTT 还在单个 episode 内进行条件建模。在 Pup Go Car 任务中

- 当机器人安装好黄色车顶后,人类会将其移除,或者在轮胎插入后将其拆下;一个基于自身 rollout 进行条件建模的策略,应当能够回到扰动前的阶段并重新安装该部件
作者收集了 30 分钟的扰动数据,并与任务数据一起进行联合训练 - 如表 3 所示,所有方法都表现出一定的鲁棒性,这很可能得益于这种联合训练,但长上下文方法的反应更为成——更频繁地成功:在roof-perturbation实验中,RoboTTT 在20 次试验中恢复了15 次,而GDN 为13/20,短上下文基线最多为10/20;并且在轮胎实验中,RosoTTT 和GDN 都在20 次试验中恢复了18 次
这支持了这样一种观点:视觉运动上下文能改进单次试验内的条件反射;示例的恢复过程如图1 所示
1.3.5 RoboTTT 可以在执行过程中即时恢复,并在效果上优于标准 DAgger
在 Pup Go Car 任务上,作者研究了 DAgger Distillation 相对于其他 DAgger 数据使用方式的表现『图 10,Pup Go Car 任务上的 DAgger 蒸馏结果。在对包含 100 条 DAgger 轨迹(50 条由 RoboTTT 收集,50条由 GR00T N1.7 收集)的数据池进行微调后得到的任务完成率。DAgger 蒸馏(DAgger Distillation)适用于序列模型 RoboTTT 和 GDN』

- 分别以 RoboTTT和 GR00T N1.7 作为基础策略,各收集了 50 条 DAgger 轨迹,并将这 100 条轨迹汇总后用于训练所有方法
标准 DAgger 仅基于人类纠正数据进行微调,相比基础策略,在四种方法上的平均性能提升为 9%,在两种序列模型上的平均提升为 13%
DAgger Distillation 适用于 RoboTTT 和 GDN 这样的序列模型:它在计算模仿损失时只针对人类纠正部分,但在上下文中使用完整的轨迹,包括次优的机器人动作
在使用同样的 DAgger 数据时,该方法带来了 33% 的平均提升:其中RoboTTT 提升 36%,GDN 提升 29%
值得注意的是,这些次优的机器人动作本身并不具有作为模仿目标的价值:对 GR00T N1.7 使用包含(次优的)机器人动作在内的完整轨迹进行微调,与只基于纠正进行微调的表现完全相同(两者均为 57%)
它们的价值在于上下文:从定性结果来看,DAgger Distillation的大部分收益来自在错误动作之后的恢复能力『图 11,通过 DAgger 蒸馏学习的即时恢复能力。在为 Pup Go Car 拧紧车顶螺丝时,RoboTTT 起初未能对准螺丝(帧 1–3),随后抬起机械臂重新尝试,位置更接近但仍未拧上(帧 4–5),然后再次调整,最终成功完成操作(帧 6–8)』
这表明,被蒸馏进 fast weights 的“失败到纠正”映射,会在 rollout 过程中表现为即时的性能改进
GDN 也有显著提升,说明 DAgger Distillation一般适用于序列模型策略,尽管 RoboTTT 受益最大
1.3.6 影响 RoboTTT 性能的设计选择
作者对关键设计选项进行消融分析
- 首先,作者与两个变体进行比较:
去掉序列动作强制的RoboTTT(No Seq. Action Forcing)
以及将快速模型替换为线性层的 RoboTTT(TTTLinear) - 其次,作者将 RoboTTT 的发展过程描绘为一条路线图:
TTT 层仅处理状态token(State Tokens)
然后再额外将动作token 传入 TTT 层(+ Action Tokens)
最后插入可学习的寄存器 token(+ RegisterTokens),从而得到完整的 RoboTTT
由于寄存器 token 增加的是独立于 TTT 的容量,作者也以相同数量的寄存器 token 增强GR00T N1.7,这样就可以将 TTT 机制与额外 token 的影响区分开来单独比较
如图 12 所示,去除序列动作在训练过程中进行强制(teacher forcing)会显著损害闭环性能:由此产生的不准确运动会使机器人无法取得有意义的进展。这凸显了在序列训练期间,对不同加噪动作块施加不同噪声水平的重要性
- TTT-linear 变体的性能优于 GR00T N1.7 基线,但仍不理想,比 MLP fast 模型差 27%,这表明具有更强表达能力的非线性 fast 模型至关重要,这一结论与视觉和语言建模任务中的研究结果一致(78)
- 从一个仅处理状态 token 的 TTT MLP 出发,作者通过逐步增加 token 来提升性能。加入动作 token 带来了 23% 的相对提升:在“知晓”自身过去动作的前提下,模型能够更好地刻画环境动态
- 进一步加入寄存器 token 又带来了 18% 的相对提升
相比之下,寄存器 token 并未帮助 GR00T N1.7。这表明,学习得到的寄存器 token 只有在与 TTT 的时间建模相结合时才是有益的,从而帮助模型编码上下文信息
1.4 小结与局限性
本工作仍存在一些局限性
- 首先,扩展训练时的上下文长度会提高训练成本;未来工作可以采用更为新近的 TTT 训练技术,例如 TNT (42)
- 其次,尽管提出了一种将 TTT 系统性地集成进机器人基础模型的方法,未来工作可以进一步为 TTT 层设计更偏向机器人任务的目标函数(类似于在视觉领域中的探索 (24))
- 最后,尽管 RoboTTT 在任务性能上取得了显著提升,它仍无法覆盖部署过程中遇到的所有失效模式;将其与强化学习结合,直接优化任务成功率,是一个自然而然的下一步方向
作者宣称,RoboTTT,这是一种机器人模型和训练方法,可以将机器人策略的视觉运动(visuomotor)上下文扩展到 8K 个时间步
- 在这一上下文长度下,RoboTTT 解锁了机器人的新能力:基于上下文中的人类视频示范进行一次性模仿、在线策略改进、对外部扰动的鲁棒性,以及在多阶段、长时域任务中的更强闭环控制性能
- 从核心机制上看,RoboTTT 将测试时训练(Test-Time Training)融入机器人基础模型之中,用作沿时间维度的序列建模机制;
其训练方案将
序列动作强制(sequence action forcing)
与
截断时间反向传播(truncated backpropagation throughtime)
相结合
使对长序列的训练变得可行
作者宣称,他们首次观察到,扩大全局预训练的上下文长度会带来闭环性能的持续提升,这表明上下文长度可以作为机器人基础模型的一个新的扩展维度
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐




所有评论(0)