【arXiv 2026】RoboTTT:把机器人策略的视觉运动上下文扩展到 8000 步|从具身智能上下文缩放视角
摘要
本文解读 arXiv 2026 论文《RoboTTT: Context Scaling for Robot Policies》。该论文提出RoboTTT,一个把测试时训练(TTT)快速权重集成进机器人基础模型(GR00T N1.7)的模型与训练配方,将视觉运动上下文缩放到 8000 个时间步,比现有最强策略高出三个数量级而推理延迟不变;其特别之处在于快速权重在训练与推理时都做梯度更新,把历史压缩进参数空间。实验表明平均任务完成度 79%、相对单步基线提升 87%,并首次观察到预训练上下文长度带来稳定的闭环性能提升(8K vs 1K:+63%),为机器人基础模型提供了"上下文长度"这一新缩放轴。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | RoboTTT: Context Scaling for Robot Policies |
| 标题(中文) | 把机器人策略的视觉运动上下文扩展到 8000 步 |
| 作者 | Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi ``Jim'' Fan |
| 机构 | NVIDIA GEAR Lab · Stanford University · The University of Texas at Austin |
| 会议 | arXiv 2026 |
| arXiv | https://arxiv.org/abs/2607.15275 |
| 项目网站 | https://research.nvidia.com/labs/gear/robottt/ |
为什么机器人策略需要 8000 步上下文?
真实世界的机器人任务往往部分可观测且长时程:目标位置、已完成步骤不会老老实实出现在当前画面里,一个五到十分钟的装配任务会产生数千步的交互历史。现有机器人基础模型只用单步或极短历史:GR00T N1.7、$\pi$0、OpenVLA 只看当前观测,RT-1/2、Octo 等最多用 2–8 帧。一旦任务出现视觉上相似的阶段(例如 Circuit 装配中不同配置的组件看起来很像),短上下文策略就会混淆状态、跳过或做错步骤。
已有长上下文方案各有缺陷:直接拼接历史(如 GR00T Hist)会引入虚假相关——它在 Pup Go Car 上只有 39.5% 完成度,反而低于无历史 GR00T 的 57%;而 Gated DeltaNet(GDN)这类线性递归记忆虽然状态固定、成本恒定,却无法从数千步密集交互流中提取结构(平均 56%)。RoboTTT 的答案是测试时训练:把历史压缩进可学习的快速权重参数空间,而不是堆在 KV 缓存或线性状态里。
研究主线:从问题到结论

图 10:RoboTTT 研究主线(Mermaid 流程图)
基准/方法设计:VLA 基础模型 + TTT 快速权重
RoboTTT 基于预训练好的 GR00T N1.7(Eagle VLM + DiT 动作头),在每个 DiT 层后追加一个 TTT 层(每层约 10M 参数,共 690M)。核心机制是快速权重:每时间步先"更新"再"应用"——用上一步权重对 K、V 做一步梯度下降得到新权重,再用新权重计算查询输出:
- 更新:$W_t \leftarrow W_{t-1} - \eta \nabla_W \mathcal{L}{\mathrm{FW}}\big(f{W_{t-1}}(K_t), V_t\big)$,其中 $\mathcal{L}_{\mathrm{FW}}(\hat{v},v)=\Vert \hat{v}-v \Vert^2$;
- 应用:$O_t = f_{W_t}(Q_t)$,投影矩阵与初始化 $W_0$ 由外层任务损失元学习;
- 16 个寄存器 token 跨时间步携带视觉语言信息,VL token 不直接过 TTT 以省计算;
- tanh 门控:$O = \tanh(\alpha)\odot O_{\mathrm{TTT}} + O_{\mathrm{attn}}$,$\alpha$ 初始化为 0.001,起步时几乎完全保留预训练能力。

图 1:RoboTTT 总览:8K 步长上下文策略集成 TTT,支持人类视频一次示教模仿与实时策略改进(来源:论文 Fig.1)
长上下文策略的三种路线对比

图 11:长上下文策略路线对比(Mermaid 流程图)
方法细节:让 8K 步训练可行的三个设计
序列动作强制:序列内每个动作块的噪声水平独立采样($\tau_t = s(1-u)$,$u\sim\mathrm{Beta}(1.5,1)$),避免固定噪声导致训练不稳定——去掉后闭环性能显著下降,因为动作不准无法推进任务。
截断 BPTT(TBPTT):梯度只回传段内,快速权重跨段携带状态、边界断开,显存只随段长而非总长增长,这是 8K 步预训练在固定显存预算下可行的关键。
长上下文条件化:屏蔽部分时间步的流匹配损失,让它们只作上下文(人类视频、次优 rollout),配合 DAgger 蒸馏把"失败动作→人类修正"的映射蒸馏进快速权重。

图 2:模型架构:GR00T N1.7(Eagle VLM + DiT)的每个 DiT 层后接 TTT 层,寄存器 token 跨时间步传递 VL 信息(来源:论文 Fig.2)
训练上分两阶段:预训练(上下文 128 → 8K 步)用桌面双手机器人数据 + EgoScale 自我中心人类视频,只训练新增序列层、冻结其余,30K 步跑在 16 块 GB200 上(4K 以下全局 batch 64,以上 16),AdamW + WSD 调度、峰值学习率 $2\times10^{-5}$;后训练针对每个下游任务以 1K 上下文微调 20K 步(全局 batch 8)、全量参数。部署在 YAM 双手机器人 + 4 个 RealSense D405(480p RGB),RTX 5090 上以 30 Hz 控制频率运行。
实验设计与结果:三个长时程双手机器人任务
评测用 YAM 双手机器人 + 4 个 RGB 相机(顶/底/左右腕),三个任务均需数分钟、多阶段操作:Pup Go Car(装车顶与轮胎,约 2 分钟/集)、Circuit(80 种装配配置,训练 20 / 测试 60,语言或一次视频示教指定目标)、Gear Bot(整装玩具机器人,约 5 分钟/集)。每任务 20 次试验(Gear Bot 与一次示教场景 10 次),报告完整成功次数与 $[0,1]$ 任务完成度评分;所有方法在相同初始摆放下评估。

图 3:三个长时程双手机器人装配任务:Pup Go Car、Circuit、Gear Bot(来源:论文 Fig.4)
主结果如下(平均完成度;评分细则见附录 D):
| 方法 | Pup Go Car | Circuit | Gear Bot | 平均完成度 |
|---|---|---|---|---|
| RoboTTT | 9/20 | 13/20 | 2/10 | 79% |
| GR00T N1.7 | 3/20 | 3/20 | 0/10 | 42% |
| GR00T N1.7 Hist. | 0/20 | 8/20 | 0/10 | — |
| GDN | 3/20 | 8/20 | 0/10 | 56% |
RoboTTT 平均完成度 79%,比单步基线 GR00T(42%)高 87%,比最强基线 GDN(56%)高 41%;Gear Bot 上只有 RoboTTT 有完整成功(2/10)——这是五分钟十阶段装配任务的第一次完整完成。

图 4:主实验:三个任务上的完整成功次数与任务完成度(来源:论文 Fig.5)
为什么能赢:快速权重实时保留历史显著特征,化解视觉相似阶段的状态混淆;策略具备策略性恢复——Pup Go Car 钻孔打偏时抬臂重对准再尝试,基线则直接进入下一阶段。对照实验表明:拼接历史本身不够(GR00T Hist 39.5% vs GR00T 57%),线性记忆也不够(GDN 同为固定大小状态,门控 Delta 规则无法从数千步密集流中提取结构)。

图 5:预训练上下文长度缩放:128 → 8K 步,RoboTTT 闭环性能稳定上升,8K 达 71.5%,无饱和迹象;GDN 无此趋势(来源:论文 Fig.6)
新能力一:一次示教模仿
给 Circuit 一条人类视频指定未见过的装配配置(不重新训练、不微调权重,只把视频喂进上下文):RoboTTT 6/10 成功(完成度 65%),GDN 0/10(33%)——能编码上下文不等于会用上下文。

图 6:一次示教模仿:人类视频指定 Circuit 装配配置,RoboTTT 跟随演示完成装配(来源:论文 Fig.8)
新能力二:扰动鲁棒性
拆掉已装好的屋顶/轮胎再让机器人继续:RoboTTT 以 15/20、18/20 恢复,短上下文基线屋顶最多 10/20、GR00T Hist 仅 3/20。长上下文方法对扰动反应更成功——上下文改善"集内条件化",自己的 rollout 历史参与决策。
新能力三:DAgger 蒸馏
同一批 100 条 DAgger 数据(50 条轨迹 × {RoboTTT, GR00T} 基础策略):标准 DAgger(只微调人类修正)平均 +9%,蒸馏(全轨迹作上下文、损失只算在修正上)平均 +33%(RoboTTT +36%,GDN +29%)。次优机器人动作作模仿目标无价值(GR00T 全轨迹微调 = 仅修正,均 57%),其价值在"作上下文"——可视为机器人版的 Algorithm Distillation。

图 7:DAgger 蒸馏结果:相同数据下,蒸馏(失败作上下文)明显优于标准 DAgger 微调(来源:论文 Fig.10)

图 8:定性 rollout:错误动作后 RoboTTT 在线恢复并继续完成任务(来源:论文 Fig.11)
消融实验
在 Pup Go Car 上:去掉序列动作强制后闭环性能显著下降;快速模型用线性层比 MLP 差 27%(非线性快速模型至关重要);开发路线图显示仅状态 token → +动作 token(+23% 相对提升)→ +寄存器 token(再 +18%);寄存器 token 对没有 TTT 的 GR00T 无帮助——它们只在与 TTT 时序建模配对时有效。

图 9:消融:序列动作强制、快速模型架构(MLP vs 线性)、逐组件开发路线图(来源:论文 Fig.A.1)
结果对比总结

图 12:结果对比总结(Mermaid 流程图)
关键发现
- 上下文缩放成立:8K vs 1K 预训练上下文,闭环性能 71.5% vs 43.9%(+63%),且无饱和迹象——首次在机器人策略上观察到稳定的上下文缩放规律。
- 快速权重优于线性记忆:同为固定大小状态,TTT 快速权重(79%)比 GDN 门控 Delta 规则(56%)平均高 23 个百分点。
- 一次示教模仿解锁:单条人类视频即可指定未见过的 Circuit 配置,6/10 成功 vs GDN 0/10。
- 部署期持续学习:DAgger 蒸馏让失败→修正映射进入快速权重,+36% 在线改进(标准 DAgger 仅 +9%)。
- 扰动恢复强:屋顶/轮胎扰动后 15/20、18/20 恢复,短上下文基线 ≤10/20。
- 恒定推理延迟:8K 步历史不增加推理成本,快速权重把历史压缩进参数空间。
局限性
- 训练成本:上下文越长预训练开销越大;可引入 TNT 等更新的 TTT 训练技巧。
- 通用 TTT 目标:当前用均方误差式快速权重损失,可探索面向机器人的 TTT 目标(如视觉领域的工作)。
- 未覆盖所有失败模式:性能大幅提升但不处理每种部署故障;与强化学习结合、直接优化任务成功是作者指出的自然下一步。
常见问题(FAQ)
RoboTTT 和"测试时微调"(如 TTT-VLA)有什么区别?
之前的机器人 TTT 工作只是用测试数据微调整个模型;RoboTTT 用真正的快速权重——一个小的可学习网络在训练和推理时都做梯度更新,只更新这层参数而非整个模型,并把预训练上下文真正缩放到 8K 步。
8K 步上下文为什么不会拖慢推理?
历史被压缩进快速权重的参数空间,推理时只做一次快速权重更新加前向计算,成本与上下文长度无关;对比之下,Transformer 的 KV 缓存随历史线性增长。
为什么 GR00T Hist 拼接历史反而更差?
拼接历史引入虚假相关:示范分布与部署分布发生协变量偏移后,策略把无关的旧帧当成决策依据(Pup Go Car 上 39.5% vs 无历史 57%)。选择性记忆比盲目堆上下文更重要。
一次示教模仿是怎么工作的?
人类视频被当作上下文条件输入,快速权重在"看视频"的过程中把示教信息压缩进权重;部署时这些权重参与决策,无需任何微调或标注。
上下文长度还能继续往上缩吗?
8K 步下性能曲线仍无饱和迹象,作者认为上下文长度是机器人基础模型的新缩放轴,可与 RL 后训练、更精细的 TTT 目标组合继续扩展。
RoboTTT 的训练开销大吗?
预训练 30K 步 @ 16 GB200、只训练新增序列层(冻结 VLM 与 DiT 其余部分);后训练每任务 1K 上下文微调 20K 步。显存由段长而非总长决定。
参考链接
- arXiv 论文:https://arxiv.org/abs/2607.15275
- 项目网站(含视频):https://research.nvidia.com/labs/gear/robottt/
- TTT RNN(Sun et al., 2024):https://arxiv.org/abs/2407.04620
- GR00T N1(NVIDIA, 2025):https://arxiv.org/abs/2503.14734
- Gated Delta Networks(Yang et al., ICLR 2024):https://arxiv.org/abs/2412.06464
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)