【RSS 2026】HALO:长时程机器人控制,让视觉运动策略学会「检索哪段记忆」|从机器人长时程记忆视角
摘要
本文解读 RSS 2026 论文《Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control》。该论文提出 HALO,一个面向长时程机器人控制的记忆检索式视觉运动策略(visuomotor policy),通过融合 VLM 生成的视频问答监督、top-k 稀疏注意力与模仿学习联合训练,让策略能在长达 8 分钟的历史里检索出与当前决策相关的片段,其特别之处在于不压缩历史,而是学习「该读哪几条」。实验表明仿真基准平均成功率 0.41(比最强基线 SMT 高 7 个百分点、比标准 Transformer 高 19 个百分点),真机五个任务平均 0.55,为具身智能中的长时程记忆检索提供了可复用的设计范式。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control |
| 标题(中文) | 长时程机器人控制:让视觉运动策略学会「检索哪段记忆」 |
| 作者 | Rutav Shah, Yisu Li, Femi Bello, Yuke Zhu, Roberto Martín-Martín |
| 机构 | 得克萨斯大学奥斯汀分校(UT Austin)· RobIn Lab 与 RPL Lab |
| 会议 | RSS 2026 |
| arXiv | arXiv:2606.25136 |
| 项目网站 | robin-lab.cs.utexas.edu/HALO |
背景与动机:为什么机器人必须学会「回忆」
家用机器人执行长时程任务时,决策所需的信息往往已经不在当前画面里:物体被放到台面哪一侧、灶台开了多久、已经往抽屉里放了几包薯片。这类任务中,纯反应式策略必然失败,因为成功与否取决于能否回忆起先前观察到的信息。而需要回忆的内容类型还非常杂,至少包括四类:空间信息(物体位置)、关系信息(这件物体原本在哪个盘子里)、数值信息(已经数到第几个)与事件时间信息(某个动作是何时发生的)。
已有路线可以归为三类,各自都带着先验假设。第一类是手工先验:MemER 一类方法用人工规则决定存什么、丢什么,SAM2Act++ 用对象中心的像素坐标作为记忆,ReMemBer 用 VLM 生成的文本摘要压缩历史。第二类是压缩表示:Scene Memory Transformer 用注意力把整段历史压成一个场景嵌入,Token Merging 把时间上相邻、嵌入相近的 token 合并进固定预算,LSTM 与 Mamba 则把历史压进隐状态。第三类是长上下文注意力:让 Transformer 直接访问过去,理论上能从数据里学到检索,但在离线模仿学习上有两个致命问题——策略可能学到虚假相关(把与专家动作偶然同步的过去帧当成因果线索,测试时失效),以及记忆漂移(闭环执行中的小误差被反复写进记忆并在长时程上复合,导致级联失败)。
把这篇工作放回更长的脉络里看,这条线在六年间换了两次问题:2019 年的 Scene Memory Transformer 第一次让策略端到端消费历史;2023 至 2025 年的 MemER、SAM2Act++、ReMemBer 都在设计「存什么」,用先验换取紧凑与可解释;MemoryVLA 与 Token Merging 则用压缩换取更长的可用上下文。HALO 换的是第三个方向:不压缩存储,而是学习读哪一段——记忆的瓶颈从容量转向了寻址。这也是它能在八分钟量级的历史上仍然工作的根本原因。
研究主线:从问题到结论

图 11:HALO 的研究主线(Mermaid 流程图)。问题始于信息已离开当前视野,动机落在虚假相关与记忆漂移两类失效模式上,设计上选择「保留全部历史 + 学习式检索」,再用 VQA 蒸馏解决「该检索什么」、用 top-k 稀疏注意力解决「读多少」,最后在 ReMemBench 与五个真机任务上验证。
基准/方法设计:把记忆当作可检索的对象
HALO 的问题设定是标准的离线模仿学习:学习一个闭环策略 $\pi_\theta(a_t \mid \tau_t, l)$,其中 $\tau_t$ 是交互历史、$l$ 是语言指令,训练数据是遥操作采集的专家示范。与常见做法不同,HALO 不为记忆设计任何专用表示——它保留全部历史,把「读什么」交给学习。记当前观测编码为 $x_t$、历史中第 $i$ 条记忆为 $m_i$,检索用最朴素的 query-key-value 形式:查询由当前上下文给出,即 $q_t = f_q(x_t, l)$,每条记忆映射为键与值 $k_i = f_k(m_i)$、$v_i = f_v(m_i)$,再按相似度聚合。

图 1:视觉运动策略学习中的记忆检索。长时程家务任务要求机器人依据当前感知里已经不存在的信息行动:把零食放到台面之后,越往后越需要回头去翻历史。需要的信息类型还会随任务阶段变化,这正是「通用的、可学习的检索机制」的动机。
这套设定下,系统的三个组件是:冻结的预训练视觉编码器加可学习池化(把 RGB 与本体感知压成单个嵌入)、MLP 动作编码器,以及一个 Transformer 策略骨干——其中四层做局部注意力、两层执行长时程检索。输出端有两个头:动作头预测 32 步未来动作,文本头自回归回答问题。两个失效模式各配一个组件来治,这是全文最核心的设计选择。
分类全景:机器人长时程记忆的四条技术路线

图 12:机器人长时程记忆的技术路线分类(Mermaid 图)。手工先验路线包含 MemER、SAM2Act++ 与 ReMemBer;压缩表示路线包含 Scene Memory Transformer、MemoryVLA(Token 合并)与 LSTM/Mamba;显式记忆加学习式检索路线则分全注意力与 HALO 的 top-k 稀疏检索两类。
方法细节:两个组件分别解决「检索什么」与「读多少」
组件一:用视频问答把 VLM 先验蒸进检索。 直觉是:VLM 知道完成这个任务时历史上哪些信息重要,但它不含动作、单独拿来控制不够,正适合当检索的监督信号。作者用三阶段流水线生成问答对:先把轨迹转成文本(SAM3 做目标检测、gpt-4o-mini 写活动描述,合成带帧号的事件摘要);再从摘要合成问题与答案,关键细节是随机采样帧号再提问,以缓解语言模型只问轨迹开头信息的偏置,同时允许模型回答 N/A;最后用 gpt-4o 按正确性与任务相关性打分过滤,约 20% 的数据被丢弃。每个任务最终得到 20k 至 30k 条问答对。之所以称之为「记忆依赖」的问题,是因为要回答「第 19 帧有几个海绵」,模型必须回头去读那一段历史——于是检索过程本身被直接监督了。训练目标是模仿损失与问答损失的加权和,即 $\mathcal{L} = \mathcal{L}{\mathrm{IL}} + \lambda \mathcal{L}{\mathrm{VQA}}$,权重取 $\lambda \in {0.1, 1.0}$。

图 2:HALO 总体框架。中间是共享的检索骨干,从历史观测与动作的显式记忆里取信息来预测低层动作;左侧把 VLM 先验通过视频问答蒸进同一个检索模块,让检索偏向任务相关片段;右侧用稀疏注意力限制每次实际读入的信息量。

图 3:视频问答数据的生成流水线。图像先经带定位能力的视觉模型转成文本,轨迹被摘要成带帧号的事件序列;随后 LLM 依据摘要与任务描述生成问答对,并逐条校验正确性与相关性。作者发现一次性用长视频直接提问会大量出错与幻觉,分阶段是可用性的前提。
组件二:用 top-k 稀疏注意力限制读取量。 标准注意力对全部记忆聚合,噪声历史每一条都会施加影响;HALO 先按相似度选出最相关的 $k$ 条,即 $\mathcal{I}k = \mathrm{TopK}({s_i}, k)$,其中 $s_i = \langle q_t, k_i \rangle$,然后只在子集上做归一化加权 $c_t = \sum{i \in \mathcal{I}k} \exp(s_i) v_i / \sum{j \in \mathcal{I}_k} \exp(s_j)$,集合外权重置零。由于 top-k 选择不可微,作者用 straight-through estimator 直通梯度:被选中的条目若有助于动作预测或问答,其 query-key 相似度会被强化,反之被削弱。实现上每 8 个交互步写入一条记忆,单条 episode 的记忆条数从 192 到 3840 不等,每次取 $k=8$ 条;策略骨干共 4 层局部注意力(各 4 头)加 2 层 top-k 检索,动作头预测 32 步动作并用 L1 损失。之所以强调内容相关而非位置固定,是因为任务相关事件出现的时刻不可预测——窗口、步长、分层这些固定访问模式会漏掉它们。

图 4:HALO 实际检索到了什么。它从历史里取回的是异质而互补的信息:既有目标物体被看到的那几帧,也有其它通常放置该物体的位置帧;既有能提示物体来源容器的历史动作,也有标记子目标进度的帧。
实验设计与结果:仿真基准 + 五个真机任务
评测分两部分。仿真用 ReMemBench,每个任务 50 次 rollout,专门覆盖空间、关系、数值与事件时间四类记忆需求;真机上做五个任务,每个 20 次 rollout,跨固定底座机械臂与移动操作两台平台。评测协议是闭环执行并报告最终成功率。
| 任务 | 域 | 最大记忆条数 | 相机数 | 专家示范数 |
|---|---|---|---|---|
| Retrieve Object | 仿真 | 196 | 2 | 50 |
| Retrieve Object | 真机 | 192 | 1 | 50 |
| Return to Same Container | 仿真 | 192 | 2 | 50 |
| Return to Same Container | 真机 | 192 | 2 | 100 |
| Store N Objects | 仿真 | 768 | 2 | 50 |
| Store N Objects | 真机 | 768 | 2 | 100 |
| Heat Stove for T mins | 仿真 | 768 | 2 | 50 |
| Heat Stove for T mins | 真机 | 768 | 2 | 60 |
注意记忆容量是按任务最大时长设定的,也就是说在这类系统里,「记忆该多长」仍是一个需要按任务手工分配的资源,而不是自动决定的量。

图 5:真机任务一览(每行一个任务、每列一个阶段)。四个固定底座与移动操作任务加一个人机协作任务,共同特点是强部分可观测:目标物或事件一旦离开视野就只能靠记忆。
主结果。 在仿真基准上,手工设计特征在空间任务最强(0.68),SAM2Act++ 在计数任务最好(0.27),而 HALO 在关系与事件时间上领先,平均成功率 0.41,比最强基线 Scene Memory Transformer 的 0.34 高 7 个百分点,比标准 Transformer 的 0.22 高 19 个百分点。逐类对手的差距是:对对象中心路线 +21 个点、对文本摘要 +23 个点、对人工规则 +12 个点、对两种压缩表示分别 +7 与 +12 个点。真机上 HALO 平均 0.55,比标准 Transformer 的 0.36 高 19 个百分点。
| 任务(记忆类型) | 标准 Transformer | 最强基线 | HALO w/o VQA | HALO |
|---|---|---|---|---|
| Retrieve Object(空间) | 0.26 | 0.68(手工特征) | 0.42 | 0.64 |
| Return to Same Container(关系) | 0.23 | 0.25(SMT) | 0.29 | 0.32 |
| Store N Objects(数值) | 0.12 | 0.27(SAM2Act++) | 0.17 | 0.26 |
| Heat Stove for T mins(事件时间) | 0.27 | 0.40(SMT) | 0.37 | 0.40 |
| 平均 | 0.22 | 0.34 | 0.31 | 0.41 |
没有任何方法在所有任务上都赢,HALO 的价值在于不需要任务特定的假设或人工规则就能拿到最高平均分。
备选稀疏化与记忆机制的横向对比。 把历史压进隐状态的路线在检索类任务上普遍只有 0.1 至 0.2;固定访问模式的注意力同样低,说明任务相关事件出现的时刻不可预测。同为内容相关,软门控注意力明显不如硬选择。
| 机制 | 类别 | Retrieve Object | Return to Container |
|---|---|---|---|
| LSTM | 压缩隐状态 | 0.14 | 0.12 |
| Mamba | 压缩隐状态 | 0.20 | 0.18 |
| Transformer-XL | 压缩隐状态 | 0.12 | 0.20 |
| 窗口注意力 | 固定访问模式 | 0.13 | 0.16 |
| 步长注意力 | 固定访问模式 | 0.20 | 0.28 |
| 分层注意力 | 固定访问模式 | 0.28 | 0.22 |
| 门控注意力 | 内容相关(软) | 0.45 | 0.28 |
| HALO(top-k) | 内容相关(硬选择) | 0.64 | 0.32 |
定性证据。 在 Retrieve Object 的导航决策上,策略同时取回目标物体可见的帧与该物体通常所在位置的帧;在 Return to Same Container 的操作决策上,同时取回能提示来源容器的历史动作与标记子目标进度的帧。更关键的是 Grad-CAM 对照:HALO 的影响区域集中在目标物体(如橄榄油瓶)位置,去掉 VQA 监督后,标准 Transformer 会对纸巾卷这类干扰物敏感——虚假相关在像素层面被看见了。

图 6:两个决策点上被检索到的记忆。左列是当前观测,机器人必须依据之前看到的信息决定移动方向或把物体放回哪个容器;右列是实际被选中的帧与动作嵌入。

图 7:Grad-CAM 式归因可视化(历史图像中对动作预测影响最大的区域)。上:HALO 聚焦在目标物体位置上;下:没有 VQA 监督的标准 Transformer 会被干扰物影响,例如纸巾卷的位置。
漂移的量化证据。 作者在相同初始条件下分别 rollout 策略与专家轨迹,把连续动作按维度分箱成归一化直方图,计算两者动作分布之间的 Jensen-Shannon 散度(JSD)。加入 top-k 之后,JSD 从 0.07 降到 0.06,与成功率提升方向一致。作者也提醒 JSD 是诊断指标而不是成败判据:在某些随机环境下完全复刻专家并非最优。

图 8:rollout 与专家动作分布之间的 Jensen-Shannon 散度(每任务一个标量,越小越接近专家)。加入 top-k 稀疏检索后 JSD 由 0.07 降到 0.06。

图 9:受控玩具实验:检索预算 k 与上下文长度 N 的交互。固定 N 时不同 k 的表现相近,而不同信息需求的任务之间差异明显——说明该取多大的 k 取决于「这道决定需要多少比特的信息」,而不是「历史有多长」。
VQA 数据长什么样。 提问覆盖物体位置、计数与长时程任务进度等不同类型,但都满足同一条件:必须回看历史才能回答。这正是它们能够充当检索过程监督的原因。生成端还有两条硬规则:必须使用具体的查询帧号(禁止「第一帧」「最后一帧」这类泛指),无答案时回答 N/A;过滤端则把「记忆依赖性」单列为一项评分维度,因为问题有用并不等于问题必须靠记忆。

图 10:自动生成并过滤后的视频问答示例(为保持可读性每个视频只均匀采样四帧)。
结果对比总结

图 13:结果对比总结(Mermaid 图)。仿真平均成功率从标准 Transformer 的 0.22、最强基线 SMT 的 0.34 提升到 HALO 的 0.41;真机由 0.36 提升到 0.55;Retrieve Object 任务上记忆失败率下降 25 个百分点。
关键发现
- VLM 先验必须与动作接地联合训练。 只加 VQA 监督平均 +10 个点的前提下,纯先验(不做动作接地)只有 18% 成功率,联合训练才到 41%;而且先 VQA 预训练再微调只有 44%,几乎等于完全不用 VQA 的 42%——说明 VQA 学到的检索偏置会在微调阶段被冲掉,共同训练是必需而非可选。
- 稀疏化直接带来 9 个点的平均提升,但 k 不能乱调。 k=8 最优(52%),k=4 掉到 40%(漏掉必要上下文),k=16 掉到 33%(把无关历史带了进来),k=24 回到 44%。最优 k 取决于决策所需的信息量,而非上下文长度。
- 真机上的失败分解支持「漂移减少」这一机制解释。 在 Retrieve Object 任务上,操作失败下降 8 个百分点、记忆失败下降 25 个百分点;配套的 JSD 从 0.07 降到 0.06。
- 数据流水线的质量是上限。 分阶段生成问答比一次性用长视频提示准确率高 60 个百分点、幻觉少 20 个百分点;过滤阶段丢掉约 20% 数据。
- 这篇工作命中的创新模式很清晰。 一是用可自动生成的外部先验替代手工定义的监督(把「该检索什么」交给 VLM 生成的问题来监督);二是用简单算子替换复杂机制(top-k 加一个直通估计器,就替代了窗口、步长、分层、门控一整套设计,比同为内容相关的门控注意力高 11 个点);三是把混淆拆开的诊断实验(Grad-CAM 让「模型在看哪里」与性能数字相互独立地成立)。
局限性
- 没有跨任务与跨本体的证据。 每个任务单独训练一个模型,论文没有给出统一策略在多任务、多平台上的表现。
- k 是超参而不是决策。 作者自己的受控实验显示最优 k 取决于决策所需的信息量,但本文用的是固定 k;自适应检索被留作未来工作。
- 写入策略同样固定。 每 8 步写一条记忆、容量 192 至 3840,按任务时长手工设定,何时该写、该写多少都没有学习。
- 对生成流水线依赖很重。 VQA 质量依赖 SAM3 与 gpt-4o 系列的三级流水线,既是成本也是误差来源。
- 延迟未优化,评测规模有限。 从大记忆里检索会引入额外延迟,作者提出用 speculative retrieval 隐藏它但没有实现;真机每任务 20 个 episode、仿真 50 个,统计噪声不可忽略。
常见问题(FAQ)
HALO 和 ReMemBer 这类用 VLM 的方法有什么本质区别?
区别在于 VLM 先验用在哪里。ReMemBer 把历史压成 VLM 写的文本摘要,摘要本身成为策略的输入,因此会丢掉导航到物体所需的动作细节——它在 Retrieve Object 任务上的表现正说明了这一点。HALO 只把 VLM 用作检索的监督信号:问答对教策略「该回忆什么」,而控制所需的信息仍然从原始记忆里取,所以保留了细粒度。
为什么用 top-k 而不是窗口注意力或门控注意力?
因为任务相关事件出现的时刻不可预测。窗口、步长、分层这三种固定访问模式在仿真基准上分别只有 0.13、0.20、0.28(Retrieve Object),明显低于按内容选择的方案;而在内容相关的两类方法里,硬选择的 top-k(0.64)又优于软门控(0.45)——少而准的读取比全量加权更有效。
HALO 需要存储多大的记忆?
单条 episode 的记忆条数在 192 至 3840 之间,取决于任务最大时长;每 8 个交互步写入一条,检索时只取 8 条,因此记忆容量本身不是瓶颈,检索才是。这也解释了作者为何把下一步放在自适应检索上。
记忆机制会不会在完全可观测的任务上拖后腿?
论文的评测集中在需要记忆的部分可观测任务上,没有报告完全可观测任务上的对照;但从机制上看,top-k 检索只影响「读多少」,动作头与局部注意力层仍在处理当前观测,因此代价主要体现为检索延迟而不是表达能力下降。这一点在长时程任务上更明显,也是作者列出的待解决问题之一。
这篇论文在写作与实验陈设上有什么可借鉴或需要留意的地方?
可借鉴的是它的验证结构:先证明 VLM 先验单独不够(18%),再证明与动作接地联合才有效(41%),把「组件有效」拆成两步来证。需要留意的是若干细节瑕疵——真机任务清单里 Store N objects 这个任务名出现了两次;任务名为 Heat Stove 而正文描述为加热锅具;「过滤掉约 20% 数据」这个数字只出现在图注;基准 ReMemBench 的引用仍是匿名投稿形式。
参考链接
- 论文 arXiv 摘要页:arXiv:2606.25136
- 项目主页(含视频与代码):robin-lab.cs.utexas.edu/HALO
- 关键基线 ReMemBer(VLM 文本摘要式记忆):arXiv 检索
- 关键基线 SAM2Act++(对象中心记忆):SAM2Act 项目页
- 关键基线 Scene Memory Transformer(历史压缩):arXiv:1903.03878
- 稀疏注意力源头:arXiv:1904.10509
- 非参数记忆(检索增强):arXiv:2005.11401
- 长上下文循环:arXiv:1901.02860
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)