摘要

本文解读 ICML 2026(Oral)论文《RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies》。该论文提出大规模具身记忆评测基准 RoboMME,通过融合认知心理学记忆分类框架与非马尔可夫任务设计,系统性评测 VLA 模型的长程记忆能力,其特别之处在于首次同时覆盖时序、空间、对象、程序四种记忆维度,并在统一 π0.5 基座上构建 14 种记忆增强变体进行公平对比。实验表明感知记忆 + Modulator 集成以 44.51% 成功率夺冠,远超无记忆基线,且记忆效果高度任务依赖,为记忆增强机器人策略的设计提供了重要借鉴。

论文基本信息

项目 内容
标题(英文) RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies
标题(中文) 大规模具身记忆评测基准 RoboMME:系统性评估 VLA 模型的长程记忆能力
作者 Yinpei Dai, Hongze Fu, Jayjun Lee*, Yuejiang Liu, Haoran Zhang, Jianing Yang, Chelsea Finn, Nima Fazeli†, Joyce Chai†
机构 University of Michigan · Stanford University · Figure AI
会议 ICML 2026 (Oral)
arXiv https://arxiv.org/abs/2603.04639
项目网站 https://robomme.github.io/

为什么需要新的记忆评测基准?

现有 VLA(视觉-语言-动作)模型在长程操控任务中表现尚可——但仔细看,它们其实只依赖当前观测就能决策,记忆并非必需。RoboMME 指出这是现有基准的普遍缺陷:

  • LIBERO / CALVIN / VLABench:虽涉及时序,但仅凭当前观测即可决策——记忆非必需。
  • MemoryBench:首个显式记忆评测,但仅 3 个任务,近乎解决。
  • MIKASA-Robo:包含记忆任务,但短期、缺乏高质量演示,未系统性覆盖记忆类型。

RoboMME 将所有任务设计为非马尔可夫——相同观测在不同历史下需要不同动作,记忆从"可选"变为"必须"。从"隐式需要记忆"到显式评测记忆,这是 RoboMME 与既有基准的关键差异。

研究主线:从"隐式需要记忆"到"显式评测记忆"

RoboMME 研究主线 Mermaid 流程图:从现有基准无法评测记忆,到认知记忆维度定义、16 项非马尔可夫任务、14 种 MME-VLA 变体,再到感知记忆+Modulator 最优 44.51%

图 5:RoboMME 研究主线——从"隐式需要记忆"到"显式评测记忆"(Mermaid 流程图)

RoboMME 基准设计:4 种记忆维度 × 16 项任务

RoboMME 基于 ManiSkill 模拟器,使用 Franka Panda 7-DOF 机械臂、双视角 RGB 输入(前视图 + 腕部)。4 大任务套件 × 每套 4 个任务 = 16 项操控任务,全部非马尔可夫:

  • Counting(时序记忆 T):PickXTimes、BinFill、SwingXTimes、StopCube——记住"已经做了几步"。
  • Permanence(空间记忆 S):VideoUnmask、ButtonUnmask、VideoUnmaskSwap、ButtonUnmaskSwap——追踪遮挡后的物体位置。
  • Reference(对象记忆 O):PickHighlight、VideoRepick、VideoPlaceButton、VideoPlaceOrder——记住"哪个物体被高亮/被参照过"。
  • Imitation(程序记忆 P):MoveCube、InsertPeg、PatternLock、RouteStick——复现演示的动作模式。

数据规模:16 任务 × 100 条演示 = 1.6k 演示 / 770k 时间步,含 5% 扰动注入增强行为多样性。平均单任务 481 步,最长达 1134 步(VideoPlaceOrder)。

RoboMME 基准的四大任务套件:Counting、Permanence、Reference、Imitation,分别覆盖时序、空间、对象、程序四种记忆维度

图 1:RoboMME 四大任务套件:Counting(时序记忆)· Permanence(空间记忆)· Reference(对象记忆)· Imitation(程序记忆)

记忆维度全景:时序 / 空间 / 对象 / 程序

RoboMME 四种认知记忆维度 Mermaid 分类图:时序记忆、空间记忆、对象记忆、程序记忆及代表任务

图 6:RoboMME 四种认知记忆维度分类(时序/空间/对象/程序,含代表任务)(Mermaid)

MME-VLA 方法:3 种记忆表示 × 3 种集成机制

MME-VLA 套件基于 π0.5 基座,统一记忆预算 512 tokens(与 π0.5 单帧视觉 token 数匹配)。三种记忆表示:

  • 符号记忆(Symbolic):语言子目标(SimpleSG / GroundSG),VLM 生成(Gemini / QwenVL / Oracle)。可解释,但需额外子目标标注。
  • 感知记忆(Perceptual):历史视觉 token 序列——TokenDrop(保留变化最大的区域)vs FrameSamp(均匀采样关键帧)。保留丰富低级视觉信息。
  • 循环记忆(Recurrent):TTT(在线更新快权重)或 RMT(持久记忆槽位),压缩为固定大小潜状态。

三种集成机制:

  • Memory-as-Context:记忆 token 直接拼接到输入序列——最简单,但混合记忆与观测流,增加上下文长度。
  • Memory-as-Modulator:通过 AdaLN 将记忆注入动作专家——记忆作为调节信号,保持 VLM 流不变。
  • Memory-as-Expert:专用记忆专家处理记忆 token,动作专家同时关注 VLM 和记忆专家——隔离干扰,分配专用容量。

训练配置:多任务学习,80k steps,batch 64(循环 16),4×A40 GPU,冻结 SigLIP ViT。设计哲学:固定表示层(π0.5 VLM + SigLIP),只训练交互层——不重新发明表征,而是发明如何使用记忆表征

MME-VLA 框架图:三种记忆表示(符号/感知/循环)与三种端到端集成机制(Context/Modulator/Expert)

图 2:MME-VLA 框架:三种记忆表示(上)与三种端到端集成机制(下)

实验设置:800 episode 评测协议

  • 每任务 50 episode × 16 任务 = 800 episode;记忆预算 512 tokens;每 episode 最大 1,300 步。
  • 取最后 3 个检查点 × 3 个随机种子 = 9 次运行取平均。
  • 对比 4 种基线:π0.5(无记忆)、π0.5 w/ past actions(UniVLA 风格)、SAM2Act+、MemER。

实验结果:感知记忆 + Modulator 以 44.51% 夺冠

主结果:

方法 记忆类型 成功率%
Human Performance -- 90.50
GroundSG + Oracle Symbolic 84.08
MemER Hybrid 42.38
FrameSamp + Modul Perceptual 44.51
TokenDrop + Modul Perceptual 38.04
GroundSG + QwenVL Symbolic 32.70
π0.5 (no memory) None 17.93
SAM2Act+ Perceptual 21.37

感知记忆 + Modulator 集成达最优 44.51%,远超基准 π0.5(17.93%);人类 90.5% 仍有失误——RoboMME 对记忆的要求极高。

RoboMME 实验分析图:感知记忆在运动中心和长时间视频推理中最强,符号记忆在短程视频推理和事件显著任务中占优

图 3:不同任务功能需求下的性能对比:感知记忆在运动中心和时间敏感任务优势明显,符号记忆在事件显著任务中更强

RoboMME 效率-性能权衡图:FrameSamp+Modul 在适度计算成本下实现最优性能

图 4:效率-性能权衡:FrameSamp+Modul 在适度计算成本下实现最优性能;VLM 方法(GroundSG、MemER)计算开销显著更高

RoboMME 各方法成功率对比 Mermaid 图:基线 π0.5 17.93%、记忆增强 FrameSamp+Modulator 44.51%、参考上限人类 90.5%

图 7:主要方案成功率对比:基线 vs 记忆增强 vs 参考上限(Mermaid)

关键发现(Q1–Q6)

  • Q1 最强记忆方案:FrameSamp+Modul 以 44.51% 夺冠;Modulator 集成对感知记忆最有效——保持 π0.5 原始表征,以特征级调节注入记忆。
  • Q2 符号记忆够用吗:看任务。GroundSG+Oracle 达 84.08%(上限),但 StopCube(78%)和 InsertPeg 中语言指导有限,精确视控成为瓶颈。
  • Q3 人类表现如何:90.5% 整体成功率,但在 PatternLock 和 StopCube 等长程/时间敏感任务中持续犯错——RoboMME 对人类也有挑战。
  • Q4 记忆效果的任务依赖性:感知记忆在运动中心和长时间视频推理中最强;符号记忆在短程视频推理和事件显著任务中占优。无单一方案通吃
  • Q5 效率-性能权衡:FrameSamp+Modul 随记忆预算增加持续提升,计算开销仅 6.27 TFLOPs;VLM 方法(GroundSG ~3×, MemER ~5× 于 π0.5)。
  • Q6 真实世界迁移:4 项真实任务验证——符号记忆(PutFruits 9/10)优于计数任务,感知记忆(DrawPattern 8/10)优于运动模仿任务,趋势一致。

真实世界结果:

方法 PutFruits TrackCube RepickBlock DrawPattern Total
π0.5 2/10 1/10 1/10 0/10 4/40
GroundSG+QwenVL 9/10 3/10 5/10 2/10 19/40
FrameSamp+Modul 6/10 5/10 6/10 8/10 25/40

局限性

  • 桌面操控场景:固定桌面环境 + 有限资产集,未涉及移动操控或开放世界任务。
  • 单一基座(π0.5):主要评测 π0.5 变体,未覆盖 memory-bank 方法和更多 VLA backbone(如 OpenVLA、GR00T)。
  • 记忆表示之间仍独立:实验揭示互补性,但未探索混合记忆架构——同时利用符号和感知记忆。
  • 真实世界验证规模有限:仅 4 项任务 350 条演示,需更大规模物理验证。

作者展望:扩展到移动操控、更多基座架构、多记忆融合框架,希望 RoboMME 成为可靠、记忆增强的机器人通用策略的持久评测基础。

常见问题(FAQ)

RoboMME 是什么?

RoboMME(Robotic Memory Benchmark and Evaluation)是首个大规模标准化具身记忆评测基准,发表于 ICML 2026(Oral),由密歇根大学、斯坦福大学和 Figure AI 联合提出,用于系统性评估 VLA 模型在长程操控中的记忆能力。

RoboMME 评测哪几种记忆?

四种认知记忆维度:时序记忆(T,Counting 套件)、空间记忆(S,Permanence 套件)、对象记忆(O,Reference 套件)、程序记忆(P,Imitation 套件),共 16 项非马尔可夫操控任务。

为什么说现有基准测不了记忆?

LIBERO、CALVIN 等基准的任务仅凭当前观测即可决策,模型无需记忆也能完成;RoboMME 的所有任务都是非马尔可夫的——相同观测在不同历史下需要不同动作,记忆成为必需。

哪种记忆方案最强?

感知记忆 + Modulator 集成(FrameSamp+Modul)以 44.51% 成功率夺冠,远超无记忆基线 π0.5(17.93%);但记忆效果高度任务依赖,符号记忆(GroundSG+Oracle 84.08%)在计数类任务上更强。

MME-VLA 变体是怎么构建的?

在统一 π0.5 基座上,组合 3 种记忆表示(符号/感知/循环)× 3 种集成机制(Context/Modulator/Expert),共 14 种变体,统一 512 token 记忆预算,实现同一起跑线的公平对比。

人类在 RoboMME 上表现如何?

人类整体成功率 90.5%,但在 PatternLock、StopCube 等长程或时间敏感任务中持续犯错,说明 RoboMME 对记忆的要求极高,对人类同样有挑战。

参考链接

  • 论文 arXiv:https://arxiv.org/abs/2603.04639
  • 项目网站:https://robomme.github.io/
  • π0.5:A Vision-Language-Action Model with Open-World Generalization(CoRL 2025)
  • MemER: Scaling Up Memory for Robot Control via Experience Retrieval(ICLR 2026)
  • SAM2Act: Integrating Visual Foundation Model with a Memory Architecture for Robotic Manipulation(ICML 2025)
  • ContextVLA: VLA Model with Amortized Multi-Frame Context(arXiv:2510.04246)

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐