【CVPR 2026】WorldMM:长视频推理的动态多模态记忆智能体|从具身智能长时记忆视角
摘要
本文解读 CVPR 2026(Highlight)论文《WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning》。该论文提出 WorldMM——一个动态多模态记忆智能体,通过融合多时间尺度情节记忆、持续演化的语义记忆与双模式视觉记忆,让视频大模型在不处理全量帧的前提下完成小时级到周级的长视频推理,其特别之处在于把「用哪种模态、取多长的时间窗」这两个决定下放给检索智能体自行决策。实验表明它在五个长视频问答基准上平均准确率 69.5%,超过最强基线 8.4 个百分点,检索的时间交并比达到 10.09(最强基线 HippoRAG 仅 4.00),为长视频记忆系统提供了可复用的设计范式。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning |
| 标题(中文) | 长视频推理的动态多模态记忆智能体 |
| 作者 | Woongyeong Yeo, Kangsan Kim, Jaehong Yoon, Sung Ju Hwang |
| 机构 | KAIST (MLAI Lab) · NTU Singapore · DeepAuto.ai |
| 会议 | CVPR 2026(Highlight) |
| arXiv | 2512.02425 |
| 项目网站 | worldmm.github.io |
背景与动机
长视频记忆的问题从哪里来?视频大模型(video LLM)在短视频理解上已经相当成熟,但当视频长度扩展到数小时甚至数天,两个约束立刻显现:一是上下文容量——一段日长视频即使按每秒 1 帧采样,帧数也远超模型的上下文窗口;二是细节损失——把视频压成文本摘要时,最关键的外观、空间与场景细节往往最先被丢掉。已有的记忆增强方法选择用「文本摘要 + 检索」绕开上下文限制,只把少量相关片段送进模型,方向是对的,却留下两个结构性缺口。
缺口一:记忆几乎全是文本。 主流做法把每段视频转成 caption 或 summary,检索与推理都只在这套文本上进行。M3-Agent(ICLR 2026)在建记忆时用到了视觉输入,但仅限实体识别,推理阶段并不使用视觉证据;EgoRAG(EgoLife,CVPR 2025)那种把 caption 与对应帧一并交给模型的做法,又会因为引入无关帧而干扰模型判断——论文明确指出,固定地同时给文本和图像是次优策略。
缺口二:检索被钉死在固定时间尺度上。 典型实现是固定取「3 个 30 秒片段」,可真实问题的时间跨度差异极大:问「我的眼镜放哪了」只需要数秒证据,问「下半场比赛发生了什么」却需要小时级上下文。论文用一句很形象的对比说明这一点,固定窗口的检索设计必然顾此失彼。
这两条缺口共同指向一个结论:缺的不是更强的摘要模型,而是一套自适应机制——让检索端自己决定用哪种模态(文本 / 视觉)与取多长的时间窗(秒 / 分 / 小时)。相关工作也印证了这个空白:Video-RAG、LightRAG、HippoRAG 提供了检索式证据但记忆仍以文本片段为载体;Ego-R1、HippoMM 引入工具化推理与双过程记忆,但检索形态与时间尺度依然是预设固定的。
研究主线:从问题到结论

图 7:WorldMM 研究主线(Mermaid 流程图):问题(天级视频撑爆上下文)→ 动机(文本记忆丢失视觉证据)→ 设计(三类互补记忆)→ 方法(检索智能体自选模态与尺度)→ 实验(五基准)→ 结论(平均 69.5%)。
基准/方法设计
WorldMM 的设计可以概括为「三类记忆 × 自适应检索 × 解耦作答」。三类记忆各自编码互补的视频知识,构成一个有层次的证据池:
| 记忆类型 | 载体 | 负责什么 |
|---|---|---|
| 情节记忆(Episodic) | 多时间尺度知识图谱 $\mathcal{M}e={G{t_0}, G_{t_1}, \dots, G_{t_N}}$ | 事件与时序,支持跨尺度的时间接地 |
| 语义记忆(Semantic) | 持续演化的关系图 $\mathcal{M}s=G{t_s}^M$ | 长期关系与习惯,跨事件连续性 |
| 视觉记忆(Visual) | 特征嵌入 $\mathcal{M}_v^f$ + 帧时间戳索引 $\mathcal{M}_v^I$ | 外观、空间与场景细节等文本说不清的证据 |
这套设计的关键在于时间尺度集合 $\mathcal{T}={t_0, t_1, \dots, t_N}$($t_0<t_1<\cdots<t_N$)不是超参而是结构:同一段视频会按每个 $t_i$ 切分并分别建图,使检索端可以在秒、分、小时之间自由切换。视觉记忆则采用双通道,一路按文本查询做特征余弦检索,一路保存 $(t_i, I_i)$ 帧索引以便按时间戳精确回取。

图 1:长视频记忆的四种形态。(a) 天级视频按 1 fps 采样,帧数远超视频 LLM 的上下文容量;(b) M3-Agent 依赖文本表示,视觉信息被压缩掉;(c) EgoRAG 同时检索 caption 与对应帧,无关帧反而干扰模型;(d) WorldMM 构建三类互补记忆,并用自适应检索按需取用多模态信息。
分类全景

图 8:WorldMM 的记忆体系分类(Mermaid 图):情节记忆(多尺度事件图)、语义记忆(演化关系图)、视觉记忆(特征索引)与自适应检索(模态 + 尺度选择)四块共同构成完整记忆能力。
方法细节
情节记忆怎么建。 先在最小单元 $t_0$ 上做细粒度 caption,再对多尺度集合中的每个时间粒度切分并抽取 entity–action–entity 三元组,得到一组知识图谱。这样做的直接好处是:粗尺度的图给出叙事主线,细尺度的图保留事件细节,检索时可以「先粗后细」。
语义记忆怎么保持连续。 情节图由独立事件构成,无法保留远距离场景之间的连续性。因此语义记忆改用固定粗尺度 $t_s$ 抽取概念性三元组,并做增量整合:先用嵌入相似度定位重叠或冲突的项,再由 LLM 判定哪些过期、哪些需要修订或新增,形式化为 $\text{Consolidate}(G^k, T^{k+1}) = (G^k \setminus T_{\text{remove}}) \cup T_{\text{update}}$。相似度超过 0.6 的三元组才进入合并判定,最终保留 top-10。举个例子,反复出现「用厨房湿巾清理台面」的片段会被抽象成一条稳定的习惯性关系,而不会随单次事件被覆盖。
检索为什么算推理。 检索智能体 $\mathcal{R}(q, r_{<i})$ 每轮以原问题 $q$ 与历史 $r_{<i}$ 为输入,输出一个记忆–查询对 $(m_i, q_i)$ 或停止信号,其中 $m_i \in {\mathcal{M}_e, \mathcal{M}_s, \mathcal{M}_v}$。三类记忆各有专属检索算子:情节检索按个性化 PageRank 分数取 top-$k$ caption 后,再由 LLM 充当跨尺度重排器联合挑选;语义检索把 PPR 从节点推广到边,用两端节点 PPR 之和给边打分;视觉检索在无时间线索时走特征相似度,已有时间戳时直接取帧。多轮迭代把每一步的结果累积进历史,直到模型判断信息充分或触达上限——「用什么模态、在什么粒度上、取几次」这三个决定全部由模型自己做出,这正是它区别于固定检索管线的地方。

图 2:WorldMM 总览。(左) 多模态记忆构建——情节、语义、视觉三类记忆分别承载时间事件、长期关系与视觉细节;(中) 自适应记忆检索——检索智能体迭代地选择记忆来源并构造模态相关查询;(右) 响应生成——用检索结果与推理历史生成有据可依的回答。
实验设计与结果
实验覆盖五个长视频问答基准,时间跨度从小时级到周级,全部为多选问答、以准确率为指标。
| 数据集 | 查询数 | 领域 | 平均视频长度 |
|---|---|---|---|
| EgoLifeQA | 500 | 第一视角 | 44.3 h |
| Ego-R1 Bench | 300 | 第一视角 | 44.3 h |
| HippoVlog | 1,000 | Vlog | 0.45 h |
| LVBench | 1,534 | 通用 | 1.14 h |
| Video-MME (L) | 900 | 通用 | 0.69 h |
其中 EgoLifeQA 与 Ego-R1 Bench 共享同一位参与者 44.3 小时的第一视角视频流,前者分 EntityLog、EventRecall、HabitInsight、RelationMap、TaskMaster 五类,后者侧重多步工具增强推理;HippoVlog 分听觉、视觉、视听与摘要四类;LVBench 按所需片段长度分短、中、长三档;Video-MME 长视频子集包含 12 个能力类别。记忆构建统一用 GPT-5-mini,视觉编码器为 VLM2Vec-V2,语音转写为 Distil-Whisper large-v3.5,智能体分别取 GPT-5 与 Qwen3-VL-8B-Instruct。
主结果如下(节选自论文主表,完整表见原文):
| 方法 | EgoLifeQA | Ego-R1 Bench | LVBench | 平均 |
|---|---|---|---|---|
| GPT-5 | 48.6 | 46.3 | 60.4 | 61.1 |
| HippoRAG | 59.6 | 56.0 | 54.0 | 57.0 |
| HippoMM | 54.6 | 53.0 | 38.2 | 51.8 |
| M3-Agent (7B) | 53.5 | 52.0 | 49.3 | 55.1 |
| WorldMM-8B | 56.4 | 52.0 | 55.4 | 59.9 |
| WorldMM-GPT | 65.6 | 65.3 | 61.9 | 69.5 |
记忆组合的消融直接验证了「互补」这一说法:只用情节记忆平均 64.9,只用视觉记忆仅 44.9(差 20.0 个点);情节 + 语义为 66.8,情节 + 视觉为 66.9,而三类齐全达到 69.5,比任何一个两类组合都高 2.6–2.7 个点。模块级消融进一步给出可归因的损失:情节记忆换成单一固定尺度 −6.1 点、换成嵌入检索 −4.4 点,语义记忆去掉增量 consolidation 约 −7 点,视觉记忆关闭双模式检索约 −3 点。

图 3:WorldMM 在 EgoLifeQA 五类问题上的记忆类型使用比例:情节记忆在所有类别中都占基础地位,HabitInsight 与 RelationMap 明显偏向语义记忆,EntityLog 与 EventRecall 则更多调用视觉记忆。
动态时间尺度的价值用 tIoU(检索片段与真值片段的时间交并比)衡量:WorldMM 在 EgoLifeQA 上为 10.09,是 HippoRAG(4.00)的 2.5 倍、EgoRAG(3.60)的 2.8 倍;在 LVBench 超过 5 分钟的长片段问题上差距进一步拉大到 10.02 对 1.88。推理式时间定位(Time-R1,0.58)与关键帧选择方法的得分最低,说明「会定位」并不等于「会跨尺度取证」。

图 4:WorldMM 与基线在 EgoLifeQA 100 条随机问题上的延迟—精度权衡:长视频 LLM 延迟高而精度低,RAG 与记忆式方法延迟较低但精度受限,WorldMM 取得更优的整体位置。

图 5:检索轮数的影响:随最大迭代步数增加,各基准准确率持续上升;EgoLifeQA 上 5 步较单步提升 9.3 个点,说明多轮取证对长视频推理是必要的。

图 6:定性结果:(a) 仅靠情节记忆会丢失视觉细节(无法判断烘焙的是什么),检索智能体转取视觉记忆后即可正确作答;(b) 面对习惯性行为,智能体主动调用语义记忆,用长期累积的关系知识补上单事件记忆无法给出的答案。
结果对比总结

图 9:WorldMM 结果对比(Mermaid 图):检索 tIoU 从 HippoRAG 的 4.00 提升到 10.09,平均准确率从最强基线 55.1 提升到 69.5,并由自适应尺度与多轮检索共同贡献。
关键发现
- 周级视频的增益最大:WorldMM-GPT 在 EgoLifeQA 上 65.6(最强基线 59.6)、Ego-R1 Bench 上 65.3(最强基线 56.0),而长视频 LLM 类方法在这两个基准上普遍低于 50%,说明「选择性检索」比「处理全量帧」更契合天级视频。
- 三类记忆不可互相替代:仅情节记忆比仅视觉记忆平均高 20.0 个点,但任何两类组合都不如三类齐全;三类齐全比 E+S 高 2.7 点、比 E+V 高 2.6 点。
- 语义记忆是长程推理的关键:HabitInsight 类别达到 76.9,比无语义的 E+V 配置高 23.0 个点——习惯性行为无法从单个事件中读出,必须依赖持续累积的关系知识。
- 自适应尺度的收益可以量化:EgoLifeQA 检索 tIoU 10.09 对比 HippoRAG 4.00;LVBench 长片段问题 10.02 对比 1.88,固定尺度在长跨度问题上几乎失效。
- 多轮不是冗余:EgoLifeQA 上 5 步相比单步提升 9.3 个点,且性能随迭代次数单调上升;增益来自策略修正(窄关键词 → 宽关键词 → 转取视觉帧)。
- 对骨干与尺度都不敏感:换成 Gemini 3 Flash 后 EgoLifeQA 反而升到 68.2;时间尺度扰动三组配置分别为 65.2 / 65.6 / 64.8,说明增益来自多尺度结构本身而非某组特定数值。
局限性
- 预处理成本不低:构建记忆需要视频 caption、三元组抽取与语义 consolidation 三步离线处理。作者强调这是记忆式视频 LLM 的共性约束(M3-Agent 因依赖实体识别更重),并非本方法独有。
- 强依赖 LLM 抽取质量:情节图与语义图都来自生成式抽取,噪声会沿「记忆 → 检索 → 作答」链路传播,论文未给出抽取质量的独立评测。
- 在线化仍属设计目标:记忆按固定间隔更新(如每 10 秒),要求每个片段的预处理在该窗口内完成,真实流式部署的工程可行性尚未实验验证。
- 隐私与安全成本:跨天累积的结构化知识本身就是敏感资产,需要访问控制、安全数据处置与隐私保护策略。
- 评测口径单一:全部为多选问答、以准确率为唯一指标,缺少开放式生成与人工评测;相似度阈值 0.6 等关键超参对语料分布的敏感性也未展开。
常见问题(FAQ)
WorldMM 与 M3-Agent、HippoMM 的核心区别是什么?
M3-Agent 以实体为中心建多模态记忆,但视觉只用于实体识别,推理时不使用视觉证据;HippoMM 用双过程记忆结合语义摘要与多模态线索,但检索形态与时间尺度是预设固定的。WorldMM 的区别在于三类记忆并存 + 检索端自选模态与时间尺度,并把视觉记忆做成可精确回溯的帧索引。
为什么不能只做文本记忆,把视觉留给最后一帧?
论文给出了两个方向的证据:只用视觉记忆的平均准确率仅 44.9,而只用情节记忆是 64.9——文本更易组织成图、更适合检索,所以它仍是主力。但纯情节配置会在 EntityLog、EventRecall 以及烘焙品类这类外观问题上出错,必须由视觉记忆补位,因此「谁替代谁」的答案是不存在,二者分工。
多轮检索会不会让延迟爆炸?
不会。检索智能体自己判断「够了就停」,因此在延迟—精度权衡上同时优于两端:长视频 LLM 延迟显著更高而精度更低,RAG 与记忆式方法延迟低但精度有明显缺口。EgoLifeQA 上 5 步相比单步提升 9.3 个点,说明多轮带来的精度是「花得值」的。
换一个大模型骨干,这套记忆还能用吗?
可以。论文测试了 GPT-5 系列与 Gemini 3 Flash 两种智能体骨干、Qwen3-VL-Embedding-2B 与 VLM2Vec-V2 两种多模态编码器的组合,WorldMM 均保持竞争力,Gemini 版本在 EgoLifeQA 上甚至更高(68.2)。
论文有没有夸大自己的增益?
有一处口径需要留意:正文称完整配置比「情节 + 语义」高出 4.2%,但主表五基准的逐项差值是 +2.2 / +4.3 / +4.5 / +3.1 / +2.5,均值约 3.3%。方向上无损结论(三类记忆互补),但引用具体数字时建议以主表为准。此外效率一节只给了延迟—精度曲线,没有给出绝对延迟或 token 消耗。
这套记忆适合什么落地场景?
论文的定位是面向流式场景的记忆基础设施:第一视角助手与具身智能体。记忆支持增量更新,因此按固定间隔(如每 10 秒)滚动构建是设计目标;作者也提醒,长期累积结构化知识必须配套访问控制与隐私保护策略。
参考链接
- 论文 arXiv 页面:arXiv:2512.02425
- 项目主页:worldmm.github.io
- 记忆基础工作 HippoRAG 2(本文检索框架基础):From RAG to Memory
- M3-Agent(ICLR 2026,实体中心多模态长期记忆):Seeing, Listening, Remembering, and Reasoning
- HippoMM(长音视频事件理解的双过程记忆):arXiv:2504.10739
- EgoLife / EgoRAG(周级第一视角基准与层级文本记忆):EgoLife: Towards Egocentric Life Assistant
- Agent Memory 综述(2026):A Survey of Agent Memory in the Second Half
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)