从今天觉醒,技术赋予每一个人数字生命


超越时间线:用「具身实体传记」重构长视频记忆

① 技术背景:长视频问答,卡在“这是谁”上

想象你有一段连续一周的家庭监控录像。你想问:“那只橘猫今天下午有没有靠近过厨房?”——这个问题看似简单,却要求系统在几十个小时的视频里,把“同一只橘猫”在不同时间、不同摄像头下的所有出现串联起来。

传统长视频问答(Long-Video QA)的做法是:把视频切片段,为每个片段生成文字描述,再按时间顺序拼成一条“流水账”。检索时,系统根据问题找到语义相近的片段,拼凑答案。问题在于——文字描述会丢掉物理身份。两只不同的白猫在描述里都是“一只白猫在沙发上”,而同一只猫在上午和下午的片段,因为场景变化,描述可能完全不相关。检索到相关事件,不等于找回了“这只猫的传记”。

这正是 Grounded Entity Biographies(GEB)要解决的问题:在记忆构建阶段就为每个物理实体建立身份链接,让检索能沿着“实体”而非“时间”走。该工作由 Hui Ren、Lei Fan、Henry Pao 等 8 人完成,发表于 2026 年 9 月,在 EgoLifeQA 上达到 72.0% 准确率,比此前最好结果高出 4.4 个百分点。

An abstract visualization of entity identity netwo

② 主流方案盘点:三条技术路线

当前长视频记忆框架大致分三类,各有明确的职责边界。

第一类:时间线记忆(Timeline Memory)。代表思路是按时间顺序组织片段描述,检索时做语义匹配。优点是实现简单,适合“什么时候发生了什么”这类问题。缺点是实体身份完全靠文字描述隐式表达,不同片段里的同一实体无法保证被关联。典型项目如早期 Video-LLaMA 的记忆模块。

第二类:文本派生实体(Text-Derived Entities)。从描述中抽取命名实体(人、物、地点),建立实体-事件索引。比纯时间线进了一步,但实体来自文本,不同描述里的“白猫”可能被合并,同一只猫也可能因描述差异被拆开。代表工作是部分 VideoQA 系统中的实体图模块。

第三类:具身实体传记(Grounded Entity Biographies, GEB)。核心区别在于:实体不是从文本里抽的,而是从视觉观测中直接建立物理身份链接。每个片段里的检测/跟踪结果被归入某个“传记”,传记保留每个时刻的上下文。检索时,传记和片段证据一起返回,模型可以沿着身份链接追踪实体。

③ 对比与优劣

维度时间线记忆文本派生实体具身实体传记(GEB)
实体身份来源无显式身份文本描述视觉观测+身份链接
跨片段关联弱(靠语义)中(靠文本匹配)强(靠物理身份)
长时跨度表现随长度下降明显中等在日/周级录像上稳定
检索粒度片段级实体-事件级传记+片段级
实现复杂度低中高(需跟踪与链接)
代表结果早期基线部分 VideoQA 系统EgoLifeQA 72.0%

GEB 的代价是构建阶段更重:需要做视觉跟踪、身份关联、传记维护。但消融实验表明,具身身份关联和传记阅读各自都有贡献,仅靠额外描述无法完全弥补。

④ 选型建议:按场景走

场景一:短视频问答(分钟级)。时间线记忆足够,没必要上 GEB。检索片段语义匹配就能覆盖大部分问题。

场景二:日级录像、问题涉及“同一实体跨事件”。推荐 GEB 思路。比如“我早上拿的那个杯子,下午放哪了?”——需要把早上和下午的杯子观测链接起来。文本派生实体在这里容易把不同杯子混在一起。

场景三:周级录像、开放域问答。GEB 优势最明显,但构建成本高。建议先做实体检测与跟踪的轻量版,再逐步加传记阅读。面试常被追问:身份链接的误关联怎么处理? GEB 的做法是保留每个时刻的上下文,让模型在阅读传记时自己判断,而不是硬合并。

⑤ 未来展望

GEB 指出了一个方向:长视频记忆的核心不是“存更多”,而是“连更准”。已出现的趋势包括:视觉身份链接与语言模型的端到端联合训练、传记的增量更新与遗忘机制、多模态实体对齐。仍未解决的问题也很明显:身份链接在遮挡、外观突变时的鲁棒性;传记构建的计算开销如何压缩到可接受范围;以及当问题涉及“实体之间的关系”而非单个实体时,传记结构如何扩展。

对在校学生和转行者来说,这是一个很好的练手方向:从“给一段视频里的同一物体建立跨帧链接”这个小任务开始,就能写进作品集,也能在面试里讲清楚“为什么文字描述不够”。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐