【NeurIPS 2025 (Spotlight)】G-Memory 论文解读:多智能体三层图记忆,把协作轨迹变成可检索经验|从多智能体记忆架构视角
摘要
本文解读 NeurIPS 2025 Spotlight 论文《G-Memory: Tracing Hierarchical Memory for Multi-Agent Systems》。该论文提出三层图记忆架构 G-Memory,通过融合insight graph(可泛化洞见)、query graph(查询与任务状态)与interaction graph(原子话语构成的协作轨迹),把多智能体系统冗长的协作过程沉淀成可检索的经验,其特别之处在于——检索沿图双向遍历:向上取高层洞见、向下取精简后的协作片段,并按每个 agent 的角色分发,完全不改动 AutoGen / DyLAN / MacNet 等框架的源码。实验表明在 5 个基准 × 3 个多智能体框架 × 3 个 LLM 骨干上几乎全面领先:具身行动最高提升 20.89%、知识问答最高提升 10.12%,而整个系统的 token 成本只增加约 140 万,为多智能体系统的跨 trial 自我进化提供了一套可直接复用的记忆基础设施。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | G-Memory: Tracing Hierarchical Memory for Multi-Agent Systems |
| 标题(中文) | 多智能体系统的层级记忆:把协作轨迹组织成三层图 |
| 作者 | Guibin Zhang$^{}$, Muxin Fu$^{}$, Guancheng Wan, Miao Yu, Kun Wang$^{\dag}$, Shuicheng Yan$^{\dag}$ |
| 机构 | 新加坡国立大学 · 同济大学 · UCLA · A*STAR · 南洋理工大学 |
| 会议 | NeurIPS 2025 |
| arXiv | arXiv:2506.07398 |
| 项目网站 | github.com/bingreeky/GMemory |
背景与动机
大模型驱动的多智能体系统(LLM-powered MAS)在感知、规划与执行上已经明显超过单智能体:AutoGen、DyLAN、MacNet 这类框架把多个角色组织起来,用分工与互相纠错换来更强的任务表现。但它们的自我进化能力长期受限于记忆设计,论文把这个问题拆成两个病灶。
第一是记忆过度简化。MetaGPT、ChatDev、MacNet 等框架的记忆基本停留在 inside-trial 层面,跨 trial 时只传递被压缩过的最终产物——比如上一轮的最终答案或执行结果。于是最值钱的信息被丢掉了:谁在第几步把谁从错误里拉了回来、哪条协作路径导致了失败。第二是缺少跨 trial 与角色定制。团队里不同 agent 承担不同角色,却拿到同一份历史上下文,结果是在不同任务上重复同一种协作错误。
既有方案各自的局限也很清楚。单智能体记忆(Generative Agents 的观察加反思、MemoryBank 的遗忘曲线、Voyager 的技能库、MemGPT 的上下文分页)都是围绕「一个智能体与自己的对话」设计的;多智能体侧的 MetaGPT-M、ChatDev-M、MacNet-M 要么只做 inside-trial,要么只保存历史查询的最终答案;而 GPTSwarm、ADAS、AFlow、MaAS 这类自动化 MAS 专注优化拓扑或提示词,架构越来越臃肿,进化往往还是一次性的,不随经验累积。
论文的切口来自组织记忆理论(organizational memory theory):人类组织的知识检索会先命中宽泛的「图式」,再逐步细化到具体案例。对应到智能体团队,就意味着记忆必须有层级——从抽象可泛化的洞见,到细粒度的协作片段——并且要按角色分发。这条思路最终换来可量化的收益:具身行动任务最高提升 20.89%,知识问答任务最高提升 10.12%。
研究主线:从问题到结论
基准/方法设计
G-Memory 的核心设计是把团队经验组织成三张互相连通的图,它们共同覆盖「抽象—具体」的完整谱系。
- Insight Graph(洞见图):节点是可泛化的洞见内容及其支撑查询集合,超边表示「某条洞见通过某个查询语境化了另一条洞见」。它负责回答「这类任务通常该怎么做、要避开什么陷阱」。
- Query Graph(查询图):节点是查询本身、任务状态(成功或失败)以及该查询对应的协作轨迹,边表示查询之间的语义关系。它让检索不再只依赖向量相似度,而是可以利用图拓扑。
- Interaction Graph(交互图):节点是原子话语,包含说话人与内容,边表示「这句话被传递并启发了下一句」。它保留了谁在什么时候纠正了谁这类关键细节。
三张图不是静态档案,而是随每个任务闭环生长:任务执行结束后,交互层写入这次协作的轨迹,查询层新建节点并与「本次检索到的 top-M 历史查询」以及「所用到洞见的支撑查询」连边,洞见层则用摘要算子生成新洞见、并回写支撑集。这种设计让记忆的更新完全发生在图结构上,不需要任何梯度训练。
一个容易忽略的设计动机是上下文预算:如果直接把检索到的历史全部塞进提示词,既会压垮模型的上下文,也会让不同角色的智能体互相干扰。因此 G-Memory 把「检索」和「分配」拆成两步,先在图层面筛出多粒度的候选,再按角色过滤——这一步是它能同时做到「性能涨、token 不涨」的原因。
分类全景
方法细节
方法分成三个动作:粗粒度检索、双向遍历、按角色分配。
第一步,粗粒度检索加 hop 扩张。 新查询先与查询图做 top-k 余弦相似度匹配(论文取 k 属于 {1,2}),但相似度只看表象,于是把命中节点在图上的邻居一并并入候选集,形成一跳扩张后的候选集合。论文的敏感性分析显示一跳最好,两跳、三跳反而变差——扩张过头会把不相关的洞见带进上下文。
第二步,双向遍历。 向上遍历把候选查询投影到洞见图:凡是支撑查询集与候选集合有交集的洞见都被取出。向下遍历先用一个 LLM 打分器评估每个候选历史查询与当前查询的相关性,取出 top-M 个,再用图稀疏器从这些冗长的轨迹里抽出核心对话子图——哪些轮次交代了关键约束、哪些轮次出现了纠错,都由稀疏器判定保留。这样向下拿到的不是日志全文,而是可操作的协作片段。
第三步,按角色分配。 分配算子 $\Phi$ 会针对每个智能体的角色与当前查询,评估每条洞见、每个稀疏子图的效用与相关性,只把相关部分写入该智能体的记忆状态。同一个团队里,规划者拿到的是策略型洞见,执行者拿到的是操作型片段——这也是「角色定制记忆」落到实处的环节。
参数与实现。 嵌入函数用 all-MiniLM-L6-v2;向下遍历取 top-M 的 M 在 {2,3,4,5} 中选取;检索 top-k 的 k 在 {1,2} 中选取。调用时机是「每个查询开始时注入一次记忆」,论文也指出实践者可以配置更细粒度的调用。
实验设计与结果
评测协议。 实验覆盖三个领域五个基准:知识推理用 HotpotQA 与 FEVER(指标为 exact match),具身行动用 ALFWorld(success rate)与 ScienceWorld(progress rate),游戏用 AgentBoard 的 PDDL(progress rate)。为了把「记忆有用」与「模型更强」「框架更好」区分开,实验做了三层交叉:AutoGen、DyLAN、MacNet 三个多智能体框架,Qwen-2.5-7B、Qwen-2.5-14B 与 GPT-4o-mini 三个骨干;对比对象包括 No-memory、Voyager、MemoryBank、Generative Agents、MetaGPT-M、ChatDev-M 与 MacNet-M 七类记忆设计。Qwen 系列用 Ollama 本地部署,GPT 系列走 OpenAI 接口。
主结果(AutoGen + Qwen-2.5-14B)。
| 基准 | No-memory | 最强记忆基线 | G-Memory | 提升 |
|---|---|---|---|---|
| ALFWorld(具身) | 74.63 | 82.09 | 85.82 | +11.19 |
| SciWorld(具身) | 46.84 | 59.00 | 60.62 | +13.78 |
| PDDL(游戏) | 44.92 | 54.46 | 55.24 | +10.32 |
| HotpotQA(知识) | 24.49 | 33.21 | 34.61 | +10.12 |
| FEVER(知识) | 63.27 | 64.69 | 71.43 | +8.16 |
三个框架的平均表现(Qwen-2.5-14B)。
| MAS 框架 | No-memory | 最强记忆基线 | G-Memory | 相对 no-memory |
|---|---|---|---|---|
| AutoGen | 50.83 | 56.77(MetaGPT-M) | 61.54 | +10.71 |
| DyLAN | 53.03 | 56.57(MetaGPT-M) | 59.69 | +6.66 |
| MacNet | 49.08 | 54.76(Generative) | 57.85 | +8.77 |
敏感性与超参。 记忆不是「取得越多越好」。hop 扩张方面,一跳一致最好或接近最好,AutoGen 上 ALFWorld 峰值 85.82%、PDDL 峰值 55.24%;两跳时 PDDL 掉到 49.79%,原因是向上遍历扩张过头会把无关洞见带进上下文,干扰任务特定推理。参数 k 的最优区间是 {1,2},k=5 时 ALFWorld+AutoGen 掉 7.71%。
消融:两层都不可替代。 把洞见层与交互层分别关掉,性能都会下降:只保留交互时,AutoGen 平均掉 4.47%、DyLAN 掉 3.82%;只保留洞见时分别掉 3.95% 与 3.39%。两者同时启用时 PDDL 与 FEVER 都取得最好结果——协作轨迹略比抽象总结更难替代。
| MAS | 启用层 | PDDL | FEVER |
|---|---|---|---|
| AutoGen | 仅 interaction | 54.46 | 63.27 |
| AutoGen | 仅 insight | 50.00 | 68.77 |
| AutoGen | 两层全开 | 55.24 | 71.43 |
| DyLAN | 仅 interaction | 48.75 | 61.39 |
| DyLAN | 仅 insight | 46.69 | 64.31 |
| DyLAN | 两层全开 | 51.12 | 66.66 |
定性案例。 在 ALFWorld 中,任务「把干净布料放到台面」检索到高度相似的历史查询「把干净鸡蛋放进微波炉」,两者都要求物体处于 clean 状态;检索到的协作片段里,求解智能体先放鸡蛋再清洗而被监督智能体纠正,这条「谁纠正了谁」的轨迹直接给出了可操作的操作顺序。在 HotpotQA 的网页检索任务中,记忆则提供了「不要被同名人物误导」的洞见,避免智能体基于错误实体作答。
记忆结构的可视化证据。 洞见图在 ALFWorld 上呈现「同类任务密集互联、跨类别稀疏连接」的模式,说明洞见既在同类任务内收敛,也能跨任务迁移;查询图在 ALFWorld、SciWorld 与 PDDL 上都出现相似聚类,并在 gpt-4o-mini、Qwen-7B、Qwen-14B 下保持一致,说明结构来自任务本身而非某个模型的偏置。
结果对比总结
关键发现
- 跨域、跨框架、跨骨干几乎全胜。 三个 MAS 的平均增益为 AutoGen +10.71、DyLAN +6.66、MacNet +8.77;单任务峰值是 MacNet 在 ALFWorld 上的 +20.89(从 58.21 提升到 79.10)。
- 通用记忆未必帮多智能体。 Voyager 让 AutoGen 在 PDDL 上掉 4.17%、MemoryBank 掉 1.34%,ChatDev-M 让 MacNet+SciWorld 掉 2.32%——缺少角色定制与高层洞见的记忆甚至会产生负迁移。
- 成本结构是「固定开销、随经验递增的收益」。 PDDL+AutoGen 上 +10.32% 的性能只多花约 1.4e6 tokens;对比 MetaGPT-M 花 2.2e6 tokens 只换 4.07%。
- 两层记忆缺一不可,交互层略更关键。 关掉交互层平均掉 4.47%(AutoGen)/ 3.82%(DyLAN),关掉洞见层掉 3.95% / 3.39%。
- 记忆要克制。 一跳扩张、k 取 {1,2} 最优;k=5 时 ALFWorld+AutoGen 掉 7.71%,两跳时 PDDL 掉到 49.79%。
- 无需梯度训练即可进化。 记忆完全在图结构上累积与连边,ALFWorld 的成功率曲线显示它用更少的 trial 就达到更高天花板。
局限性
- 任务覆盖有限。 作者明确只验证了 3 个领域 5 个基准,建议扩展到医学问答等更多样任务,留作 future work。
- 调参依赖任务。 hop 数与 k 的最优值随任务变化(一跳、k 取 {1,2} 最好),论文没有给出可直接使用的选择启发式。
- 额外的 LLM 调用。 向下遍历依赖 LLM 相关性打分与图稀疏化,会带来 token 与延迟开销;论文只报系统总量,没有把开销拆解到各环节。
- 失败记忆的污染未做评估。 失败任务同样以「Failed」状态写入查询图并参与洞见生成,但论文没有单独评估错误记忆被检索到时的风险。
- 机制解释偏弱。 为什么 hop 扩张过多反而变差,只给了「引入无关洞见」的定性解释,缺少受控实验佐证。
- 表述层面的小问题。 原文存在少量笔误(如 intializes)、子节标题用词不一致(Hierarchy Memory Update)、同一句里两次使用同一个序号 (ii),以及一处被注释掉的强声明,引用时需要注意。
常见问题(FAQ)
G-Memory 到底是什么?一句话能说清吗?
把多智能体团队的历史协作过程组织成三张图:保存可泛化洞见的 insight graph、保存查询与任务状态的 query graph、保存原子话语轨迹的 interaction graph。新任务到来时先在图里检索,再按每个 agent 的角色分发记忆,执行结束后三张图一起吸收这次经验。
它和 MemoryBank、Voyager 这类记忆方案的本质区别是什么?
那些方案是为单智能体设计的:MemoryBank 用遗忘曲线管理对话记忆,Voyager 用技能库存放可执行代码,Generative Agents 用记忆流加反思。它们把「智能体自己的经历」当作记忆对象;G-Memory 的记忆对象是智能体之间的协作——谁向谁说了什么、哪一步被纠正了,并且按角色做差异化分发。
为什么记忆要分三层,只留一层不够吗?
分工不同:洞见层提供「这类任务通常怎么做、要避开什么坑」的策略性指导,交互层提供「这次具体应该按什么顺序操作」的过程性参考。消融实验显示只保留任一层都会掉点——只留交互时 AutoGen 平均掉 4.47%,只留洞见时掉 3.95%。
记忆变多了,token 成本会不会失控?
不会。论文报的数字是:PDDL+AutoGen 上性能提升 10.32%,整个系统的 token 只多约 1.4e6;对比之下 MetaGPT-M 多花 2.2e6 tokens 只换来 4.07%。原因是记忆并不直接把历史拼进提示词,而是先在图层面筛选、再按角色分配,上下文长度由筛选结果决定,而不是由历史长度决定。
它需要训练吗?能不能直接接到我自己的多智能体框架上?
不需要训练。记忆的更新完全发生在图结构上(写轨迹、连边、生成洞见),没有梯度更新。接入方式是在框架外层做插件:论文在 AutoGen、DyLAN、MacNet 三个主流框架上都验证过即插即用,不需要改框架源码。
参数应该怎么选?
论文的经验是「宁可少取」:hop 扩张取一跳,初始相似查询数 k 取 1 到 2,向下遍历的协作子图数 M 在 2 到 5 之间选取。k=5 时 ALFWorld+AutoGen 会掉 7.71%,两跳扩张时 PDDL 会掉到 49.79%,说明靠图扩张补召回比靠多取相似查询更稳。
参考链接
- 论文 arXiv 摘要页:arXiv:2506.07398
- 代码开源仓库:github.com/bingreeky/GMemory
- MemoryBank(记忆管理基线):arXiv:2305.10250
- Voyager(技能库记忆基线):arXiv:2305.16291
- Generative Agents(观察加反思记忆):arXiv:2304.03442
- MemGPT(上下文分页):arXiv:2310.08560
- 智能体记忆综述(后续生态):arXiv:2512.13564
- MacNet(多智能体协作扩展,重要基线):arXiv:2406.07155
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)