YoutuRAG 开源框架
腾讯开源的《Youtu-GraphRAG:面向图检索增强型复杂推理的垂直统一智能体》
摘要
图检索增强生成(GraphRAG)通过将碎片化知识组织成结构清晰的图谱,有效提升了大型语言模型在复杂推理任务中的性能。此前的研究多单独优化图谱构建或图谱检索环节,导致整体性能欠佳,尤其在出现领域迁移(domain shift)时问题更为明显。
本文提出一种垂直统一的智能体范式(agentic paradigm)——Youtu - GraphRAG,将整个框架深度整合为一个有机整体。具体而言:
- 引入种子图谱 schema(图结构模板),为自动抽取智能体(automatic extraction agent)限定目标实体类型、关系类型及属性类型,同时支持该 schema 持续扩展,以适应未见过的新领域,实现可扩展性;
- 为基于上述 schema 获取更高层级的知识,本文提出创新性的双感知社区检测(dually - perceived community detection)方法,融合结构拓扑信息与子图语义信息,实现全面的知识组织。该方法自然构建出层级化知识树,依托社区摘要(community summaries)支持自上而下的筛选与自下而上的推理;
- 设计智能体检索器(agentic retriever),该检索器能够解读同一图谱 schema,将复杂查询转化为可处理的并行子查询,并通过迭代反思(iterative reflection)实现更高级别的推理;
- 为缓解预训练大型语言模型(pre - trained LLM)中的知识泄露(knowledge leaking)问题,本文构建了定制化匿名数据集,并提出新颖的 “匿名还原”(Anonymity Reversion)任务,该任务可深度衡量 GraphRAG 框架的真实性能。
在六个具有挑战性的基准测试(benchmarks)上开展的大量实验表明,Youtu - GraphRAG 具备优异的鲁棒性,显著推动了帕累托前沿(Pareto frontier)的发展:相较于当前最优基线模型(state - of - the - art baselines),其 token 成本最高可降低 90.71%,准确率最高可提升 16.62%。实验结果证实,该框架具有出色的适应性,仅需对 schema 进行少量调整,即可实现跨领域的无缝迁移。
1.介绍
图检索增强生成(GraphRAG)已成为一种极具潜力的范式,能够借助结构化知识提升大型语言模型(LLMs)的性能 [Xiao 等人,2025;Pan 等人,2024],在跨多文档的复杂多跳推理任务中表现尤为突出 [Wang 等人,2024;Zhang 等人,2024]。通过将碎片化文档表示为包含底层关系的连通图谱 [He 等人,2024;Dong 等人,2023],GraphRAG 支持大型语言模型在文档与实体间追溯明确关联路径,从而实现传统扁平检索难以完成的复杂推理 [Peng 等人,2024;Han 等人,2024]。这种结构化方法有效解决了传统检索增强生成(RAG)的关键局限性 [Dong 等人,2024]—— 传统 RAG 在处理离散信息片段间的连贯关系及多跳推理任务时,往往存在明显不足。
自 [Edge 等人,2024] 的基础性研究以来,图检索增强生成(GraphRAG)的发展形成了两条截然不同但同等重要的轨迹。
第一条轨迹聚焦于检索层面:LightRAG [Guo 等人,2024] 率先提出向量稀疏化技术,以提升检索效率。此后,GNN-RAG 和 GFM-RAG [Mavromatis 与 Karypis,2024;Luo 等人,2025] 进一步推动了该方向的发展 —— 它们引入图神经网络(GNN)实现细粒度节点匹配;而近期的 HippoRAG 1 与 HippoRAG 2 [Jimenez Gutierrez 等人,2024;Gutiérrez 等人,2025] 则整合了记忆机制与个性化 PageRank 算法,实现了上下文感知型检索。
第二条轨迹围绕图谱构建展开:现有方法大致可分为扁平式构建与层级式构建两类。早期方法如 KGP [Wang 等人,2024],依赖已有的超链接或基于 KNN(k - 近邻)的图谱,所形成的关系粒度较粗,无法捕捉细微的层级语义。近期的技术进展(如 GraphRAG [Edge 等人,2024])则将知识图谱与社区检测、摘要生成相结合,实现了多级别信息组织。后续的层级式方法(如 RAPTOR [Sarthi 等人,2024]、E²GraphRAG [Zhao 等人,2025])进一步优化了图谱构建过程:通过树状聚类与递归式摘要生成,丰富了图谱的结构化表示。
然而,这些方法均受限于 “孤立优化” 的局限 —— 它们仅专注于图谱构建或检索中的某一个环节,却忽略了两者间的相互依赖关系。在复杂推理任务中,知识的连贯组织与高效检索同等重要,这种孤立优化模式可能会制约模型的复杂推理性能。
为填补这一空白,我们旨在解答一个关键问题:如何有效统一图谱构建与检索过程,以实现更稳健的复杂推理?
该任务面临两大挑战。首先,构建与检索作为两个独立模块,难以直接对齐。如何在二者间建立有机协同机制(即构建出的图谱能通过结构与语义双重维度为检索提供有效支撑),仍是亟待解决的难题。其次,如何对性能进行合理评估同样颇具挑战性。随着大型语言模型(LLMs)规模的快速扩大,现有数据集几乎都已被模型 “见过”,这使得评估结果无法反映整个 GraphRAG 框架的真实性能。
(图中特定符号)代表非定制化组件,这表明当前方法要么仅专注于图谱构建(图 a),要么仅专注于检索(图 b),而 Youtu-GraphRAG 则提出了一种统一范式(图 c),以实现更优异的复杂推理性能。
本文提出一种垂直统一的智能体范式(Youtu-GraphRAG),基于图谱 schema(图结构模板)将图谱构建与检索深度整合为一个有机整体。具体而言:
- 引入图谱 schema 约束抽取智能体的行为,通过限定目标实体类型、关系类型及属性类型,确保知识抽取的质量与简洁性;同时,基于反馈对初始种子 schema 进行持续自动扩展;
- 为基于上述 schema 获取更高层级的知识,我们提出双感知社区检测方法,融合结构拓扑信息与子图语义信息实现全面的知识聚类。该方法自然构建出层级化知识树,依托社区摘要支持自上而下的筛选与自下而上的推理;
- 设计智能体检索器,该检索器可解读同一图谱 schema,将复杂查询转化为并行子查询,并执行迭代反思。智能体通过迭代进行推理与反思,以实现更优性能;
- 为缓解预训练大型语言模型中的知识泄露问题,我们首次构建了定制化匿名数据集,并设计了 “匿名还原” 任务。在六个具有挑战性的基准测试上开展的大量实验表明,Youtu-GraphRAG 具备优异的鲁棒性,显著推动了帕累托前沿(Pareto frontier)的发展:相较于当前最优(SOTA)基线模型,其 token 消耗最高可降低 90.71%,准确率最高可提升 16.62%。实验结果还证实,该框架具有出色的适应性 —— 仅需对图谱 schema 进行少量调整,即可实现跨领域的无缝迁移。这为面向实际应用的下一代 GraphRAG 范式发展提供了重要思路。
(i)抽取智能体通过目标实体 / 关系抽取,将文档自动处理为结构化知识;(ii)基于该 schema,结合融合拓扑结构与图谱语义的社区检测方法,构建四层知识树,为层级化推理提供支持;(iii)检索智能体将用户查询分解为与 schema 对齐的并行子查询,通过迭代驱动多路径检索。
总体而言,本文的主要贡献总结如下:
- 首次提出一种垂直统一的智能体式图检索增强生成(Agentic GraphRAG)框架,将图谱构建与检索过程相整合,以实现更稳健、更高级的推理;其中,构建智能体与检索智能体分别受图谱 schema(图结构模板)约束,从而确保高效的知识抽取与查询分解;
- 采用一种具有理论依据的新型社区检测算法,在图谱 schema 基础上注入高层级摘要信息,同时保留图谱的结构属性与语义属性;
- 构建了定制化匿名数据集,并提出 “匿名还原”(Anonymous Reversion)任务,以避免大型语言模型(LLM)的知识泄露问题,从而对 GraphRAG 的性能进行公平评估;
- 在五个具有挑战性的基准测试上开展了大量实证实验,结果表明,该框架在不同推理任务与领域中均实现了当前最优(state-of-the-art)性能,推动了帕累托前沿(Pareto frontier)的发展:相较于现有方法,其 token 成本最高可降低 90.71%,准确率最高可提升 16.62%。
2 任务定义
在本节中,我们将从零开始,采用标准化符号对通用 GraphRAG 流程进行形式化定义,定义内容涵盖图谱构建与图谱检索两部分。文中符号约定如下:标量用小写字母表示(如 a),向量用粗体小写字母表示(如a),矩阵用粗体大写字母表示(如A),集合用花体字母表示(如\(\mathcal{A}\))。本文将 GraphRAG 定义为这样一项任务:先从语料库中检索结构化知识,再基于检索到的知识生成回答,以此完成对自然语言问题的响应。
给定文档集合ℬ,图检索增强生成(GraphRAG)首先利用冻结的大型语言模型 f_LLM (・) 抽取关键知识,并将这些知识通过结构化图谱𝒢关联起来,以𝒢作为输出结果。为深化对图谱𝒢的理解,引入社区检测算法 f_comm (𝒢),将𝒢划分为多个社区𝒞={C₁,C₂,…,Cₘ},从而获得更高层级的摘要信息。基于构建完成的图谱𝒢,对于给定的复杂查询 q∈𝒬,检索模型 f_retrieve (q, 𝒢)=arg max P (G_sub | q) 会遍历图谱,检索出与查询 q 相似度最高的前 k 个查询专属子图谱 G_sub⊆𝒢(其中 P (G_sub | q) 表示给定查询 q 时子图谱 G_sub 的概率)。最终性能将从多个维度进行评估:(1)图谱构建成本,包括时间效率与 token 消耗;(2)检索准确率与检索效率;(3)最终回答准确率,通过比较预测答案 a_pred 与真实答案 a_gold 得出。
2.1 构建阶段
以文档集合𝒟为语料库,当前 GraphRAG 研究包含两种协同的知识组织方式,可构建不同粒度的图谱 G。首先,通过冻结的大型语言模型 f_LLM (𝒟) 从每个文档 d∈𝒟中抽取 “三元组(h,r,t)” 形式的原子单元,构建细粒度图谱 G_triple =(E,R,𝒟)—— 其中实体 {h,t}∈E(E 为实体集合)、关系 r∈R(R 为关系集合),实体与关系通过明确关联,体现二者间丰富的关联信息。这一抽取过程由冻结的大型语言模型 f_LLM (d) 完成:该模型处理原始文本,生成符合图结构模板(schema)的三元组,进而填充至 G_triple 中。与此同时,在另一研究分支中,通过直接对文档进行聚类,构建粗粒度文档图谱 G_doc =(𝒟,C)—— 这种方式能最大程度保留原始上下文,其原子单元为 “文档” 而非 “三元组”。为获取更高层级的知识,研究引入一种互补性社区检测算法 f_comm (G)。通常,这类算法(包括 Louvain、Leiden、GMM [Traag 等人,2019;Sarthi 等人,2024] 等)会基于图谱 G 运行,且需结合冻结的大型语言模型 f_LLM (d) 生成的足量摘要信息,最终得到社区集合 C = {C₁,C₂,…,Cₘ}。对于每个社区 C_i⊆G(C_i 为图谱 G 的子集),再通过冻结的大型语言模型 f_LLM (C) 将其进一步汇总为高层级元节点 ê_i = f_LLM (C_i),其中 ê_i∈G(ê_i 为图谱 G 的组成部分)。本阶段的性能通过以下指标评估:构建时间 t_construct 与构建过程中的 token 消耗 $。
2.2 增强阶段
在推理阶段,给定查询 q∈Q(Q 为查询集合),传统检索模型 f_retrieve (q, G) = arg max P (d | q) 会直接返回与查询最相似的前 k 个文档 Dˆ = {d₁, d₂, …, dₖ} 作为最终结果;而基于图的方法则会提供更具可解释性的子图谱 Gˆ,以支持多跳路径遍历,即 f_retrieve (q, G) = arg max P (Gˆ | q),其中 Gˆ = {e₀→(r₁) e₁→(r₂) …→(rₖ) eₖ} ⊆ G(e 代表实体,r 代表实体间关系,箭头表示关系指向)。基于检索到的子图谱,会调用模型 f_LLM (q, Gˆ) 生成最终回答。最终性能将通过两个维度进行综合评估:一是检索召回率,通过比较检索到的文档子图 Gˆ_doc 与真实文档集合A_doc_gold 得出;二是回答准确率,通过比较预测答案 a_pred 与真实答案 a_gold 得出。
3. 方法
在本节中,我们将详细阐述 Youtu-GraphRAG 的核心方法。该方法旨在解答两个基础性研究问题:(1)如何实现图谱构建与检索的统一优化,以提升方法的稳健性与泛化性?(2)如何实现跨不同知识粒度的有效推理?与此对应,我们的框架基于图谱 schema(图结构模板),以垂直统一的方式整合了三项关键设计:首先,设计图谱 schema 约束下的智能体,在通过自动扩展提升适用性的同时,保障图谱构建质量并过滤噪声;其次,在 schema 基础之上,提出双感知社区检测方法 —— 该方法同时分析拓扑相似度与语义相似度,构建多尺度知识聚类,进而形成四层知识树;最后,设计智能体检索器,能够将复杂问题有效分解为与 schema 对齐的原子子查询,并支持并行检索路径与迭代反思机制。
3.1 Schema 约束下的智能体抽取
现有 GraphRAG(图检索增强生成)方法要么采用纯大型语言模型(LLMs),要么借助开放信息抽取(OpenIE)技术 [Jimenez Gutierrez 等人,2024;Gutiérrez 等人,2025;Luo 等人,2025;Edge 等人,2024],来完成命名实体识别与三元组抽取任务。然而,这种开放式方法难免会引入噪声与无关冗余信息,进而降低图谱的可用性。与此不同,我们将图谱抽取视为 “基于高质量种子图谱 schema(图结构模板)的约束性生成任务”—— 该 schema 针对特定领域任务设计,同时我们将其定义为一种简洁的结构,具体形式如下:

其中,Se 代表目标实体类型(例如 “人物”“疾病”),Sr 通过精简的关系(例如 “治疗”“导致”)指导抽取过程,Sattr 则列出可附加并用于描述相应实体的属性类型(例如 “职业”“性别”)。基于冻结大型语言模型的智能体 f_LLM (S, D) 受此约束,仅识别出现在 S 中的匹配信息,从而将搜索空间有效缩减至 Se×Sr×Sa 的笛卡尔积(即实体类型、关系类型、属性类型的组合范围)。形式上,对于每个文档 d,我们得到如下一组三元组:
![]()
(a)通过三元组嵌入将输入图谱划分为初始社区;(b)通过联合考虑拓扑连通性与子图语义相似度识别社区中心;(c)通过迭代式成对社区合并形成最终层级结构。不同颜色代表功能上连贯的社区。
因此,在本文中,我们将细粒度三元组图谱定义为 Gtriple = (E, R, D),其中完整的实体集合 E = {Er, Eattr} 不仅包含命名实体 e,还包含对应的属性实体 eattr;关系集合 R 同样包含两类关系,即实体 - 实体关系 r 和属性关系 rattr(也就是用于连接实体与属性的 “has_attribute” 关系)。
然而,种子图谱 schema(初始图结构模板)可能具有通用性,且需要人工进行预定义,这限制了 GraphRAG 在未见过的领域中的可扩展性与适应性。为此,我们为智能体配备了 “添加工具”,并融入自适应设计 —— 通过与文档内容的持续交互,动态优化初始 schema S。智能体通过分析每个文档 d∈D(D 为文档集合)中潜在的关系模式,自动提出 schema 扩展建议,这一过程通过更新函数实现:
![]()
其中,S (t) 表示迭代 t 时的 schema,µ 为置信度阈值,用于控制新 schema 元素的接受与否。∆S 分别包含实体类型、关系类型和属性类型的候选扩展内容。这种动态适应机制使 schema 能够突破初始定义的限制,同时保持可控的增长 —— 智能体仅选择性纳入高置信度的模式,这些模式在新领域的文档中需表现出足够的出现频率和上下文一致性。
因此,我们期望最终得到的 schema 既能保持简洁的表示形式,又能获得特定于文档的表达能力,从而有效平衡严格的 schema 指导与灵活的知识获取。通过这一机制,与静态 schema 方法相比,我们的框架实现了更全面的知识覆盖,尤其在处理具有新兴关系模式的领域时表现更为突出。
3.2 基于 Schema 的知识树图谱索引
粒度的原始图谱可能会迅速变得极为密集且包含噪声。通常会采用一种互补性的社区检测算法 f_comm (G) 对知识进行汇总,将图谱重组为社区集合 C = {C₁, C₂, …, Cₘ}。现有方法会应用 Louvain、Leiden、高斯混合模型(GMM)等算法 [Traag 等人,2019;Sarthi 等人,2024],这些算法在图谱 G 上运行时,需结合由 f_LLM (d) 生成的足量摘要与概要信息。每个社区 Cᵢ⊆G 会通过 f_LLM (C) 进一步汇总为高层级元节点 êᵢ = f_LLM (Cᵢ),其中 êᵢ∈G。
然而,现有社区检测方法的性能难以满足实际需求。它们主要依赖结构连通性,却在很大程度上忽略了关系上下文中蕴含的丰富语义信息。因此,在真实世界的知识图谱中,这些方法往往会产生非最优的分区 —— 因为对于有意义的社区检测而言,拓扑连贯性与语义连贯性同样重要。为解决这一局限,我们提出了一种新颖且创新性的双感知社区检测框架,通过三阶段优化过程,同时对拓扑连通性与语义相似度进行优化(如图 3 所示)。最终输出压缩为深度为 L 的知识树 K,其叶节点保留细粒度事实,内部节点则为粗粒度摘要。在本文中,我们定义 L=4,包括 {社区、关键词、实体 - 关系三元组、属性} 四个层级。
实体表示。给定图谱 G = (E, R),我们首先对每个实体 ei ∈ E 进行编码,以获取其实体的上下文嵌入 ei ∈ R3d(3d 维实数空间),这一过程通过聚合其一跳邻域 Ni 内所有三元组的冻结大型语言模型嵌入实现。具体而言,对于一跳邻域 Ni 中的每个三元组 (ei, r, ej),我们将头实体 ei、关系 rij 和尾实体 ej 的嵌入进行拼接,然后在所有邻域三元组上取平均:

为此,该实体表示方法能够有效保留局部结构模式与语义关系,使下游聚类能够利用这两种信号(即结构信号与语义信号)。
聚类初始化。由于真实世界图谱 G 的规模庞大,我们首先通过对实体嵌入集合 {ei}ₙᵢ₌₁(n 为实体总数)应用 K 均值聚类(K-means clustering)来初始化社区,生成初始分区候选集 {C (0)₁, ..., C (0)ₖ}—— 其中上标 “(0)” 表示迭代次数(初始迭代为第 0 次)。尽管此步骤能实现粗粒度分组,但尚未考虑结构相似度与语义相似度之间的相互作用。聚类数量 k 的取值受以下规则约束:k = min(⌊n/β⌋, η)(注:基于上下文逻辑补充完整公式,原文此处表述略简)。其中,参数 β=10 用于控制聚类粒度,确保每个聚类至少包含 10 个实体;参数 η=200 用于防止聚类过度碎片化(即避免生成过多小聚类)。我们采用优化后的 K 均值算法(参数设置:n_init=5,random_state=42)实现这一步骤,以保证实验结果的可复现性(random_state 固定随机种子,n_init 控制初始化次数以避免局部最优)。
基于双感知评分的迭代式社区融合。首先,为优化初始聚类结果,我们引入双感知评分函数 φ(ei, C (t) m),用于量化迭代轮次 t 时节点 ei 与社区 C (t) m 之间的关联度。该评分综合考虑两方面因素:(1)拓扑连通性重叠度(Sr),即通过计算与节点 ei 关联的关系和社区 C (t) m 内关系的杰卡德相似度(Jaccard similarity)来衡量;(2)子图语义相似度(Ss),计算方式为:先通过嵌入变换矩阵 FΘ 分别得到实体嵌入 FΘ(Ti) 与社区质心嵌入 EC (t) m [FΘ(Tjk)],再求解二者的余弦相似度(cosine similarity)。


其中,Ss 表示基于关联关系类型多重集合 Ψ(・) 计算得到的杰卡德相似度矩阵。Ss (i, j) 用于衡量节点 i 与节点 j 之间 “关系特定邻域” 的重叠程度。
借助双感知评分,在每一轮迭代 t 中,我们首先为每个社区定位最具代表性的质心实体 —— 该实体需使自身与整个社区子图的双感知关联度评分 φ(ei, Cm) 达到最大值。我们将中心节点定义为:即 e∗center = arg max φ(ei, Cm),其中 ei ∈ Cm(ei 为社区 Cm 内的实体),φ(ei, Cm) 为前文所述的双感知评分,综合了拓扑关系重叠度 Sr (ei, Cm) 与语义相似度 Ss (ei, Cm)。这一选择标准确保中心节点不仅在社区内具有较强的结构连通性(即较高的 Sr 值),还能涵盖子图的主导语义特征(即较高的 Ss 值)。
由此得到的中心节点将作为各自社区的高质量代表,为高效的成对社区融合提供支持。随后,我们利用社区质心的双感知评分实现所有聚类间的成对匹配:若两个聚类(C (t) a, C (t) b)的双感知差异度低于阈值 ε,则将二者合并,公式如下:
![]()
该设计进一步将搜索空间从 “节点 - 社区比较” 缩小至 “节点 - 节点比较”,从而实现了更高效的社区检测。
3.2.1 知识树
基于此,在我们的 schema 约束抽取框架基础上,我们开发了一个层级化知识组织流程,将原始图谱转化为结构化的知识树 K。首先,该过程始于我们提出的新型双感知社区检测算法,该算法通过结合拓扑连通性重叠度和子图语义相似度的综合指标,计算实体 - 社区关联度。其次,应用 f_LLM (Cm),基于社区成员名称为整个社区生成简短名称和描述。这些社区名称被视为社区节点插入到原始图谱中,并通过 "member_of"(属于)关系与每个成员实体相连。第三,在每个检测到的社区 Cm 内,我们通过选择使结构 - 语义评分最大化的实体(即 arg maxei∈Cm ϕ(ei, Cm))来确定关键关键词。
由此形成的层级结构与 schema 共同为我们四层知识树 K 的构建提供依据。该知识树在每个层级上最大化自底向上的语义连贯性,同时通过细粒度的实体 - 关系 / 实体 - 属性检索(L1 层)保留细粒度推理能力,并通过高层级的基于社区的过滤(L4 层)提升效率。我们将其形式化定义为 K = ∪₄ℓ=1 Lℓ(即知识树 K 为 L1 到 L4 层的并集)。

3.3 智能体检索器
Schema 增强的查询分解器。大规模知识图谱中多跳查询的复杂性,要求有一种智能分解机制,既能尊重显式的 schema 约束,又能尊重隐式的语义关系。与传统方法相比,我们的 schema 引导式分解方法具有几个关键优势。
首先,通过利用图谱 schema S = (Se, Sr, Sattr)(其中 Se 表示实体类型,Sr 代表关系类型,Sattr 包含属性定义),我们确保每个生成的原子子查询都严格遵循知识图谱中的有效模式。这种 schema 感知能力可防止生成格式错误的查询,这类错误查询要么无法返回结果,要么会检索到无关信息。例如,在处理 "哪些制药公司生产糖尿病药物?" 这类查询时,schema 能保证 "生产" 关系仅连接公司与药物,而不会连接到其他实体类型。
其次,schema 作为一种语义框架,在整个分解过程中保持连贯性。以查询 "图灵奖得主在哪里学习过?" 为例,我们的方法会自动将 "图灵奖得主" 映射到相应的实体类型 Se:具有特定奖项属性的 "人物",同时将 "学习" 正确解释为 Sr:"受教育于" 关系。这种语义精确性避免了简单分解方法中常见的解释偏移问题。
因此,最终的子查询集合 Q = f_LLM (q, S) = {q1, q2, …, qi},其中 i 是预先定义的原子子查询总数的最大值,每个 qi 明确针对以下之一:(i) 节点级检索 (e, has_attr, a),(ii) 三元组级匹配 (h, r, t),或 (iii) 社区级验证 Cm,具体由 schema 元素 Se、Sr 和 Sattr 决定。

该过程通过以下两点解决了复杂问答(QA)任务中的组合泛化难题:
(1)在推理步骤中借助图谱 schema(S)保持显式的符号锚定;
(2)通过反思机制进行持续的自我监控,以检测并修正推理路径。智能体的运行流程在两种模式间交替进行:一种是结合 schema 引导的查询分解与检索的正向推理,另一种是针对复杂场景的反向反思。这种交替形成了一个闭环框架,能够逐步收敛至最优解决方案。
多路径检索:为处理不同类型的子查询,我们实现了四种并行检索策略,每种策略均具有明确的优化目标:

总体而言,这四条检索路径呈现出明确的专业化分工模式:(1)实体匹配(Entity Matching)能最优处理需精准定位节点的单跳简单查询,例如原子事实核查类问题;(2)三元组匹配(Triple Matching)通过对(头实体 h,关系 r,尾实体 t)的组合语义建模,在少跳推理任务中表现突出,尤其在关系推理场景下效果显著;(3)社区过滤(Community Filtering)旨在解决全局类查询(如摘要生成、跨领域问题),通过在聚类中自上而下的过滤实现;(4)深度优先搜索路径遍历(DFS Path Traversal)可适配复杂多约束问题,我们将其最大深度定义为 d = 5。这种专业化分工与从原子事实到复杂推理场景的认知范围相契合。
4 实验
4.1 评估指标
遵循检索增强生成(RAG)的工作流程,评估通常分为两个阶段:(1)评估检索到的证据的准确性;(2)通过评估基于检索证据生成的大语言模型(LLM)回答质量,检验端到端性能。在实际部署场景中,针对同一答案可能存在多个有效检索参考,因此后一种评估范式已成为实际应用中的主流标准。
在 LLM 回答评估方面,已确立了多种基于字符的匹配协议,如召回率(recall)、精确匹配(EM)和 F1 分数。考虑到轻微字符差异可能导致语义大幅偏离(即细微文本差别可能引发含义截然不同的情况),我们采用 DeepSeek-V3-0324 模型,将生成的回答与真实参考答案进行相似度评估。
在复现各类图检索增强生成(GraphRAG)框架的过程中,我们发现实验结果会因 LLM 生成阶段的提示词(prompt)不同而产生显著差异。具体而言,部分框架(Zhao 等人 [2025])要求在检索证据不足时明确拒绝回答;而其他框架(Xiao 等人 [2025]、Sarthi 等人 [2024])则允许 LLM 在这种情况下调用其参数化知识,或对此类场景下的指令表述模糊。鉴于大多数 LLM 在预训练阶段已接触过海量语料,我们认为:基于 LLM 自身知识而非检索机制回答问题,是影响评估公平性的关键因素 —— 我们将这种现象称为 “知识泄露”(knowledge leaking)。
为分别评估两项关键能力:
(1)识别知识局限性的能力;
(2)调用 LLM 参数化知识的能力,我们在三个广泛使用的数据集上实施了双模式评估:
- 拒绝模式(Reject mode):在此模式下,若检索无法提供充足证据,LLM 必须拒绝回答问题。该模式可严格评估检索有效性,并防止生成幻觉内容(hallucination)。
- 开放模式(Open mode):允许 LLM 使用检索到的内容或其自身固有的参数化知识进行回答。该模式能最大程度地衡量模型在实际部署场景中的综合能力。
本文复现了具有代表性的基准模型(baseline),并基于上述指标开展了全面评估。相关提示词(prompt)详见附录 A。此外,这些观察结果进一步凸显了我们提出的 AnonyRAG 数据集的重要性 —— 该数据集可为 GraphRAG 方法的公平、全面评估提供保障。
4.2 数据集
为保证对比的公平性,我们遵循(Jimenez Gutierrez 等人 [2024]、Gutiérrez 等人 [2025])中的设置,首先在三个广泛使用的多跳问答(QA)数据集上,以双模式对 Youtu-GraphRAG 进行评估,这三个数据集分别是:HotpotQA(Yang 等人 [2018])、MuSiQue(Trivedi 等人 [2022])和 2WikiMultiHopQA(简称 2Wiki,Ho 等人 [2020])。
为评估该框架在不同领域的性能,我们还采用了 GraphRAG-Bench(Xiao 等人 [2025],简称 G-Bench)—— 这是一个基于教科书语料构建的基准数据集。此外,为防止知识泄露,我们提出了两个新型双语匿名数据集,即 AnonyRAG-CHS(中文简体版)和 AnonyRAG-ENG(英文版),并设计了一项具有挑战性的 “匿名还原” 任务。
我们对数据集中的特定实体类型(如人物、地点)进行匿名化处理,以打破模型的记忆捷径,避免其依赖预训练知识而非检索到的证据进行回答。同时,我们通过实体链接保留了语义连贯性,确保即使实体名称经过匿名化处理,大语言模型(LLM)仍能理解文本语境。该数据集的构建细节详见附录 B。
4.3 基准模型
我们选取三类研究方法作为基准模型,具体如下:(1)朴素检索增强生成(Naive RAG):作为标准的 RAG 方法,该方法仅通过向量相似度搜索检索排名前 k 的文档片段,不进行任何显式的知识结构化处理;(2)纯图检索增强生成(Pure GraphRAG):此类方法构建扁平结构的知识图谱用于检索,但缺乏层级化组织,主要通过图遍历算法实现关系推理,包括 GraphRAG(Edge 等人 [2024])、LightRAG(Guo 等人 [2024])、G-Retriever(He 等人 [2024])以及 HippoRAG 1 和 HippoRAG 2(Jimenez Gutierrez 等人 [2024]、Gutiérrez 等人 [2025]);(3)基于树结构的图检索增强生成(Tree-based GraphRAG):代表采用递归聚类与汇总策略构建多层级知识树的层级化方法,包括 RAPTOR(Sarthi 等人 [2024])和 E2GraphRAG(Zhao 等人 [2025])。
为确保性能对比的公平性,我们在相同设置下复现了所有基准模型与 Youtu-GraphRAG,并使用一致的指标进行评估。在基础模型选择上,我们采用 DeepSeek-V3-0324 和 Qwen3-32B 作为基础大语言模型(LLM),同时选用轻量级嵌入模型 all-MiniLM-L6-v2。
4.4 整体评估
4.4.1 时间与 Token 消耗对比
对于包含图谱构建和社区检测阶段的基准模型,本节对其 Token 消耗和时间消耗进行对比分析。除非另有说明,此处调用的所有大语言模型(LLM)API 均基于 DeepSeek-V3-0324,并部署在相同硬件上。所有流程均采用 32 线程并发推理执行,以确保图谱构建效率和对比公平性。
图 5a 展示了 Youtu-GraphRAG 与 5 个基准模型在图谱构建阶段的时间消耗和 Token 消耗情况。在所有 6 个数据集上,我们提出的方法始终实现了最低的 Token 消耗,并且在其中 5 个数据集上保持了相对高效的时间性能。在社区检测阶段(如图 5b 所示),与其他 3 个基准模型相比,Youtu-GraphRAG 的 Token 消耗仍为最低,在所有数据集上的 Token 消耗均不超过 10,000。同时,我们的方法在所有数据集上的时间性能也始终保持高效。


4.4.2 主要性能对比
在表 1 中,我们基于 DeepSeek-V3-0324 和 Qwen3-32B 这两个性能强劲的大语言模型(LLM)基础模型,报告了在开放模式和拒绝模式下,模型在 6 个具有挑战性的基准数据集上的 Top-20 准确率。在几乎所有数据集和设置下,Youtu-GraphRAG 均取得了最高性能,这体现了其将精准检索与稳健推理相结合的能力。此外,我们还纳入了一个不含迭代推理与反思智能体的变体模型(即 “Ours w/o Agent”,我们的无智能体版本)作为轻量级方案,以满足需要实时交互反馈的实际应用场景。
两种评估模式的差异为分析系统能力提供了互补视角:
- 开放模式:无论检索是否存在信息缺口,均可充分释放大语言模型的推理潜力以生成答案。这种模式模拟了实际应用中 “覆盖范围优先” 的部署场景 —— 在此类场景中,最大化最终任务准确率的优先级高于风险规避。Youtu-GraphRAG 在该模式下始终优于现有基准模型,在各数据集上较性能最强的竞品提升了 2 至 8 个百分点。当结合我们的智能体框架后,Youtu-GraphRAG 进一步突破性能极限:在 DeepSeek-V3-0324 基础模型上,其在 HotpotQA、2Wiki 和 MuSiQue 数据集上的 Top-20 准确率分别达到 86.5%、85.5% 和 53.6%;在 Qwen3-32B 基础模型上,这三项准确率分别为 85.9%、85.7% 和 54.6%。这一结果证明了该模型在多跳推理和跨文档信息整合方面的显著优势。
- 拒绝模式:该模式设定了严格标准 —— 若检索到的上下文信息不足,模型必须拒绝回答。在该模式下,Youtu-GraphRAG 在 HotpotQA、2Wiki 和 MuSiQue 数据集上的准确率分别达到 81.2%、77.6% 和 47.5%,较性能最强的基准模型提升了 7 至 14 个百分点。
在所有数据集上,我们的方法始终实现了更高的 Top-20 准确率,这印证了其能够将基于图的检索与智能体驱动的推理相协同,从而同时适配 “高覆盖范围” 和 “高精度” 场景。我们重视这一指标,因为它可直接衡量检索质量:推测性答案会被 penalize(扣分),而模型的回答接受率直接取决于检索的完整性与精准度。
此外,我们的方法在两个匿名数据集上的优势也验证了 Youtu-GraphRAG 超越标准基准数据集的泛化能力。具体而言,在开放模式下,该模型在 Anony-CHS(匿名中文数据集)和 Anony-ENG(匿名英文数据集)上的 Top-20 准确率分别达到 42.88% 和 43.26%,显著优于所有基准模型。这些结果还体现了我们的方法在不同语言和领域中,对推理与检索的稳健整合能力 —— 证明该方法可轻松迁移至未见过的数据分布场景,同时保持较高准确率。
Youtu-GraphRAG 的核心目标之一是通过统一图谱构建与检索过程,实现性能与效率的联合优化。图 6 展示了在 6 个基准数据集上,图谱构建阶段的 Token 消耗与问答任务整体性能之间的权衡关系。我们的方法始终以最低的 Token 消耗实现了最优性能,与所有基准模型相比,有效推动了帕累托前沿(Pareto frontier)的移动(注:帕累托前沿指在多目标优化中,无法在提升一个目标性能的同时不降低另一个目标性能的最优解集合,此处 “推动前沿移动” 表示在 Token 消耗更低的同时,性能仍优于现有方法,突破了原有最优权衡边界)。

4.5 泛化性分析
为验证 Youtu-GraphRAG 的领域迁移能力,我们在未进行任何任务特定微调的情况下,在 6 个异质基准数据集上对其进行了评估。如图 7 所示,Youtu-GraphRAG 在所有数据集的 “开放模式准确率”(Open Accuracy)和 “拒绝模式准确率”(Reject Accuracy)两项指标上均取得最佳性能,显著优于当前最先进的 GraphRAG 基准模型。
我们认为,该模型强大的泛化能力得益于框架内部图谱构建与检索过程的本质性整合,具体体现在以下两方面:
(1)schema 引导的抽取智能体能够生成一致性强、具备领域适应性的图谱;双感知社区检测算法所生成的层级化知识结构,在不同领域中均能保持稳健性;
(2)智能体查询分解器可动态调整检索策略以适配不同问题类型,无需人工调参。值得注意的是,在开放模式下,我们的模型在 HotpotQA、2Wiki 等多跳推理数据集上的性能提升尤为显著;而在拒绝模式下,其在 MuSiQue、2Wiki 数据集上展现出更优的 “拒绝回答能力”(abstention capability)—— 这表明该模型在复杂推理和不确定性校准(uncertainty calibration)两方面均具备稳健性。

上述结果证实,Youtu-GraphRAG 能够无缝迁移至未见过的领域,同时保持结构准确性(structural fidelity)与推理深度,实现了 “基础 GraphRAG 范式” 的设计愿景。
此外,我们在表 2 中汇总了 Top-10(前 10 名)检索结果,该表对检索效果的评估标准更为严格。在开放模式和拒绝模式下,我们的方法均持续优于所有基准模型。
在开放模式下,Youtu-GraphRAG 在 HotpotQA、2Wiki 和 MuSiQue 数据集上的 Top-10 准确率分别达到 83.4%、82.3% 和 52.1%,较性能最强的竞品提升约 4.8 个百分点。在拒绝模式下,性能提升更为显著,提升幅度约 8.12 个百分点,这表明该方法具备稳健的检索真实性,且推测性回答明显减少。
值得注意的是,在 Anony-CHS(匿名中文数据集)和 Anony-ENG(匿名英文数据集)这两个匿名数据集上,我们的智能体增强模型(agent-enhanced model)准确率分别达到 38.08% 和 42.57%,进一步证明了其在不同场景下的稳定优势。这些 Top-k(前 k 名)检索结果表明,我们的方法不仅在高覆盖场景中表现出色,在更严格的评估标准下也能保持精准的答案筛选能力,这进一步验证了将基于图的检索与智能体引导的推理相结合的有效性。
4.6 消融实验
为量化各组件的贡献,我们通过移除以下组件开展消融实验:社区检测(记为 “w/o Comm.”,无社区检测)、智能体推理与反思(记为 “w/o Agent.”,无智能体)、schema 引导(记为 “w/o Schema”,无 schema)。六个基准数据集上的实验结果汇总于表 3。
具体而言,移除社区检测后,所有数据集上的性能均出现持续性下降,在 HotpotQA、2Wiki 等多跳问答任务中尤为明显,降幅分别约为 1.7% 和 2.5%。这表明将知识组织为语义连贯的社区,有助于提升全局类问题检索与推理的准确性。
移除智能体推理与反思后,复杂推理数据集上的性能下降最为显著,尤其在 2Wiki 和 MuSiQue 数据集上,降幅分别高达 19.8% 和 7.5%。这印证了我们的设计初衷 —— 迭代式 “推理 - 反馈” 循环对于解决模糊的中间推理步骤至关重要。
移除 schema 引导后,知识密集型场景下的性能出现明显下滑,其中 AnonyRAG-CHS 数据集的降幅达 7.27%。这凸显了在新领域中,高质量的种子 schema 初始化具有重要意义,也进一步体现了我们方法的优势:Youtu-GraphRAG 仅需极少人工干预即可应对领域迁移。
综上,我们的模型性能始终优于所有消融变体,这表明上述三个组件具有互补作用:社区检测提升检索质量,智能体推理增强多步推理能力,schema 引导保障结构准确性。这些结果表明,移除任一组件都会破坏检索与推理间的协同效应 —— 其中,智能体推理对多跳推理最为关键,而 schema 在低资源场景和特定领域场景中则发挥着决定性作用(注:原文 “vito role” 应为 “vital role”,此处按 “关键作用” 修正,以符合语义逻辑)。
5.相关工作
尽管大型语言模型(LLMs)在语言理解和推理方面展现出卓越能力,但已知其容易产生 “幻觉”—— 即生成看似确信无疑但事实错误的输出 —— 尤其是在对复杂查询或多跳查询进行推理时 [Zhang 等人,2025;Qin 等人,2024;Kuang 等人,2025;Dong 等人,2024;Qin 等人,2024]。因此,将大型语言模型与图结构知识相结合,既能保留大型语言模型生成式的灵活性,又能兼具结构化数据的事实严谨性,从而在复杂领域实现更准确、更可信的推理 [Luo 等人,2023;Dong 等人,2023;Bei 等人,2025;Yasunaga 等人,2021;Luo 等人,2024]。
自 [Edge 等人,2024] 的开创性研究以来,图检索增强生成(GraphRAG)技术的发展主要沿着两条互补的研究路径推进。第一条路径的研究方法从 LightRAG [Guo 等人,2024] 的向量稀疏化技术,逐步发展为更复杂的图感知方法。后续的创新成果包括 GNN-RAG 和 GFM-RAG [Mavromatis 与 Karypis,2024;Luo 等人,2025]—— 这两种方法采用图神经网络提升节点匹配效果,以及 HippoRAG 1 和 HippoRAG 2 [Jimenez Gutierrez 等人,2024;Gutiérrez 等人,2025]—— 这两种方法引入记忆机制和个性化 PageRank 算法,以实现上下文感知的检索。
另一条研究路径的方法则聚焦于提升知识组织质量,例如 RAPTOR [Sarthi 等人,2024] 和 E2GraphRAG [Zhao 等人,2025] 等层级化方法,采用类树状聚类和递归汇总技术来优化语义组织。然而,当前研究仍受限于其针对性优化:要么孤立地关注检索环节,要么孤立地关注构建环节,缺乏统一的设计框架。这种碎片化问题使其在需要紧密整合知识组织与检索能力的复杂推理任务中性能受限,尤其在发生领域迁移时,更难以调整整个框架以保证泛化性。
本研究通过构建一个整体框架填补了这一空白:该框架在对知识组织和检索能力进行联合优化的同时,保留了图基础模型的特性。
6 结论
本文提出了一种垂直统一的智能体范式 ——Youtu-GraphRAG,该范式通过图谱 schema 对(知识组织与检索)两方面进行联合优化。我们的框架主要包含以下创新点:(1)一个 schema 引导的智能体,可基于预定义的实体类型、关系和属性进行持续的知识抽取;(2)双感知社区与关键词检测模块,将结构拓扑与子图语义相融合,构建支持自上而下过滤与自下而上推理的层级化知识树;(3)一个智能体检索器,能够解析 schema 并将复杂查询拆解为可处理的子查询,同时结合迭代式推理与反思机制;(4)“匿名还原”(Anonymity Reversion)任务,这是一项用于缓解大语言模型(LLMs)中知识泄露问题的新型任务,通过精心构建的匿名数据集,可深度衡量 GraphRAG 框架的真实性能。
在 6 个具有挑战性的基准数据集上开展的大量实验表明,Youtu-GraphRAG 具备优异的稳健性:相比当前最先进的基准模型,其 Token 成本最高降低 90.71%,准确率最高提升 16.62%,推动了帕累托前沿(Pareto frontier)的进一步发展。值得注意的是,我们的框架展现出强大的适应性,仅需对 schema 进行少量调整,即可实现无缝的领域迁移。这些结果充分凸显了图谱构建与检索相统一的重要性,为研发更高效、更具泛化性的 GraphRAG 技术奠定了基础。
参考文献:
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)