【大模型RAG】 RAGEval: 场景特定的 RAG 评估数据集生成框架
RAGEval: 场景特定的 RAG 评估数据集生成框架
论文链接:https://arxiv.org/abs/2408.01262添加链接描述
Kunlun Zhu
1
∗
{}^{1 * }
1∗ , Yifan Luo
1
∗
{}^{1 * }
1∗ , Dingling Xu
2
∗
{}^{2 * }
2∗ , Ruobing Wang
3
{}^{3}
3 , Shi Yu
1
{}^{1}
1 , Shuo Wang
1
{}^{1}
1 Yukun Yan
1
†
{}^{1 \dagger }
1† Zhenghao Liu
4
{}^{4}
4 , Xu Han
1
{}^{1}
1 , Zhiyuan Liu
1
†
{}^{1 \dagger }
1† , Maosong Sun
1
{}^{1}
1
1
{}^{1}
1 清华大学,
2
{}^{2}
2 北京师范大学,
3
{}^{3}
3 中国科学院大学
4
{}^{4}
4 东北大学
摘要
检索增强生成(RAG)系统在缓解大型语言模型(LLMs)幻觉方面展现了其优势。现有的RAG基准主要关注评估LLMs是否能正确回答一般知识问题。然而,它们无法评估RAG系统在处理来自不同垂直领域的数据时的有效性。本文介绍了RAGEval,这是一个自动生成评估数据集的框架,用于评估不同LLMs在不同场景下的知识使用能力。具体而言,RAGEval从种子文档中总结模式,应用配置生成多样化的文档,并根据文章和配置构建问答对。我们提出了三种新颖的指标:完整性、幻觉和不相关性,来仔细评估LLMs生成的响应。通过在垂直领域基准测试RAG模型,RAGEval能够更好地评估LLMs的知识使用能力,从而避免了现有问答数据集中关于答案来源的混淆—无论是来自参数化记忆还是检索。
1 引言
大型语言模型(LLMs)在自然语言处理(NLP)任务中取得了显著进展。然而,LLMs仍然面临幻觉问题(Zhang et al., 2023),这导致它们在响应中产生事实错误。为了缓解这个问题,许多研究者(Gao et al., 2023b; Asai et al., 2024)倡导采用检索增强生成(RAG)模型来帮助LLMs生成更准确的响应。然而,基准测试RAG模型的有效性仍然具有挑战性(Chen et al., 2024)。

图 1:RAGEval框架。
现有的RAG基准主要关注问答任务(Joshi et al., 2017; Nguyen et al., 2017; Kwiatkowski et al., 2019),评估一般领域内问题回答的事实正确性。然而,这些基准通常在评估RAG模型的可靠性方面面临挑战,尤其是在金融、医疗和法律等垂直领域(Bruckhaus, 2024)。构建不同领域的RAG基准是应对这一问题的最直接方式。然而,由于用户数据的隐私性,挑选出高质量、多样化的数据集以评估RAG模型在不同领域的有效性是具有挑战性的。
本文介绍了RAGEval,这是一个通用框架,旨在自动生成各个垂直领域的场景特定RAG评估案例。具体而言,RAGEval首先收集一小组特定领域的文档以总结模式,这一模式通过分析事实信息而创建,从而封装了该领域的基本知识。然后,在某些规则的约束下,RAGEval根据这个模式生成不同的配置。这些配置进一步被用来生成多样化的文档。最后,生成的文档和配置被用来生成问题。问题、参考资料和答案的三元组随后用于评估RAG的有效性。
为了全面评估生成数据上的RAG有效性,我们的工作专注于从三个维度评估模型响应的质量:完整性、幻觉和不相关性,而不考虑字符串精确匹配(EM)指标(Yu et al., 2023)。对于每个问答对,框架识别并总结出基本的事实点,称为关键点,基于这些点我们提出了新颖的评估指标,更侧重于事实准确性。
2 相关工作
问答(QA)和RAG评估的领域在近年来发生了显著变化。传统的开放领域QA基准,如HotpotQA(Yang et al., 2018)、Triv-iaQA(Joshi et al., 2017)、MS Marco(Nguyen et al., 2017)、自然问题(Kwiatkowski et al., 2019)、2WikiMultiHopQA(Ho et al., 2020)和KILT(Petroni et al., 2021)长期以来作为基础数据集。然而,这些基准在评估现代RAG系统时面临限制,包括潜在的数据泄露和对细微输出的不充分评估。
为了解决这些缺点,新一代RAG特定基准已出现。RGB(Chen et al., 2024)评估LLMs利用检索信息的能力,关注噪声鲁棒性和信息整合。CRUD-RAG(Lyu et al., 2024)通过将RAG应用程序分为创建、读取、更新和删除操作来扩展范围。CRAG(Yang et al., 2024)增加了领域覆盖面,并引入模拟API以模拟实际的检索场景。MultiHop-RAG(Tang and Yang, 2024)专注于需要跨多个文档进行多次推理的复杂查询。
尽管这些基准提供了有价值的见解,但它们仍然局限于预定义领域。我们的方法旨在解决这一局限性,提供一个框架,提供更高的上下文灵活性,使领域特定的事实查询设计成为可能。这促进了整个RAG系统的微调,确保与每个应用场景的独特需求更好地对齐。
传统的RAG评估依赖于如F1、BLEU、ROUGE-L和EM等已建立的NLP指标进行答案生成,同时对检索评估使用命中率、MRR和NDCG(Liu, 2023; Nguyen, 2023)。然而,这些指标在评估RAG的生成能力时缺乏必要的细微差别。
更近期的方法在评估过程中整合了LLMs。RAGAS(Es et al., 2024)和ARES(Saad-Falcon et al., 2023)利用LLM生成的数据评估上下文相关性、真实性和信息量,而不依赖于真实参考。RGB(Chen et al., 2024)引入了以任务为导向的指标,关注噪声鲁棒性、负面拒绝、信息整合和反事实鲁棒性。
当代框架组合了多项指标,以评估检索和生成能力(Gao et al., 2023a)。这些方法通常使用一般质量分数评估RAG在信息检索和生成阶段的表现,有些引入了自动化的基于LLM的评估,以减少人工评估的成本(Liu et al., 2023)。
我们的工作在这些进展的基础上,引入了三种基于关键点的评估指标和两种适应的检索指标,旨在提供更全面的RAG管道评估。
3 方法
建立一个垂直领域的检索增强生成(RAG)评估数据集面临两个重大挑战。首先,由于这些文档的敏感性和分析所需的专业知识,收集和注释垂直文档的成本极高。其次,与开放域QA任务不同,后者通常要求模型生成相对简短的答案,而垂直领域的答案往往更加全面和详细,这使得它们的评估变得复杂。
为了解决这些挑战,RAGEval采用了“模式-配置-文档-QAR-关键点”管道,强调利用事实信息,并增强答案估计的稳健性,以提高评估过程的准确性和可靠性。我们将详细描述这个管道的组成部分。

图 2:RAGEval进展。
3.1 阶段 1:模式总结
在特定领域的场景中,文本通常遵循一个共同的知识框架,不论其风格变异如何。这个框架由一个模式 S \mathcal{S} S 表示,概括了文档中事实信息的整体覆盖。该模式包括关键元素,如组织、类型、事件、日期和地点,汇总了场景的特征信息。为了推导这个模式,我们利用大型语言模型(LLMs)基于一小组种子文本进行归纳推理。尽管这些种子文本可能属于同一类型,但它们在风格和具体事实内容上可能差异很大。例如,财务报告可能涵盖从互联网技术到食品加工的各个行业。这种方法确保了推导模式的有效性和全面性,提高了文本生成的可控性,并使得生成的内容在结构模式上与特定文档类型保持一致。
3.2 第二阶段:文档生成
生成富有事实信息、逻辑一致性和内部一致性的虚拟文本对创建有效的评估数据集至关重要。为此,我们首先生成源自第一阶段建立的模式 S \mathcal{S} S 的配置 C \mathcal{C} C ,而不是立即生成文本。这些配置直接对应于事实信息的类型和内容,作为文本生成的参考和约束。这种方法确保文档不同部分的信息与配置保持更一致。
为了生成这些配置,我们采用一种结合基于规则和基于LLM的方法来为模式元素赋值。基于规则的值生成使用编程算法来创建或选择值,确保高准确性、事实一致性和效率,特别是对于日期或分类信息等结构化数据。这种方法对于选项有限或要求严格格式的模式元素特别有用。为此,我们利用LLMs生成更复杂或多样化的内容。LLMs擅长创造多样且细致的信息,特别是对于需要自然语言理解或创造力的元素,如详细描述或复杂关系信息。这种方法使我们能够生成广泛的高质量、多样化的配置。例如,在财务报告领域,我们的配置涵盖了“农业”、“航空”和“建筑”等多个行业。我们的文档中总共有20个不同的商业领域。
使用以下策略,我们将配置 C \mathcal{C} C 中的事实信息转化为文档 D \mathcal{D} D :我们将配置细节整合到适合该领域的结构化叙述格式中,结合领域特定的先验知识以确保准确性和上下文相关性。对于医疗记录,这涉及对结构和内容的指导,包括疾病类别,确保包含必要的字段,如“患者信息、病史、检查结果、诊断、治疗计划和随访”。为了缓解法律文档中的幻觉问题,模型仅通过其编号生成对法律条款的引用,以确保之后添加正确的引用。在财务报告中,我们向模型提供公司摘要以确保连续性。财务文档通常包含多个章节;因此,我们使用三个部分:“财务报告、公司治理、环境和社会责任”来涵盖各种方面。鉴于财务事件的复杂性,我们手动将配置划分为上述三个部分。然后,我们将这些部分提供给GPT-4o以生成文档的相关部分。这防止了重复的整体摘要,并保持内容流动。最后,这三个部分被连接起来形成完整的财务报告。
3.3 第三阶段:QRA生成
在本小节中,我们描述使用给定文档 D \mathcal{D} D 和配置 C \mathcal{C} C 生成问题-参考-回答(QRA)三元组的过程。本阶段的动机是创建一个全面的评估框架,以测试信息检索和推理能力的各个方面。
利用配置生成问题和初始回答。我们利用配置 C \mathcal{C} C 来指导问题和初始回答的生成。这些配置嵌入在提示中,以确保生成的问题是具体的,回答是准确的。如表6所示,我们解决了七种类型的问题:事实问题、多步推理问题、概括问题、多文档问题等。这一多样的题型旨在评估语言理解和信息处理的不同方面。GPT-4o模型的输入包括详细的指令以及针对每种问题类型的几个示例,这些示例是根据配置量身定制的。这导致了更具针对性和准确性的问题 Q \mathcal{Q} Q 和初始回答 A \mathcal{A} A 。具体的提示和示例在附录中详细列出。
提取参考文献。我们的目标是捕捉所有相关参考文献,以全面支持答案。使用构造的问题 Q \mathcal{Q} Q 和初始回答 A \mathcal{A} A ,我们通过利用提取提示从文章中提取相关的信息片段(参考文献) R \mathcal{R} R 。在提示中,我们强调了将答案与来源材料结合起来的重要性,以确保可靠性和可追溯性。这一步骤通过确保答案得到原始文档的良好支持,增强了答案的全面性和准确性。在提取阶段应用的约束和规则确保参考文献相关且直接支持答案,从而导致更精确和全面的QRA三元组。
优化答案和参考文献。优化答案是确保准确性并与提供的参考文献 R \mathcal{R} R 一致的重要环节,从而尽量减少错误信息,增强生成内容的可靠性。改进过程遵循以下原则:如果参考文献 R \mathcal{R} R 包含初始回答 A \mathcal{A} A 中没有的内容,我们会相应地补充答案。相反地,如果初始回答 A \mathcal{A} A 中包含在参考文献 R \mathcal{R} R 中找不到的内容,我们首先检查文章是否有忽略的引用。如果找到这样的引用,我们将其添加到参考集合中,并保持答案不变。如果未找到对应的引用,我们将从答案中移除不相关的内容。这种方法解决了在答案生成过程中可能出现的幻觉问题,确保最终的答案既准确又得到参考文献 R \mathcal{R} R 的良好支持。
生成关键点。在我们的评估框架中,评估答案不仅仅是关于正确性或关键词匹配,而是关于识别响应中包含的关键信息。为了实现这一点,我们从每个问题 Q \mathcal{Q} Q 的标准答案 A \mathcal{A} A 生成关键点。
为了生成这些关键点,我们为GPT-4o模型使用预定义的提示,该提示支持中文和英文。该提示采用上下文学习的方式设计,提供来自不同领域和问题类型的关键点提取示例。这包括答案无法回答的情况,关键点对此作出适当反映。通常,回应被提炼成3-5个关键点,涵盖必要的事实信息、相关推论以及回答问题所需的最终结论。
通过提取这些关键点,我们确保我们的评估建立在清晰定义和相关信息的基础上,从而提高后续度量计算的精确性和可靠性。
3.4 DRAGONBall数据集
利用上述生成方法,我们构建了DRAGONBall数据集,代表所有领域的多样RAG全基准。该数据集涵盖了三个关键领域(金融、法律和医疗)的广泛文本和相关RAG问题。此外,数据集中包含中英文文本,为多语言和特定领域的研究提供了全面的资源。
对于文档生成,数据集包含来自20个不同金融企业领域的文本,每个领域随机选择一篇;10个不同法律领域,每个领域随机选择两篇文本;以及19个主要医疗类别,每个类别有两个子类别和一篇随机选择的主要类别文本。这确保了金融、法律和医疗领域中人类评估文档数量的平衡。
在表1中,我们详细列出了DRAGONBall数据集的组成。表的第一部分展示了这三个领域(金融、法律和医疗)中文(CN)和英文(EN)文档的分布,两个语言的文档数量相等。第二部分对数据集中包含的问题类型进行分类,提供每类问题的百分比。第三部分详细说明了用于回答问题的参考文档数量的分布,反映数据集的复杂性和多样性。数据集总共有6711个问题。
为了确保QRA三元组的高质量,我们首先考虑不同问题类型间的平衡和多样性,然后去除同质和无意义的问题。例如,如果无法回答的问题数量不足,我们会根据文章进行补充。其次,我们消除冗余引用和答案陈述,并纠正答案中的逻辑推理错误,以确保数据集的质量。
| 领域 | 语言 | 文档数量 |
|---|---|---|
| 金融 | 中文和英文 | ${40}\& {40}$ |
| 法律 | 中文和英文 | 30 & 30 |
| 医学 | 中文和英文 | 38 & 38 |
| 问题类型 | 百分比 |
|---|---|
| 信息整合 | 22.34% |
| 事实性 | 19.49% |
| 多跳推理 | 16.15% |
| 摘要 | 17.40% |
| 数值比较 | 10.51% |
| 时间序列 | 7.15% |
| 无关/无法回答 | 6.96% |
| 参考文档数量 | 百分比 |
|---|---|
| 0 文档 | 6.35% |
| 1 文档 | 20.82% |
| 2 文档 | 46.64% |
| 3 文档 | 7.09% |
| 4 文档 | 4.56% |
| 超过 4 | 14.54% |
表1:DRAGONBALL 数据集中文档和问题类型的分布,总共收集了 6711 个问题。
3.5 RAG系统的评估指标
在本研究中,我们提出了一个全面的评估框架,用于RAG系统,同时考虑了检索和生成组件。
我们定义了多个指标来评估模型在检索阶段的有效性和效率。这些指标是专门为RAG系统设计的,考虑到在不完整和嘈杂的信息存在下对生成的需求。
3.5.1 检索指标
召回率。我们引入RAG检索召回率指标,以评估检索过程在匹配真实参考方面的有效性。召回率形式上定义为 Recall = 1 n ∑ i = 1 n I ( M ( G i , R ) ) (1) \text{ Recall } = \frac{1}{n}\mathop{\sum }\limits_{{i = 1}}^{n}\mathbb{I}\left( {M\left( {{G}_{i},\mathcal{R}}\right) }\right) \tag{1} Recall =n1i=1∑nI(M(Gi,R))(1) 其中 n n n 是真实参考的总数, G i {G}_{i} Gi 表示第 i i i 个真实参考, R = { R 1 , R 2 , … , R k } \mathcal{R} = \left\{ {{R}_{1},{R}_{2},\ldots ,{R}_{k}}\right\} R={R1,R2,…,Rk} 表示检索到的参考集合, M ( G i , R ) M\left( {{G}_{i},\mathcal{R}}\right) M(Gi,R) 是一个布尔函数,如果 G i {G}_{i} Gi 中的所有句子在 R \mathcal{R} R 中至少找到一个参考时返回真,否则返回假,而 I ( ⋅ ) \mathbb{I}\left( \cdot \right) I(⋅) 是指示函数,如果条件为真则返回1,否则返回0。
该指标评估检索的句子与真实参考之间的对齐程度。如果一个真实参考的所有组成句子在检索到的至少一个参考中都存在,则该真实参考被视为成功召回。
有效信息率(EIR)。该指标量化了检索到的段落中相关信息的比例,确保检索过程在信息内容上既准确又高效。其计算公式为 E I R = ∑ i = 1 m ∣ G i ∩ R t ∣ ∑ j = 1 k ∣ R j ∣ (2) \mathrm{{EIR}} = \frac{\mathop{\sum }\limits_{{i = 1}}^{m}\left| {{G}_{i} \cap {R}_{t}}\right| }{\mathop{\sum }\limits_{{j = 1}}^{k}\left| {R}_{j}\right| } \tag{2} EIR=j=1∑k∣Rj∣i=1∑m∣Gi∩Rt∣(2) 其中 G i {G}_{i} Gi 是第 i i i 个真实参考, R t {R}_{t} Rt 是检索到的所有段落集合, m m m 是成功匹配的真实参考数量, ∣ G i ∩ R t ∣ \left| {{G}_{i} \cap {R}_{t}}\right| ∣Gi∩Rt∣ 表示第 i i i 个真实参考与所检索段落 R t {R}_{t} Rt 的交集中的单词数,仅在 G i {G}_{i} Gi 在 R t {R}_{t} Rt 匹配时计算, ∣ R j ∣ \left| {R}_{j}\right| ∣Rj∣ 表示第 j j j 个检索段落中的字数总数, k k k 是检索到的段落总数。
要计算 ∣ G i ∩ R t ∣ \left| {{G}_{i} \cap {R}_{t}}\right| ∣Gi∩Rt∣ 以句子为单位,按照以下步骤进行:1. 将 G i {G}_{i} Gi 划分为单个句子。2. 对于 G i {G}_{i} Gi 中的每个句子,检查其是否与 R t {R}_{t} Rt 中的任一句子匹配。3. 计算匹配句子中的单词数。4. 将所有匹配句子的单词数相加以获得 ∣ G i ∩ R t ∣ \left| {{G}_{i} \cap {R}_{t}}\right| ∣Gi∩Rt∣ 。这确保了重叠是基于句子级匹配来计算的,为检索段落中的相关信息提供了更细致和准确的度量。
3.5.2 生成指标
对于生成组件,我们引入了针对RAG评估的新指标。这些指标提供了对生成答案的质量和可靠性的全面评估。
完整性。完整性衡量生成的答案如何捕捉真实信息中的关键信息。我们使用大型语言模型(LLM)从真实信息中生成一组关键点 K = { k 1 , k 2 , … , k n } K = \left\{ {{k}_{1},{k}_{2},\ldots ,{k}_{n}}\right\} K={k1,k2,…,kn} 。然后计算完整性得分为生成答案 A A A 保留的语义关键点的比例: Comp ( A , K ) = 1 ∣ K ∣ ∑ i = 1 n 1 [ A 包含 k i ] (3) \operatorname{Comp}\left( {A, K}\right) = \frac{1}{\left| K\right| }\mathop{\sum }\limits_{{i = 1}}^{n}\mathbb{1}\left\lbrack {A\text{ 包含 }{k}_{i}}\right\rbrack \tag{3} Comp(A,K)=∣K∣1i=1∑n1[A 包含 ki](3) 其中 1 [ ⋅ ] \mathbb{1}\left\lbrack \cdot \right\rbrack 1[⋅] 是一个指示函数,如果生成答案 A A A 语义上包含了关键点 k i {k}_{i} ki ,则返回1,否则返回0。这里,“包含”意味着生成的答案包含与关键点一致且准确的相关信息。具体而言,想要考虑一个关键点被覆盖,生成的答案必须不仅包含相关信息,还要准确地呈现这些信息,没有矛盾或事实错误。
幻觉。幻觉识别内容与关键点矛盾的实例,突出潜在的不准确性。幻觉得分计算为 Hallu ( A , K ) = 1 ∣ K ∣ ∑ i = 1 n 1 [ A 与 k i 矛盾 ] (4) \operatorname{Hallu}\left( {A, K}\right) = \frac{1}{\left| K\right| }\mathop{\sum }\limits_{{i = 1}}^{n}\mathbb{1}\left\lbrack {A\text{ 与 }{k}_{i} 矛盾}\right\rbrack \tag{4} Hallu(A,K)=∣K∣1i=1∑n1[A 与 ki矛盾](4) 其中 1 [ ⋅ ] \mathbb{1}\left\lbrack \cdot \right\rbrack 1[⋅] 是一个指示函数,如果生成答案 A A A 与关键点 k i {k}_{i} ki 矛盾,则返回1,否则返回0。
无关性。无关性评估未被生成答案覆盖或与之矛盾的真实关键点的比例。无关性量化了没有被覆盖或与之矛盾的关键点比例,指示出答案未能与相关信息互动的领域。无关性得分计算为 Irr ( A , K ) = 1 − Comp ( A , K ) − Hallu ( A , K ) . (5) \operatorname{Irr}\left( {A, K}\right) = 1 - \operatorname{Comp}\left( {A, K}\right) - \operatorname{Hallu}\left( {A, K}\right) . \tag{5} Irr(A,K)=1−Comp(A,K)−Hallu(A,K).(5) 这些指标-完整性、幻觉和无关性-共同定位RAG模型的特定优缺点,确保生成的答案具有信息性、准确性和相关性,从而增强其整体质量和可信赖性。
4 质量评估
在本节中,我们介绍了用于评估生成数据集质量和评价的人为验证过程。评估分为三个主要任务:QAR和生成文档质量评估,以及自动评估的验证。QAR质量评估。我们要求标注者根据图3中列出的标准,通过打分评估在不同配置下生成的QAR的正确性,从而评估QAR的质量。我们为每种语言和领域随机选择每种问题类型的10个样本,最终共计420个样本用于标注。在评分时,标注者获得包含文档、问题、问题类型、生成的回应和参考材料的资料。表2的结果显示,不同领域的QAR质量评分始终较高,不同语言之间略有差异。具体来看,所有领域中4分和5分的组合比例约为 95 % {95}\% 95% 或更高。这表明我们的方法在QAR中维持了高标准的准确性和流畅性。
5: 回应完全正确且流畅。
4: 回应正确,但包含冗余信息。
3: 回应的大部分内容正确。
2: 回应约一半内容正确。
1: 回应的小部分内容正确,或者存在逻辑错误。
0: 回应无关或完全错误。
图3: QAR质量评分标准。
生成的文档质量评估。我们通过将使用RAGEval生成的文档与使用基线方法生成的文档进行比较来评估文档的质量,这些基线方法包括零样本提示(仅根据领域提示要求LLM生成文档)和一次性提示(根据领域提示和样本文档要求LLM生成文档)。我们分别为金融、法律和医疗领域随机选择20、20和19个生成的文档,为每种语言,每组将每个文档与两个通过零样本和一次性提示生成的基线文档打包在一起进行比较。我们要求标注者根据图4中定义的清晰度、安全性、丰富性和符合性对每组文档进行排名,并允许并列。图5所示的结果表明,我们的方法在所有标准中始终优于零样本和一次性方法,特别是在安全性、清晰度、符合性和丰富性方面。具体来看,在丰富性、清晰度和安全性的三个方面,中国和英语数据集中的方法在超过 85 % {85}\% 85% 的案例中排名第一。这表明我们的方法在生成内容丰富、多样且高质量的文章方面的有效性,而无需-
安全性: 避免真实世界的敏感信息。
清晰度: 信息清晰且具体。
符合性: 与真实文档如财务报告或医疗记录的相似度。丰富性: 信息的深度和广度。
图4: 文档质量比较标准。
| 金融 | 法律 | 医疗 | |
|---|---|---|---|
| CN | 4.94 | 4.81 | 4.76 |
| EN | 4.84 | 4.79 | 4.87 |
表2: 按领域划分的QAR质量人工评审分数。
有望的安全性和清晰度。
自动评估验证。为了验证LLM和人工评估之间的一致性,我们将LLM报告的完整性、幻觉和无关性指标与人类报告的结果进行比较。我们使用来自QAR质量评估的同一个420个样本,并要求人工标注者判断Baichuan-2-7B-chat的答案。然后我们计算指标并将其与LLM标注的结果进行比较。图6中的结果显示,机器和人工评估在所有指标上表现出高度的一致性,绝对差异小于0.015。这验证了我们自动评估指标的可靠性,并确认其与人工判断的一致性。
总之,人工评估结果突显了我们的方法在各个领域中生成准确、安全和丰富内容的稳健性和有效性,以及我们自动评估指标在反映人工判断方面的可靠性。
5 实验
5.1 主要设置
我们遵循经典流程进行主要实验,该流程包括文本切分、段落检索和生成,以估计RAG系统中的不同模块。
在我们的主要实验中,我们利用一个检索模型,其超参数设置如下:TopK检索文档数设置为5,检索批量大小为256,并启用了fp16精度以优化检索模型的性能。检索查询的最大长度限制为128个tokens。默认块大小设置为512,没有重叠;我们还添加了有关基本信息的元信息,如公司名称、患者等,以提高检索过程的成功率。在生成阶段,查询生成器的最大输入长度设置为4096个tokens,生成器处理5个的批次。生成参数包括每个输出最多256个新tokens。

图5: 按领域的文档生成比较。

图6: 自动指标验证结果。
我们使用模型的默认生成配置,如温度、TopP等。当模型没有默认生成配置时,将应用hugging face的默认生成配置。ChatGPT系列模型的温度和TopP设置为0.2和1.0,每个查询生成一个响应。更多详细信息可以在发布的代码中找到。
5.2 RAG性能评估
我们从以下角度进行实验。
生成性能比较。该实验旨在比较9个流行的开源/闭源生成模型在不同参数规模上的性能,包括MiniCPM-2B-sft(Hu等,2024)、Phi3-mini(Abdin等,2024)、Baichuan-2-7B(Yang等,2023)、Llama3-8B-Instruct(AI@Meta,2024)、Qwen1.5-7B/14B-chat(Bai等,2023)、Qwen2-7B-Instruct(Bai等,2023)、GPT-3.5-Turbo和GPT-4o。
我们使用相同的输入提示来比较不同生成模型的输出。我们选择每个领域和语言的所有问题类型的前50个问题进行评估,例如每个领域共计350个问题。
5.3 生成性能比较
不同生成模型的整体实验结果如表3所示。
可以观察到,根据Rouge-L指标,Baichuan-2-7B-chat以 0.3262 ( C N ) {0.3262}\left( \mathrm{{CN}}\right) 0.3262(CN) 和0.3039(EN)的分数实现了最佳性能,而GPT-4o的表现几乎是最差的,分数为 0.1527 ( C N ) {0.1527}\left( \mathrm{{CN}}\right) 0.1527(CN) 和 0.2190 ( E N ) {0.2190}\left( \mathrm{{EN}}\right) 0.2190(EN) 。这与我们的直觉相悖-根据Chatbot Arena(Chiang等,2024)和OpenCompass(贡献者,2023),GPT-4o在整体性能方面是最好的模型之一。因此,我们可以推断,像Rouge-L这样基于词频统计的稀疏指标并不能准确反映模型的能力以及RAG系统在RAG场景中的有效性。
与Rouge-L相比,GPT-4o在完整性、幻觉和无关性指标上的表现更好,证明我们提出的基于关键点的评估指标确实能够更好且更全面地反映RAG场景中的模型性能。具体来说,GPT-4o在完整性指标上获得了最高分数 0.5187 ( C N ) {0.5187}\left( \mathrm{{CN}}\right) 0.5187(CN) 和0.6845(EN),在英语中无关性得分为0.1520,最低。
通过我们的详细分析,可以得出几个关键见解:
- 2 B 2\mathrm{\;B} 2B 模型MiniCPM-2B取得了显著的结果,特别是在中文中,其完整性得分为0.4114。这个得分甚至超过了更大的模型,如Baichuan-2-7B-chat和Qwen1.5-7B-chat,后者的得分分别为0.4009和0.3983。在英语中,MiniCPM-2B的表现同样令人印象深刻,完整性得分为0.5484,几乎与Baichuan-2-7B-chat的0.5498相当。这些结果为 2 B 2\mathrm{\;B} 2B 模型在RAG任务中超过参数更多的模型的性能提供了有力证据。
表3: 整体模型性能结果。(无无关结果)
| 模型 | 完整性 ( $\uparrow$ ) | 幻觉 $\left( \downarrow \right)$ | 无关性 $\left( \downarrow \right)$ | Rouge-L ( $\uparrow$ ) | ||||
|---|---|---|---|---|---|---|---|---|
| 中文 | 英文 | 中文 | 英文 | 中文 | 英文 | 中文 | 英文 | |
| MiniCPM-2B-sft | 0.4114 | 0.5484 | 0.4080 | 0.2115 | 0.1803 | 0.2401 | 0.2773 | 0.2505 |
| Baichuan-2-7B-chat | 0.4009 | 0.5498 | 0.4181 | 0.2212 | 0.1809 | 0.2290 | 0.3262 | 0.3039 |
| Qwen1.5-7B-chat | 0.3983 | 0.5704 | 0.4058 | 0.1953 | 0.1957 | 0.2340 | 0.2040 | 0.1862 |
| Qwen2-7B-Instruct | 0.4564 | 0.6052 | 0.3829 | 0.1955 | 0.1596 | 0.1988 | 0.2035 | 0.2182 |
| Llama3-8B-Instruct | 0.4427 | 0.6524 | 0.3888 | 0.1582 | 0.1679 | 0.1894 | 0.1982 | 0.2406 |
| Qwen1.5-14B-chat | 0.4926 | 0.6053 | 0.3440 | 0.1795 | 0.1630 | 0.2152 | 0.2611 | 0.2330 |
| GPT3.5-Turbo | 0.4774 | 0.6540 | 0.3601 | 0.1901 | 0.1626 | 0.1556 | 0.2309 | 0.2563 |
| GPT-4o | 0.5187 | 0.6845 | 0.2797 | 0.1636 | 0.1972 | 0.1520 | 0.1527 | 0.2190 |
表 4:检索模型性能结果。
| 模型 | 检索 | 生成 | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 召回率 $\left( \uparrow \right)$ | EIR (↑) | 完整性 $\left( \uparrow \right)$ | 幻觉 $\left( \downarrow \right)$ | 无关性 $\left( \downarrow \right)$ | ||||||
| 中文 | 英文 | 中文 | 英文 | 中文 | 英文 | 中文 | 英文 | 中文 | 英文 | |
| BM25 | 0.7662 | 0.6717 | 0.0470 | 0.1162 | 0.6316 | 0.6649 | 0.2441 | 0.1264 | 0.1242 | 0.2087 |
| GTE-Large | 0.5760 | 0.7542 | 0.0362 | 0.1372 | 0.5337 | 0.6921 | 0.2851 | 0.1042 | 0.1813 | 0.2037 |
| BGE-Large | 0.6881 | 0.7321 | 0.0465 | 0.1362 | 0.5780 | 0.7077 | 0.2794 | 0.1129 | 0.1426 | 0.1795 |
| BGE-M3 | 0.8387 | 0.6928 | 0.0541 | 0.1243 | 0.6980 | 0.6556 | 0.2004 | 0.1254 | 0.1010 | 0.2190 |
-
在7B-8B范围内的四个模型中,Llama3-8B-Instruct表现出显著优势。在英文评估中,它以最高得分0.6524领先于其他模型。在中文评估中,尽管略低于Qwen2-7B-Instruct的0.4564,Llama3-8B-Instruct仍然表现卓越,得分为0.4427。这些结果强有力地证明了Llama3-8B-Instruct模型在两种语言上的优越性。
-
模型大小影响:在比较同系列不同参数大小的模型时,Qwen1.5-14B-chat显著优于Qwen1.5-7B-chat。14B模型的完整性得分为0.4926(中文)和0.6053(英文),表明较大的参数大小通常在RAG问题中表现更好。
-
表现最佳的开源模型:在所有测试的开源模型中,Qwen1.5-14B-chat在中文中表现最佳,完整性得分为0.4926,而Llama3-8B-Instruct在英文中表现最佳,得分为0.6524。
-
GPT-4o性能:虽然GPT-4o目前显示出最好的整体性能,但与表现最佳的开源模型之间的差距并不大。具体而言,在中文中,GPT-4o的完整性得分0.5187仅比Qwen1.5-14B-chat的0.4926高出0.0261。在英文中,GPT-4o的完整性得分0.6845仅比Llama3-8B-Instruct的0.6524高出0.0321。这表明开源模型有潜力通过进一步的进展缩小性能差距。
5.4 检索性能比较
我们的实验使用Llama3-8B-Instruct模型在Dragonball金融数据集上进行,并在中文和英文中进行了评估。BGE-Large模型使用了针对中文和英文的语言特定版本。所有其他参数都与之前的实验设置保持一致。
表4展示了各种检索模型在中文(CN)和英文(EN)数据集上的性能结果。评估的主要指标包括召回率、预期信息检索(EIR)、信噪比(SNR)、完整性、幻觉和无关性。在英语环境中,GTE-Large模型在多个关键指标上表现优越。它达到了0.7542的召回率(Recall)和0.1372的EIR,表明其在以最低噪声检索相关信息方面的稳健性。然而,该模型在中文环境中的表现不如预期,召回率显著降低至0.5760。
表5:TopK和Chunk-TopK性能结果。
| 设置 | 检索 | 生成 | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 召回率 (↑) | EIR (↑) | 完整性 $\left( \uparrow \right)$ | 幻觉 $\left( \downarrow \right)$ | 无关性 $\left( \downarrow \right)$ | ||||||
| CN | EN | CN | EN | CN | EN | CN | EN | CN | EN | |
| TopK | ||||||||||
| 2 | 0.4667 | 0.5685 | 0.0764 | 0.2491 | 0.5004 | 0.5682 | 0.3226 | 0.1693 | 0.1770 | 0.2625 |
| 4 | 0.6362 | 0.6976 | 0.0553 | 0.1591 | 0.5517 | 0.6503 | 0.3127 | 0.1303 | 0.1352 | 0.2194 |
| 6 | 0.7259 | 0.7542 | 0.0408 | 0.1182 | 0.5835 | 0.7087 | 0.2974 | 0.1227 | 0.1191 | 0.1686 |
| Chunk-TopK | ||||||||||
| 128-8 | 0.5031 | 0.5472 | 0.0884 | 0.2222 | 0.4549 | 0.6683 | 0.2861 | 0.1168 | 0.2591 | 0.2148 |
| 256-4 | 0.4393 | 0.6161 | 0.0824 | 0.2628 | 0.4855 | 0.6509 | 0.3196 | 0.1241 | 0.1944 | 0.2250 |
| 512-2 | 0.4667 | 0.5685 | 0.0764 | 0.2491 | 0.4932 | 0.5609 | 0.3195 | 0.1635 | 0.1873 | 0.2756 |
相反,在中文环境中,BGE-M3模型实现了最佳的整体性能。它记录了最佳的召回率0.8387和完整性0.6980,以及领先的EIR 0.0501。此外,BGE-M3展现出最低的幻觉率0.2711和无关性率0.1085,表明其在中文语境中的检索能力均衡且可靠。
这些结果强调了在检索模型中进行语言特定优化的重要性。在检索和生成指标中观察到的一致性能模式进一步支持了我们的评估框架的有效性。这表明,为检索阶段设计的指标可以有效预测生成阶段的结果,因为更高的召回率和EIR分数通常能够产生更好的完整性和幻觉分数。
5.5 超参数比较
我们的实验是在Dragonball金融数据集上使用Llama3-8B-Instruct模型进行的,评估了常见的RAG(检索增强生成)设置,特别是TopK检索和块大小,对模型在中文和英文中的性能的影响。结果总结在表5中,突出了几个关键观察和见解:
5.5.1 TopK检索观察
-
随着TopK的提高,召回率提高:- 正如预期,随着TopK值的提高,召回率得到了改善。具体而言,中文中,召回率从TopK = 2 = 2 =2 的0.4667提高到TopK = 6 = 6 =6 的0.7259,而英文中,从TopK=2的0.5685提高到TopK=6的0.7542。- 这些改善显示,较高的TopK值使模型能够检索到更多相关信息,这对于提高整体检索效果至关重要。
-
生成指标随召回率提高而改善:由于TopK值增加而导致的召回率改善在生成指标中得到了反映,显示出检索性能与生成质量之间的正相关关系。对于中文,完整性从TopK=2时的0.5004显著改善到TopK=6时的0.5835。同样,对于英文,完整性从TopK=2的0.5682提升到TopK=6的0.7087。这些结果表明,检索到更多的相关文档(更高的TopK)导致更完整和准确的回应,并减少幻觉,突显了改善检索对生成质量的直接影响。
5.5.2 块大小影响
-
最优块大小因语言而异:从表5中,我们观察到中文和英文的最优块大小不同。对于中文,128-8设置(128个令牌,8个块)在召回率(0.5031)和EIR(0.0884)上表现最佳,而对于英文,256-4设置达到了最高召回率(0.6161)和EIR(0.2628)。这表明理想的块大小可能依赖于语言,中文更适应较小、更为众多的块,而英文则稍大一些的块。
-
生成指标中的权衡:有趣的是,最佳的检索性能并不总是转化为最佳的生成指标。对于中文,512-2设置尽管召回率较低,但总体完整性最高(0.4932),而对于英文,128-8设置的完整性最高(0.6683)。幻觉率在两个语言中都是在128-8设置下最低(中文为0.2861,英文为0.1168),表明更多的小块可能有助于减少幻觉。
-
平衡检索和生成性能:结果强调了块大小、检索性能与生成质量之间复杂的关系。虽然较小的块(128-8)通常导致更好的检索指标和较低的幻觉,但较大的块有时可以提高完整性。这建议在选择最优块大小时应根据任务的具体要求进行平衡,兼顾检索准确性、生成完整性和幻觉减少。
在不同块大小和语言表现差异中的变化强调了在检索增强生成系统中进行细致调优的重要性。它还强调了一种整体方法的必要性,在优化此类系统时应考虑检索和生成指标。
6 结论
本文介绍了RAGEval,一个用于自动生成和场景特定数据集以评估RAG系统能力的新框架。我们的方法通过关注事实准确性和场景特定知识解决了现有基准的局限性,这在金融、医疗和法律等行业中至关重要。我们的实验结果表明,与传统指标相比,我们设计的新指标提供了对RAG场景中模型性能的更全面和准确的评估。值得注意的是,尽管GPT-4o整体表现优越,但与表现最佳的开源模型之间的差距相对较小。这表明开源模型有显著提升的潜力。未来的工作可以集中于将该框架扩展到更多样化的领域,并探索进一步缩小开源模型与专有模型在RAG场景中之间的性能差距的方法。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)