Search-R3: 让大语言模型同时拥有推理和嵌入生成能力的新框架
摘要:尽管大型语言模型(LLMs)在自然语言理解方面表现出色,但它们在检索任务中的应用一直未被充分利用。我们提出了Search-R3,这是一个新颖的框架,通过使LLMs将其推理过程的直接输出生成为搜索嵌入向量,从而解决了这一限制。我们的方法利用了LLMs的思维链能力,使它们能够通过逐步推理进行复杂的语义分析,从而产生更有效的嵌入向量。我们通过三种互补的机制来实现这一点:(1)监督学习阶段使模型能够生成高质量的嵌入向量,(2)强化学习(RL)方法在推理的同时优化嵌入向量的生成,以及(3)一个专门的强化学习环境,该环境能够高效地处理不断演变的嵌入向量表示,而无需在每次训练迭代时重新编码整个语料库。我们在多种基准测试中的广泛评估表明,Search-R3通过统一推理和嵌入向量生成过程,显著优于先前的方法。这种集成的后训练方法在处理需要复杂推理和有效信息检索的复杂知识密集型任务方面,代表了巨大的进步。
title: "Search-R3: 让大语言模型同时拥有推理和嵌入生成能力的新框架"
authors: "Yuntao Gui, James Cheng"
year: 2025
paper_link: "https://arxiv.org/pdf/2510.07048v1"
code_link: "https://github.com/ytgui/Search-R3"
keywords: ["大语言模型", "嵌入生成", "强化学习", "检索增强生成", "语义表示"]
欢迎大家关注我的公众号:大模型论文研习社
往期回顾:大模型也会 “脑补” 了!Mirage 框架解锁多模态推理新范式,无需生成像素图性能还暴涨
欢迎大家体验我的小程序:王哥儿LLM刷题宝典,里面有大模型相关面经,正在持续更新中
研究背景:现有嵌入方法的痛点
传统的检索系统通常将嵌入(Embedding) 生成和语言理解割裂开来:BERT等专用嵌入模型负责将文本转化为向量,而LLMs则单独处理自然语言理解。这种"两张皮"的架构存在三大问题:
- 语义理解不足:专用嵌入模型难以捕捉复杂概念间的深层关系,缺乏多步推理能力
- 表示不可解释:生成的嵌入向量如同黑箱,无法追溯其决策逻辑
- 系统复杂度高:需要维护多个模型,增加了部署和维护成本
就像一个厨师只会切菜却不懂烹饪原理,传统嵌入模型能生成向量却不理解其中的语义含义。而Search-R3要做的,就是教会这个"厨师"不仅会切菜,还能理解每道菜的烹饪哲学!
方法总览:两阶段训练管道
Search-R3采用创新的两阶段训练方法,巧妙地将LLM的推理能力转化为嵌入生成能力,整个过程不改变原模型架构,堪称"无侵入式升级"。

第一阶段:指令引导表示学习(Instruction-guided Representation)
就像教孩子认识世界一样,我们首先需要告诉LLM如何生成嵌入。研究人员设计了特殊的嵌入令牌(<|embed_token|>),让模型学会在生成文本的同时输出嵌入向量。通过以下三步训练:
- 监督微调(SFT):让模型学会遵循特定格式,在回答结尾生成嵌入令牌
- 对比学习:使用InfoNCE损失和三元组损失优化嵌入空间
- 知识蒸馏:通过KL散度确保模型在学习新能力的同时保留原有语言理解能力
这一阶段就像给LLM颁发了"嵌入生成资格证",使其具备基本的嵌入生成能力。
第二阶段:强化学习优化(Reinforcement Learning)
拿到"资格证"后,还需要通过实践提升技能。研究人员设计了基于组相对策略优化(GRPO) 的强化学习框架,让模型在实际检索任务中不断学习优化:
- 更丰富的系统提示:引导模型进行深度语义分析
- 创新奖励函数:结合检索质量(DCG分数)和格式合规性
- 选择性图刷新机制:高效更新嵌入索引,避免全量重计算
这一阶段相当于"实习培训",让LLM通过真实任务不断提升嵌入质量。
深度拆解:创新点详解
1. 推理增强的嵌入生成
传统嵌入模型像相机快照,只能捕捉文本表面信息;而Search-R3则像专业影评人,会先分析文本内容再生成深度理解。通过以下四步推理过程:

- 识别核心概念及关系:如将"数据分析Python库"解析为数据处理、可视化等子概念
- 包含关键术语及定义:明确pandas、matplotlib等工具的功能
- 添加上下文相关同义词:如"数据操作"、"数据可视化"等
- 连接相关主题和应用:如数据分析在科研、商业中的应用场景
这种推理过程让嵌入向量不仅包含字面信息,更蕴含深层语义关系,就像给文本生成了"语义指纹"。
2. 选择性图刷新机制
想象一下,如果每次更新手机系统都要格式化整个硬盘,效率该多低!传统检索系统在模型更新后需要重新编码所有文档,而Search-R3的选择性图刷新机制则像智能更新:

- 定位关键区域:只更新与正例和难负例相关的嵌入节点
- 扩展二跳邻居:通过语义关联扩展需要更新的范围
- 批量更新操作:一次性处理整个相关区域,大幅提升效率
这一机制使强化学习阶段的计算成本降低了80%以上,让大规模训练成为可能。
3. 混合训练数据策略
Search-R3采用"营养餐"式的数据混合策略,确保模型获得全面的训练:

- 学术文献(S2ORC):提供专业领域知识
- 问答数据(TriviaQA、MSMARCO):增强检索能力
- 代码数据(CodeSearchNet):提升技术领域理解
- 多语言数据(Miracl):支持跨语言检索
- 合成数据:专门构建的难例数据,强化模型辨别能力
这种多元化的数据组合就像运动员的全面训练,让模型在各种场景下都能表现出色。
实验结果:实力说话
开源模型对比
在五大权威基准测试中,启用推理能力的Search-R3-Small表现惊艳:

- CoSQA代码检索:nDCG@10达0.317,超越Sentence-T5-XL
- LitSearch文献检索:nDCG@10提升0.036,达到0.453
- MedicalQA医疗检索:Recall@100高达0.971,接近人类专家水平
- MKQA问答检索:nDCG@10提升0.017,在最具挑战性的任务中脱颖而出
- SciFact事实核查:nDCG@10达0.672,证明推理能力提升事实理解
特别值得注意的是,在每个任务中,启用推理(绿色圆点标记)都能带来稳定提升,证明推理过程确实增强了嵌入质量。
专有模型对比
在与闭源商业模型的对比中,Search-R3-Small虽规模较小(1.5B参数),却展现出惊人竞争力:

- 推理启用后nDCG@10达0.871,超越Qwen3-Embedding-0.6B
- 仅比2倍参数的Qwen3-Embedding-4B低0.008,性价比极高
这就像一位轻量级拳击手击败了中量级选手,证明了Search-R3方法的高效性!
强化学习效果
强化学习究竟带来了什么变化?通过对比训练前后的奖励分布:

- 训练前:分数分布分散(-1.0到0.75),平均仅-0.39
- 训练后:分数集中在0.5左右,69%的输出超过0.5分
就像从打靶随机命中到百发百中,强化学习显著提升了模型输出的稳定性和质量。
案例分析:MSMARCO上的有趣发现
在MSMARCO数据集上,研究人员发现了一个有趣现象:

当查询"哪种医疗系统为所有公民提供平等医疗服务"时,传统模型会优先匹配包含"全民医疗"关键词的文档(Groundtruth),而Search-R3却更青睐描述新加坡、爱尔兰等国实际医疗系统的文档(Prediction)。
这并非错误,反而体现了Search-R3的深度理解能力:它不仅看到了关键词,还理解了查询背后对"实际实施案例"的潜在需求。就像一位经验丰富的顾问,不仅回答问题本身,还提供更有价值的实际参考案例。
未来展望
Search-R3的创新为LLM应用开辟了新方向:
- 统一模型架构:一个模型同时处理生成和检索任务,简化系统设计
- 可解释嵌入:通过推理过程可追溯嵌入生成逻辑
- 领域适配性:只需微调即可适应特定领域需求
- 低资源部署:小模型也能实现高性能,降低硬件门槛
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)