重新定义相关性检索!腾讯中科院开源 RARG:10 万文档问答准确率 84%,工具调用降至约四分之一

发布时间:2026/8/4 2:11:07
重新定义相关性检索!腾讯中科院开源 RARG:10 万文档问答准确率 84%,工具调用降至约四分之一 一句话讲清楚腾讯与中科院信工所开源 RARG 先让关键词搜索查看更可能相关的文档匹配过多时再把最值得看的片段排到前面。论文标题A New Role for Relevance: Guiding Corpus Interaction in Agentic Search论文链接https://arxiv.org/abs/2607.24223Github 链接https://github.com/LeqsNaN/RARG项目链接https://qdcassie-li.github.io/RARG/面对十万份本地文档一个搜索智能体常在两种不理想的做法之间选择。它可以先用检索模型挑出排名靠前的文档再把内容交给大模型。这种办法快但相关文档里的关键证据可能只占几行截取片段时很容易漏掉。多步问题还会遇到另一层麻烦只有先发现中间人物或事件后续证据才知道该去哪里找。另一种做法是让模型直接使用终端工具在原始语料库里反复搜索和读取。它能追踪新出现的实体、核对上下文也能把分散在多份文档里的线索接起来代价是关键词搜索不知道哪些文档更值得先看。结果一多真正有用的那几行还可能被截断在模型的可见范围之外。RARG 试图把两种做法的优点接起来。论文的核心想法很直接相关性分数不只用来决定“给模型哪些文档”也可以决定一次搜索“先扫哪里、先显示哪些匹配”。左图横轴是每道题的估算模型调用费用纵轴是问答准确率 RARG 系列整体向左上方移动。右图比较 BRIGHT 排序质量及每题费用。相关文档找到了关键证据仍可能没被看见传统检索通常把问题和每份文档分别计算相似度再返回前若干项。这个分数衡量的是“这份文档大概有没有用”无法保证关键句已经被准确截取也无法替模型完成跨文档核对。直接语料库交互 Direct Corpus Interaction DCI 把原始文档作为文件暴露给智能体。模型主要使用 Bash 和 Read 两个工具前者运行关键词或正则搜索后者读取匹配位置附近的原文。论文使用rg也就是速度较快的 ripgrep 执行具体的模式匹配。它擅长准确找词却不理解问题。假如一百份文档都含有同一个人名rg默认不会优先返回与当前问题最相关的那一份。更棘手的是输出上限。一次命中几百条时工具只能保留前面一部分。相关文档若被较晚扫描或者关键段落藏在整体排名较低的文档中智能体连看到它的机会都没有。论文把智能体从开始搜索到找到并核实证据的过程称为“搜索收敛”。 RARG 让智能体在前几次搜索中看到更多有用证据从而减少无关方向上的工具调用。RARG 把文档排名改造成搜索顺序左侧 DCI 按默认顺序搜索关键匹配可能落在截断线之后右侧 RARG 、 RARG、 RARG 分别加入文档排序、起点段落和局部匹配重排。RARG 在 DCI 的两个工具之外增加embed_recall。智能体先根据原问题生成一个语义检索请求嵌入模型据此给文档排序。这里有一个重要区别embed_recall不把排名靠前的文档内容直接返回给大模型。它只把排好序的文档路径写进临时的范围文件并告诉模型这个文件对应哪次查询。这份按相关性排好序的候选文件清单最多保留 10000 条路径。智能体随后用一条管道命令把这些路径按顺序交给rg1cat /tmp/scope_N.txt | xargs -d ‘\n’ rg -j1 “PATTERN”检索模型在这里提供方向rg仍负责寻找和验证具体证据。相关性排名不再直接决定哪些内容能进入上下文而是决定文件被搜索的先后顺序。实现中还有一个容易被忽略的细节。rg默认并行读取文件输出顺序取决于各个线程何时结束会打乱范围文件里的排名。 RARG 因此自动加入-j1强制单线程顺序扫描。收集到足够多的匹配后即可停止无需先扫完整个范围再重排。智能体通常只需建立一两次搜索范围。以 GPT-5.4-mini 的主实验为例 RARG 三种版本平均调用embed_recall1.2 至 1.6 次后续探索仍主要由范围内的rg完成。这避免了智能体为了持续获取新片段而反复调用语义检索。两层补强给出起点再重排局部匹配只有文档顺序还不够。智能体刚拿到范围文件时手里仍只有原问题可能不知道第一条精确的搜索词该写什么。建立候选文件清单后 RARG 额外从排名靠前的文档中切出 400 至 1000 字符的段落再用嵌入模型选出最相关的 10 段直接与清单一起展示给智能体。它们提供人物名、术语或事件等后续搜索线索答案仍需由rg与 Read 核实。这一步不需要额外的大模型回合。案例实验显示它对“何时第一次看到决定性线索”的影响尤其明显。RARG 进一步解决匹配过多、关键片段仍可能被截断的问题。文档整体相关性不高不代表其中每一段都无关。一份长文可能只有一句话正好补上证据链但表示整篇文档内容的向量会稀释这句信息。因此 RARG 会从一次rg搜索中收集最多 500 条匹配用嵌入模型重排再把最相关的 30 条展示给问答智能体排序检索任务展示 60 条。重排同时考虑用户最初的问题和本次关键词搜索想核对的内容。论文也测试了让大模型单独生成重排查询。这个版本平均只用 17.8 次工具调用收敛最快准确率却降到 75%。作者推测额外要求模型输出一段重排查询改变了它原本熟悉的 Bash 与rg行为。更少的步骤在这里没有换来更可靠的答案。一个多文档问题 33 次工具调用降到 10 次论文附录给出了一条完整线索链智能体要根据博士毕业年份、学会会士身份、合作者、奖项和另一篇论文标题在多份文档中确定同一个人。三种 RARG 都答对了区别出现在关键证据何时出现。圆点表示完整姓名第一次出现的位置一个模型回合中可以连续执行多个工具调用因此回合数与工具数不同。基础 RARG 先广泛交叉人物与奖项线索到第 7 回合才找到含完整姓名和博士年份的简历最后用 33 次工具调用完成核验。RARG 在初始段落中更早接触到这份简历第 2 回合便不再漫无目标地找人转而核对某个具体候选人。 RARG 同样在第 2 回合看到姓名又通过局部重排减少后续匹配最终只用 10 次工具调用。这个案例不能单独证明方法普遍更好但它把机制呈现得很清楚起点段落主要改变关键证据出现的时间局部重排则继续压缩验证过程。主实验准确率提高工具调用明显减少主实验使用 BrowseComp-Plus 的 100 个复杂问答样本语料库含 10 万份文档。 GPT-5.1 按 DCI 的评审提示将每个最终答案与标准答案对照并判定是否正确表中的准确率就是 100 道题里答对的比例。 RARG 分别搭配 GPT-5.4-mini 、 GPT-5.4-nano 和 GPT-5.4 测试。对照方法中 RISE 先用 BM25 检索构建一批可搜索文档并向模型返回部分文档片段 DCI 则让模型直接在原始文档中搜索。二者分别代表“先检索再交互”和“直接搜索原文”的路线。10 万文档问答主结果。重点看准确率、总工具调用和智能体回合数 Search 、 Bash 、 Read 分别记录语义检索、命令搜索和局部读取次数。GPT-5.4-mini 下 RISE 与 DCI 的准确率都是 78%。 RARG 、 RARG、 RARG 依次达到 80%、 81% 和84%。成本差异更大。 DCI 平均调用工具 99.1 次 RARG 为23.9 次约为前者的四分之一 RISE 为 28.7 次。 RARG 同时把平均智能体回合数降到 17.6 DCI 为 48.8 。GPT-5.4-nano 下三种 RARG 分别达到 73%、 74% 和 79%仍高于最强对照方法的 71%。不过较小的模型更容易偏离“先建立范围、再在范围内搜索”的要求基础 RARG 平均调用embed_recall9.1 次 RARG 更增至 14.5 次三个版本的工具调用没有随方法增强而稳定下降。GPT-5.4 下 RARG 从 RISE 的 82% 提高到91%平均工具调用从 34.30 次降到 25.43 次。更强的指令遵循能力让相关性排序更稳定地转化为实际搜索行为。这些对比还排除了一个简单解释提升并非只来自换用更强的嵌入模型。论文把 RISE 的 BM25 换成同一款 Qwen3-Embedding-4B 后准确率反而只有 69%语义检索调用也更多。真正起作用的是让文档排名直接控制后续关键词搜索的顺序。扩到 100 万文档排名稳定局部搜索仍会受噪声影响作者又加入 90 万篇较长的 FineWeb-Edu 文档把语料库扩大到 100 万份。长文档会制造更多偶然的关键词匹配比加入短小无关文档更难处理。语料库扩至 100 万文档后 RARG 保持 79% 准确率和 24.7 次平均工具调用 RISE-BM25 为 69% 和 32.1 次。RARG 的准确率从 84% 降到 79% RISE-BM25 从 77% 降到 69%。 RARG 仍保留 10 个百分点的优势工具调用只从 23.9 次增加到 24.7 次。为什么准确率下降而调用次数几乎不变可以把搜索看成两道门。第一道门检查正确文件有没有进入前 10000 份候选清单用“范围召回率”衡量第二道门检查智能体写出的关键词是否真的在这些文件里碰到正确证据用“rg覆盖率”衡量。GPT-5.4-mini 在 10 万与 100 万文档设置下的范围召回率都约为 95% 至 97%说明候选清单仍然可靠。扩容后下降的是智能体实际执行的rg搜索命中正确文件的比例。左图显示范围召回率在扩容后仍为 95.4%但rg覆盖率降至 75.9%右图显示 GPT-5.4-mini 的命令仍有 96% 至 98% 遵循范围内搜索。这意味着系统没有忘记规定好的搜索步骤也没有明显选错文档范围。长文档产生了大量碰巧同词的匹配真正相关的结果更容易被截断模型也可能过早结束搜索。 RARG 的局部重排只能部分缓解这类干扰。为什么局部重排既能救回线索也可能缩小视野论文统计了相关文档命中在搜索范围中的位置。纯嵌入检索把命中集中在排名最前面却反复返回相近文档 DCI 的命中分布最平说明它在缺少顺序指引时需要遍历更大范围。横轴是文件在候选清单中的位置颜色越深表示该区间命中相关文档的次数越多。 RARG 能从整体排名较后的文档中找回相关片段。RARG 位于两者之间搜索仍明显偏向排名靠前的文档同时能通过rg接触更多不同文件。 RARG 的分布比 RARG 更平说明即使整篇文档排名不高其中高度相关的片段仍可能被重新排到前面。但“更快看到最强局部证据”并非适合所有目标。问答只需找到一条完整且可验证的证据链快速收敛通常有利文档排序任务需要尽可能找全相关候选再精确安排前十名过早集中到少数强匹配可能损失覆盖面。BRIGHT 正好检验了这一点。它包含生物、地球科学、经济学和机器人四个子集问题需要推理后才能判断文档是否相关。它用 nDCG10 评价返回结果前十名的排序质量相关文档排得越靠前分数越高。BRIGHT 四个子集结果。 RARG 的平均 nDCG10 为 53.36 专门面向复杂检索的 NeMo Agent 为 52.89 RARG 为 50.55 。RARG 取得最高平均分53.36比 NeMo Agent 的 52.89 高 0.47 分差距很小。基础 RARG 为 51.75 RARG 降到 50.55 。这里更值得关注的证据是三种版本的顺序反转。这一反转与方法目标一致。 RARG 平均 Bash 调用最少说明它确实更快集中到与当前问题高度相关的片段 BRIGHT 奖励广泛召回时这种收敛速度反而会让找到的相关文档种类不够多。工程上不宜把 RARG 当成固定升级项。答案核验可以优先使用局部重排并在证据链闭合后停止候选发现则要保留更宽的文档覆盖停止条件也应更保守。选择整篇文档还是具体片段作为主要排序单位取决于任务更重视快速找到一条证据链还是尽量找全相关文档。方法的边界RARG 依赖嵌入模型在整篇文档和具体片段两个层次上提供可靠分数既要给长文档排序也要判断短匹配片段。论文在 BRIGHT 上用 NV 模型排文档却发现它不适合短片段于是局部重排改用 Qwen3-Embedding-4B 。部署时可能需要两套模型或专门调校。按顺序执行的rg -j1和最多 500 条匹配的嵌入重排都会增加单次搜索延迟。论文报告的是工具调用与估算成本没有给出完整的端到端时延对比因此“调用更少”不能直接等同于“从开始到结束的实际耗时一定更短”。部署前至少还要同时记录端到端耗时、单次rg扫描时间和嵌入重排时间。文档很长或存储读取较慢时少几十次工具调用未必能抵消单线程扫描与重排增加的等待。方法也依赖负责规划和回答的大模型遵守“先选文件、再搜关键词、最后核验证据”的步骤。 GPT-5.4-nano 更频繁地重复建立候选清单范围召回率也低于 GPT-5.4-mini 。论文目前只测试 GPT-5.x 系列、固定本地语料库与两个基准开放网页和其他模型上的表现仍待验证。RARG 能改善先看哪些文件、先显示哪些片段却不能消除长文档内部的关键词噪声。它在问答任务上得到的收益也不能直接推导到强调广泛召回的检索任务。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】