资讯详情

资讯详情

【AAAI 2026】Relink:按查询现场取证,GraphRAG 从「先建图」到「边推理边建图」|从知识图谱与检索增强视角

摘要本文解读 AAAI 2026 论文《Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG》。该论文提出查询驱动的证据图即时构造reason-and-construct通过融合高精度事实知识图谱、从语料实体共现构建的潜在关系池与统一语义空间中的查询感知排序器把 GraphRAG 的推理底座从静态图换成按需构造的证据图其特别之处在于补链与去噪都发生在推理的那一刻而不是离线建图阶段。实验表明五个多跳开放域问答基准上平均提升 5.4 个百分点的 EM 与 5.2 个百分点的 F12WikiMultiHopQA 上 EM 达到 0.628相对 GPT-4o 提升 115.1%并且在删掉九成显式图边时静态基线 F1 掉 34.7% 而 Relink 仍保持 0.669为知识图谱与检索增强生成提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQRelink 和普通 GraphRAG 最本质的区别是什么为什么「潜在关系池」能补上知识图谱缺失的边统一语义空间到底解决了什么问题这套方法的主要代价是什么这篇论文在写作与叙事上有哪些值得借鉴的地方参考链接论文基本信息项目内容标题英文Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG标题中文按查询现场取证GraphRAG 从「先建图」到「边推理边建图」作者Manzong Huang, Chenyang Bu, Yi He, Xingrui Zhuo, Xindong Wu机构合肥工业大学 计算机与信息工程学院 · 大数据知识工程教育部重点实验室 · 威廉与玛丽学院 数据科学系 · AAAI 2026会议AAAI 2026arXivarXiv:2601.07192项目网站github.com/DMiC-Lab-HFUT/Relink背景与动机图谱检索增强生成GraphRAG之所以有效是因为它把大模型从纯参数化知识里拉出来接到结构化的外部知识上让多跳问题可以沿着显式的关系链一步步推理。但 Relink 指出当前几乎所有 GraphRAG 方法都建立在同一个默认前提之上先离线构建一张静态知识图谱再在这张图上推理——论文把这条路线称为 build-then-reason。问题恰恰出在这个前提上它带来两类结构性失败。第一类是知识图谱不完整知识本身在演化抽取过程又会引入误差所以静态图的覆盖率天生不足缺一条关键边就足以让整条推理链断掉。已有的应对办法是知识图谱补全KGC以及基于大模型的图谱构建KGGen、SAC-KG、AutoKG但这些「全局补全」把图无差别地变稠并不保证补上某个具体问题真正需要的那条局部边。第二类是低信噪比图里充满与问题高度相关、却对答案毫无帮助的干扰事实。论文给出的经典例子是定位墓葬地点时检索到「died in」而不是「buried in」——两者都与人物相关只有后者指向答案。于是作者的判断是这两种失败不是工程细节问题而是范式的天花板。图里已经存在什么决定了你最多能推理出什么。为此论文主张把范式换成reason-and-construct证据图不是需要一次性投入的全局资产而是当前查询的即时产物。把这条主张放回历史脉络会更清楚。2020 到 2023 年是图谱问答的检索与推理阶段图被当作外部事实源多跳问题在图上走路径2024 年 GraphRAG、Think-on-Graph、HippoRAG 与 LightRAG 把语料整体建成图再检索确立了 build-then-reason 范式图成为一次性投入的全局资产2025 年起以 TCR-QF 和 HOLMES 为代表的工作开始承认建图会丢信息但仍在静态图上做表示层与检索层的事后补偿到 2026 年Relink 把补链与去噪挪到推理时刻图被降级为骨架。为什么这条主线重要三点不完整是常态全局补全无法对准某个问题的局部需求噪声不可先验消除相关不等于有用只有拿到问题才能判断哪条边该丢成本可摊销离线只建一次骨架重活留在推理时。在基线对比上论文把现有方法归于两条路线一条是让图变稠代表是 KGC 与 LLM 建图另一条是让检索变准代表是 G-Retriever、KG-Retriever、StructGPT 以及用文本证据补三元组的 TCR-QF、HOLMES。最相关的工作是 ToG 与作者自己的前作 TCR-QF它们都把静态图当作既定前提。Relink 的差异在于别人在已有的图上找路它在推理过程中造边候选同时来自知识图谱与语料潜在关系判据是「对答案有没有用」而不是「图里有没有」。研究主线从问题到结论图 5Relink 研究主线——从静态图谱的两类失败到查询驱动证据图与统一空间排序Mermaid 流程图基准/方法设计Relink 的设计目标很明确把「缺边」和「歧边」这两类问题放进同一个打分台而不是分别处理。为此它构造了一个异构知识源包含两个互补的部分。第一部分是高精度事实图谱$\mathcal{G}_b$由大模型从语料中抽取得到作为可靠但不完整的推理底座论文的消融显示这个底座是整个系统里最不能省的一环。第二部分是高召回潜在关系池$\mathcal{R}_c$来自语料中实体的共现关系先对共现实体对用点互信息阈值过滤再对每一对取它的上下文句子用编码器读取掩码位置的隐状态得到该关系的稠密向量表示作为可以参与排序的候选边。两个源的分工是显式的显式图保精度潜在池保召回前者保证推理有据可依后者负责把断掉的路径接起来。图 1静态 GraphRAG 的两类失败 vs. Relink 的动态构造——(a) 缺边直接打断推理路径(b) 干扰事实与查询相关却与目标错位Relink 通过丢弃干扰并从语料潜在关系中实例化缺失事实同时解决两者真正让两类候选可比的是一个统一语义空间。事实三元组 $(h,p,t)$ 被线性化成序列后由编码器编码取句首标记的表示作为候选边的向量潜在关系直接使用它自己的向量。两者因此落在同一个 $\mathbb{R}^d$ 空间里可以由同一个排序器同台评估。这个设计不是装饰论文的消融显示去掉维持这个空间一致性的对齐损失后HotpotQA 上的 EM 相对下降 7.2%说明「跨源可比」本身就是性能来源。分类全景图 6Relink 的四层组成——显式图保精度、潜在池保召回、统一语义空间保证跨源可比、粗到细排序器负责去噪Mermaid 流程图方法细节整条流水线可以概括为五个步骤其中第四步是全文的核心。第一步构造上面说的异构知识源第二步完成潜在关系的向量化第三步建立统一语义空间第四步是查询驱动的动态路径探索从问题中的主题实体出发做束搜索第五步把选中的证据图交给生成模型产出带句子级出处的答案。第四步之所以关键是因为它同时承担了补链与过滤两个职责。候选扩展时对束中的每条部分路径取其末端实体在显式图与潜在池里的全部一跳邻居作为候选。排序采用粗到细两段打分先用轻量可训练排序器对所有候选快速粗筛再让大模型对排名靠前的候选做精评给出相关性增量 $\Delta S$路径的平均分按步数递推更新为 $\bar{S}(P_k|q)\frac{(k-1)\bar{S}(P_{k-1}|q)\Delta S(e_{\text{new}}|P_{k-1},q)}{k}$每一步只保留得分最高的前 $K$ 条路径。当一条高分路径需要用到潜在关系 $\mathbf{r}{ij}$ 时系统把源上下文句 $c{ij}$ 与原始问题 $q$ 一起交给大模型按 $(h,p,t)\mathrm{LLM}{\text{instantiate}}(e_i,e_j,c{ij},q)$ 现场生成事实三元组。这一步的巧妙之处在于它是查询感知的同一对实体在不同问题下会得到不同的三元组所以实例化本身就不只是补链而是一次精确过滤。搜索在大模型判定路径完整、或达到最大路径长度时终止。图 2Relink 的动态证据图构造——候选同时取自显式知识图谱$\mathcal{G}_b$与语料共现关系池$\mathcal{R}_c$编码器 $E_L$、$E_F$ 把两者投影到统一语义空间查询驱动排序器在此评估相关性选中潜在关系时由大模型结合源上下文实例化为事实关系推理中即时修复缺失路径段训练上系统的可学习部分由排序器与两个编码器组成用两个目标交替优化。排序器用成对排序损失训练目标是让通向正确答案的路径得分高于更差的路径$\mathcal{L}_{\text{rank}}\mathbb{E}[\max(0,m-S(P^|q)S(P^-|q))]$其中 $m$ 是边界超参数。编码器则用 InfoNCE 形式的对比对齐损失训练把事实三元组的表示与其对应潜在关系的表示拉近同时推远 $N$ 个批内负样本温度参数为 $\tau$。两者采取分阶段优化训练排序器时冻结编码器对齐表示时冻结排序器每个阶段各训一个 epoch循环到验证集收敛。这样做的目的是让表示学习和排序逻辑各自学好自己的那一半不互相干扰。实验设计与结果实验的评测口径刻意做得干净五个多跳开放域问答基准2WikiMultiHopQA、HotpotQA、ConcurrentQA、MuSiQue-Ans、MuSiQue-Full每个基准从测试集随机采样 500 题以控制算力指标是 EM 与 F1所有检索增强变体包括 Relink 统一使用 deepseek-v3-0324 作为主干模型所有基于图的方法统一在同一个框架内实现因此排名差异只应归因于方法本身而不是实现细节或算力差异。基线覆盖四类只用大模型deepseek-v3-0324、gpt-4o、纯文本检索Vanilla RAG、RAPTOR、图检索ToG、G-Retriever、以及图与文本混合GraphRAG、LightRAG、HippoRAG。主结果如下表Relink 在五个基准的 EM 与 F1 上全部第一数据集EMGPT-4oRAPTORHippoRAGRelink2WikiMultiHopQA0.2920.4670.5780.628HotpotQA0.3300.4720.4980.558ConcurrentQA0.0860.4000.4580.505MuSiQue-Ans0.1060.2580.2540.304MuSiQue-Full0.1060.1880.1900.252平均来看Relink 比领先的 GraphRAG 基线高 5.4 个百分点的 EM 和 5.2 个百分点的 F1。几个具体对比值得记住2WikiMultiHopQA 上 0.628 的 EM 相对 GPT-4o 的 0.292 提升 115.1%相对 RAPTOR 的 0.467 提升 34.5%即使面对最强的图基线 HippoRAGHotpotQA 上也拉开了 12.0% 的相对 EM而在最难的 MuSiQue-Full 上领先幅度扩大到 32.6%0.252 vs 0.190。组件消融删掉四个部件每一个都有可测的代价变体2Wiki EM2Wiki F1HotpotQA EMHotpotQA F1Relink完整0.6280.7220.5580.704w/o 显式图 $\mathcal{G}_b$0.5820.6720.4860.636w/o 动态修复 $\mathcal{R}_c$0.6160.7140.5260.680w/o 查询驱动排序器0.5520.6490.4500.600w/o 对比对齐损失0.6030.6950.5180.675去掉查询驱动排序器的跌幅最大HotpotQA 的 EM 从 0.558 掉到 0.450相对损失 19.4%去掉显式图掉到 0.486相对损失 12.9%去掉对比对齐损失掉到 0.518相对损失 7.2%去掉动态修复掉到 0.526相对损失 5.7%。换句话说排序器管精度去噪潜在池管覆盖补链显式图管可靠接地对比损失管跨源可比——四者协同而非可替代。稀疏实验把这套论证推到了更有说服力的位置作者逐步删掉显式图的边失去动态修复的静态方案在删掉 90% 的边时2Wiki 的 F1 直接掉 34.7%而 Relink 在同样的删边比例下仍有 0.669。图 3随着事实图 $\mathcal{G}_b$ 被逐步删边Relink 的性能几乎不降而失去动态修复的基线急剧塌陷——「静态推理脆弱」在本文里是被测出来的不是被假设的定性案例则解释了机制差异基线缺少「作曲家」这条边时只能从可用但次优的边上拼出一条绕远且低置信的路径随后又选中了与问题高度相关、却违反「出生在何处」这一语义约束的「居住于」Relink 先用文本证据把缺失关系现场造出来并绑定源句再让新造的关系与图内干扰事实在同一个空间同台打分排序器最终按问题的语义约束选中了「出生在」这条链。这不是搜索算法的改良而是把构造与推理合成了一个动作。图 4静态推理与 Relink 的对比案例——基线被高相关但错位的「resides in」干扰误导Relink 动态造出「composer of → born in」链并由查询驱动排序器把它排到最前结果对比总结图 7主结果对比总结——2WikiMultiHopQA 上从 GPT-4o 的 0.292 走到 Relink 的 0.628Mermaid 流程图关键发现范式层面的证伪是被测出来的。论文没有停留在「静态图不完整」的论断上而是把显式图的边一条条删掉记录两条曲线的分岔删掉 90% 的边后静态方案 2Wiki F1 掉 34.7%Relink 仍有 0.669。把负载假设放到实验台上直接证伪正是这篇工作最容易拿到 Oral 的地方。统一空间是可测的性能来源不是装饰。事实三元组与潜在关系被投影到同一个 $\mathbb{R}^d$ 空间、由同一个排序器评估去掉维持这个空间一致性的对齐损失后HotpotQA 的 EM 相对下降 7.2%0.558 → 0.518。排序器是最脆弱的部件。把它替换成通用文本嵌入的余弦相似度HotpotQA EM 从 0.558 掉到 0.450相对损失 19.4%——通用语义相似度能捕捉主题相关却抓不住「对推理有用」。两个知识源都不可省但代价不对称。去掉显式图相对损失 12.9%去掉潜在池相对损失 5.7%可靠的事实底座比召回更关键而潜在池的价值在稀疏场景才充分显现。增益在越难的基准上越大。相对最强图基线 HippoRAGHotpotQA 上拉开 12.0% 的相对 EM到 MuSiQue-Full 上扩大到 32.6%0.252 vs 0.190说明动态构造更适合组合式多跳这类需要多条链路协作的问题。创新模式上这是一次双赢配置。用创新模式框架审视Relink 同时命中「审计并扭转负载假设」程序委员会最偏爱实测证伪静态图假设与「统一异构输入到同一空间」社区引用最多交付可复用的候选空间与排序器再叠加「分解并委托求解器」粗排交给可训练排序器、精排交给大模型替换后相对掉 19.4%。局限性潜在关系本身不可信。它的初始形态来自共现统计并没有真值保证成败最终取决于大模型结合源句做实例化的正确性——「相关」这个信号本身是启发式的。推理期开销上升。候选扩展、粗排、大模型精排与实例化、迭代扩展全部发生在推理时代价从训练期挪到了服务期单次查询的延迟与调用成本都会高于纯检索方案。论证范围有限。结论建立在五个多跳开放域问答基准上每个数据集只采样 500 题并没有覆盖简单事实查找、跨领域迁移或长文档摘要这类场景。训练数据构造未被单独消融。排序器依赖 $(q,P^,P^-)$ 偏好对训练这些偏好对的构造质量本身会直接影响排序质量但论文没有对这一点做消融。常见问题FAQRelink 和普通 GraphRAG 最本质的区别是什么区别在于图的角色。普通 GraphRAG 把预先构建的知识图谱当作一次性投入的全局资产推理只是在既有的边上找路Relink 把图降级为骨架真正的证据图在推理过程中按当前问题现场生成缺的边由语料潜在关系即时实例化补上无关的边则在同一空间排序时被丢弃。为什么「潜在关系池」能补上知识图谱缺失的边因为它的来源不同。显式图是从语料抽取的高精度三元组覆盖有限潜在关系池则直接来自实体共现只要求两个实体在同一语境里出现过召回更高。对每一对共现实体论文用点互信息阈值过滤噪声再用编码器读取上下文句中掩码位置的隐状态得到可参与排序的向量。当检索路径需要这条边时大模型结合源句把它实例化成一个事实三元组边就被补上了。统一语义空间到底解决了什么问题解决「跨源不可比」。如果显式图的事实与语料潜在关系各自用一套表示和一套打分方式排序器就无法比较两者的优劣只能先按来源分组再各自挑一个——那样图里已有的事实会天然占优。把两类候选都投影到同一个空间后排序器只回答一个问题这条候选对回答当前问题有没有用。消融证明这一步值 7.2% 的相对 EM0.558 → 0.518。这套方法的主要代价是什么推理时开销。每问一个问题都要做候选扩展、粗排、大模型精排与实例化、迭代扩展好处是离线只建一次骨架、算力花在真正被问到的路径上代价是单次查询的延迟和模型调用量都上去了。此外潜在关系初始不可信实例化环节的错误会直接进入证据图。这篇论文在写作与叙事上有哪些值得借鉴的地方三点值得学。第一是范式否定开场摘要第一句就直接否定既有范式先建图后推理随后才给出替代方案论点立得很快。第二是用受控实验代替论证把「静态推理脆弱」这个论断变成一个可执行的删边实验让结论自带证据。第三是范围诚实把主张限定在五个开放域问答基准与 500 题采样口径内不越界外推。可改进的地方也有正文里出现过「our Relinks mechanism」这种叠加所有格引用处波浪号前多了一个空格结论节还保留着一段被注释掉的旧结论。参考链接论文 arXiv 摘要页arXiv:2601.07192官方代码仓库github.com/DMiC-Lab-HFUT/Relink混合式 GraphRAG 基线From Local to Global: A Graph RAG Approach (arXiv:2404.16130)图检索基线Think-on-Graph (ICLR 2024)神经生物学启发的图记忆基线HippoRAG (NeurIPS 2024)作者前作、同为 GraphRAG 信息损失方向TCR-QF (arXiv:2501.15378)给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →