今天为大家分享的是北京理工大学出品的GraphRAG论文–HyGRL,多实体问答SOTA、推理1.82s、构建token省90%。
问"哪个导演拍的电影既拿了奥斯卡又演过Christopher Nolan的电影"–这种多实体问题让现有RAG集体翻车。HyGRL要解决的就是这种"多跳桥接证据分布散"的问题。
它做了两个反共识选择:
- 不抽取三元组,直接把原始text chunk塞进KG当relay node;
- 不更新LLM参数,冻结LLM做supervisor,只训轻量MLP做路由。
核心思路
HyGRL的三阶段框架围绕"轻量+自适应"展开:
- 异构图构造:text chunk直接当节点塞进KG,不抽三元组
- RL推理:把推理建模为MDP,训轻量MLP policy做adaptive beam search
- 两阶段训练:imitation learning蒸馏4个启发式专家做初始化,RL用LLM偏好做pairwise reward精调
关键判断:LLM只做supervisor不做参数更新,推理时zero-token路由;relevance vector表示state避免online dense encoder,保证near real-time。
方案细节
异构图构造
HyGRL的反共识做法:
- 只抽(Entity, Type) tuples,通过基于类型消歧连到KG节点,构成实体集V_e
- raw text chunks作为独立节点V_c,双向连到实体(V_e ↔ V_c)
- offline补全:在实体之间用KG最短路径连通,形成综合离线索引
这样text chunk不再是静态检索endpoint,而是active reasoning element,可以在结构和文本之间cross-modal跳转。
RL推理
推理建模为MDP,核心三件套:
State:滑动窗口保留最近L个节点。关键是用relevance vector S ∈ R^L表示,每个元素是node与Q的语义相似,不编码raw text特征。这样避免在线编码,保证近实时和最小memory。
Action:当前state节点的unselected neighbors。action vector A ∈ R^(L+1),前L个是与state各节点的similarity,第L+1个是PPR score,让policy判断该action是否引入了当前context之外的新证据。
Policy:轻量MLP,P(a) = σ(MLP([S ∥ A])),对节点identity和graph schema agnostic。
Adaptive Beam Search:用confidence threshold τ过滤扩展噪声,每步从C_valid选top-k追加到N_s并标记visited,达到D_max或L或候选耗尽停止,最终诱导出G_sub = G[N_s]。
两阶段训练
直接用"检索证据能否让LLM答对"做reward会sparse reward–反馈要等整个推理+生成结束才有,中间步骤credit assignment难。
Stage 1: Imitation Learning蒸馏4个启发式专家:
- m_ce:Context-aware Semantic Matching,cross-encoder算a与(Q, Ns)的语义交互
- m_ppr:Multi-source Personalized PageRank,以V_Q为restart vector反映a的全局结构重要性
- m_aa:Path-aware Adamic-Adar Index,加权共享邻居衡量a与当前节点v_cur的结构亲近度
- m_jac:Jaccard Coefficient,邻居重叠率
用learnable softmax权重Θ = {θ_ce, θ_ppr, θ_aa, θ_jac}融合四个专家,在小随机子集上calibrate后冻结。用aggregated score做teacher,BCE loss蒸馏到MLP。
Stage 2: RL Fine-tuning用LLM偏好做精调,两个loss联合:
- Local Pairwise Reward (L_MR):LLM做偏好判断(n+, n-)哪个更好(n+来自Top-K,n-来自remaining neighbors),用margin ranking loss:L_MR = Σ max(0, ξ - (fθ(S, A+) - fθ(S, A-)))。
- Joint Optimization via SCST (L_SCST):LLM用binary prompt判断subgraph是否足够推出ground-truth,L_SCST = -(r_sample - γ·r_greedy) × Σ log πθ(S, A)
总loss:L_Total = L_SCST + λ · L_MR,λ平衡全局规划与局部监督。
实验结果
主结果:三数据集平均EM/F1,HyGRL 56.24/63.87击败HippoRAG2-hybrid(54.30/61.23)等SOTA;2Wiki上Kg2RAG和GraphRAG的F1略高但EM更低,说明静态扩展引入语义噪声。
消融:w/o KG Completion掉到45.07(动态图搜索是地基);w/o Text Nodes掉到51.90(text chunk作为relay node不可或缺);Replace RL with BFS还有60.12(图构造本身就强,RL策略提供额外增益)。
效率:构建token比Microsoft GraphRAG省90%(GraphRAG超20亿token);推理1.82s(vs LLM 1.15s,HippoRAG2-hybrid 2.91s)。
鲁棒性:50%噪声下F1只掉4.09,graceful degradation;LLM偏好与专家共识88%对齐。参数最优:K=3, Hops=8, L=20。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~