news 2026/10/12 3:56:31

一边说 RAG 已死,一边是 9 万星的 RAGFlow

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
一边说 RAG 已死,一边是 9 万星的 RAGFlow

2020 年一篇论文给「模型不会就去查」起了名字,六年后这件事被拆成了五个工种。RAG 没死,死的是最朴素那一种。

01|十二个人给「去查一下」起了个名字

2020 年 5 月,12 个人往 arXiv 传了一篇论文,给「模型不会就去查」这件事起了个正式名字,Retrieval-Augmented Generation(arXiv:2005.11401)。

作者来自 Facebook AI Research、伦敦大学学院和纽约大学,第一作者叫 Patrick Lewis。同年 12 月,论文在 NeurIPS 2020 上宣读。

它要解决的问题不复杂。那时候的语言模型把知识全背在参数里,论文管这叫「参数记忆」,背下来的东西有三个代价。训练截止之后的事一概不知道;答错了也没法翻到某处去改,模型是个黑箱;想更新一次知识,只能重训。

论文的方案是再加一份「非参数记忆」——一份能读、能查、能改的外部索引。

配置也很具体。生成器是 BART-large,检索器是 DPR(Dense Passage Retrieval),底库是 2100 万条维基百科段落。检索这一步用今天的眼光看很朴素,把问题和每段资料都转成一串数字,算它们之间的距离,挑最近的送进生成器,每次挑 5 到 10 段。

02|论文里最值钱的不是分数

论文当年确实拿下了一批最好成绩,Natural Questions 44.5、WebQuestions 45.5、TriviaQA 68.0。但这些数字两年后就被刷新了,一篇 2020 年的论文能被人引用六年,靠的不是它们。

真正被反复引用的,是藏在正文里的一行字。知识要更新,把索引换掉就行,模型一个参数都不用动。

要理解这行字的分量,得先看它推翻的是什么。在那之前,知识进了模型就等于长在模型里,想更新只能重训,也就是把模型重新练一遍,排期、算力、评测全走一轮,几周起步。论文给的是另一条路,模型和资料从此分开。

论文里的原话是「不用算任何梯度」。梯度是训练里才会有的东西,不算梯度就等于不训练,模型的权重一个数字都不动。

这一步的价值,用起来才看得出来。公司规章改了、产品价格变了、系统上线换了流程,都不用等模型团队排期重训,把新文档灌进去,下一个问题就能答对。

分数是那个时代的上限,谁都能追。把更新知识从「训练问题」降成「数据问题」,才是这篇论文留给今天的真东西。

同一篇论文还留了两个变体,区别只在检索的颗粒度。RAG-Sequence 是一句话开口前就把资料挑好,整段回答从头到尾看同一批;RAG-Token 是每写一个词都能抬头换一批资料。后者在「答案要从几份材料里拼出来」时更准,代价是更贵、更难训。

今天生产环境里跑的,基本都是前一种。

03|六年五代,从切块到上下文工程

RAG 这六年不是一条直线,是五次换挡。

RAG 六年五代演进时间线

第一代是朴素 RAG,起点是 2023 年。LangChain 和 LlamaIndex 把它标准化成四步,切块、嵌入、检索、拼接。大多数人第一次接触 RAG 看到的就是这个形状。

坑也埋在这儿。整条链路没有校验环节,检索回一堆看着像其实没用的片段,模型照样一本正经地答。

第二代是进阶 RAG,时间跨度是 2023 到 2025 年,优化全压在检索这头。做法包括换着法子改写问题、先让模型编一个假答案再拿它去搜(这招叫 HyDE)、向量检索和全文检索各跑一遍再合起来、把候选片段逐条配着问题重新排序,以及拿小块去搜、搜中之后把所在的整段一起交给模型。其中重排是投产性价比最高的一项。

第三代是模块化加图谱,发生在 2024 年。微软 2024 年 4 月开源 GraphRAG(arXiv 2404.16130),用大模型从文本里抽实体和关系、聚类成社区、给每个社区预生成摘要,专门回答「这批资料整体讲了什么」,这种问题任何单个切片都答不了。

代价是索引阶段要过大量模型调用。同年 10 月的 LightRAG(arXiv 2410.05779)和 11 月的 LazyGraphRAG 都在压这笔成本,后者官方给的口径是索引开销与向量 RAG 持平、约为完整 GraphRAG 的 0.1%。

第四代是智能体 RAG,从 2025 年开始。Self-RAG、CRAG 让系统自己判断「要不要查」「查到的够不够」「答的有没有资料支持」,不够就改写问题重查。检索从一条固定流水线,变成了可以被调度的工具。

第五代是上下文工程,从 2025 年下半年开始。RAG 不再被当成独立工具,而是「这一轮该给模型看什么」这个大问题下的一块。检索负责挑出高价值证据,长上下文负责在证据上做推理。

04|「塞得进去」和「用得上」是两件事

「RAG 已死」的说法从 2024 年就开始传,理由是模型窗口都到百万甚至两百万 token 了,整个知识库直接塞进去不就行了。

斯坦福 2023 年那篇《Lost in the Middle》(arXiv:2307.03172)早就把这条路堵了一半。实验设计很简单,给模型 20 篇文档,答案只在其中一篇里,然后移动那篇文档的位置。

GPT-3.5-Turbo 的表现是这样。答案在第 1 位,准确率 75.0%;挪到中间,掉到 53.8%;放到最后,回到 63.2%。

而完全不给文档、让模型凭记忆答,闭卷成绩是 56.1%。

中间位置的成绩,比一篇文档都不给还低。文档数从 20 加到 30,中间那块塌得更明显,最差一档约 50.9%。

答案文档位置与准确率的关系

Chroma 在 2025 年 7 月做了更大一轮,测 18 个前沿模型,包括 Claude Opus 4、GPT-4.1、o3、Gemini 2.5 Pro 和 Qwen 3 系列。结论是所有模型都随输入变长而退化,连那些内容固定、本身极简的任务也不例外。

再叠上成本。token 按长度计费,喂进去多少就付多少,缓存也只在反复复用同一段开头时才便宜。所以真正的落点是混着来。

检索把证据收窄,长上下文在收窄后的证据上做推理。一个常见配比是召回几十片,重排到 7 片左右,约 20K token 进模型。

05|拉开差距的两个数,都在检索这头

到 2026 年,生成这头早就不是瓶颈,模型够聪明。失败点几乎总在检索,该捞出来的资料没被捞出来。

有一个方案值得完整记一遍。Anthropic 在 2024 年 9 月提出上下文检索(Contextual Retrieval)。做法是切片之前,先让模型给每一片生成 50 到 100 token 的说明,讲清这片在整篇文档里的位置,把说明拼在切片前面,再去做嵌入,同时另建一份按关键词匹配的索引,两条路一起搜。

实测的口径是每次捞前 20 条、答案没在里面的比例,从 5.7% 降到 3.7%,这一步只是给切片加了那句位置说明,降幅 35%;再叠上关键词那条路,到 2.9%,降 49%;再往里叠一层重排,到 1.9%,降 67%。

给这些说明付的是一次性的钱,官方口径是每一百万 token 的文档约 1.02 美元,配合缓存还能再省一点。5.7% 到 1.9%,功夫基本花在索引和排序上,跟换模型没关系。

另一个是重排。向量检索只做粗筛,把问题和每一个候选片段配成一对、逐条细看再重新排序,就是重排在干的事。上面那串数字里,最后那一步就是它。

06|工具分五层,每层卡一道关

先说清这张表怎么读。下面按「卡哪一道关」分层,不按功能多少排名;star 数是 2026 年 10 月 8 日抓的,会随时间变;标了「修改版 Apache 2.0」的两个项目都带多租户限制条款,商用前要看清楚。

层代表性工具卡住什么
解析MinerU、Docling、Unstructured扫描件、表格、公式能不能变成干净文本
嵌入与重排BGE、Cohere Rerank、Jina语义搜得准不准、排序对不对
向量库Milvus、Qdrant、Chroma、Weaviate、pgvector千万级以上还能不能毫秒召回
编排LangChain、LlamaIndex、Haystack、RAGFlow、Dify、FastGPT、AnythingLLM整条链路怎么拼、谁来维护
评测与图谱RAGAS、GraphRAG、LightRAG、Graphiti改完怎么知道变好没有、全局问题怎么答

RAG 工具链的五层分工

最容易纠结的是编排层。挑六个常见选项放在一起看。

编排层工具star许可证适合谁要留意
RAGFlow91,782Apache-2.0文档复杂,要深度解析和可视化画布资源吃得多,检索链路参数多
Dify158,042修改版 Apache 2.0要工作流、要快,非技术同事也要用RAG 深度不如 RAGFlow,多租户需授权
AnythingLLM66,799MIT本地优先,个人和小团队企业级权限和大规模知识库偏弱
LlamaIndex52,435MIT做定制检索、写研究型代码抽象层厚,版本迭代快
LangChain147,544MIT生态最大、组件最全抽象层层叠加,调试成本高
Haystack26,692Apache-2.0生产管线,模块可替换社区热度低于前两个,中文资料少

RAGFlow 在 2026 年 9 月 29 日发了 v1.0.0-rc1,是它第一个 1.0 候选版。这个项目 2023 年 12 月建仓,到现在不到三年。

剩下几层放在一张表里,第一列标出它属于哪一层。跨层的 star 数只能看热度,不能排好坏。

层工具star许可证一句话
解析MinerU81,232Apache-2.0 加附加条款公式、表格、扫描件解析,中文文档友好
解析Docling68,507MITIBM 出的文档转换,结构还原稳
解析Unstructured15,541Apache-2.0老牌 ETL,格式覆盖最广
嵌入与重排BGE12,220MIT中文场景常用的嵌入与重排模型
向量库Milvus46,332Apache-2.0分布式,奔着十亿级向量去
向量库Qdrant34,967Apache-2.0Rust 写的,过滤和元数据查询强
向量库Chroma29,461Apache-2.0轻,原型阶段够用
向量库pgvector23,266PostgreSQL 许可已经在用 PG,就别再起一个库
向量库Weaviate16,873BSD-3-Clause 加企业目录原生混合检索
评测RAGAS15,954Apache-2.0评测指标封装,仓库已迁到 vibrantlabsai
图谱GraphRAG36,246MIT专治全局和主题类问题
图谱LightRAG40,006MIT图谱索引更轻,支持增量更新
图谱Graphiti31,530Apache-2.0给 Agent 用的实时知识图谱

表里有个数字挺扎眼。MinerU 81,232 星、Docling 68,507 星,两个解析项目的星数都超过了 LlamaIndex 的 52,435。热度在从框架层往数据侧挪,大家踩的坑多半不在拼链路,在文档进去的时候就已经错了。

解析这一层值得展开说一句。同一份 PDF,用不同工具跑出来的文本能差出三成——页眉页脚混进正文、跨页表格被拆成两张、公式变成乱码。这些脏东西进了知识库,后面检索再准也没用。

评测这一层容易被跳过。RAGAS 的做法是拿另一个大模型当裁判,判三件事。答案里的每条说法资料支不支持(忠实度)、答的和问的贴不贴(相关性)、检索回来的片段是不是真的用得上(上下文精确率与召回率)。

它管不了业务对错,但能告诉你这次改动是往好还是往坏。

图谱这一层要看问题类型。问「某条规定是什么」,向量检索够用;问「这批投诉里反复出现的三个根因是什么」,就得靠图谱。GraphRAG 论文里报的数字是在全局类问题上对向量 RAG 有七八成的胜率,而一份独立评测发现,简单事实检索上两者持平、图谱方案的查询延迟反而更高。

07|五句话选型,加一句我自己的用法

整个语料不到 5 万 token、而且基本不变,直接塞长上下文,别搭 RAG。

不同的人能看的文档不一样,检索时的权限过滤跑不掉。

文档每周都在更新,走增量重建索引,比每次重新灌一遍便宜得多。

要回答「这批资料整体讲了什么」,加一层图谱;只问「某条规定是什么」,加了是浪费。

库里已经在用 PostgreSQL,先上 pgvector,别急着起第二个数据库。

这五句背后其实是同一个判断,先看数据规模、更新频率和权限要求,再看技术选型。反过来做,就是先挑了个框架,再想办法让数据适配它。

我自己那套问答机器人现在的配置是混合检索,向量权重 0.6、全文 0.4,召回后过一遍重排,Top N 控制在个位数。下一步想补的是上下文检索那一步,现在切片还是裸切,每片前面没有那句位置说明,而就是这一步,把失败率从 5.7% 压到了 3.7%。

你的知识库现在卡在哪一步?是文档进去就没解析干净,是检索捞不回对的片段,还是答得没问题但引用指错了?评论区说说,下一篇拆解析这一层怎么选。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/12 3:56:05

家里宽带没有公网 IP?IPv6 加 DDNS,让 NAS 在外网照样直连

文章目录 📖 介绍 📖 🖥️ 演示环境 🖥️ 📒 从确认线路到安全收尾:IPv6 直连 NAS 的完整链路 📒 🧭 动手之前:先确认这条路在您家通不通 🧭 域名与 DDNS:让变化的地址有固定的名字 🧭 防火墙:IPv6 直连最容易被忽略的关卡 🧭 安全收尾:直连打开了,门…

作者头像 李华
网站建设 2026/10/12 3:55:51

宿主防御与口腔病理标志物联合解析 —— 云克隆 DEFA1—HTN1—STATH 多因子检测方案助力黏膜免疫前沿探索

来源:生物医药科技前沿 2026 年 9 月 黏膜免疫是人体抵御外界病原入侵的第一道屏障,口腔、呼吸道、消化道黏膜层持续面临微生物、理化刺激,宿主防御肽、唾液功能蛋白共同构建起复杂的分子调控网络。DEFA1(α 防御素 1&#xff09…

作者头像 李华
网站建设 2026/10/12 3:55:45

OWL 本体详解:从描述逻辑到智能体语义中间层

引言:为什么需要 OWL在上一篇文章中,我们讨论了基于 OntoRAG 和 Flexible GraphRAG 构建本体增强 AI 系统的工程实践。在那套架构中,OWL 本体扮演着“合同”的角色——它定义了系统中允许存在哪些实体类型、允许建立哪些关系,LLM …

作者头像 李华