2020 年一篇论文给「模型不会就去查」起了名字,六年后这件事被拆成了五个工种。RAG 没死,死的是最朴素那一种。
01|十二个人给「去查一下」起了个名字
2020 年 5 月,12 个人往 arXiv 传了一篇论文,给「模型不会就去查」这件事起了个正式名字,Retrieval-Augmented Generation(arXiv:2005.11401)。
作者来自 Facebook AI Research、伦敦大学学院和纽约大学,第一作者叫 Patrick Lewis。同年 12 月,论文在 NeurIPS 2020 上宣读。
它要解决的问题不复杂。那时候的语言模型把知识全背在参数里,论文管这叫「参数记忆」,背下来的东西有三个代价。训练截止之后的事一概不知道;答错了也没法翻到某处去改,模型是个黑箱;想更新一次知识,只能重训。
论文的方案是再加一份「非参数记忆」——一份能读、能查、能改的外部索引。
配置也很具体。生成器是 BART-large,检索器是 DPR(Dense Passage Retrieval),底库是 2100 万条维基百科段落。检索这一步用今天的眼光看很朴素,把问题和每段资料都转成一串数字,算它们之间的距离,挑最近的送进生成器,每次挑 5 到 10 段。
02|论文里最值钱的不是分数
论文当年确实拿下了一批最好成绩,Natural Questions 44.5、WebQuestions 45.5、TriviaQA 68.0。但这些数字两年后就被刷新了,一篇 2020 年的论文能被人引用六年,靠的不是它们。
真正被反复引用的,是藏在正文里的一行字。知识要更新,把索引换掉就行,模型一个参数都不用动。
要理解这行字的分量,得先看它推翻的是什么。在那之前,知识进了模型就等于长在模型里,想更新只能重训,也就是把模型重新练一遍,排期、算力、评测全走一轮,几周起步。论文给的是另一条路,模型和资料从此分开。
论文里的原话是「不用算任何梯度」。梯度是训练里才会有的东西,不算梯度就等于不训练,模型的权重一个数字都不动。
这一步的价值,用起来才看得出来。公司规章改了、产品价格变了、系统上线换了流程,都不用等模型团队排期重训,把新文档灌进去,下一个问题就能答对。
分数是那个时代的上限,谁都能追。把更新知识从「训练问题」降成「数据问题」,才是这篇论文留给今天的真东西。
同一篇论文还留了两个变体,区别只在检索的颗粒度。RAG-Sequence 是一句话开口前就把资料挑好,整段回答从头到尾看同一批;RAG-Token 是每写一个词都能抬头换一批资料。后者在「答案要从几份材料里拼出来」时更准,代价是更贵、更难训。
今天生产环境里跑的,基本都是前一种。
03|六年五代,从切块到上下文工程
RAG 这六年不是一条直线,是五次换挡。
RAG 六年五代演进时间线
第一代是朴素 RAG,起点是 2023 年。LangChain 和 LlamaIndex 把它标准化成四步,切块、嵌入、检索、拼接。大多数人第一次接触 RAG 看到的就是这个形状。
坑也埋在这儿。整条链路没有校验环节,检索回一堆看着像其实没用的片段,模型照样一本正经地答。
第二代是进阶 RAG,时间跨度是 2023 到 2025 年,优化全压在检索这头。做法包括换着法子改写问题、先让模型编一个假答案再拿它去搜(这招叫 HyDE)、向量检索和全文检索各跑一遍再合起来、把候选片段逐条配着问题重新排序,以及拿小块去搜、搜中之后把所在的整段一起交给模型。其中重排是投产性价比最高的一项。
第三代是模块化加图谱,发生在 2024 年。微软 2024 年 4 月开源 GraphRAG(arXiv 2404.16130),用大模型从文本里抽实体和关系、聚类成社区、给每个社区预生成摘要,专门回答「这批资料整体讲了什么」,这种问题任何单个切片都答不了。
代价是索引阶段要过大量模型调用。同年 10 月的 LightRAG(arXiv 2410.05779)和 11 月的 LazyGraphRAG 都在压这笔成本,后者官方给的口径是索引开销与向量 RAG 持平、约为完整 GraphRAG 的 0.1%。
第四代是智能体 RAG,从 2025 年开始。Self-RAG、CRAG 让系统自己判断「要不要查」「查到的够不够」「答的有没有资料支持」,不够就改写问题重查。检索从一条固定流水线,变成了可以被调度的工具。
第五代是上下文工程,从 2025 年下半年开始。RAG 不再被当成独立工具,而是「这一轮该给模型看什么」这个大问题下的一块。检索负责挑出高价值证据,长上下文负责在证据上做推理。
04|「塞得进去」和「用得上」是两件事
「RAG 已死」的说法从 2024 年就开始传,理由是模型窗口都到百万甚至两百万 token 了,整个知识库直接塞进去不就行了。
斯坦福 2023 年那篇《Lost in the Middle》(arXiv:2307.03172)早就把这条路堵了一半。实验设计很简单,给模型 20 篇文档,答案只在其中一篇里,然后移动那篇文档的位置。
GPT-3.5-Turbo 的表现是这样。答案在第 1 位,准确率 75.0%;挪到中间,掉到 53.8%;放到最后,回到 63.2%。
而完全不给文档、让模型凭记忆答,闭卷成绩是 56.1%。
中间位置的成绩,比一篇文档都不给还低。文档数从 20 加到 30,中间那块塌得更明显,最差一档约 50.9%。
答案文档位置与准确率的关系
Chroma 在 2025 年 7 月做了更大一轮,测 18 个前沿模型,包括 Claude Opus 4、GPT-4.1、o3、Gemini 2.5 Pro 和 Qwen 3 系列。结论是所有模型都随输入变长而退化,连那些内容固定、本身极简的任务也不例外。
再叠上成本。token 按长度计费,喂进去多少就付多少,缓存也只在反复复用同一段开头时才便宜。所以真正的落点是混着来。
检索把证据收窄,长上下文在收窄后的证据上做推理。一个常见配比是召回几十片,重排到 7 片左右,约 20K token 进模型。
05|拉开差距的两个数,都在检索这头
到 2026 年,生成这头早就不是瓶颈,模型够聪明。失败点几乎总在检索,该捞出来的资料没被捞出来。
有一个方案值得完整记一遍。Anthropic 在 2024 年 9 月提出上下文检索(Contextual Retrieval)。做法是切片之前,先让模型给每一片生成 50 到 100 token 的说明,讲清这片在整篇文档里的位置,把说明拼在切片前面,再去做嵌入,同时另建一份按关键词匹配的索引,两条路一起搜。
实测的口径是每次捞前 20 条、答案没在里面的比例,从 5.7% 降到 3.7%,这一步只是给切片加了那句位置说明,降幅 35%;再叠上关键词那条路,到 2.9%,降 49%;再往里叠一层重排,到 1.9%,降 67%。
给这些说明付的是一次性的钱,官方口径是每一百万 token 的文档约 1.02 美元,配合缓存还能再省一点。5.7% 到 1.9%,功夫基本花在索引和排序上,跟换模型没关系。
另一个是重排。向量检索只做粗筛,把问题和每一个候选片段配成一对、逐条细看再重新排序,就是重排在干的事。上面那串数字里,最后那一步就是它。
06|工具分五层,每层卡一道关
先说清这张表怎么读。下面按「卡哪一道关」分层,不按功能多少排名;star 数是 2026 年 10 月 8 日抓的,会随时间变;标了「修改版 Apache 2.0」的两个项目都带多租户限制条款,商用前要看清楚。
| 层 | 代表性工具 | 卡住什么 |
| 解析 | MinerU、Docling、Unstructured | 扫描件、表格、公式能不能变成干净文本 |
| 嵌入与重排 | BGE、Cohere Rerank、Jina | 语义搜得准不准、排序对不对 |
| 向量库 | Milvus、Qdrant、Chroma、Weaviate、pgvector | 千万级以上还能不能毫秒召回 |
| 编排 | LangChain、LlamaIndex、Haystack、RAGFlow、Dify、FastGPT、AnythingLLM | 整条链路怎么拼、谁来维护 |
| 评测与图谱 | RAGAS、GraphRAG、LightRAG、Graphiti | 改完怎么知道变好没有、全局问题怎么答 |
RAG 工具链的五层分工
最容易纠结的是编排层。挑六个常见选项放在一起看。
| 编排层工具 | star | 许可证 | 适合谁 | 要留意 |
| RAGFlow | 91,782 | Apache-2.0 | 文档复杂,要深度解析和可视化画布 | 资源吃得多,检索链路参数多 |
| Dify | 158,042 | 修改版 Apache 2.0 | 要工作流、要快,非技术同事也要用 | RAG 深度不如 RAGFlow,多租户需授权 |
| AnythingLLM | 66,799 | MIT | 本地优先,个人和小团队 | 企业级权限和大规模知识库偏弱 |
| LlamaIndex | 52,435 | MIT | 做定制检索、写研究型代码 | 抽象层厚,版本迭代快 |
| LangChain | 147,544 | MIT | 生态最大、组件最全 | 抽象层层叠加,调试成本高 |
| Haystack | 26,692 | Apache-2.0 | 生产管线,模块可替换 | 社区热度低于前两个,中文资料少 |
RAGFlow 在 2026 年 9 月 29 日发了 v1.0.0-rc1,是它第一个 1.0 候选版。这个项目 2023 年 12 月建仓,到现在不到三年。
剩下几层放在一张表里,第一列标出它属于哪一层。跨层的 star 数只能看热度,不能排好坏。
| 层 | 工具 | star | 许可证 | 一句话 |
| 解析 | MinerU | 81,232 | Apache-2.0 加附加条款 | 公式、表格、扫描件解析,中文文档友好 |
| 解析 | Docling | 68,507 | MIT | IBM 出的文档转换,结构还原稳 |
| 解析 | Unstructured | 15,541 | Apache-2.0 | 老牌 ETL,格式覆盖最广 |
| 嵌入与重排 | BGE | 12,220 | MIT | 中文场景常用的嵌入与重排模型 |
| 向量库 | Milvus | 46,332 | Apache-2.0 | 分布式,奔着十亿级向量去 |
| 向量库 | Qdrant | 34,967 | Apache-2.0 | Rust 写的,过滤和元数据查询强 |
| 向量库 | Chroma | 29,461 | Apache-2.0 | 轻,原型阶段够用 |
| 向量库 | pgvector | 23,266 | PostgreSQL 许可 | 已经在用 PG,就别再起一个库 |
| 向量库 | Weaviate | 16,873 | BSD-3-Clause 加企业目录 | 原生混合检索 |
| 评测 | RAGAS | 15,954 | Apache-2.0 | 评测指标封装,仓库已迁到 vibrantlabsai |
| 图谱 | GraphRAG | 36,246 | MIT | 专治全局和主题类问题 |
| 图谱 | LightRAG | 40,006 | MIT | 图谱索引更轻,支持增量更新 |
| 图谱 | Graphiti | 31,530 | Apache-2.0 | 给 Agent 用的实时知识图谱 |
表里有个数字挺扎眼。MinerU 81,232 星、Docling 68,507 星,两个解析项目的星数都超过了 LlamaIndex 的 52,435。热度在从框架层往数据侧挪,大家踩的坑多半不在拼链路,在文档进去的时候就已经错了。
解析这一层值得展开说一句。同一份 PDF,用不同工具跑出来的文本能差出三成——页眉页脚混进正文、跨页表格被拆成两张、公式变成乱码。这些脏东西进了知识库,后面检索再准也没用。
评测这一层容易被跳过。RAGAS 的做法是拿另一个大模型当裁判,判三件事。答案里的每条说法资料支不支持(忠实度)、答的和问的贴不贴(相关性)、检索回来的片段是不是真的用得上(上下文精确率与召回率)。
它管不了业务对错,但能告诉你这次改动是往好还是往坏。
图谱这一层要看问题类型。问「某条规定是什么」,向量检索够用;问「这批投诉里反复出现的三个根因是什么」,就得靠图谱。GraphRAG 论文里报的数字是在全局类问题上对向量 RAG 有七八成的胜率,而一份独立评测发现,简单事实检索上两者持平、图谱方案的查询延迟反而更高。
07|五句话选型,加一句我自己的用法
整个语料不到 5 万 token、而且基本不变,直接塞长上下文,别搭 RAG。
不同的人能看的文档不一样,检索时的权限过滤跑不掉。
文档每周都在更新,走增量重建索引,比每次重新灌一遍便宜得多。
要回答「这批资料整体讲了什么」,加一层图谱;只问「某条规定是什么」,加了是浪费。
库里已经在用 PostgreSQL,先上 pgvector,别急着起第二个数据库。
这五句背后其实是同一个判断,先看数据规模、更新频率和权限要求,再看技术选型。反过来做,就是先挑了个框架,再想办法让数据适配它。
我自己那套问答机器人现在的配置是混合检索,向量权重 0.6、全文 0.4,召回后过一遍重排,Top N 控制在个位数。下一步想补的是上下文检索那一步,现在切片还是裸切,每片前面没有那句位置说明,而就是这一步,把失败率从 5.7% 压到了 3.7%。
你的知识库现在卡在哪一步?是文档进去就没解析干净,是检索捞不回对的片段,还是答得没问题但引用指错了?评论区说说,下一篇拆解析这一层怎么选。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~