news 2026/7/27 8:24:15

向量数据库实战:选型、调优与落地~系列文章19:向量数据库 + RAG 融合实战:构建企业级知识库的完整链路

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
向量数据库实战:选型、调优与落地~系列文章19:向量数据库 + RAG 融合实战:构建企业级知识库的完整链路

向量数据库 + RAG 融合实战:构建企业级知识库的完整链路 🔗

🔥本文是《向量数据库实战:选型、调优与落地》专栏第 19 篇

⏱️阅读时间:约 15 分钟


🎯 开篇:RAG 是向量数据库最核心的应用场景

RAG(Retrieval-Augmented Generation)= 检索增强生成

简单说就是:让大模型在回答之前,先从你的知识库里"查资料"📚

┌─────────────────────────────────────────────────────────┐ │ RAG = 向量数据库 + 大模型 │ ├─────────────────────────────────────────────────────────┤ │ │ │ 没有 RAG 的大模型: │ │ 用户: "我们公司的退货政策是什么?" │ │ AI: "抱歉,我不知道贵公司的具体政策..." │ │ │ │ 有 RAG 的大模型: │ │ 用户: "我们公司的退货政策是什么?" │ │ → Step 1: 从向量知识库检索相关文档 │ │ → Step 2: 把检索到的文档 + 用户问题一起发给大模型 │ │ AI: "根据公司退货政策(2025年3月更新), │ │ 自购买之日起30天内可无理由退货..." │ │ │ └─────────────────────────────────────────────────────────┘

🏗️ RAG 完整架构

┌─────────────────────────────────────────────────────────────┐ │ RAG 完整架构 │ ├─────────────────────────────────────────────────────────────┤ │ │ │ 📥 离线阶段(数据入库) │ │ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ │ │ │ 文档 │ → │ 分块 │ → │向量化 │ → │ 存储 │ │ │ │ PDF/ │ │Chunk │ │Embed │ │向量DB│ │ │ │ Word │ │ │ │ding │ │ │ │ │ └──────┘ └──────┘ └──────┘ └──────┘ │ │ │ │ 🔍 在线阶段(检索问答) │ │ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ │ │ │ 用户 │ → │查询 │ → │向量 │ → │重排序 │ → │ 大模型 │ │ │ │ 提问 │ │向量化 │ │检索 │ │Rerank│ │ 生成 │ │ │ └──────┘ └──────┘ └──────┘ └──────┘ └──────┘ │ │ ↑ │ │ 检索到的文档 │ │ │ └─────────────────────────────────────────────────────────────┘

💻 完整代码实现

Step 1:文档处理 & 入库

fromlangchain.text_splitterimportRecursiveCharacterTextSplitterfromsentence_transformersimportSentenceTransformerfrompymilvusimportCollectionimportnumpyasnp# 1. 加载嵌入模型model=SentenceTransformer("BAAI/bge-m3")# 2. 文档分块text_splitter=RecursiveCharacterTextSplitter(chunk_size=500,chunk_overlap=50,separators=["\n\n","\n","。","!","?"])defprocess_document(file_path,collection):"""处理单个文档并入库"""# 读取文档withopen(file_path,'r',encoding='utf-8')asf:text=f.read()# 分块chunks=text_splitter.split_text(text)# 向量化embeddings=model.encode([f"represent document:{chunk}"forchunkinchunks],normalize_embeddings=True)# 构造元数据metadatas=[{"source":file_path,"chunk_index":i,"total_chunks":len(chunks)}foriinrange(len(chunks))]# 入库data=[chunks,# text 字段embeddings.tolist(),# embedding 字段[str(m)forminmetadatas]# metadata 字段]collection.insert(data)collection.flush()print(f"✅{file_path}:{len(chunks)}个分块已入库")

Step 2:检索 & 生成

defrag_query(question,collection,model,llm,top_k=5):"""RAG 问答"""# 1. 查询向量化query_embedding=model.encode(f"represent passage:{question}",normalize_embeddings=True)# 2. 向量检索collection.load()results=collection.search(data=[query_embedding.tolist()],anns_field="embedding",param={"metric_type":"COSINE","params":{"ef":128}},limit=top_k,output_fields=["text","source"])# 3. 构造上下文context_parts=[]forhitinresults[0]:context_parts.append(f"[来源:{hit.entity.get('source')}] "f"{hit.entity.get('text')}")context="\n\n".join(context_parts)# 4. 构造 Promptprompt=f"""基于以下参考资料回答用户问题。如果资料中没有相关信息,请如实说明。 参考资料:{context}用户问题:{question}请给出准确、简洁的回答:"""# 5. 调用大模型生成回答answer=llm.generate(prompt)return{"answer":answer,"sources":[hit.entity.get('source')forhitinresults[0]],"scores":[hit.distanceforhitinresults[0]]}

🚀 RAG 进阶优化

优化 1:查询改写

defquery_rewrite(question,llm):"""查询改写:提升检索效果"""prompt=f"""请将以下用户问题改写为更适合检索的形式。 保留核心意图,补充可能的同义词和相关概念。 原始问题:{question}改写后的检索查询:"""returnllm.generate(prompt)# 使用rewritten=query_rewrite("怎么退货",llm)# → "商品退货流程 退货政策 退换货规则 退款申请"

优化 2:HyDE(假设文档嵌入)

defhyde_search(question,collection,model,llm):"""HyDE: 先让 LLM 生成假设性回答,用回答去检索"""# 1. 生成假设性回答hypothetical_answer=llm.generate(f"请回答以下问题(即使不确定也请尝试):{question}")# 2. 用假设性回答做向量检索query_embedding=model.encode(hypothetical_answer)results=collection.search(data=[query_embedding.tolist()],anns_field="embedding",param=search_params,limit=5,output_fields=["text"])returnresults

优化 3:Reranker 重排序

fromsentence_transformersimportCrossEncoder# 加载重排序模型reranker=CrossEncoder("BAAI/bge-reranker-v2-m3")defrerank(query,results,top_k=3):"""对检索结果重排序"""pairs=[(query,doc["text"])fordocinresults]scores=reranker.predict(pairs)# 按重排序分数排序ranked=sorted(zip(results,scores),key=lambdax:x[1],reverse=True)return[docfordoc,scoreinranked[:top_k]]

📊 RAG 优化效果对比

方案Recall@5回答准确率延迟
基础 RAG85.2%72%1.5s
+ 查询改写89.5%78%2.0s
+ HyDE91.3%82%3.0s
+ Reranker93.8%89%2.5s
+ 混合搜索95.2%91%2.8s

🔑 本篇核心要点回顾

要点说明
RAG 核心检索 + 生成,让大模型用你的数据回答
完整链路文档分块 → 向量化 → 存储 → 检索 → 生成
关键优化查询改写、HyDE、Reranker、混合搜索
效果提升优化后准确率可从 72% 提升到 91%

📌下篇预告:《向量数据库在推荐系统中的应用:从协同过滤到向量召回 🎯》

💬有问题欢迎评论区讨论,觉得有用请点赞收藏 👍

作者:高炉炼铁智能化技术研究者,专注钢铁冶金与人工智能 交叉领域。

👍 如果觉得有帮助,请点赞、收藏、转发!
版权归作者所有,未经许可请勿抄袭,套用,商用(或其它具有利益性行为)
🔔 关注专栏,不错过后续精彩内容

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/27 8:23:28

TMS320C6421开发全解析:从命名规则到工具链与实战避坑指南

1. 项目概述与核心价值 在嵌入式DSP开发领域,尤其是面对德州仪器(TI)TMS320C6000这类高性能平台时,新手和老手都容易在一个看似简单的问题上栽跟头:如何正确解读芯片型号那一长串字母数字组合,以及如何为它…

作者头像 李华
网站建设 2026/7/27 8:21:33

LangChain结构化输出:Pydantic与JSON解析器实战

1. 为什么需要模型返回结构化数据?在自然语言处理的实际应用中,我们经常会遇到这样的场景:模型输出的文本内容需要被后续程序解析和处理。比如你问模型"明天北京的天气如何?",理想的回答可能是:{…

作者头像 李华
网站建设 2026/7/27 8:20:29

uv:快得像火箭,顺便把“安装依赖”藏起来了

Python 的包管理长期以来像一个人员严重超编、职责划分不明的政府部门:pip 负责装包,venv 负责建环境,pip-tools 负责锁版本,pipx 负责装工具,pyenv 负责管 Python 版本。每个工具都说自己只负责一小块,最后…

作者头像 李华
网站建设 2026/7/27 8:17:23

FSDrive框架:时空思维链与视觉推理的自动驾驶决策

1. 项目概述:FSDrive 框架的核心定位FSDrive 是一个将时空思维链(CoT)与视觉推理相结合的自动驾驶决策框架。不同于传统基于规则或端到端学习的方案,它通过模拟人类驾驶时的"观察-思考-决策"认知过程,在复杂…

作者头像 李华
网站建设 2026/7/27 8:10:39

TVA数字小脑:具身智能的物理交互革命(7)

前沿技术探索:AI智能体视觉(TVA,Transformer-based Vision Agent)是依托Transformer架构与“因式智能体”理论所构建的颠覆性工业视觉技术,是集深度强化学习(DRL)、卷积神经网络(CNN…

作者头像 李华