很多小伙伴部署完 Ollama 本地大模型后,面临一个痛点:模型不懂你的私有文档,容易凭空编造信息(幻觉)。RAG 检索增强生成是最优离线解决方案。本文基于 Ollama+LangChain+ChromaDB 搭建纯本地知识库,支持 PDF、TXT、Markdown,附带完整可运行代码,整理文档切分、检索失效、向量库报错、回答跑偏等高频问题解决方案。
markdown
@[TOC](文章目录) # Ollama+LangChain搭建本地RAG知识库|解决AI幻觉,实测踩坑全集 > 前言 上一篇分享了Ollama本地部署与远程访问方案,不少读者留言:本地模型能跑起来,但无法读取自己的笔记、技术文档,经常答非所问、编造不存在的内容。 这就是大模型经典的**幻觉问题**。 RAG(检索增强生成)可以让AI先检索私有文档片段,再结合资料回答问题,全程离线运行,不需要上传文件到云端,数据完全可控。 网上很多教程只有基础demo,缺少工程化优化方案,我把一周调试遇到的坑全部整理出来。 ## 一、方案整体架构 整套系统全部本地运行,无外部接口依赖 1. Ollama:运行对话大模型 + 嵌入Embedding模型 2. LangChain:链路编排,文档加载、文本分割、检索链路组装 3. ChromaDB:轻量级本地向量数据库,持久化存储向量 4. 支持文档:PDF / Markdown / TXT ## 二、环境准备 ### 2.1 前置条件 1. 已经正常安装并启动Ollama(参考上篇文章) 2. 提前拉取模型 ```bash # 对话模型(中文推荐) ollama pull qwen2.5:7b # 文本嵌入模型,用于向量化文档 ollama pull nomic-embed-text2.2 Python 依赖安装
bash
pip install langchain langchain-ollama langchain-chroma chromadb pypdf三、最简可运行完整代码(直接复制测试)
新建 rag_demo.py
python
运行
from langchain_ollama import ChatOllama, OllamaEmbeddings from langchain_chroma import Chroma from langchain.text_splitter import RecursiveCharacterTextSplitter from langchain.document_loaders import PyPDFLoader, TextLoader from langchain.chains import RetrievalQA # 1.初始化模型 llm = ChatOllama( model="qwen2.5:7b", base_url="http://127.0.0.1:11434", temperature=0.1 # 越低,回答越严谨,减少幻觉 ) embedding = OllamaEmbeddings( model="nomic-embed-text", base_url="http://127.0.0.1:11434" ) # 2.加载文档(示例PDF,换成你的文件路径) loader = PyPDFLoader("./test.pdf") documents = loader.load() # 3.文本分割【RAG最关键参数】 text_splitter = RecursiveCharacterTextSplitter( chunk_size=800, chunk_overlap=120, separators=["\n\n", "\n", "。", ",", " "] ) split_docs = text_splitter.split_documents(documents) # 4.构建本地向量库,持久化保存 vector_db = Chroma.from_documents( documents=split_docs, embedding=embedding, persist_directory="./chroma_db" ) # 5.构建检索器 retriever = vector_db.as_retriever(search_kwargs={"k": 4}) # 6.组装问答链路 qa_chain = RetrievalQA.from_chain_type( llm=llm, chain_type="stuff", retriever=retriever, return_source_documents=True ) # 发起提问 result = qa_chain.invoke({"query": "文档中的核心结论是什么?"}) print(result["result"])运行方式:
python rag_demo.py首次运行会向量化文档,后续启动直接读取向量库,无需重复处理。
四、90% 新手遇到的疑难问题(核心干货)
问题 1:检索到无关内容,AI 回答跑偏
原因:
- chunk_size 设置过大,单个片段包含多个无关主题
- 重叠值 overlap 太小,上下文被切割断裂 ✅优化方案:通用场景 chunk_size 700~1000,overlap 控制在 100~150
问题 2:更换 Embedding 模型,向量库直接报错
不同嵌入模型输出向量维度不一致! ❌错误操作:直接切换模型,复用旧 chroma_db 文件夹 ✅解决方案:更换嵌入模型前,删除chroma_db目录,重建向量库
问题 3:文档存在,但是检索不到相关片段
排查顺序:
- 确认文档加载成功,打印 documents 查看内容
- 中文场景优先使用适配中文的嵌入模型
- 降低检索 top_k,不要一次性召回过多片段
- 检查文档是否存在扫描版 PDF(纯图片无法解析文字)
问题 4:显存占用持续飙升,多次问答后卡顿
优化:
- Ollama 开启模型加载限制,不用的模型执行
ollama stop - 不要一次性加载上千份文档构建向量库,分批处理
- 低配电脑降低 chunk 数量,减少单次传入上下文长度
问题 5:AI 依旧编造文档不存在的信息
提示词约束非常重要! 默认链路没有强制限制,建议自定义 Prompt 模板,强制模型:
你只能使用提供的上下文信息回答问题,如果上下文没有答案,请直接说明无法找到相关资料,禁止编造信息。
五、进阶优化方向(后续系列文章预告)
- 自定义 Prompt 模板,进一步抑制幻觉
- 增加 Reranker 重排序,提升检索精准度
- 开发简易 Web 界面,浏览器访问知识库
- 支持批量文件夹导入(PDF/TXT/MD 混合加载)
六、新手避坑清单
✅先单机调试成功,再尝试局域网远程访问 Ollama 服务 ✅文档优先使用可复制文字的 PDF,扫描件需要 OCR 预处理 ✅向量库定期备份,大量文档重建耗时很长 ✅temperature 不要设置过高,知识库问答建议 0~0.2
大家搭建 RAG 时遇到过哪些问题?检索不准、向量库报错、显存问题都可以留言,我尽量回复!后续持续更新本地 AI 应用实战系列。