WeKnora 知识库快速上手:用 3 种方式回答 40 份 PDF
【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora
周一的 40 份 PDF,一个午饭前的查源任务
周一早上 9 点 05,你被塞了一摞 40 份 PDF——产品手册、API 文档、故障排查笔记混在一起;领导要在午饭前知道「回家模式场景联动」到底配置在哪一份里。逐页翻不现实,关键词搜索只能给你一堆拼不起来的碎片。这类需求我一般交给 WeKnora 知识库处理:文件夹整个传上去,解析、分块、检索、带来源地回答,一条龙。
WeKnora 知识库是什么:三个能力速览
WeKnora 是一个开源的 LLM 知识平台,把原始文档变成可查询的 RAG、可自主推理的 Agent 和自维护的 Wiki。它把 PDF、Word、Excel 等十余种格式解析成向量索引和知识图谱,用 BM25、向量、图谱的混合检索加重排序来回答问题,能开 ReAct Agent 模式自主编排检索与工具调用,还能让 Agent 从原始文档自动生成相互链接的 Wiki 页面和知识图谱。
能力拆解:从检索到建库的三条核心路径
混合检索:一个问题如何被找到对的片段
它是什么:文档入库后,WeKnora 按固定流水线完成解析、分块、向量化和图谱构建;你提问时不走单一路径——先做查询改写,再用 BM25 关键词与向量语义两路同时召回,最后 Rerank 重排序,才交给大模型生成答案。
为什么有用:纯向量检索的坑是「语义相近但字面没命中」,关键词检索正好相反,两路互补;重排序环节再筛掉「看着像但不全对」的片段。回答时界面把过程一次摊开:查询理解在哪个文档上、知识库检索命中几条、来源文件叫什么,都写在答案上方。
一个关键细节:按官方架构描述,混合检索可叠加 GraphRAG 图谱增强与 pgvector HNSW 加速,重排序模型可替换,官方截图中的一次实际问答用的就是 bge-reranker-v2-m3。
ReAct Agent:替你思考的检索过程
它是什么:把对话从「快速回答」切到「智能推理」,系统会跑一个 ReAct 循环——自己拆解问题、依次调用知识库检索、网络搜索和 MCP 工具,边想边查,查够了才给答案。
为什么有用:有些问题一次检索命不中。比如问「售后 POC 的检索策略是什么」,得先查策略文档,再进具体章节确认有没有遗漏。这事 RAG 模式下要你手动做两三轮,Agent 模式里界面上实时回放:每一轮思考、每次工具调用、命中了几条片段、累计耗时,全部可见。官方截图里这次多步查询的记录是「思考 2 轮 · 调用 3 次工具 · 耗时 17s」,末尾答案既有策略总结,也有参数表格。
一个关键细节:Agent 支持 @Skill / @MCP 提及,按轮次限定它这一轮能用哪些工具;整条推理链路在 Langfuse 里可回放,排查「它当时为什么这么查」有据可依。
Wiki 模式与知识图谱:自己成型的知识库
它是什么:Agent 把原始文档再读一遍,自主生成一组相互链接的 Markdown Wiki 页面和可视化知识图谱;页面带版本历史,支持浏览器内手动编辑、行级 diff 和一键回滚。
为什么有用:RAG 能回答问题,但说不清「整个知识体系长什么样」。Wiki 模式补的就是这张地图:左侧目录树从「人力资源」一路下钻到「年假」,页面正文里链接互相跳转,页脚写明内容来自哪份源文档。点顶部「图谱」标签,就是知识图谱可视化界面——节点按摘要、实体、锚点、引用、对比分色,点开节点右侧直接展示对应页面,关系沿连线追踪。
一个关键细节:按官方截图,演示知识库生成了 49 个节点、49 条链接,图谱面板显示「已加载知识库全部节点」,万级文档入库依赖任务队列加独立 Worker 池支撑。
走一遍流程:从上传到出答案
按这条线走一遍,十分钟能通。克隆仓库、docker compose up -d启动后,打开 Web UI,第一眼是初始化向导:选模型厂商、Embedding 模型和向量存储,第一次全用默认值就行。然后新建知识库,把文件夹拖进去——PDF、Word、Markdown 都可以,弹出「上传文档解析」确认框,里面挑解析引擎、分块设置,要不要开图像处理和 AI 问题生成,点「确认上传并开始解析」。
解析完的文档在知识库里是带绿勾的卡片,左侧保留文件夹树,框选几篇可以批量重新解析、批量打标签、移动目录或重建知识。接着点「新对话」,底部输入框左侧的模式选「快速回答」或「智能推理」,把问题打进去。
快速回答模式下,答案上方会滚动出「已完成问题理解 → 检索到 N 个结果 → 完成」的过程,结尾标注来源文件名;智能推理模式过程更长,但每次工具调用都摊开给你看。问通第一个问题后,再问一个需要多步的难题,然后切到 Wiki 标签页,看 Agent 把这张知识地图一点点搭出来。
真实对照:部署前后差在哪
下面的数字全部来自官方截图与 README 的原始记录,耗时是截图实测值,没有做任何放大。
| 场景 | 部署前 | WeKnora 知识库部署后 |
|---|---|---|
| 参数出处在哪份文档 | 40 份 PDF 逐份翻,关键词搜索只给碎片 | 混合检索直接命中片段,答案末尾标来源文件 |
| 多步骤交叉核对 | 自己开 3~4 份文档对照 | ReAct Agent 自主完成,实测「思考 2 轮 · 3 次工具 · 17s」 |
| 理解整个知识体系 | 靠老人带和口口相传 | Wiki 自动生成互链页面,演示库 49 节点 · 49 链接,可一键回滚 |
| 要处理的文档格式 | 手动转成文本 | PDF / Word / Excel / EPUB / MHTML 等十余种直接解析 |
| 程序化调用 | 自建检索服务 | 官方 MCP Server 29 个工具,另有 CLI 与权限范围 API Key |
如果你的团队在意「检索效果到底怎么样」,仓库还带端到端测试模块,可以跑「检索 + 生成」全链路,输出召回命中率、BLEU / ROUGE 等指标,给后续调参一个基线。
快速上手:从克隆到第一次提问的 5 步
想知道怎么私有化部署一个 RAG,官方路径比想象中短。克隆仓库、备好配置、拉镜像启动,然后打开浏览器:
git clone https://gitcode.com/GitHub_Trending/we/WeKnora cd WeKnora cp .env.example .env docker compose pull docker compose up -d启动后访问http://localhost,后端 API 在:8080。需要知识图谱(Neo4j)、对象存储(MinIO)或链路追踪(Langfuse)时,用docker compose --profile neo4j --profile minio up -d按需叠加组件。
延伸资源(都在仓库内):
- 官方文档站 website-docs/:按入门、架构、功能、API、客户端、开发六大板块组织
- API 文档 与 常见问题排查
- 知识图谱配置说明
- MCP Server 配置
- 路线图 与 版本更新记录
写在最后
回到周一那个场景:40 份 PDF,午饭前,参数出处。有了跑起来的 WeKnora 知识库,这件事不再靠逐页翻——上传文件夹、等解析、拿到带来源的答案。建议今晚花十分钟docker compose up -d,传两份你最熟的文档,把第一个问题问出去。
【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考