news 2026/10/8 13:32:49

用EdgeQuake构建智能问答应用:从PDF摄取到GraphRAG查询的端到端完整教程

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
用EdgeQuake构建智能问答应用:从PDF摄取到GraphRAG查询的端到端完整教程

用EdgeQuake构建智能问答应用:从PDF摄取到GraphRAG查询的端到端完整教程

【免费下载链接】edgequakeEdegQuake 🌋 High-performance GraphRAG inspired from LightRag written in Rust; Transform documents into intelligent knowledge graphs for superior retrieval and generation项目地址: https://gitcode.com/gh_mirrors/ed/edgequake

EdgeQuake是一个用 Rust 编写的高性能 GraphRAG 框架:它把 PDF 等文档摄取为知识图谱(实体 + 关系),再通过向量 + 图混合检索实现智能问答,回答还带来源引用。本教程带你走完完整链路:一键部署 → PDF 摄取 → 图谱查询,10 分钟就能拥有自己的文档问答应用。

为什么需要 GraphRAG 智能问答?

传统 RAG 只靠向量相似度找文档片段,遇到这类问题就失灵:

  • 跨文档关联:“这两份文件里提到的同一个产品,功能有什么区别?”
  • 关系推理:“A 公司 CEO 之前在哪里工作?”
  • 全局主题:“这些文档整体在讲什么?”

EdgeQuake 的解法是把文档拆解成知识图谱——LLM 从每个文本块中提取实体(人物、组织、产品……)和关系,查询时同时走向量空间和图结构,兼顾速度与推理能力。

快速开始:一键安装 EdgeQuake 问答服务

无需 Rust、无需 Node.js,只用 Docker 即可。先克隆仓库:

git clone https://gitcode.com/gh_mirrors/ed/edgequake cd edgequake sh quickstart.sh

交互式向导会引导你选择模型提供商(OpenAI / Ollama)和模型,然后自动拉起完整服务栈。启动后访问http://localhost:3000即可使用,Quickstart 默认免登录。

💡 想固定版本?EDGEQUAKE_VERSION=0.32.0 sh quickstart.sh服务地址一览:Web UI:3000、REST API:8080、Swagger 文档:8080/swagger-ui。

验证服务是否就绪:

curl -s http://localhost:8080/health | python3 -m json.tool

看到"status": "healthy"就说明一切正常。完整的安装细节见 快速开始指南 和 安装文档。

第一次进入 WebUI:上传页面与知识图谱

打开 WebUI 后,左侧边栏有 Dashboard、Documents(文档)、Knowledge Graph(知识图谱)、Query(问答)等入口。文档上传页支持拖拽 PDF、TXT、MD 等文件(单文件最大 100MB),还可以为本次上传单独指定 PDF 解析器:

当文档摄取完成后,在Knowledge Graph页面就能看到自动生成的知识图谱——不同颜色代表不同实体类型(人物、组织、产品、概念等),点击节点可查看详情:

PDF 摄取:4 步把文档变成知识图谱

EdgeQuake 的 PDF 摄取采用两阶段流水线:先把 PDF 转成 Markdown(PdfProcessing任务),再进行知识图谱摄取(Insert任务)。整个过程大致分三步:

第 1 步:上传 PDF

最简单的方式是在 WebUI 的 Documents 页拖拽上传;用 API 的话只需一条 curl:

curl -X POST http://localhost:8080/api/v1/documents/pdf \ -H "X-Workspace-ID: default" \ -F "file=@your-paper.pdf" \ -F "title=Research Paper"

接口会立即返回task_id和estimated_time_seconds(预估耗时),摄取是异步的,无需阻塞等待。

第 2 步:选择 PDF 解析后端

EdgeQuake 内置 4 种解析后端(pdf_parser_backend):

后端适用场景
vision(默认)复杂版面:双栏、表格、图表,由视觉大模型逐页识读
edgeparse纯文本数字 PDF,CPU 解析,快速省钱
edgeparse-ocr扫描件,EdgeParse + Tesseract OCR
auto按文本密度自动选择快路径

解析失败的 vision 路径会自动回退到文本抽取,不会卡死。

第 3 步:跟踪摄取进度

轮询进度(也可用 SSE 或 WebSocket 实时推送):

curl -s "http://localhost:8080/api/v1/documents/pdf/progress/$TASK_ID"

文档状态会依次经历converting(转 Markdown)→extracting(实体抽取)→embedding(向量化),直到display_status变为completed即可查询。中途想放弃?一条命令取消:

curl -X POST "http://localhost:8080/api/v1/tasks/$TASK_ID/cancel"

第 4 步:查看抽取结果

curl -s "http://localhost:8080/api/v1/graph/entities" | python3 -m json.tool curl -s "http://localhost:8080/api/v1/graph/stats"

你会看到类似MARIE_CURIE(PERSON)、RADIUM(CONCEPT)这样的实体,以及 “discovered” 这类关系边。抽取细节(含多轮 Gleaning 补漏)详见 LightRAG 算法解析。

GraphRAG 查询:6 种模式怎么选?

进入 WebUI 的Query页面,输入问题即可获得带来源引用的回答。EdgeQuake 提供 6 种查询模式,覆盖不同问法:

模式适合问题原理
Naive关键词式查找,最快纯向量相似度
Local具体实体相关问题定位实体 → 遍历邻居
Global主题/全局性问题社区摘要 + 高层关键词
Hybrid(默认)复杂综合问题Local + Global 结合
Mix自定义平衡全模式加权融合
Bypass纯 LLM 对话不经过 RAG

用 API 查询只需:

curl -X POST http://localhost:8080/api/v1/query \ -H "Content-Type: application/json" \ -d '{"query": "文档中提到的关键发现是什么?", "mode": "hybrid"}'

响应包含answer(自然语言回答)和sources(引用片段 + 相似度分数),每个回答都可追溯到具体文档:

实操示例:同一问题的三种问法

假设你摄入了三篇公司介绍文档(示例见 第一个 RAG 应用教程):

  1. “谁创立了 TechCorp?”→ 用hybrid模式,答案直接给出两位创始人及各自职务
  2. “CEO 之前在哪里工作?”→ 用local模式,图谱沿实体关系边找到 “Google DeepMind”
  3. “这几份文档整体在讲什么?”→ 用global模式,基于社区摘要输出主题归纳

这就是 GraphRAG 相比传统 RAG 的核心优势:关系类问题靠图遍历,主题类问题靠社区摘要,而不是硬靠向量相似度硬凑。

常见问题速查表

症状检查方法解决办法
文档卡在converting视觉模型服务是否在线检查 Ollama:curl http://localhost:11434/api/tags,或改用pdf_parser_backend=edgeparse
查询返回泛泛的答案文档是否completed轮询至display_status=completed再查
401 未授权生产模式需登录Quickstart 为免登录;生产环境先登录取 token
批量上传慢租户并发上限查看GET /api/v1/pipeline/queue-metrics,本地 Ollama 默认每租户 1 个并发任务

更多排查思路见 常见故障排查 和 PDF 摄取教程。

下一步:让问答应用更强大

  • 多租户:为不同项目/客户隔离工作区 → 多租户教程
  • 自定义实体类型:医疗、法律等 5 套领域预设 → 实体抽取概念
  • 知识注入:注入术语表、缩写表提升抽取精度 → 知识注入教程
  • SDK 集成:Python / TypeScript / Go / Java 等 11 种语言 SDK → SDK 总览
  • API 全量契约:REST API 参考 · 架构总览

从sh quickstart.sh到第一条带引用的智能回答,EdgeQuake 全程只需不到 10 分钟。现在就把你的 PDF 丢进去,问问它吧 🌋

【免费下载链接】edgequakeEdegQuake 🌋 High-performance GraphRAG inspired from LightRag written in Rust; Transform documents into intelligent knowledge graphs for superior retrieval and generation项目地址: https://gitcode.com/gh_mirrors/ed/edgequake

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/8 13:32:17

T113i MIPI-DSI点屏实战:从设备树配置到初始化序列的完整指南

1. 从一块不亮的屏幕说起:MIPI-DSI 到底在系统里扮演什么角色如果你手里正拿着一块 T113i 的开发板,屏幕排线插好了、背光也亮了,但屏幕上就是一片白或者一片黑,那你大概率正卡在 MIPI-DSI 这条链路的某个环节上。我见过太多人第一…

作者头像 李华
网站建设 2026/10/8 13:31:25

面向对象程序设计-类与对象3- 学生排名表(析构函数)

作者 何振峰单位 福州大学现在输入一批学生(人数大于0且不超过100)的名次和他们的姓名。要求按名次输出每个人的排名。输入格式:每行为一个学生的信息,共两项,第一项为排名(为正整数,且任意两名…

作者头像 李华
网站建设 2026/10/8 13:30:56

2026具品牌实力的GEO生成式引擎优化平台 合规业务归属

2026 GEO市场现状:从“流量争夺”到“认知资产”生成式引擎优化(GEO)并非传统SEO的简单升级,而是AI时代企业品牌信息体系、可信内容资产与用户意图覆盖的系统建设。随着大模型成为信息整理者,企业在线信息的完整性、准…

作者头像 李华
网站建设 2026/10/8 13:29:29

系统调用揭秘:内核与用户空间边界全解析

系统调用揭秘:内核与用户空间边界全解析 【免费下载链接】coursebook Open Source Introductory Systems Programming Textbook for the University of Illinois 项目地址: https://gitcode.com/GitHub_Trending/co/coursebook 系统调用是连接你的程序与操作…

作者头像 李华
网站建设 2026/10/8 13:29:28

C++ 内存模型深度解析:从虚拟地址空间到对象生命周期

本文系统阐述C内存模型的核心机制,涵盖虚拟地址空间布局、对象存储周期(静态、线程、自动、动态)、栈与堆底层原理、内存对齐、生命周期管理及多线程内存序。重点解析严格别名规则、数据竞争防范与智能指针的RAII设计,揭示C在控制…

作者头像 李华
网站建设 2026/10/8 13:28:59

模板初阶与STL简介(以问答形式入门)

模板初阶与STL简介(以问答形式入门) 问答1.1 若用函数重载实现一个通用的交换函数,存在哪些不好的地方呢? 答: 重载的函数仅仅是类型不同,代码复用率比较低,只要有新类型出现时,就需…

作者头像 李华