如何用graphify搭建个人第二大脑?从/raw文件夹到可查询图谱
【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify
🧠 想知道如何把散落的代码、文档、PDF 变成能随时提问的"第二大脑"吗?开源工具graphify可以把你任意文件夹里的内容(代码、文档、SQL 配置、PDF、图片)解析成一张可查询的知识图谱——本地 AST 确定性解析、每条边都有出处说明、无需向量数据库。你只需三步:装 CLI、把资料丢进/raw文件夹、运行一次/graphify,就能用自然语言向自己的资料库提问,而不是满仓库 grep。
🗺️ graphify 给"第二大脑"带来了什么?
传统做法是用向量搜索(RAG)"近似"地找资料,而 graphify 的思路不同:构建一张真正的图,让关系可以沿着路径被遍历。
graphify 把代码库渲染成可交互的知识图谱:每个节点是一个概念,颜色代表自动检测出的社区
| 特性 | 说明 |
|---|---|
| 代码解析零成本 | 用 tree-sitter AST 本地解析,不经过 LLM,数据不出本机 |
| 每条边可解释 | 关系标记为EXTRACTED(源码里明确写出)或INFERRED(图谱推断,带置信分) |
| 不是向量索引 | 没有 embedding、没有向量库,问问题就是沿图查路径 |
| 文档/PDF/图片同图 | 代码、文档、PDF、视频、图片全部映射进同一张图 |
工作原理详见 docs/how-it-works.md,核心是三遍处理:本地 AST 提取 → 音视频转写 → 文档/PDF/图片的语义抽取。
📁 搭建第二大脑的三步法:从 /raw 文件夹到可查询图谱
第一步:30 秒安装 graphify CLI
前提:Python 3.10+,推荐配合uv:
uv tool install graphifyy # 注意包名是双 y 的 graphifyy,命令仍是 graphify graphify install # 把 /graphify 技能注册给你的 AI 助手graphify install会识别你的助手平台(Claude Code、Cursor、Codex、Gemini CLI 等 20+ 平台),写入对应的技能文件,比如 .claude/skills/graphify/SKILL.md。
第二步:把所有资料放进 /raw 文件夹
"第二大脑"的本质是先囤积、后结构化。约定俗成:建一个raw/目录,把你想纳入知识范围的东西丢进去:
raw/ ├── api.py、parser.py … # 任意语言的代码(36+ 种语法) ├── architecture.md # 架构说明、笔记 ├── notes.md # 想法、待办、调研笔记 ├── paper.pdf # 论文/文档 └── diagram.png # 截图、图表仓库里就放着两个开箱即练的示例语料,照着摆就行:
- worked/example/README.md:7 个文件的小型文档流水线(4 个 Python 模块 + 2 篇 Markdown + 1 个 API),跑一遍零 token 成本;
- worked/karpathy-repos/README.md:3 个代码库 + 5 篇 PDF 论文 + 4 张图的 52 文件混合语料,官方用它测出了71.5 倍的查询 token 节省。
第三步:运行 /graphify 生成可查询图谱
在你的 AI 助手里输入:
/graphify ./raw几秒钟(大语料稍久)后,graphify-out/目录里会得到三个文件,这就是你的第二大脑实体:
| 产物 | 用途 |
|---|---|
graph.html | 浏览器直接打开——点节点、筛选、搜索的交互式图谱 |
GRAPH_REPORT.md | 摘要报告:核心概念、意外连接、建议提问 |
graph.json | 完整图谱数据,之后所有查询直接读它,无需重读原始文件 |
📊 读懂图谱报告:上帝节点、社区与置信标签
GRAPH_REPORT.md是你第二大脑的"体检报告"。以仓库内置示例 worked/httpx/GRAPH_REPORT.md 为例,6 个文件被提取为144 个节点、330 条边、6 个社区,报告直接告诉你:
- 上帝节点(God Nodes):连接数最多的核心抽象——比如
Client(26 边)、Response(24 边),一眼看出系统的心脏在哪; - 意外连接(Surprising Connections):跨文件、跨模块的隐藏关联,往往是你没意识到的知识盲点;
- 社区(Communities):Leiden 算法把图聚成子系统,比如认证相关节点自动聚成一个社区。
每条推断边都带置信标签:EXTRACTED(置信 1.0,源码明确)/INFERRED(0.55–0.95 分档)/AMBIGUOUS(报告中标出待人工确认)。你永远知道哪条结论是"读出来的"、哪条是"猜出来的"——这对知识库的可信度至关重要。
🤖 让第二大脑真正可用:query、path、explain
图谱建好后,你不再翻文件,而是"查图":
/graphify query "auth 和数据库之间是怎么连的?" # 自然语言提问 → 返回子图 /graphify path "UserService" "DatabasePool" # 追踪两个概念的最短路径 /graphify explain "RateLimiter" # 解释一个概念的来源与连接实际输出长这样(对 FastAPI 语料跑出的真实结果):
$ graphify path "FastAPI" "ModelField" Shortest path (3 hops): FastAPI --uses--> DefaultPlaceholder <--references-- get_request_handler() --references--> ModelField配合这几个习惯,第二大脑会持续生长:
- 增量更新:
/graphify ./raw --update只重提变化的文件(SHA256 缓存自动跳过未变文件); - 自动重建:graphify/hooks.py 提供
graphify hook install,git commit 后自动重建图谱(纯 AST,无 API 成本); - 外部资料随手加:
/graphify add <论文URL或视频链接>直接抓取并入图; - 多格式输出:
--wiki生成 Markdown 维基、--obsidian导出 Obsidian 库、--svg/--graphml导出图文件; - 共享给团队:
python -m graphify.serve graphify-out/graph.json把图谱暴露为 MCP 服务,见 graphify/serve.py。
📦 /raw 文件夹能吃下哪些文件?
graphify 的文件覆盖面决定了"第二大脑"的容量上限(完整清单见 README.md 的"What files it handles"一节):
| 类型 | 示例格式 | 处理方式 |
|---|---|---|
| 代码(36+ 种语法) | .py .ts .go .rs .java .cpp .cs .swift .sql … | 本地 tree-sitter AST,免费、离线 |
| 文档 | .md .html .txt .yaml .rst | 文档间[链接]和[[wikilink]]自动变references边 |
| Office / PDF | .docx .xlsx .pdf | 语义抽取(走你的助手模型) |
| 图片 | .png .jpg .webp | 语义抽取,进同一张图 |
| 音视频 | .mp4 .mp3 .wav | 本地 faster-whisper 转写后入图 |
💡 提示:不想收进图的文件(比如node_modules/、生成代码)写一个.graphifyignore,语法同.gitignore,且会自动叠加.gitignore。
✅ 新手避坑清单
- 包名是
graphifyy(双 y),命令是graphify。装错包名会得到"找不到命令"的诡异报错; - 装完提示
command not found?跑uv tool update-shell(或pipx ensurepath)后重开终端; - 纯代码语料完全离线:不需要任何 API key,
graphify extract ./raw --code-only即可; - 隐私:代码本地解析、音频本地转写、无遥测;只有文档/PDF/图片的语义抽取才调用模型,且用的是你助手会话的模型;
- PowerShell 用户:用
graphify .而不是/graphify .(前导斜杠会被当成路径)。
🎯 小结:三步搭好你的第二大脑
装 CLI(1 分钟) → 资料丢进 /raw(随攒随放) → /graphify ./raw(一次构建) ↓ graph.html 看全貌 · GRAPH_REPORT.md 抓重点 · graph.json 答问题从 worked/example/ 的 7 个文件跑通第一张图开始,逐步把读书笔记、项目代码、论文 PDF 都搬进/raw——当你能用graphify query问出"我的笔记里哪个结论引用了这篇论文"这类问题时,第二大脑就真正长出来了。🚀
【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考