news 2026/8/30 10:45:17

如何用graphify搭建个人第二大脑?从/raw文件夹到可查询图谱

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如何用graphify搭建个人第二大脑?从/raw文件夹到可查询图谱

如何用graphify搭建个人第二大脑?从/raw文件夹到可查询图谱

【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify

🧠 想知道如何把散落的代码、文档、PDF 变成能随时提问的"第二大脑"吗?开源工具graphify可以把你任意文件夹里的内容(代码、文档、SQL 配置、PDF、图片)解析成一张可查询的知识图谱——本地 AST 确定性解析、每条边都有出处说明、无需向量数据库。你只需三步:装 CLI、把资料丢进/raw文件夹、运行一次/graphify,就能用自然语言向自己的资料库提问,而不是满仓库 grep。

🗺️ graphify 给"第二大脑"带来了什么?

传统做法是用向量搜索(RAG)"近似"地找资料,而 graphify 的思路不同:构建一张真正的图,让关系可以沿着路径被遍历

graphify 把代码库渲染成可交互的知识图谱:每个节点是一个概念,颜色代表自动检测出的社区

特性说明
代码解析零成本用 tree-sitter AST 本地解析,不经过 LLM,数据不出本机
每条边可解释关系标记为EXTRACTED(源码里明确写出)或INFERRED(图谱推断,带置信分)
不是向量索引没有 embedding、没有向量库,问问题就是沿图查路径
文档/PDF/图片同图代码、文档、PDF、视频、图片全部映射进同一张图

工作原理详见 docs/how-it-works.md,核心是三遍处理:本地 AST 提取 → 音视频转写 → 文档/PDF/图片的语义抽取。

📁 搭建第二大脑的三步法:从 /raw 文件夹到可查询图谱

第一步:30 秒安装 graphify CLI

前提:Python 3.10+,推荐配合uv

uv tool install graphifyy # 注意包名是双 y 的 graphifyy,命令仍是 graphify graphify install # 把 /graphify 技能注册给你的 AI 助手

graphify install会识别你的助手平台(Claude Code、Cursor、Codex、Gemini CLI 等 20+ 平台),写入对应的技能文件,比如 .claude/skills/graphify/SKILL.md。

第二步:把所有资料放进 /raw 文件夹

"第二大脑"的本质是先囤积、后结构化。约定俗成:建一个raw/目录,把你想纳入知识范围的东西丢进去:

raw/ ├── api.py、parser.py … # 任意语言的代码(36+ 种语法) ├── architecture.md # 架构说明、笔记 ├── notes.md # 想法、待办、调研笔记 ├── paper.pdf # 论文/文档 └── diagram.png # 截图、图表

仓库里就放着两个开箱即练的示例语料,照着摆就行:

  • worked/example/README.md:7 个文件的小型文档流水线(4 个 Python 模块 + 2 篇 Markdown + 1 个 API),跑一遍零 token 成本;
  • worked/karpathy-repos/README.md:3 个代码库 + 5 篇 PDF 论文 + 4 张图的 52 文件混合语料,官方用它测出了71.5 倍的查询 token 节省

第三步:运行 /graphify 生成可查询图谱

在你的 AI 助手里输入:

/graphify ./raw

几秒钟(大语料稍久)后,graphify-out/目录里会得到三个文件,这就是你的第二大脑实体:

产物用途
graph.html浏览器直接打开——点节点、筛选、搜索的交互式图谱
GRAPH_REPORT.md摘要报告:核心概念、意外连接、建议提问
graph.json完整图谱数据,之后所有查询直接读它,无需重读原始文件

📊 读懂图谱报告:上帝节点、社区与置信标签

GRAPH_REPORT.md是你第二大脑的"体检报告"。以仓库内置示例 worked/httpx/GRAPH_REPORT.md 为例,6 个文件被提取为144 个节点、330 条边、6 个社区,报告直接告诉你:

  • 上帝节点(God Nodes):连接数最多的核心抽象——比如Client(26 边)、Response(24 边),一眼看出系统的心脏在哪;
  • 意外连接(Surprising Connections):跨文件、跨模块的隐藏关联,往往是你没意识到的知识盲点;
  • 社区(Communities):Leiden 算法把图聚成子系统,比如认证相关节点自动聚成一个社区。

每条推断边都带置信标签:EXTRACTED(置信 1.0,源码明确)/INFERRED(0.55–0.95 分档)/AMBIGUOUS(报告中标出待人工确认)。你永远知道哪条结论是"读出来的"、哪条是"猜出来的"——这对知识库的可信度至关重要。

🤖 让第二大脑真正可用:query、path、explain

图谱建好后,你不再翻文件,而是"查图":

/graphify query "auth 和数据库之间是怎么连的?" # 自然语言提问 → 返回子图 /graphify path "UserService" "DatabasePool" # 追踪两个概念的最短路径 /graphify explain "RateLimiter" # 解释一个概念的来源与连接

实际输出长这样(对 FastAPI 语料跑出的真实结果):

$ graphify path "FastAPI" "ModelField" Shortest path (3 hops): FastAPI --uses--> DefaultPlaceholder <--references-- get_request_handler() --references--> ModelField

配合这几个习惯,第二大脑会持续生长:

  • 增量更新/graphify ./raw --update只重提变化的文件(SHA256 缓存自动跳过未变文件);
  • 自动重建:graphify/hooks.py 提供graphify hook install,git commit 后自动重建图谱(纯 AST,无 API 成本);
  • 外部资料随手加/graphify add <论文URL或视频链接>直接抓取并入图;
  • 多格式输出--wiki生成 Markdown 维基、--obsidian导出 Obsidian 库、--svg/--graphml导出图文件;
  • 共享给团队python -m graphify.serve graphify-out/graph.json把图谱暴露为 MCP 服务,见 graphify/serve.py。

📦 /raw 文件夹能吃下哪些文件?

graphify 的文件覆盖面决定了"第二大脑"的容量上限(完整清单见 README.md 的"What files it handles"一节):

类型示例格式处理方式
代码(36+ 种语法).py .ts .go .rs .java .cpp .cs .swift .sql …本地 tree-sitter AST,免费、离线
文档.md .html .txt .yaml .rst文档间[链接][[wikilink]]自动变references
Office / PDF.docx .xlsx .pdf语义抽取(走你的助手模型)
图片.png .jpg .webp语义抽取,进同一张图
音视频.mp4 .mp3 .wav本地 faster-whisper 转写后入图

💡 提示:不想收进图的文件(比如node_modules/、生成代码)写一个.graphifyignore,语法同.gitignore,且会自动叠加.gitignore

✅ 新手避坑清单

  1. 包名是graphifyy(双 y),命令是graphify。装错包名会得到"找不到命令"的诡异报错;
  2. 装完提示command not found?跑uv tool update-shell(或pipx ensurepath)后重开终端;
  3. 纯代码语料完全离线:不需要任何 API key,graphify extract ./raw --code-only即可;
  4. 隐私:代码本地解析、音频本地转写、无遥测;只有文档/PDF/图片的语义抽取才调用模型,且用的是你助手会话的模型;
  5. PowerShell 用户:用graphify .而不是/graphify .(前导斜杠会被当成路径)。

🎯 小结:三步搭好你的第二大脑

装 CLI(1 分钟) → 资料丢进 /raw(随攒随放) → /graphify ./raw(一次构建) ↓ graph.html 看全貌 · GRAPH_REPORT.md 抓重点 · graph.json 答问题

从 worked/example/ 的 7 个文件跑通第一张图开始,逐步把读书笔记、项目代码、论文 PDF 都搬进/raw——当你能用graphify query问出"我的笔记里哪个结论引用了这篇论文"这类问题时,第二大脑就真正长出来了。🚀

【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/30 10:42:50

Penpot快速上手:免费开源的网页端设计协作工具完整实战指南

Penpot快速上手&#xff1a;免费开源的网页端设计协作工具完整实战指南 【免费下载链接】penpot Penpot: The open-source design platform for Product teams that need scalable collaboration. 项目地址: https://gitcode.com/GitHub_Trending/pe/penpot Penpot 是一…

作者头像 李华
网站建设 2026/8/30 10:42:39

open-code-review团队引入指南:30分钟让团队用起AI代码评审

open-code-review团队引入指南&#xff1a;30分钟让团队用起AI代码评审 【免费下载链接】open-code-review Fast, efficient, battle-tested at Alibabas scale. Hybrid architecture code review tool: deterministic pipelines LLM Agent, precise line-level comments, bui…

作者头像 李华
网站建设 2026/8/30 10:41:57

graphify安全模型全解析:10个威胁向量与逐一缓解措施

graphify安全模型全解析&#xff1a;10个威胁向量与逐一缓解措施 【免费下载链接】graphify Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: loca…

作者头像 李华
网站建设 2026/8/30 10:39:11

STM32N6570裸机I3C驱动移植:VL53L9 ToF传感器从V4L2到MCU实战

1. 项目背景与移植目标&#xff1a;从Linux V4L2到裸机I3C&#xff0c;到底在移什么 接到这个任务时&#xff0c;我先花了两天时间把STSW-IMG053的软件包结构完整过了一遍。这个包是ST官方发布的飞行时间&#xff08;ToF&#xff09;传感器软件套件&#xff0c;最初是给Linux环…

作者头像 李华