传记分析完整指南:4 条命令用 Hyper-Extract 生成人物生平时序图谱与关系网络
【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-Extract
Hyper-Extract是一个基于 LLM 的智能知识提取 CLI 工具,核心能力是将非结构化文本转化为结构化知识。本篇聚焦传记分析实战:用它内置的general/biography_graph模板,把一篇人物传记变成带时间线的时序图谱(Temporal Graph)——每条关系都标注发生时间,人物、地点、作品、事件组成一张可搜索、可对话、可可视化的关系网络。全程只需 4 条命令,新手也能 5 分钟跑通。
为什么传记分析要用"时序图谱"
普通关系图谱只回答"谁和谁有关",而传记最核心的是"何时发生":1057 年中举、1079 年乌台诗案、1080 年贬谪黄州——这些时间点本身就是知识。
Hyper-Extract 的时序图谱把时间作为关系的属性来提取:相对时间(如"二十岁时")会自动换算成绝对年份,模糊时间则保留原文、绝不臆造。它的底层实现位于 hyperextract/types/temporal_graph.py,模板中通过time_field声明哪个字段承载时间。
项目共有 9 种知识结构,从简单列表到时序图谱、时空图谱一应俱全:
快速上手:30 秒安装与配置
1️⃣ 安装
uv tool install hyperextract # 或 pipx install hyperextract2️⃣ 配置模型(任选其一)
# OpenAI:一个 key 同时提供 LLM 和 embedding he config init -p openai -k YOUR_OPENAI_API_KEY # DeepSeek 仅 LLM,最经济,需搭配 OpenAI 的 embedder he config llm -p deepseek -k YOUR_DEEPSEEK_API_KEY he config embedder -p openai -k YOUR_OPENAI_API_KEY💡 本地部署可选 vLLM,数据不出本机,详见 README 中文版。
实战:一条命令提取苏轼传记
项目自带了一份示例传记 examples/zh/sushi.md,覆盖苏轼生平 64 年、12 个关键节点,非常适合做传记分析练手。
执行提取:
he parse examples/zh/sushi.md -t general/biography_graph -o ./output/ -l zh| 参数 | 含义 |
|---|---|
-t general/biography_graph | 指定传记图谱模板 |
-o ./output/ | 知识库输出目录 |
-l zh | 文档语言为中文 |
这一条命令背后,LLM 按模板的抽取规则完成三件事:
- 实体识别:主人公苏轼 + 家人(苏洵、苏辙、程氏)、师友(欧阳修、佛印)、地点(黄州、儋州)、作品(《定风波》《前赤壁赋》)等
- 关系抽取:仅在文本明确表达时创建关系(父亲、师承、创作、贬谪地……),不脑补常识性关联
- 时间归一:
1057年科举中举、1080年躬耕东坡……时间挂到关系上而非实体上
模板定义见 hyperextract/templates/presets/general/biography_graph.yaml,其中guideline部分就是给 LLM 的"传记分析师"工作规范。命令细节可查 he parse 文档。
可视化关系网络:一张图看懂人物生平
提取完成后,打开交互式可视化:
he show ./output/图中左侧面板显示统计信息:37 个节点、48 条边,平均节点度 2.6。点击任意节点(如"苏轼"),下方 DETAILS 区会展示实体类型与描述;边上的标签则写明关系类型——父亲、创作、贬谪地、任职地……
对人物生平脉络做传记分析时,这种"以人物为中心的辐射网络"比线性时间轴更能体现关系密度:谁是他人生转折的关键推手,哪个地点承载了哪段创作,一眼可见。
查询与对话:给知识库"提问"
构建搜索索引后(he parse已默认构建),你可以用两种方式挖掘知识:
① 语义搜索——即使关键词不匹配也能命中:
he search ./output/ "苏轼被贬谪期间创作了哪些著名作品?"② 自然语言对话——检索上下文 + LLM 综合生成带来源的答案:
he talk ./output/ -q "苏轼的家庭关系和师友有哪些?"项目提供了现成的提问清单 examples/zh/sushi_question.md,三条问题正好覆盖人物传记分析的三个经典视角:家庭师友关系、仕途与创作的关系、贬谪期间的作品。更多用法见 he search 文档 与 he talk 文档。
进阶:增量更新与多文档溯源
传记材料往往不止一份——《宋史》本传、年谱、后人评传都可以陆续喂入:
# 带来源标注地补充新文档 he feed ./output/ new-sushi-material.md --source new-material # 审计:哪些文档贡献了哪些知识 he info ./output/ --sources # 文档过时了?按来源整体回滚 he remove ./output/ --document new-material每个来源自动标注、索引增量更新,旧文档撤销后它贡献的事实随之回滚——这让多源传记分析变得可审计、可维护。
小结:4 条命令的传记分析工作流
| 步骤 | 命令 | 产出 |
|---|---|---|
| ① 安装配置 | uv tool install hyperextract+he config | 可用的 CLI 环境 |
| ② 提取 | he parse 传记.md -t general/biography_graph -o ./output/ -l zh | 带时间戳的时序图谱知识库 |
| ③ 可视化 | he show ./output/ | 交互式关系网络 |
| ④ 提问 | he search/he talk | 语义检索与自然语言问答 |
整条流水线由 CLI、模板层(80+ 预设模板)与方法层(GraphRAG、KG-Gen 等 11+ 提取引擎)三层构成,架构全景如下:
一句话总结:传记分析不必再手工整理年表——把传记文本丢给 Hyper-Extract,人物生平时序图谱与关系网络自动生成,还附带可搜索、可对话的知识底座。试试把任何一篇名人传记喂进去,你会发现"时间 × 关系"的组合远比文字叙述更直观。
【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-Extract
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考