MinerU:3 条命令把 PDF 和 Office 文档解析成 Markdown/JSON
【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU
MinerU 是一个开源文档解析引擎,把 PDF、图片、DOCX、PPTX、XLSX 转成带阅读顺序的 Markdown 与 JSON,供大模型和 RAG 系统直接消费。默认的 pipeline 后端在纯 CPU 上就能运行,GPU 场景最低 4GB 显存。
能力速览
- 5 种格式原生进:PDF、图片、DOCX、PPTX、XLSX 直接解析,Word 和 Excel 不再需要先转成 PDF。
- 公式转 LaTeX、表格转 HTML:公式和表格自动识别成可编辑的结构化内容,支持跨页表格合并。
- 109 种语言 OCR:自动检测扫描件和乱码 PDF,并启动 OCR。
- 4GB 显存或纯 CPU 可用:pipeline 后端支持纯 CPU 环境,官方文档标注 OmniDocBench v1.6 综合分为 86.47。
3 条命令跑起解析:零配置上手
安装
pip install --upgrade pip pip install uv uv pip install -U "mineru[all]"mineru[all]包含全部核心功能,兼容 Windows / Linux / macOS,要求 Python 3.10–3.13。首次运行会自动下载模型;无法访问 HuggingFace 时执行一行export MINERU_MODEL_SOURCE=modelscope切到国内模型源即可。
跑第一个文件
mineru -p ./demo/pdfs/demo1.pdf -o ./output输入路径也可以是目录,批量文件会按文件名分别输出。每个文件会生成主.md文件、images/图片目录、含坐标与阅读顺序的.json,以及用于质检的layout.pdf布局可视化文件。没有 GPU 时加-b pipeline强制走 CPU 后端。
后端按硬件和精度需求选择:
| 后端 | 资源要求 | 适用场景 |
|---|---|---|
| pipeline | 纯 CPU 或 4GB 显存 | 通用 PDF 解析 |
| hybrid / vlm | 8GB 显存 | 复杂版式、更高精度 |
| *-http-client | 2GB 显存 | 对接已有 OpenAI 兼容服务 |
引擎室:流水线如何解析一页
pipeline 后端是一条模块化流水线,每个环节由专门的小模型负责,主流程编排在 mineru/backend/pipeline/,数据流向如下:
布局检测先定位每一块内容
布局模型(如mineru/model/layout/pp_doclayoutv2.py)输出每个内容块的位置、类型和阅读顺序,页眉、页脚、页码在这一步被剥离,多栏版式按人类阅读顺序重排。
公式与表格各走专属模型
文本块再分流给专用模型:公式模型把数学符号转成 LaTeX,表格恢复模块 mineru/model/table/rec/ 支持有线和无线表格,输出 HTML;扫描件则走 OCR 通道完成 109 语言识别。
精度不够时切换 hybrid 或 vlm 后端
对复杂文档,可选 1.2B 参数的 MinerU2.5-Pro VLM 做端到端解析。官方标注其 OmniDocBench v1.6 综合分为 95.39,明显高于 pipeline 的 86.47,代价是 8GB 显存起步。
进阶玩法:从单文件到流水线
批量目录解析:把-p指向目录(如./demo/pdfs),批量推理采用流式写盘,解析完成的文件即时落盘,适合整本论文或整批报告的转换。
接入 API 与多卡调度:启动mineru-api --host 0.0.0.0 --port 8000后,POST /tasks提交任务并返回task_id,GET /tasks/{task_id}/result取结果,服务实现见 mineru/cli/fast_api.py;再加一层mineru-router即可做统一入口和多 GPU 负载均衡。
精度与速度二选一:hybrid 后端提供effort参数,两档实测对比如下:
| effort | 相对 high 的分数损失 | 解析提速 |
|---|---|---|
| medium | 0.13 分 | 35%~220% |
官方默认使用medium,需要图像分析或最高精度时切回high。
如果你手头有一批格式诡异的 PDF,不妨先跑一遍仓库里的demo1.pdf,生成的layout.pdf会把每页的块位置和阅读顺序标出来,解析质量一眼可查。
- 完整使用指南
- FAQ 常见问题
- 源码入口
【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考