news 2026/8/29 22:20:58

MinerU:3 条命令把 PDF 和 Office 文档解析成 Markdown/JSON

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MinerU:3 条命令把 PDF 和 Office 文档解析成 Markdown/JSON

MinerU:3 条命令把 PDF 和 Office 文档解析成 Markdown/JSON

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

MinerU 是一个开源文档解析引擎,把 PDF、图片、DOCX、PPTX、XLSX 转成带阅读顺序的 Markdown 与 JSON,供大模型和 RAG 系统直接消费。默认的 pipeline 后端在纯 CPU 上就能运行,GPU 场景最低 4GB 显存。

能力速览

  • 5 种格式原生进:PDF、图片、DOCX、PPTX、XLSX 直接解析,Word 和 Excel 不再需要先转成 PDF。
  • 公式转 LaTeX、表格转 HTML:公式和表格自动识别成可编辑的结构化内容,支持跨页表格合并。
  • 109 种语言 OCR:自动检测扫描件和乱码 PDF,并启动 OCR。
  • 4GB 显存或纯 CPU 可用:pipeline 后端支持纯 CPU 环境,官方文档标注 OmniDocBench v1.6 综合分为 86.47。

3 条命令跑起解析:零配置上手

安装

pip install --upgrade pip pip install uv uv pip install -U "mineru[all]"

mineru[all]包含全部核心功能,兼容 Windows / Linux / macOS,要求 Python 3.10–3.13。首次运行会自动下载模型;无法访问 HuggingFace 时执行一行export MINERU_MODEL_SOURCE=modelscope切到国内模型源即可。

跑第一个文件

mineru -p ./demo/pdfs/demo1.pdf -o ./output

输入路径也可以是目录,批量文件会按文件名分别输出。每个文件会生成主.md文件、images/图片目录、含坐标与阅读顺序的.json,以及用于质检的layout.pdf布局可视化文件。没有 GPU 时加-b pipeline强制走 CPU 后端。

后端按硬件和精度需求选择:

后端资源要求适用场景
pipeline纯 CPU 或 4GB 显存通用 PDF 解析
hybrid / vlm8GB 显存复杂版式、更高精度
*-http-client2GB 显存对接已有 OpenAI 兼容服务

引擎室:流水线如何解析一页

pipeline 后端是一条模块化流水线,每个环节由专门的小模型负责,主流程编排在 mineru/backend/pipeline/,数据流向如下:

布局检测先定位每一块内容

布局模型(如mineru/model/layout/pp_doclayoutv2.py)输出每个内容块的位置、类型和阅读顺序,页眉、页脚、页码在这一步被剥离,多栏版式按人类阅读顺序重排。

公式与表格各走专属模型

文本块再分流给专用模型:公式模型把数学符号转成 LaTeX,表格恢复模块 mineru/model/table/rec/ 支持有线和无线表格,输出 HTML;扫描件则走 OCR 通道完成 109 语言识别。

精度不够时切换 hybrid 或 vlm 后端

对复杂文档,可选 1.2B 参数的 MinerU2.5-Pro VLM 做端到端解析。官方标注其 OmniDocBench v1.6 综合分为 95.39,明显高于 pipeline 的 86.47,代价是 8GB 显存起步。

进阶玩法:从单文件到流水线

批量目录解析:把-p指向目录(如./demo/pdfs),批量推理采用流式写盘,解析完成的文件即时落盘,适合整本论文或整批报告的转换。

接入 API 与多卡调度:启动mineru-api --host 0.0.0.0 --port 8000后,POST /tasks提交任务并返回task_idGET /tasks/{task_id}/result取结果,服务实现见 mineru/cli/fast_api.py;再加一层mineru-router即可做统一入口和多 GPU 负载均衡。

精度与速度二选一:hybrid 后端提供effort参数,两档实测对比如下:

effort相对 high 的分数损失解析提速
medium0.13 分35%~220%

官方默认使用medium,需要图像分析或最高精度时切回high

如果你手头有一批格式诡异的 PDF,不妨先跑一遍仓库里的demo1.pdf,生成的layout.pdf会把每页的块位置和阅读顺序标出来,解析质量一眼可查。

  • 完整使用指南
  • FAQ 常见问题
  • 源码入口

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/29 22:19:10

什么是claude-obsidian?开源AI第二大脑完全入门指南

什么是claude-obsidian?开源AI第二大脑完全入门指南 【免费下载链接】claude-obsidian Self-organizing AI second brain for Obsidian Claude Code. Drop any source and Claude reads, links, and files it into one connected knowledge graph of plain Markdow…

作者头像 李华
网站建设 2026/8/29 22:17:37

Godot 3D 模型材质切换指南:3 步实现完整换装与状态替换

Godot 3D 模型材质切换指南:3 步实现完整换装与状态替换 【免费下载链接】godot Godot Engine – Multi-platform 2D and 3D game engine 项目地址: https://gitcode.com/GitHub_Trending/go/godot 角色一踏进雨里,身上的衣服要立刻变成湿身材质&…

作者头像 李华
网站建设 2026/8/29 22:10:43

2019前端校招笔试全解析:JavaScript/ES6与工程化考点拆解

2019年这个时间节点,正好卡在前后端分离已经全面普及、但工程化体系还没完全固化的阶段。那年校招笔试,前端开发工程师的题目风格很有代表性:JavaScript基础仍然是绝对主角,ES6新特性已经大量出现在考题里,CSS布局题依…

作者头像 李华
网站建设 2026/8/29 22:04:52

从机器人税看AI自动化:开发者如何守住人类决策边界

最近的 AI 圈子确实不太平静。一边是大模型能力持续刷新,另一边是“AI 会不会取代我的岗位”的讨论越来越频繁。比尔盖茨发长文谈 AI,提到建议征收机器人税、设置人类专属岗位,很快在各种开发者群里刷了屏。作为经常和 AI 打交道的开发者&…

作者头像 李华
网站建设 2026/8/29 22:04:42

基于ROS 2 Jazzy的端到端机械臂抓取系统实战:从选型到调试全解析

简介:机器人抓取是智能制造与仓储自动化中的关键环节,其核心挑战在于打通感知、规划与控制的全链路。以ROS 2 Jazzy为代表的长期支持版本,为这类系统提供了稳定可靠的通信与工具链基础。结合RGB-D相机与MoveIt 2运动规划,开发者可…

作者头像 李华
网站建设 2026/8/29 22:00:28

欢聚时代2018校招前端A卷深度解析:从JS基础到工程化实战

1. 这套卷子出现的时机和背景2018年的校招,是移动互联网从高速增长转向存量竞争的关键节点。欢聚时代(YY)在那个时间段的业务盘子已经不小了:直播是基本盘,游戏、教育、社交多线并进,对前端的需求不再是&qu…

作者头像 李华