news 2026/8/30 8:03:14

1B 参数跑赢 72B VLM:MinerU PDF 转 Markdown 低显存完整指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
1B 参数跑赢 72B VLM:MinerU PDF 转 Markdown 低显存完整指南

1B 参数跑赢 72B VLM:MinerU PDF 转 Markdown 低显存完整指南

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

把带公式和表格的 PDF 喂给 RAG,最怕转出来的 Markdown 排版散架、表格丢失,而大模型方案又常被显存劝退。MinerU 走的是另一条路:用 1B 级小模型配合模块化流水线做 PDF 转 Markdown 文档解析,最低 6G 显存、纯 CPU 也能跑,单页约 0.8 秒。下面从一条命令跑通讲起,顺带说清它为何能逼近 72B 大模型的效果,以及显存怎么选。

一条命令,先把 PDF 跑通

安装与环境准备

MinerU 提供全平台支持(Windows / Linux / macOS),用 uv 安装最省事:

uv pip install -U "mineru[core]" export MINERU_MODEL_SOURCE=modelscope

第二行是给国内用户的建议:把模型源切到 ModelScope,首次运行时会自动下载所需模型并走本地缓存,后续直接用缓存。模型源机制详见 docs/zh/usage/model_source.md。

解析一条命令,产出三种文件

mineru -p ./demo/pdfs/demo1.pdf -o ./output

输入可以是单个 PDF,也可以是目录。输出遵循标准化目录结构(详见 docs/zh/reference/output_files.md):

  • *.md:按阅读顺序排好版的 Markdown,公式转 LaTeX、表格转 HTML
  • *.json:带坐标和语义信息的结构化数据,方便二次开发
  • images/:从文档中提取出的图片资源

示例文件可直接用仓库里的 demo/pdfs/demo1.pdf,一篇典型的学术论文,公式、跨页表格、图表都齐全。

1B 小模型凭什么打过大模型

答案不在"模型更大",而在"分工更细"。72B 视觉大模型要靠一个模型端到端硬扛所有环节,而 MinerU 把解析拆成流水线,每个小模型只负责自己最擅长的一段。整体架构见 mineru/backend/pipeline/:

模块化流水线:每环节只干一件事

每个环节都能单独优化、单独升级,互不影响:布局检测模型在 mineru/model/layout/pp_doclayoutv2.py 中区分 25 类版面元素(页眉页脚、公式、表格、竖排文本、印章等),先框清楚"这是什么、在哪、按什么顺序读";文字识别由 mineru/model/ocr/ 下的 PaddleOCR 系模型承担,OCR 支持 109 种语言;公式交给 mineru/model/mfr/unimernet/ 里的 Unimernet 转成 LaTeX;表格走 mineru/model/table/,针对无线表格的恢复准确率达 98.7%。

先看检测效果,再看识别结果

下面这张图就是真实检测输出:不同色块代表不同版面类型,右上角数字是阅读顺序,公式和表格被单独框出并转成 LaTeX。

跑 pipeline 后端还会额外产出 span 级别的可视化文件,方便排查文字丢失、行内公式识别等细节问题:

显存与效果:拿数据对照

后端怎么选,显存差多少

解析后端硬件要求适用场景
pipeline纯 CPU 或 6G 显存 GPU通用文档解析
vlm-transformers8G 显存 GPU复杂版式解析
vlm-vllm10G 显存 GPU批量处理任务

大多数普通用户用默认的 pipeline 后端就够了,消费级显卡甚至纯 CPU 都能驱动;文档量大、版式复杂时再上 VLM 后端。Docker 方式的一键部署见 docs/zh/quick_start/docker_deployment.md,Linux / WSL2 都支持。

速度、公式、表格的硬指标

  • 单页 PDF 处理约 0.8 秒,传统 VLM 方案约 2.3 秒/页,整体快约 30 倍
  • 复杂公式保留率 99.1%(传统工具约 92%)
  • 跨页表格完整性 97.3%(传统工具约 68%),被截断的表格会自动拼接
  • 最低 6G 显存即可运行

进阶玩法与生态

不想敲命令?起个网页界面

mineru-gradio --server-port 7860

启动 Gradio 可视化界面,浏览器里拖文件、看结果,适合先试效果再决定是否上生产,更多交互方式见 docs/zh/usage/quick_usage.md。

接入 RAG 与工作流

解析出的 Markdown/JSON 可以直接喂给 Dify、RAGFlow、FastGPT 这类知识库框架,仓库文档里按工具整理了接入步骤:

批量任务还可以走 vllm 后端做分布式推理:张量并行突破单卡显存限制、PagedAttention 管 KV 缓存,服务端实现在 mineru/cli/vlm_server.py,配合 docs/zh/usage/advanced_cli_parameters.md 里的--max-num-batched-tokens等参数在速度和精度之间做取舍。

换模型、改输出、多卡扩展

  • 新增 OCR 模型:继承 mineru/model/utils/pytorchocr/base_ocr_v20.py 基类,扩展流程参考 docs/zh/quick_start/extension_modules.md
  • 自定义输出格式:改 mineru/backend/pipeline/pipeline_middle_json_mkcontent.py 这一处
  • 多卡 / 多服务部署:仓库内置mineru-router,接口与mineru-api兼容,支持任务自动负载均衡,入口在 mineru/cli/router.py

延伸资料

从一条命令到多卡集群,MinerU 的完整解析链路都摆在上面这些路径里,按自己的显存和文档量挑一个后端跑起来就行。

  • 快速上手:docs/zh/usage/quick_usage.md
  • 进阶 CLI 参数:docs/zh/usage/advanced_cli_parameters.md
  • Docker 部署:docs/zh/quick_start/docker_deployment.md
  • 输出文件说明:docs/zh/reference/output_files.md
  • 常见问题:docs/zh/faq/index.md
  • 源码入口:mineru/

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/30 8:01:09

晶体内部三维结构:从原子坐标到Python可视化

如果你对晶体的印象还停留在“食盐那样方方正正的小颗粒”,那“晶体内部竟然能自发织出三维结构”这类发现,确实会让人有点意外。晶体并不是“死板”的原子堆垛,在某些特殊条件下,原子、离子或分子会在结晶过程中自行组织成复杂的…

作者头像 李华
网站建设 2026/8/30 7:59:30

大模型越狱攻击与安全防御:从原理到三层防线实践

大模型越狱最近频繁出现在技术社区。大模型能够熟练回答复杂问题,并不等同于模型总是按照服务提供者的规则运行。所谓越狱(jailbreak),在 LLM 领域指的是通过精心构造的输入文本,让模型绕过训练阶段建立的安全对齐&…

作者头像 李华
网站建设 2026/8/30 7:58:14

MySQL面试三天冲刺:索引、事务、锁与优化实战

8月是这个时间节点,挺微妙的。很多Java岗位要么是在做年中盘点,要么是在准备下一轮的招人计划。而对正在找工作的人来说,MySQL几乎是Java后端面试里逃不掉的一块。简历上写了“熟练掌握MySQL”,结果聊到索引失效、事务隔离级别、M…

作者头像 李华
网站建设 2026/8/30 7:56:39

AI教学应用平台架构与治理:从原则到工程落地

真正让高校信息化团队紧张的,不是又一款大模型发布,而是“AI 真的要进入课堂了,而且不是以学生偷偷使用的方式进入”。MIT 特别委员会发布的 AI 教学应用报告之所以受到关注,是因为它没有停留在“AI 很强大、要鼓励使用”这种表态…

作者头像 李华
网站建设 2026/8/30 7:56:34

GPU语音转录加速:whisper.cpp Vulkan后端完整实战指南

GPU语音转录加速:whisper.cpp Vulkan后端完整实战指南 【免费下载链接】whisper.cpp Port of OpenAIs Whisper model in C/C 项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp whisper.cpp 是 OpenAI Whisper 模型的 C/C 移植版,能…

作者头像 李华
网站建设 2026/8/30 7:55:40

YOLOv11多光谱目标检测训练全流程指南

YOLOv11多光谱目标检测训练全流程指南 【免费下载链接】ultralytics Ultralytics YOLO26, YOLO11, YOLOv8 — object detection, instance segmentation, semantic segmentation, image classification, pose estimation, object tracking 项目地址: https://gitcode.com/Git…

作者头像 李华