Umi-OCR双层PDF转换:离线免费,5 步让扫描件变可搜索文档
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
几十页扫描PDF翻来覆去,Ctrl+F 搜不到一句话,找数据只能靠肉眼一页页扫。Umi-OCR 双层PDF转换,离线免费,5 步把扫描件变成可搜索文档。走一遍:跑通 → 调优 → 批量 → 排障。
为什么选 Umi-OCR 双层PDF转换:离线免费的本地引擎
扫描PDF就是一叠图片,文字以像素烙在图上,电脑眼里只有色块,所以搜不到、复制不了。双层PDF的思路很朴素:底层原样保留扫描图,观感打印不变;上层再叠一层透明文字。图还是那张图,只是底下垫了一层看不见的字——复制、搜索、摘录一下就全通了。
| 方案 | 能搜索 | 能复制 | 版式还原 | 是否联网 |
|---|---|---|---|---|
| 纯扫描PDF | 否 | 否 | 完整 | 不需要 |
| 导出纯文本 | 是 | 是 | 基本丢失 | 常需联网 |
| Umi-OCR双层PDF | 是 | 是 | 完整 | 全程离线 |
最打动人的差异点就一个:识别引擎是本地插件(PaddleOCR / RapidOCR 二选一),断网照样跑,敏感资料不用上传任何云端。
5 步跑通第一份双层 PDF
第 1 步:解压即用。从发布页下载Umi-OCR_Rapid_v2.1.5.7z,解压后双击Umi-OCR.exe启动,没有安装向导、没有环境配置。
第 2 步:打开"文档识别"标签。把要转换的PDF拖进左侧文件列表,支持批量添加,一次拖几十个也没问题。
第 3 步:设置输出。右侧设置面板做三件事:保存格式选"双层PDF",识别语言切到文档对应语言,段落合并保持"多栏-按自然段换行"。
第 4 步:顺手处理页眉页脚(可选)。点"忽略区域"框选页眉页脚位置,再指定生效的页码范围,正文会更干净。
第 5 步:开始任务并验收。点"开始任务",右侧逐页显示进度,单页一两秒完成。
验收标准就一条:去输出目录用 Ctrl+F 搜一个文档里的词,搜得到、抽几页看图像清晰,就算成功。
按你的场景调一调:语言、排版、页数
中英混排论文。默认中文库扛英文专有名词会掉准确率。把识别语言切到含英文的模型库,英文术语识别明显更准。
扫描版代码截图。代码的缩进、行内空格最容易丢。把排版解析方案换成"单栏-保留缩进",行首缩进和行内空格原样保留。
只转中间几页。上百页的文档只想处理中间某段。指定"页数起始/结束"范围,再配合忽略区域的页码范围做精细分段,跳过无用页,省时省内存。
💡 所有参数都在"文档识别"页右侧面板,改动即时生效,建议先用一两页试跑,确认效果再批量。
量大之后:HTTP 批量转换与翻车速查
文件多到按"批"算,就交给 HTTP 接口。前提是全局设置里允许 HTTP 服务(默认开启),本机端口1224。流程四步:上传 → 轮询状态 → 生成双层PDF取链接 → 下载并清理,完整说明见docs/http/api_doc.md。
import requests, time SERVER = "http://127.0.0.1:1224" with open("scan.pdf", "rb") as f: task = requests.post(f"{SERVER}/api/doc/upload", files={"file": f}).json()["data"] while True: r = requests.post(f"{SERVER}/api/doc/result", json={"id": task}).json() if r.get("is_done"): break time.sleep(1) url = requests.post(f"{SERVER}/api/doc/download", json={"id": task, "file_types": ["pdfLayered"]}).json()["data"] open("out.pdf", "wb").write(requests.get(f"{SERVER}{url}").content) requests.get(f"{SERVER}/api/doc/clear/{task}")把这段套进文件循环,一个文件夹的扫描件几分钟就能批量出双层PDF,结果还支持 txt / csv / jsonl 对接下游。
| 问题 | 大概率原因 | 动作 |
|---|---|---|
| 文字与图像错位 | 旧版旋转页坐标Bug | 升到 v2.1.5,或改用"整页强制OCR" |
| 任务卡在等待 | 加密PDF没填密码 / 文件损坏 | 填密码,或打开软件日志定位 |
| 大批量吃满内存 | 引擎默认占用较高 | 全局设置调低线程数与内存上限 |
| 以为双层PDF可编辑 | 文字层透明、不可改 | 要可编辑稿请另选 Word 方案 |
⚠️ 排查先核对版本号和日志,v2.1.5 起日志保存在UmiOCR-data/logs,多数诡异现象都能在这两处找到线索。
跑通 → 调优 → 批量 → 排障,一套离线免费的扫描件数字化流程。顺手还有截图OCR、二维码生成值得一试。现在挑一份最头疼的扫描PDF,按 5 步走一遍。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考