Umi-OCR 免费离线文字识别:3 步上手,截图、批量、PDF、脚本一次讲清
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费、开源、完全离线的 OCR 软件:截图取字、批量图片识别、扫描版 PDF 转可搜索文档,全部在本地完成,不联网、图片不上传,解压即用,无需安装。读完这篇,你能独立完成 Umi-OCR 截图识别的全流程,把一个文件夹的扫描图批量转出 txt 和 Excel,还能把识别能力挂进自己的脚本和 Web 服务。
主界面:左侧截图预览支持划选文字,右侧记录栏按时间保存每次识别结果
4 步跑通一次截图识别
- 解压发布包。发布版是
.7z压缩包(或免装压缩软件的.7z.exe自解压包),支持 Windows 7 x64 和 Linux x64,没有安装器。解压后你会看到一个完整目录,程序全在里面。 - 启动程序。Windows 双击
Umi-OCR.exe,Linux 运行umi-ocr.sh。你会看到主窗口弹出,界面语言跟随系统设置自动切换。 - 唤起截图。打开"截图 OCR"标签页,按该页可自定义的快捷键。屏幕变暗、出现选框,框住一块文字即可,随时按
Esc取消。 - 拿到文字。识别完成后,右侧"记录"面板多出一条文本,点一下记录就复制到剪贴板;左侧预览栏也支持直接划选。
到这里最短路径已通:截图 → 识别 → 复制。顺手可以进"全局设置"切换语言、主题,或添加桌面快捷方式、设置开机自启。
全局设置页:可切换界面语言与主题,管理桌面快捷方式和开机自启
提取代码截图:缩进原样贴进 IDE
场景:文档、视频帧里的代码想直接进 IDE,普通 OCR 会吞掉缩进和行内空格。
做法:
- 在"截图 OCR"页框选代码区域。
- 右侧"设置"面板里,把排版解析改为单栏-保留缩进。
- 识别完成后在记录栏选中该条结果,复制、粘贴。
验收:贴进 IDE 或 Markdown 预览,缩进层级与原图一致、无多余空格,即通过。
避坑:
- 现象:缩进全被拍平成一行行紧贴左边缘。原因:默认排版解析是"多栏-按自然段换行",面向普通文档排版。解法:代码类截图一律切换为"单栏-保留缩进"。
- 引擎只负责认字,排版解析负责把字块按阅读顺序拼回去,两者分工不同,方案选错结果就会不对味。
记录面板支持划选多条记录批量复制、编辑后再复制,右键菜单可删除单条或清空全部。
截图 OCR 页:左侧预览栏可划选文字,右侧面板设置排版解析等参数
识别记录面板:右键菜单可复制、删除单条记录或清空全部
批量导出识别结果:整个文件夹一次出 txt 和 Excel
练熟了单张截图,就可以整批地喂。
做法:
- 切到"批量 OCR"标签页,点"选择图片"或直接把文件夹拖进来,几百张图也能一次导入。
- 核对输入格式(
jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff),输出格式勾选txt / jsonl / md / csv (Excel)。 - 点"开始任务"。你会看到左侧列表逐张显示耗时与置信度,结束后每个文件都有对应产物。
验收:随机抽 3 张图对比左侧预览和右侧记录;置信度(0~1)低于0.8的重点人工核对。
避坑:
- 现象:固定位置的水印、LOGO 文字混进结果。原因:水印中的文本块被一起识别。解法:右侧设置里打开忽略区域编辑器,按住右键画矩形框住水印,只有完整落在框内的文本块会被丢弃,框画得略大一点更安全。
- 现象:像素超大的长图里小字认错。原因:默认"限制图像边长"为
960,大图先被压缩,小字糊掉。解法:在"设置 → 文字识别"中把该值调到2880或4320。
批量 OCR 页:左侧列表逐张显示耗时和置信度,右侧是识别记录
把扫描 PDF 变成可搜索文档
做法:切到"文档识别"标签页(v2.1.4 及以上版本支持),拖入pdf / xps / epub / mobi / fb2 / cbz文件。产物是双层可搜索 PDF:原图在底层,识别出的文字藏在顶层,能搜、能选,版面不损失。同样可以设置忽略区域,排除页眉页脚。
验收:打开生成的 PDF,按Ctrl+F搜一个只在正文出现的词,能直接跳到对应页,说明文字层写对了。
避坑:现象:页眉页脚的重复文字被识别进文本层。原因:默认不排除固定区域。解法:任务前进入忽略区域编辑器,把页眉页脚位置框住再启动任务。
把识别挂进脚本和流水线
做法:
- 在"全局设置"确认 HTTP 服务已开启(默认开启),主机保持"仅本地"即可,默认端口
1224。 - 命令行最简两条:
umi-ocr --screenshot --clip截图并复制结果;umi-ocr --path "D:/docs" --output "结果.txt"识别整个文件夹并写入文件。完整参数见 命令行手册。 - HTTP 走法:先
GET http://127.0.0.1:1224/api/ocr/get_options查参数定义,再POST http://127.0.0.1:1224/api/ocr提交,请求体 JSON 里base64放图片编码、options放语言模型与排版解析等选项。完整参数以 图片识别接口文档 和 HTTP 接口手册 为准,文档识别也有对应的上传、查询、下载接口。
验收:命令行跑完,文本出现在剪贴板或你指定的文件里;浏览器访问get_options能看到 JSON 参数定义。
避坑:
- 现象:命令行任务时主窗口被弹出。原因:命令行任务沿用"截图 OCR"标签页的参数设定。解法:在该标签页里关掉弹出主窗口的对应选项。
- 现象:长时间连续调用偶发
ECONNREFUSED。原因:后端对并发支持较差。解法:串行调用、失败重试一次即可,具体注意事项以官方 HTTP 手册为准。
参数速览:真正值得动的就这几个
| 参数 | 默认值 | 建议值 | 原因 |
|---|---|---|---|
| 排版解析 | 多栏-按自然段换行 | 代码截图选"单栏-保留缩进" | 缩进和阅读顺序全靠它,默认方案会拍平代码缩进 |
| 限制图像边长 | 960 | 2880 或 4320 | 大图先被压缩,小字容易糊 |
| 语言/模型库 | 简体中文 | 纯英文、纯代码换models/config_en.txt | 中文模型认纯英文容易出怪字符 |
| OCR 引擎插件 | Rapid-OCR(自带) | 保持默认 | 自带引擎兼容性好、速度快,无需折腾 |
所有界面改动会自动存进UmiOCR-data/.settings(ini 格式),也可以手动改完执行umi-ocr --reload重新加载。
识别结果不对时:先查这张表
| 现象 | 原因 | 处理 |
|---|---|---|
| 识别顺序错乱、读不通 | 排版解析方案与该图排版不匹配 | 换方案,代码截图选"单栏-保留缩进" |
| 大图里小字认错 | 默认边长限制 960 压缩了图片 | "限制图像边长"调到 2880 以上 |
| 水印、LOGO 文字混入结果 | 水印文本块被一并识别 | 批量页画忽略区域,把水印整块框住 |
| 命令行 / HTTP 没反应 | HTTP 服务未开启 | 全局设置中允许 HTTP 服务,主机选"仅本地" |
| 连续调用偶发连接报错 | 后端并发能力有限 | 改为串行调用,失败重试一次 |
下一步:从文档到源码
Umi-OCR 是一个放在本地的 OCR 工具箱:免费、离线,截图、批量、PDF 一次覆盖,还预留了命令行和 HTTP 两个口子给自动化。建议先在截图页练熟,再去批量页处理文件夹;想深入时,命令行手册 与 HTTP 接口手册 是完整参考,Python 源码在UmiOCR-data/py_src/目录,可以直接翻。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考