Umi-OCR 离线 OCR 教程:3 个高频场景与排障速查
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
把一批图片交给在线 OCR 网站,要受上传限速和每日额度约束,文件在别人服务器上存多久也说不准。Umi-OCR 是免费离线 OCR 工具:图片全程不离开你的硬盘,不注册、不上传。本文覆盖安装首跑、3 个高频场景、参数调优、排障和无界面用法,读完即可上手。
免安装部署:下载与首次启动
这一节把软件在你的电脑上跑起来。
- 从发布页下载
.7z包(没装压缩软件就选.7z.exe自解压包),解压到不带中文和空格的路径,例如D:\Tools\Umi-OCR。 - Windows 双击
Umi-OCR.exe启动;Linux 运行umi-ocr.sh。 - 主窗口由标签页组成:截图 OCR、批量 OCR、文档识别、二维码、全局设置,右上角可锁定常用标签防误关。
提前说:软件自带本地识别引擎和运行库,部分杀毒软件会误报拦截进程,这是"闪退"最常见的原因——首次启动前把软件目录加入白名单。
截图识别:把屏幕上的字一键抓走
适合随手摘抄消息、界面里的零散文字。
入口是"截图 OCR"标签页,快捷键唤起截图框,框住目标文字,识别结果立刻出现在右侧记录栏。
关键操作:
- 复制图片直接粘贴:在别处(如聊天窗口)复制一张图,回到 Umi-OCR 粘贴即可识别,不用先存盘。
- 记录栏直接改错:右侧文字可手动修正,还能划选多条记录一起复制,顺手整理成想要的格式。
- 竖排(从右到左的栏)由排版解析自动整理,前提是引擎支持该语言。
产出:文字直接落在右侧记录栏,改完划选复制即可,不用再跳去别的编辑器。
批量识别:几百张图怎么拖、怎么导出
适合一次性归档成批图片,如旧照片、票据扫描件。
入口是"批量 OCR"标签页,把图片直接拖进窗口,jpg、png、webp、bmp、tif 等格式都收,数量没有上限,几百张一次导入。
关键操作:
- 点"开始任务",右侧逐张显示文件耗时、置信度和识别结果。
- v2.1.2起支持"暂停任务",软件不退出,待机、休眠后接着跑。
- 可设任务完成后自动关机或待机,过夜挂机,早上起来结果已跑完。
产出与导出:txt、jsonl、md、csv 四种格式,其中 csv 用 Excel 直接打开。
文档识别:把扫描版 PDF 转成可搜索文本
适合把扫描版 PDF、电子书数字化,变成能搜索的存档。
入口是"文档识别"标签页,支持 pdf、xps、epub、mobi、fb2、cbz 六种格式,典型场景就是扫描版 PDF。
关键操作:
- 默认优先提取 PDF 自带文本层,速度快、零识别误差;纯扫描页才交给本地引擎逐页识别。也可强制整页 OCR,或反过来只提取原文本。
- 支持按页码范围设置忽略区域,剔除页眉、页脚、页码。
- v2.1.2 起可导出单层纯文本 PDF,体积小、好编辑。
产出:核心是双层可搜索 PDF——底层原图、上层透明文字,外观和扫描件一致,文字却能搜索、复制、划线,公司合同归档、论文数字化直接顶用。
调优 4 个旋钮:常见问题都能修 🔧
识别之后的常见问题,靠下面 4 个旋钮解决。
排版解析:方案怎么选
文字顺序乱、段落粘连、代码缩进丢了,别动引擎,去"文字识别"设置里换排版解析方案,输出就会按阅读顺序重新组织:
| 方案 | 适合什么 |
|---|---|
| 多栏-按自然段换行 | 两栏/三栏论文书籍,覆盖面最广,最常用 |
| 多栏-总是换行 | 每行独立,适合按行后续处理 |
| 多栏-无换行 | 整段强制合并成一行 |
| 单栏-按自然段换行 | 单栏文档,段落自然断行 |
| 单栏-保留缩进 | 代码截图,保住行首缩进和行中空格 |
| 不做处理 | 引擎原始输出,不整理 |
拿不准就选"多栏-按自然段换行";各方案都能同时处理横排和竖排(从右到左的栏)。
忽略区域:框怎么画才生效
图片角落的水印、LOGO、页眉页脚总混进结果,从批量页右侧设置进入忽略区域编辑器,按住右键画多个矩形框,框内文字在识别时自动排除。
注意:只有整个文本块完全落在框内才会被忽略,不是按单个字符判断。画框宁可大一点,把水印可能出现的位置全部包住,画完记得保存;漏框一次,结果里就多一行杂音。
引擎与识别语言库:怎么切换
某类文字识别不准或报错,先去全局设置换引擎:默认Rapid-OCR兼容性好,PaddleOCR速度更快一些,换引擎往往比调别的参数见效快。
两种语言别混:界面语言(全局设置 → 语言,中文、繁体、英文、日文、俄语、葡萄牙语等,社区翻译维护)管按钮菜单长什么样;识别语言库(各标签页"文字识别"设置里单独选或下载)管引擎认哪种文字。界面用中文、日常识别日文书籍,完全可以搭配。
长图识别不全:调哪个数
特别高的截图、长图底部漏识别,去"文字识别"设置里调高限制图像边长,默认值为了平衡速度和内存,适当调高即可覆盖长图。别放大原图——过度放大只会增加噪声,反而降准确率。
排障速查:3 组常见现象 🧯
先对现象,再找原因,按顺序处理。
识别结果:
| 现象 | 最可能原因 | 处理动作 |
|---|---|---|
| 画了忽略区域,水印还是混进来 | 框没包住整个文本块,或没保存配置 | 重画更大的框,确认配置已保存 |
| 代码截图缩进、空格全丢 | 排版方案不保留缩进 | 方案切"单栏-保留缩进" |
| 长图识别缺胳膊少腿 | 图像超过"限制图像边长"阈值 | 调高该数值,别放大原图 |
显示与加载:
| 现象 | 最可能原因 | 处理动作 |
|---|---|---|
| 截图时闪烁、界面错位 | 显卡渲染不兼容 | 全局设置 → 界面和外观 → 渲染器,换方案或关硬件加速 |
| 几万个文件的文件夹加载很卡 | 超大文件夹同步加载 | v2.1.5 起为异步加载,等预览进度走完再操作 |
| 内存占用偏高 | PaddleOCR 线程与内存默认值 | v2.1.4 起默认限制在系统内存一半以内,插件配置里再调低线程数 |
任务与命令行:
| 现象 | 最可能原因 | 处理动作 |
|---|---|---|
| 批量任务想中途休息 | 旧版本不支持暂停 | 升级到 v2.1.2 以上,用"暂停任务",休眠后可继续 |
| 命令行没反应 | HTTP 服务关闭,或用了备用启动器 | 确认 HTTP 服务开启(默认开启,仅监听本地环回),用主程序Umi-OCR.exe |
仍解决不了,查更新日志的版本说明,确认该问题是否已在更新版本修复。
无界面用法:命令行与本地 HTTP 服务
两条程序化入口,把 Umi-OCR 接进脚本和快捷键工具。
命令行入口就是主程序Umi-OCR.exe,指令支持简写(--screenshot可写--sc):
umi-ocr --screenshot --clip umi-ocr --path "D:/扫描件.png" --output result.txt umi-ocr --qrcode_create "你好" "D:/qrcode.png" 256第一条截屏识别,结果直接进剪贴板;第三条生成 256 像素的二维码图。完整参数见命令行手册。
本地 HTTP 服务在软件启动后就提供 OCR、文档识别、二维码三类接口,几十行代码就能封装成局域网小工具,实现"上传图片 → 返回 JSON 结果"。默认只监听本地环回,图片与结果都留在自己电脑里;需要局域网共享时,把主机切换为"任何可用地址"。细节见HTTP 接口手册。
免费、开源、完全离线,识别引擎整套装在你自己的硬盘上。从一张随手截图到一整本扫描书归档,文字的产出始终在你手里。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考