Umi-OCR 离线OCR使用指南:免费识别截图、图片与PDF
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费、开源、离线运行的 OCR 软件。它把文字识别整个放在你本地电脑上完成,屏幕截图、图片文件、PDF 文档、二维码都能处理,不上传、不联网。内置多种语言识别库,解压即用。适合经常要从截图里抠文字、要批量转换扫描件、或想把识别能力接到自己脚本里的个人和团队。
🖥️ 装好软件,跑通第一次识别
获取方式二选一。想直接用预编译版,下载发行包(.7z压缩包或.7z.exe自解压包),解压后双击Umi-OCR.exe即可,无需安装。想从源码构建,则克隆仓库:
git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR软件首次打开时,会按你系统的语言设置自动切换界面语言,之后可在“全局设置 → 语言”里手动改,支持简中、繁中、英文、日语等。
跑通第一次识别,走最短路径:
- 打开“截图OCR”标签页,按默认快捷键
Ctrl+Shift+A框选屏幕一块区域。 - 几秒后,左侧预览栏显示原图,右侧记录栏显示识别出的文字。
- 在记录栏划选文字即可复制;或在预览栏用鼠标框选直接复制。
除了快捷键截图,还能在别处复制一张图片,直接粘贴进软件识别。看到结果出现在记录栏,说明环境已经跑通。
📄 拿它做什么:四类识别任务
Umi-OCR v2 由若干标签页组成,你按需打开。下面按“你想解决什么问题”来对应功能。
屏幕上的文字:截图OCR
适合从技术文档、聊天记录、报错弹窗里提取文字。左侧预览栏支持鼠标划选复制,右侧记录栏可以编辑文字,也能多选几条记录一起复制。对代码截图,切到“单栏-保留缩进”方案,行首空格和缩进会原样保留,复制进 IDE 基本不用再调。
成堆的图片:批量OCR
适合一次处理几百张扫描图、截图归档。把文件夹或一批图片拖进来即可,支持jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff,没有数量上限。识别结果可保存为txt、jsonl、md、csv(Excel)四种格式,任务结束后还能设置自动关机或待机。遇到超长的图片,记得在“页面的设置 → 文字识别 → 限制图像边长”里把数值调高,避免大图被压缩丢字。
整本扫描件:文档识别
适合把 PDF 扫描件变成能搜索的文字。支持pdf / xps / epub / mobi / fb2 / cbz,对扫描件做 OCR,或提取已有文本,输出双层可搜索 PDF。也能设置忽略区域,把每页重复出现的页眉页脚排除掉。
码图:二维码识别与生成
适合从图片里读出二维码、条形码内容,或反过来把文本生成码图。识别支持一图多码,覆盖QRCode、DataMatrix、PDF417、EAN13等 19 种协议;生成时可设置纠错等级等参数。
🎯 识别结果不顺眼?这样调
识别出来的文字顺序乱了、格式不对,多半是排版没选对。Umi-OCR 用“排版解析方案”来整理识别结果的顺序和换行,按下表选:
| 你识别的是什么 | 选哪个方案 | 效果 |
|---|---|---|
| 双栏学术论文、报告 | 多栏-按自然段换行(默认) | 自动识别多栏,按自然段换行 |
| 代码截图 | 单栏-保留缩进 | 保留行首缩进与行内空格 |
| 报纸杂志等密集排版 | 多栏-总是换行 | 每句话单独换行 |
| 普通单栏文本 | 单栏-按自然段换行 | 不区分多栏,按段换行 |
| 要原始输出 | 不做处理 | 直接给引擎原始结果 |
这些方案都自动兼容横排和竖排(竖排还需要引擎本身支持)。
结果里混进不想要的文字,比如水印、LOGO、页脚,用“忽略区域”:在批量页右栏进入忽略区域编辑器,按住右键画几个矩形框,把干扰区域整个包住。处于框内的整块文本会被丢弃,框外内容照常保留。
引擎方面,Umi-OCR 内置RapidOCR-json和PaddleOCR-json两套离线引擎。日常识别用默认的 RapidOCR 兼容性好;追求速度可切到 PaddleOCR,在“全局设置 → 切换OCR插件”里换即可。
🔌 让脚本和别的系统调用它
命令行
入口就是主程序,umi-ocr --help查看全部说明。常用几条:umi-ocr --screenshot唤起截图识别,umi-ocr --path "D:/img1.png"识别指定文件或文件夹,结果用--clip复制到剪贴板、用--output "result.txt"写入文件。命令行依赖软件内置的 HTTP 服务通信(默认开启,主机选“仅本地”即可),过程只在系统本地环回进行。完整参数见 命令行手册。
HTTP 接口
在“全局设置”里勾选 HTTP 服务后,就能用 RESTful 接口调用。默认端口是1224,图片识别入口为http://127.0.0.1:1224/api/ocr,建议先请求/api/ocr/get_options查一次可传参数(语言、排版方案、忽略区域、返回格式等),再按需发起识别。文档识别、二维码各有独立接口。注意后端并发能力有限,尽量串行调用。详细字段见 HTTP接口手册。
更多资料在哪
遇到具体问题,建议按顺序查这几份材料:参数和字段以 HTTP接口手册 和 命令行手册 为准;界面功能细节看仓库根目录的 README.md;新功能与改动记录见 更新日志。
Umi-OCR 把识别能力留在本地,从一次截图到成批扫描、再到接口对接,都是同一套引擎在跑。先把上面四类任务各跑一遍,找到自己最常用的那个标签页,剩下的就是调排版和忽略区域这类细活。想深入定制语言库或引擎,或是对翻译、插件有兴趣,可以翻源码和插件目录,或在社区提问交流。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考