Umi-OCR 离线OCR新手指南:从下载到第一次批量跑通
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
开篇速览
Umi-OCR 是一款免费、开源的离线文字识别(OCR)工具,能把截图、图片、PDF 里的文字转成可编辑文本,支持二维码识别与批量处理,全程不联网、在本地完成。
它解决的是图片转文字的痛点:走在线工具要一张张上传,免费额度有限制,敏感内容还不敢传;用付费软件则按月掏钱。Umi-OCR 把离线引擎打包在软件里,不登录账号、不依赖网络、不限识别数量,解压就能用。
它和同类工具的差别也很明显:不是大而全的按钮堆叠,而是"标签页"形态——截图OCR、批量OCR、文档识别、二维码各占一个页签,用到哪个开哪个;OCR 引擎本身也是插件,随时能换另一套,不用重装软件。
从下载到跑通
先拿包。从项目官方发布渠道下载最新的发行包;仓库根目录里也放了一份现成的 Umi-OCR_Rapid_v2.1.5.7z,自带 Rapid-OCR 引擎,可直接使用。包是.7z或.7z.exe格式,后者是自解压包,在没有装压缩软件的电脑上也能直接运行。
解压路径建议放简单一点:不放中文、空格和特殊字符,比如D:\Tools\Umi-OCR。这一个习惯能省下后面大部分稀奇古怪的麻烦。
Windows 启动:解压完双击即可
- 双击解压目录根部的
Umi-OCR.exe。首次启动需要几秒钟,界面语言会按你的系统语言自动选。 - 双击没反应的话,进入
UmiOCR-data目录,改用备用启动器RUN_GUI.bat。 - 遇到 SmartScreen 提示时,点"更多信息"再选"仍要运行"。
Linux 启动:多敲一条命令
Linux 版面向 x64 系统,需要 glibc 2.31 及以上(Ubuntu 20.04+、Debian 11+ 的主流版本都满足,终端执行ldd --version可查看)。解压后进入包目录:
chmod +x umi-ocr.sh ./umi-ocr.shLinux 下默认不请求管理员权限,配置文件都放在用户目录里。
跑起来之后,你看到的就是标签页主界面。先不用管太多,记住四个页签就够:截图OCR、批量OCR、文档识别、二维码,正好对应下面四个任务。
划重点:免安装、解压即用;Windows 双击 exe,Linux 跑 sh 脚本;路径放纯英文目录能挡掉大部分怪问题。
场景实战
别记功能,记任务。下面四个是最常干的活。
把一张截图变成可编辑文本
目标:圈选屏幕上想转的文字区域,拿到剪贴板里。
操作路径:打开"截图OCR"页签 → 按你设好的快捷键,或点页面里的截图按钮 → 鼠标框选区域后松手。左栏是图片预览,可直接用鼠标划选复制;右栏是识别记录,能编辑文字,还能划选多条记录一起复制。
关键配置开关:页面下方的"文本后处理"。默认方案"多栏-按自然段换行"适合大多数文字;代码截图换成"单栏-保留缩进",行首缩进才会留下来。
省时间小技巧:在"全局设置"里给截图OCR设一个全局快捷键(比如 Ctrl+Alt+O),之后一个键就进截图模式,Esc 取消;剪贴板里已有的图片也可以直接粘贴到这一页识别,不用先存盘。
💡 单张图走截图识别最快,一目录的图请换下一页。
一次性处理整目录图片
目标:几百张图片一次识别完,输出成文本文件,方便后续处理。
操作路径:打开"批量OCR"页签 → 点"添加图片"选文件,或直接把图片、文件夹拖进窗口(支持 jpg、png、webp、bmp、tif 等格式)→ 选输出格式和目录 → 开始任务。输出支持txt、jsonl、md、csv(Excel)四种格式。
关键配置开关:两个大概率会用到。一是"忽略区域":图片里有水印、LOGO 时,在批量识别右栏打开编辑器,按住右键画矩形框,框内文字不会出现在结果里。二是"页面设置 → 文字识别 → 限制图像边长":遇到超大图、长图识别不了时把数值调高。
省时间小技巧:勾上"任务完成后自动关机/待机",睡前丢一批文件进去,早上起来结果已经躺在那了。
把扫描件 PDF 变成可搜索的文档
目标:从纯扫描版 PDF 里提取文字,或输出"双层可搜索PDF"——文字在上、图片在下,文档既能搜又能选。
操作路径:打开"文档识别"页签 → 添加pdf、xps、epub、mobi等文件 → 开始任务。
关键配置开关:输出端选双层可搜索PDF或纯文本;也可以设置任务完成后自动关机。
省时间小技巧:带页眉页脚、页码的书,用"忽略区域"把固定位置框掉再跑,结果比事后手动清理干净得多。
读一张图里的二维码
目标:从照片里的二维码、条形码提取链接或文字;反过来,把一段文本生成二维码图片。
操作路径:打开"二维码"页签 → "扫码"一栏,截图、粘贴或拖入本地图片 → 结果直接显示在页面上。支持一图多码,覆盖 QRCode、EAN13、DataMatrix 等 19 种码制;"生成码"一栏输入文本、选纠错等级即可生成图片。
关键配置开关:识别端没有开关;生成端真正有影响的只有"纠错等级",码要打印且可能磨损时选高一级。
省时间小技巧:单个码截图扫就行;要扫一批图,用命令行umi-ocr --qrcode_read "文件夹路径"整目录扫,参数细节见命令行手册。
划重点:四个页签对应四件事——截图管快、批量管多、文档管PDF、二维码管码,每页的设置互不干扰。
按你的习惯调
设置都集中在"全局设置"页签。这里只说"想达到什么效果 → 去哪改 → 改哪个值":
- 想换界面语言:全局设置 → 语言,可选简中、繁中、英语、日语等。首次启动是按系统语言自动匹配的,想换就改这里。
- 想一键唤起截图识别:全局设置里的快捷键入口,给"截图OCR"设一个组合键保存。
- 想让结果的换行排版不一样:这不在全局设置,而在每个识别页的"文本后处理"。多栏文档用"按自然段换行",代码截图用"保留缩进",要引擎原始输出就选"不做处理"。
- 想换暗色主题、调大字号:全局设置 → 界面和外观,主题、文字大小、字体都能改。
- 运行时画面闪烁、UI 错位:同一处 → 渲染器,换一个渲染方案,或关闭硬件加速。
划重点:语言、快捷键、主题在全局设置;排版方案在各识别页;画面怪就先动渲染器。
装插件:给它加新能力
Umi-OCR 的设计逻辑一句话就能说清:包括 OCR 引擎在内的所有功能都是"插件",一个插件就是一个文件夹,统一放在UmiOCR-data/plugins/目录下。
安装流程:
- 拿到插件(文件夹或压缩包形式)。
- 把整个插件文件夹放进
UmiOCR-data/plugins/。 - 重启 Umi-OCR,新插件就会出现在列表里。
切换与管理:在"全局设置"里选择当前使用的 OCR 引擎插件。可以同时装好几个引擎,用哪个切哪个,不用卸载重装。
引擎怎么选,参考这张对比:
| 引擎 | 特点 | 什么时候选 |
|---|---|---|
| Rapid-OCR | 兼容性好,发行包默认引擎 | 大多数机器,装好直接用 |
| Paddle-OCR | 识别速度稍快 | 以批量识别为主、在意速度 |
划重点:插件机制就是"往 plugins 目录丢文件夹";引擎可以多装随时切换,求稳选 Rapid,求快选 Paddle。
卡住了看这里
实际跑起来,会碰上的问题基本就这几类:
| 症状 | 解决 |
|---|---|
| 双击 exe 无反应或闪退 | 1. 换备用启动器UmiOCR-data/RUN_GUI.bat;2. 把程序挪到纯英文路径如D:\Tools;3. 解压到非系统盘并确认有读写权限 |
| 截图时闪烁、界面错位 | 1. 全局设置 → 界面和外观 → 渲染器;2. 换一个渲染方案;3. 或关闭硬件加速 |
| 大图/长图识别失败 | 1. 批量页的页面设置 → 文字识别;2. 找到"限制图像边长";3. 调高数值后重试 |
| 结果里混进水印文字 | 1. 批量识别中打开"忽略区域"编辑器;2. 按住右键画矩形包住水印;3. 框要画大,包住水印所有可能出现的位置 |
| 识别文字换行混乱 | 1. 识别页切换"文本后处理"的排版解析方案;2. 试"多栏-按自然段换行"或"单栏-无换行";3. 仍不对就换个 OCR 引擎重识别 |
划重点:八成问题集中在启动、渲染、排版方案三处,对着表格一条条改就行。
收尾
项目处于活跃迭代中(当前 v2.1.5)。提 issue、参与翻译、贡献代码都欢迎。会用了就打开试试吧。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考