Umi-OCR 离线文字识别指南:免费、可批量的一站式 OCR 方案
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款开源、免费、完全离线的文字识别软件,不联网、不注册、不限字数,解压即用。截图识别、批量图片、扫描版 PDF、二维码都是它的拿手好戏,还内置多国语言界面。对需要 Umi-OCR 离线文字识别方案的人来说,这篇文章从安装到接入工作流一次讲清。
⚡ 五分钟跑通:从安装到首次识别
Windows:下载发行版,解压即用
- 从官方发布渠道下载发行版(
.7z压缩包或.7z.exe自解压包),解压到任意目录 - 双击
Umi-OCR.exe启动,首次打开会自动跟随系统语言 - 打开"截图 OCR"标签页,用快捷键唤起截图并划选区域,完成第一次识别
源码编译日常用不上,真要自建才需要单独部署运行环境,README 的"构建项目"章节有说明,这里一笔带过。
习惯命令行的用户可以用 Scoop 一条线装好:
scoop bucket add extras # 添加 extras 软件仓库 scoop install extras/umi-ocr # 安装 RapidOCR 引擎版 # 或:scoop install extras/umi-ocr-paddle(PaddleOCR 引擎版)两个引擎版不要同时装,快捷方式会被覆盖;装完后可以通过导入插件随时切换引擎。
Linux:下载发行版 + 部署运行环境
下载 Linux 版本发行版和对应的运行库,按官方步骤部署好 Python 运行环境后,用umi-ocr.sh脚本启动即可,项目也支持 Docker 方式部署,适合服务器场景。
进软件先逛"全局设置"页:确认 HTTP 服务已开启(命令行与接口调用的前提,主机选"仅本地"即可),顺手把截图快捷键、主题、语言都配好。
按场景拆解:从截屏到批量文档
截一段屏里的字
- 适用情境:网页、文档、软件界面里的文字选不中,或逐段复制太麻烦
- 操作要点:打开"截图 OCR"标签页,按快捷键唤起截图、划选区域,识别结果实时出现在右侧记录栏,可直接编辑、划选复制;左侧预览栏也支持鼠标划选复制
- 一个具体参数:在"文本后处理 - 排版解析"里选方案——代码截图选
单栏-保留缩进,普通文章选多栏-按自然段换行,识别结果会按阅读习惯自动换行
批量图片 OCR 导出 Excel 或 Markdown
- 适用情境:手里有一批图片要集中数字化,几百张也照单全收
- 操作要点:把图片拖进"批量 OCR"页(支持 jpg/png/webp/bmp/tiff 等格式,无数量上限),勾选 txt、jsonl、md、csv(Excel) 中想要的输出格式提交任务;大文件建议勾选"任务完成后自动关机/待机"
- 一个具体参数:识别超长图时,去"页面设置 → 文字识别 → 限制图像边长"把数值调高;图片带固定水印的,在右栏"忽略区域"编辑器按住右键画矩形框即可排除
PDF 扫描件转可搜索
- 适用情境:纸质扫描件、图片型 PDF 无法复制文字,或者想给电子书补一层索引
- 操作要点:打开"文档识别"页拖入文档,扫描件走 OCR 后输出双层可搜索 PDF(原图打底 + 透明文字层,可复制可检索),文本型 PDF 直接提取原有文字
- 一个具体参数:文档页同样支持忽略区域,把固定出现在每页的页眉、页脚框掉,正文提取更干净
| 类型 | 支持格式 | 可输出 |
|---|---|---|
| 图片识别 | jpg, png, webp, bmp, tiff 等 | txt, jsonl, md, csv(Excel) |
| 文档识别 | pdf, xps, epub, mobi, fb2, cbz | 双层可搜索 PDF、纯文本 |
扫个码 / 生成个码
- 适用情境:图片里有条码/二维码要读内容,或者要把一段文本生成码图
- 操作要点:"二维码"标签页拖入图片即可扫码,支持一图多码,覆盖 QRCode、DataMatrix、EAN13、PDF417 等 19 种协议;反向输入文本则生成码图
- 一个具体参数:生成时可调整纠错等级与图片尺寸,产物直接保存为图片文件
接进你的工作流:CLI 与 HTTP 接口
两种调用方式共用同一个前提:全局设置页开启 HTTP 服务(默认已开启,"仅本地"即可,通信只在本地环回进行,不走物理网卡)。
最常用 CLI 命令:
umi-ocr --show # 弹出主窗口 umi-ocr --screenshot --clip # 截图识别,结果复制到剪贴板 umi-ocr --path "D:/images" # 批量识别文件夹图片(含子文件夹) umi-ocr --qrcode_read "D:/code.png" # 识别二维码 umi-ocr --qrcode_create "文本内容" "out.png" 128 # 生成 128px 二维码HTTP 端点一句话版:
/api/ocr:传入 Base64 图片,返回结构化识别结果/api/doc:文档识别,可下载双层 PDF 结果/api/qrcode:二维码识别与文本生成码图/argv:把上述 CLI 命令经 HTTP 转发执行,适合程序调用
注意后端对并发支持较弱,批量调用请串行;偶发ECONNREFUSED重试一次就好。完整参数见命令行手册与HTTP 接口手册。
🔧 调优实战:速度与精度怎么平衡
引擎二选一:
| 引擎 | 特点 | 适合场景 |
|---|---|---|
| RapidOCR | 兼容性好、速度稳定,默认版本自带 | 通用识别、老系统(Windows 7) |
| PaddleOCR | 速度稍快、语言模型可灵活配置 | 大批量中文文档 |
三个实操建议:
- 预处理:保证文字清晰可读,超大图先缩到合理尺寸再识别,速度提升最明显
- 忽略区域:批次图片带固定水印/页眉的,先画忽略区域,比识别完再手动清洗省事
- 分批 + 自动关机:超大数量分批提交,配合"任务完成后自动关机/待机"放一晚上跑完
资源提醒一句:批量处理高分辨率图片时引擎会持续占用内存,任务期间尽量关其他内存大户;识别异常时检查全局设置里的引擎内存清理选项。
踩坑速查:五个高频问题
- 启动提示缺少 DLL:→ 安装 Visual C++ 运行库,或重新从官方渠道下载稳定发行版(含完整运行库)。
- 截屏时画面闪烁、UI 错位:→ 全局设置 → 界面和外观里切换"渲染器",换成不同渲染方案或关闭硬件加速。
- 识别结果混入水印、页眉页脚:→ 批量页"忽略区域"编辑器里按住右键画矩形框,把干扰元素完全包裹;注意只有整块落在框内的文本才会被忽略,框别画太小。
- 批量任务跑得太慢:→ 调高"限制图像边长"、分批提交,或换用速度更快的引擎版本,配合自动关机错峰处理。
- 命令行收不到输出:→ 系统重定向符
>不生效,改用--clip或--output "file.txt";命令完全无反应时,检查全局设置里 HTTP 服务是否开启。
插件生态与二次开发入口
Umi-OCR ├─ Umi-OCR.exe # Windows 主程序 ├─ umi-ocr.sh # Linux 启动脚本 └─ UmiOCR-data ├─ main.py # Python 入口 ├─ py_src/ # 业务源码 ├─ qt_res/ # 界面资源与 QML 源码 ├─ plugins/ # 插件目录:OCR 引擎等 └─ i18n/ # 多语言翻译文件plugins/目录是扩展的核心入口,可插拔的扩展点有四类:
- OCR 引擎:Rapid、Paddle 本身就是插件形态,也可集成新识别引擎
- 输出格式:在 txt/jsonl/md/csv 之外扩展新的保存格式
- 预处理:识别前对图片做清理、增强
- 后处理:排版解析就是这个方向的现成例子,文本纠错、半全角转换都能往这里加
动手前建议先通读 README 的工程结构说明再下钻py_src/源码。
社区参与 & 项目动态
- 翻译贡献:项目在 Weblate 平台上做界面本地化协作,可在线校对现有语言(繁中、英语、日语、俄语等)或添加新语言
- 问题反馈:Bug 与功能请求直接提交到项目 Issue,作者维护活跃
- 项目动态:更新日志记录了各版本细节,当前 v2.1.5 带来了日志机制、双栏模式与
--reload配置重载 - Roadmap 关键词:GPU 加速的离线 OCR、独立数学公式识别与 LaTeX 渲染、表格图片识别输出 Excel、图片翻译、macOS 平台兼容
免费、离线、可批量,Umi-OCR 把这三件事同时做到了开源 OCR 工具里,日常识别不花一分钱,敏感数据不出本机。下载发行版解压后,五分钟就能跑出你的第一次截图识别——数字化工作流,从这一张截图开始。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考