news 2026/8/31 20:02:47

Umi-OCR 离线文字识别指南:免费、可批量的一站式 OCR 方案

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 离线文字识别指南:免费、可批量的一站式 OCR 方案

Umi-OCR 离线文字识别指南:免费、可批量的一站式 OCR 方案

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款开源、免费、完全离线的文字识别软件,不联网、不注册、不限字数,解压即用。截图识别、批量图片、扫描版 PDF、二维码都是它的拿手好戏,还内置多国语言界面。对需要 Umi-OCR 离线文字识别方案的人来说,这篇文章从安装到接入工作流一次讲清。

⚡ 五分钟跑通:从安装到首次识别

Windows:下载发行版,解压即用

  1. 从官方发布渠道下载发行版(.7z压缩包或.7z.exe自解压包),解压到任意目录
  2. 双击Umi-OCR.exe启动,首次打开会自动跟随系统语言
  3. 打开"截图 OCR"标签页,用快捷键唤起截图并划选区域,完成第一次识别

源码编译日常用不上,真要自建才需要单独部署运行环境,README 的"构建项目"章节有说明,这里一笔带过。

习惯命令行的用户可以用 Scoop 一条线装好:

scoop bucket add extras # 添加 extras 软件仓库 scoop install extras/umi-ocr # 安装 RapidOCR 引擎版 # 或:scoop install extras/umi-ocr-paddle(PaddleOCR 引擎版)

两个引擎版不要同时装,快捷方式会被覆盖;装完后可以通过导入插件随时切换引擎。

Linux:下载发行版 + 部署运行环境

下载 Linux 版本发行版和对应的运行库,按官方步骤部署好 Python 运行环境后,用umi-ocr.sh脚本启动即可,项目也支持 Docker 方式部署,适合服务器场景。

进软件先逛"全局设置"页:确认 HTTP 服务已开启(命令行与接口调用的前提,主机选"仅本地"即可),顺手把截图快捷键、主题、语言都配好。

按场景拆解:从截屏到批量文档

截一段屏里的字

  • 适用情境:网页、文档、软件界面里的文字选不中,或逐段复制太麻烦
  • 操作要点:打开"截图 OCR"标签页,按快捷键唤起截图、划选区域,识别结果实时出现在右侧记录栏,可直接编辑、划选复制;左侧预览栏也支持鼠标划选复制
  • 一个具体参数:在"文本后处理 - 排版解析"里选方案——代码截图选单栏-保留缩进,普通文章选多栏-按自然段换行,识别结果会按阅读习惯自动换行

批量图片 OCR 导出 Excel 或 Markdown

  • 适用情境:手里有一批图片要集中数字化,几百张也照单全收
  • 操作要点:把图片拖进"批量 OCR"页(支持 jpg/png/webp/bmp/tiff 等格式,无数量上限),勾选 txt、jsonl、md、csv(Excel) 中想要的输出格式提交任务;大文件建议勾选"任务完成后自动关机/待机"
  • 一个具体参数:识别超长图时,去"页面设置 → 文字识别 → 限制图像边长"把数值调高;图片带固定水印的,在右栏"忽略区域"编辑器按住右键画矩形框即可排除

PDF 扫描件转可搜索

  • 适用情境:纸质扫描件、图片型 PDF 无法复制文字,或者想给电子书补一层索引
  • 操作要点:打开"文档识别"页拖入文档,扫描件走 OCR 后输出双层可搜索 PDF(原图打底 + 透明文字层,可复制可检索),文本型 PDF 直接提取原有文字
  • 一个具体参数:文档页同样支持忽略区域,把固定出现在每页的页眉、页脚框掉,正文提取更干净
类型支持格式可输出
图片识别jpg, png, webp, bmp, tiff 等txt, jsonl, md, csv(Excel)
文档识别pdf, xps, epub, mobi, fb2, cbz双层可搜索 PDF、纯文本

扫个码 / 生成个码

  • 适用情境:图片里有条码/二维码要读内容,或者要把一段文本生成码图
  • 操作要点:"二维码"标签页拖入图片即可扫码,支持一图多码,覆盖 QRCode、DataMatrix、EAN13、PDF417 等 19 种协议;反向输入文本则生成码图
  • 一个具体参数:生成时可调整纠错等级与图片尺寸,产物直接保存为图片文件

接进你的工作流:CLI 与 HTTP 接口

两种调用方式共用同一个前提:全局设置页开启 HTTP 服务(默认已开启,"仅本地"即可,通信只在本地环回进行,不走物理网卡)。

最常用 CLI 命令:

umi-ocr --show # 弹出主窗口 umi-ocr --screenshot --clip # 截图识别,结果复制到剪贴板 umi-ocr --path "D:/images" # 批量识别文件夹图片(含子文件夹) umi-ocr --qrcode_read "D:/code.png" # 识别二维码 umi-ocr --qrcode_create "文本内容" "out.png" 128 # 生成 128px 二维码

HTTP 端点一句话版:

  • /api/ocr:传入 Base64 图片,返回结构化识别结果
  • /api/doc:文档识别,可下载双层 PDF 结果
  • /api/qrcode:二维码识别与文本生成码图
  • /argv:把上述 CLI 命令经 HTTP 转发执行,适合程序调用

注意后端对并发支持较弱,批量调用请串行;偶发ECONNREFUSED重试一次就好。完整参数见命令行手册与HTTP 接口手册。

🔧 调优实战:速度与精度怎么平衡

引擎二选一:

引擎特点适合场景
RapidOCR兼容性好、速度稳定,默认版本自带通用识别、老系统(Windows 7)
PaddleOCR速度稍快、语言模型可灵活配置大批量中文文档

三个实操建议:

  • 预处理:保证文字清晰可读,超大图先缩到合理尺寸再识别,速度提升最明显
  • 忽略区域:批次图片带固定水印/页眉的,先画忽略区域,比识别完再手动清洗省事
  • 分批 + 自动关机:超大数量分批提交,配合"任务完成后自动关机/待机"放一晚上跑完

资源提醒一句:批量处理高分辨率图片时引擎会持续占用内存,任务期间尽量关其他内存大户;识别异常时检查全局设置里的引擎内存清理选项。

踩坑速查:五个高频问题

  • 启动提示缺少 DLL:→ 安装 Visual C++ 运行库,或重新从官方渠道下载稳定发行版(含完整运行库)。
  • 截屏时画面闪烁、UI 错位:→ 全局设置 → 界面和外观里切换"渲染器",换成不同渲染方案或关闭硬件加速。
  • 识别结果混入水印、页眉页脚:→ 批量页"忽略区域"编辑器里按住右键画矩形框,把干扰元素完全包裹;注意只有整块落在框内的文本才会被忽略,框别画太小。
  • 批量任务跑得太慢:→ 调高"限制图像边长"、分批提交,或换用速度更快的引擎版本,配合自动关机错峰处理。
  • 命令行收不到输出:→ 系统重定向符>不生效,改用--clip--output "file.txt";命令完全无反应时,检查全局设置里 HTTP 服务是否开启。

插件生态与二次开发入口

Umi-OCR ├─ Umi-OCR.exe # Windows 主程序 ├─ umi-ocr.sh # Linux 启动脚本 └─ UmiOCR-data ├─ main.py # Python 入口 ├─ py_src/ # 业务源码 ├─ qt_res/ # 界面资源与 QML 源码 ├─ plugins/ # 插件目录:OCR 引擎等 └─ i18n/ # 多语言翻译文件

plugins/目录是扩展的核心入口,可插拔的扩展点有四类:

  • OCR 引擎:Rapid、Paddle 本身就是插件形态,也可集成新识别引擎
  • 输出格式:在 txt/jsonl/md/csv 之外扩展新的保存格式
  • 预处理:识别前对图片做清理、增强
  • 后处理:排版解析就是这个方向的现成例子,文本纠错、半全角转换都能往这里加

动手前建议先通读 README 的工程结构说明再下钻py_src/源码。

社区参与 & 项目动态

  • 翻译贡献:项目在 Weblate 平台上做界面本地化协作,可在线校对现有语言(繁中、英语、日语、俄语等)或添加新语言
  • 问题反馈:Bug 与功能请求直接提交到项目 Issue,作者维护活跃
  • 项目动态:更新日志记录了各版本细节,当前 v2.1.5 带来了日志机制、双栏模式与--reload配置重载
  • Roadmap 关键词:GPU 加速的离线 OCR、独立数学公式识别与 LaTeX 渲染、表格图片识别输出 Excel、图片翻译、macOS 平台兼容

免费、离线、可批量,Umi-OCR 把这三件事同时做到了开源 OCR 工具里,日常识别不花一分钱,敏感数据不出本机。下载发行版解压后,五分钟就能跑出你的第一次截图识别——数字化工作流,从这一张截图开始。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 20:01:55

商汤校招笔试复盘:AI公司笔试考点与备考策略全解析

2018年我参加了商汤科技校招笔试第二场,投递的是后端方向,但卷子拿在手里一翻:C/C、算法开发、大数据、数据挖掘、运维、测试的题目全在里面。很多同学考完回到群里第一句话都是"这考的是同一个岗位吗"。其实这场笔试很典型&#x…

作者头像 李华
网站建设 2026/8/31 20:01:52

商汤Android校招笔试复盘:从Binder到图片加载库的考点全解析

开头2018年秋天,我坐在商汤科技校招笔试的考场里,面对那张Android开发工程师的试卷,第一反应是“这公司的笔试怎么一股算法味儿”。说实话,当时很多同学是冲着AI公司的光环去的,以为Android岗就是考四大组件、写个界面…

作者头像 李华
网站建设 2026/8/31 20:01:34

Qwen3 在 text-generation-webui 中稳定聊满 10 轮:5 个关键配置

Qwen3 在 text-generation-webui 中稳定聊满 10 轮:5 个关键配置 【免费下载链接】textgen Open-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private. 项目地址: https://gitcode.com/GitHub_Trendi…

作者头像 李华
网站建设 2026/8/31 20:01:32

Umi-OCR 完全上手指南:快速完成离线批量图片识别

Umi-OCR 完全上手指南:快速完成离线批量图片识别 【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。…

作者头像 李华
网站建设 2026/8/31 20:00:58

基于MAVSDK与MQTT的飞控数据采集传输系统设计

简介:本资源是一套面向无人机飞控开发者的C语言跨平台实时数据采集与传输系统,适用于嵌入式开发者、飞控算法工程师及物联网通信学习者,解决无人机遥测数据低延迟获取、MAVLink协议解析与云端/地面站高效分发的核心问题。压缩包共38个文件&am…

作者头像 李华