news 2026/8/31 13:15:48

Umi-OCR 实战指南:免费离线 OCR,快速搞定截图、批量图片与 PDF 文字提取

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 实战指南:免费离线 OCR,快速搞定截图、批量图片与 PDF 文字提取

Umi-OCR 实战指南:免费离线 OCR,快速搞定截图、批量图片与 PDF 文字提取

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源、离线运行的 OCR 软件:识别全程在本地完成,不上传数据、不依赖网络。它覆盖截图识别、批量图片识别、PDF 文档提取和二维码扫描,支持 Windows 与 Linux,适合偶尔取字的日常用户,也适合需要整批处理扫描件、图片的办公场景。

一分钟速览:Umi-OCR 是什么、适合谁

维度说明
定位离线 OCR 工具,覆盖截图、批量图片、PDF、二维码四类任务
费用完全免费,代码开源,无订阅、无次数限制
隐私识别全部本地完成,离线可用
系统Windows(含 Win7 x64)、Linux x64
形态解压即用,无需安装,方便在不同电脑间迁移
引擎内置 RapidOCR / PaddleOCR,可随时切换
调用方式图形界面、命令行、HTTP 接口三种

从零到一:下载、启动与验证首次识别

  1. 从项目仓库的发行版(Release)中下载发布包:.7z压缩包适合已有压缩软件的电脑,.7z.exe自解压包适合没有解压工具的电脑。
  2. 解压到任意目录(路径建议不含中文和空格),双击Umi-OCR.exe启动,全程无需安装。
  3. 首次启动会按系统语言自动选择界面;如需切换,进入全局设置 → 语言即可,内置中文、繁体、英文、日文等语言。

验证是否跑通:打开截图OCR标签页,按快捷键(默认 F9)划选屏幕上任意一段文字,右侧记录栏出现识别结果,能直接划选复制,即说明环境正常。这一步同时完成了"获取 → 启动 → 出结果"的完整闭环。

实战走查:四个高频任务的照做步骤

任务一:如何从屏幕截图里快速取出文字

  1. 打开截图OCR标签页,按 F9 唤起截图,框选目标区域(按 Esc 可取消)。
  2. 左侧图片预览栏显示识别到的文字位置,可直接用鼠标划选复制;右侧识别记录栏支持编辑文字、跨多条记录划选后一次性复制。
  3. 不想截图也行:在别处复制一张图片后,回到本页直接粘贴即可识别。
  4. 在页面设置中选择"文本后处理 - 排版解析方案":多栏文档选多栏-按自然段换行,解析代码截图选单栏-保留缩进,横排竖排都能自动处理。

任务二:如何批量识别几十上百张图片并导出结果

  1. 打开批量OCR标签页,把图片文件或整个文件夹拖入窗口,没有数量上限,几百张也可以排队处理。
  2. 支持jpg / png / webp / bmp / tif等常见格式;识别进度和每张图片的置信度实时显示,任务可随时暂停、休眠后恢复。
  3. 勾选输出格式:txt / jsonl / md / csv(Excel),一次处理可同时导出多种格式。
  4. 遇到带水印、LOGO 的图片:在右栏进入"忽略区域"编辑器,按住右键画出若干矩形框住水印位置。只有完全落在框内的文本块会被忽略,框尽量画大一点,包住房印可能出现的全部位置。
  5. 长图、超大图识别不全时,把页面的设置 → 文字识别 → 限制图像边长的数值调高再提交任务。

任务三:如何把扫描版 PDF 转成可搜索、可复制的文档

  1. 打开文档识别标签页,拖入文档,支持pdf / xps / epub / mobi / fb2 / cbz
  2. 软件会先尝试提取文档自带文本;扫描版图片页则走 OCR 流程,也可输出双层可搜索 PDF——原样保留视觉排版,同时叠加一层可复制、可全文检索的文本。
  3. 用"忽略区域"框住页眉页脚位置,避免页码、公司抬头混进正文。
  4. 多个文档可批量提交;如果任务要跑一整夜,还可以设置完成后自动关机/休眠。

任务四:如何扫码或生成二维码

打开二维码标签页即可,截图、粘贴或拖入本地图片均可识别,支持一图多码,覆盖 QR、DataMatrix、PDF417 等 19 种协议。反过来,输入一段文本可生成二维码图片,并支持调节纠错等级等参数——线下物料、文档里嵌入二维码时都能用到。

效率调优:OCR 引擎、排版解析与参数怎么选

  • 引擎取舍:全局设置中可切换 OCR 插件。PaddleOCR 精度表现更好,适合对准确率要求高的场景;RapidOCR 处理速度更快、兼容性好,适合大批量简单文档。不确定的话先用默认,同一类任务各试一次再固定下来。
  • 排版解析:识别顺序乱、换行奇怪,多半是方案没选对。多栏文档优先多栏-按自然段换行;要求逐行输出的选总是换行;代码截图选单栏-保留缩进,能保住行首空格。
  • 图像参数:大图、长图先调高"限制图像边长";模糊、倾斜严重的图片,先裁剪放大到文字清晰再识别,比任何参数都有效。
  • 界面参数:全局设置页还能调整主题、字体大小、渲染器(出现截图闪烁、UI 错位时切换渲染方案通常能解决),详见 README 的全局设置说明。

集成与扩展(简版):命令行与 HTTP 接口

面向脚本和自动化的同学,Umi-OCR 提供两种外部调用方式:

  • 命令行:入口就是Umi-OCR.exe,例如对指定目录做识别并导出文件:

    umi-ocr --path "D:/images" --output "result.txt"

    完整指令(截屏、剪贴板、二维码、结果输出控制)见 命令行手册。

  • HTTP 接口:在全局设置中允许 HTTP 服务(默认开启,主机选"仅本地"即可)后,就能通过 RESTful 接口发送图片识别、文档识别、二维码请求,参数与流程详见 HTTP 接口手册 和 接口文档。

排障手册:高频问题与对策

  • 识别结果错字多、顺序乱→ 先确认原图文字是否清晰可辨;再换排版解析方案或引擎;外文识别注意选择对应语言库。
  • 批量任务耗时太长→ 改用 RapidOCR 引擎;大图先调高"限制图像边长";把任务排到空闲时段,并开启完成后自动关机。
  • 截图或粘贴识别后没有结果→ 检查截图区域是否真的包含文字;粘贴方式需要剪贴板里是图片而非文本;识别记录栏支持划选复制,别漏看右侧面板。
  • 命令行执行umi-ocr无响应→ 确认全局设置中已允许 HTTP 服务(默认开启);命令行依赖本地回环通信,主机保持"仅本地"即可。
  • Linux 上截图位置偏移或界面错位→ 到全局设置 → 界面和外观 → 渲染器切换渲染方案或关闭硬件加速。

写在最后

Umi-OCR 把"截图取字、批量导文、PDF 数字化"这几件高频事收进了一个免费离线的工具里,按需取用即可。更多功能细节、更新计划可查阅 CHANGE_LOG.md;遇到问题或想参与界面翻译,欢迎到项目 Issue 和 Weblate 协作页面反馈。

核心关键词:离线OCR、免费OCR软件、Umi-OCR长尾关键词:截图文字识别、批量图片OCR、PDF转可搜索文档、PDF文字提取、开源OCR项目、二维码识别生成

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 13:11:43

PicoPro Glitch一键IDM模板:从参数到故障艺术效果实战

在 PicoPro 的处理流程里,Glitch 功能本身并不难找,难的是参数多且互相影响。RGB 通道分离、横向撕裂、扫描线、噪点、波形抖动,每一项单独调一遍,再组合起来检查效果,通常要花掉几十分钟,而且换一段素材后…

作者头像 李华
网站建设 2026/8/31 13:10:21

Files.md任务管理:把Chat.md变成无压力待办清单的Later机制详解

Files.md任务管理:把Chat.md变成无压力待办清单的Later机制详解 【免费下载链接】files.md 🌱 Private, quiet space for thinking. Simple app for .md files. 项目地址: https://gitcode.com/GitHub_Trending/fi/files.md Files.md 是一款本地优…

作者头像 李华
网站建设 2026/8/31 13:07:45

闲置设备算力变现:AI算力共享系统技术拆解

在 AI 算力成本居高不下的今天,一个叫 Leiolai 的项目把“闲置设备算力”做成了可以变现的商品:用户把手机、电脑、家用服务器空闲时的计算能力贡献给平台,平台将这部分算力用于 AI 相关任务,并向用户支付报酬。标题里的 Show HN …

作者头像 李华
网站建设 2026/8/31 13:06:13

4GB 显存够用:DeepSpeed 在 Windows 上跑通全流程的完整指南

4GB 显存够用:DeepSpeed 在 Windows 上跑通全流程的完整指南 【免费下载链接】DeepSpeed DeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective. 项目地址: https://gitcode.com/Gi…

作者头像 李华