news 2026/8/15 12:08:38

如何用Umi-OCR免费离线OCR快速提取文字:从截图识别到批量文档处理的完整指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如何用Umi-OCR免费离线OCR快速提取文字:从截图识别到批量文档处理的完整指南

如何用Umi-OCR免费离线OCR快速提取文字:从截图识别到批量文档处理的完整指南

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

你有没有遇到过这样的时刻:网课PPT上的重点、扫描版合同里的条款、PDF里复制不出来的报错代码——屏幕上明明有字,却怎么都拿不到手。手动敲一遍?费时费力还容易出错。改用在线OCR?要么收费限次,要么上传后等半天,更关键的是你的文件被送去了别人的服务器,隐私毫无保障。

Umi-OCR就是为这个场景而生的。它是一款完全免费、开源的离线OCR软件,支持截图识别、批量图片识别、PDF文档识别、二维码扫描与生成,解压即用、全程断网运行,识别引擎和语言模型全部内置在本地。下面这份完整指南会带你从零上手,把它的每一个实用功能都变成你日常工作的趁手工具。

三步完成Umi-OCR安装与首次截图识别

很多人以为这种"本地OCR引擎"的软件安装起来会很折腾,其实恰恰相反。Umi-OCR贯彻了"解压即用"的原则,从下载到第一次识别,你只需要三步。

第一步:下载并解压。从项目发布页拿到.7z.7z.exe自解压包(比如仓库根目录的Umi-OCR_Rapid_v2.1.5.7z)。自解压包的好处是,哪怕电脑上没装任何压缩软件,双击也能解压。Windows用户也可以用 Scoop 一行命令装好:scoop install extras/umi-ocr

第二步:启动程序。解压后进入文件夹,双击Umi-OCR.exe,软件即启动。不需要安装向导,不需要配置环境变量,更不需要注册账号。

第三步:按下快捷键,框选屏幕。软件默认自带全局截图快捷键,你也可以在"全局设置"里改成顺手的组合键。按下快捷键后,屏幕上会出现一个选框,拖拽框住你想识别的区域,松手,识别结果就出现在界面里了,文本已经自动复制到剪贴板,直接Ctrl+V粘贴即可。

图为Umi-OCR截图识别界面:左侧保留原始截图,右侧实时给出识别文本,全程离线完成。

这里有个小细节:如果你正在看一篇网页文章或聊天记录,也可以直接选中内容截图复制到剪贴板,然后在Umi-OCR界面里按Ctrl+V粘贴图片,同样能触发识别。软件不限制文字必须来自截图,任何能进剪贴板的图片都行。

离线OCR原理拆解:不联网也能读字的秘密

你可能会好奇:不联网,它凭什么认字?这里要先解释一个概念。OCR全称"光学字符识别"(Optical Character Recognition),说白了就是教电脑"看"图片里的字形,再"念"成可编辑的文本。

在线OCR的思路是把图片传到云端服务器去"念",结果再传回来;而Umi-OCR反其道而行——它把"念字"的模型直接装在你自己的电脑里,所有计算都在本地完成。所以它不依赖网络、不产生流量、更不会把你的文件泄露出去

为了保证不同电脑上都能跑得顺,Umi-OCR内置了两套可以自由切换的离线OCR引擎,你可以把它们理解成两个风格不同的"阅读员":

引擎特点适合场景
PaddleOCR-json识别速度较快追求效率、硬件性能较好的电脑
RapidOCR-json兼容性好、更省资源低配置电脑、老旧系统

切换方式很简单:在"全局设置"的插件区域选择引擎即可,无需重启。两个引擎都支持简体中文、繁体中文、英文、日文等多语言识别库,识别时还能混合识别中英文混排内容。

除了引擎,另一个容易被忽视但极其重要的组件是排版解析。OCR引擎识别出的其实是一个个带坐标的"文字块",如果直接按识别顺序输出,多栏报纸、杂志、代码截图这类排版就会乱成一团。Umi-OCR内置了一套文本块后处理模块,会根据文字块的位置关系智能判断阅读顺序,就像人工排版一样把段落理顺。

截图OCR实战:把屏幕文字变成可复制的文本

截图识别是Umi-OCR使用频率最高的功能,也是它最拿手的场景。完成首次识别后,你会发现右侧记录面板里不仅能看到文本,还能对历史记录做各种操作。

  • 鼠标划选任意识别结果,直接拖出即复制;
  • 在结果上右键,可以复制单条、复制全部、清空记录;
  • 预览区可以一键隐藏文本,方便对照原图检查识别质量。

更关键的是"设置"面板里的排版解析方案,它决定了识别结果以什么形式输出。针对不同内容,选择也不同:

方案适用场景
多栏-按自然段换行报纸、论文、杂志等多栏排版(最常用)
单栏-保留缩进代码截图,保留行首缩进和空格
单栏-总是换行普通单栏文章、聊天记录
不做处理需要引擎原始输出时

举个例子:你截了一张Python代码图,如果默认方案把缩进全丢了,代码就没法直接用了;切换到"单栏-保留缩进",识别结果就能基本还原代码结构。切换后无需重新截图,软件会立即用新方案重新整理已有结果,方便你对比效果。

批量OCR实战:几百张图片一次识别,水印干扰这样排除

截图识别适合"零星作战",但当你手头有几百张图片需要处理时,就该批量OCR登场了。这个页面支持把整个文件夹拖进来,甚至能递归扫描子文件夹,任务数量没有上限,一次导入上千张也没问题。

导入后点"开始任务",右侧会实时显示每张图片的处理状态和识别置信度。全部完成后,你可以一键把结果保存为txtjsonlmdcsv(Excel可直接打开)格式,还能设置任务完成后自动关机或休眠——晚上挂机批量处理,第二天早上直接收结果。

图为Umi-OCR批量OCR界面:左侧任务列表实时显示进度与置信度,右侧汇总识别结果。

批量识别最头疼的问题是什么?水印和页眉页脚。比如你要识别一批带网站水印的截图,水印文字会被当成正文识别出来,污染结果。Umi-OCR为此提供了"忽略区域"功能:在编辑器里用鼠标右键拖出矩形框,框住水印可能出现的位置,这些区域内的文字块就会在识别时被跳过。注意,框要画得比水印大一些,因为只有完全位于框内的整个文字块才会被忽略,框小了反而放跑了水印。

PDF文档识别进阶:扫描件秒变可搜索的双层PDF

如果说前两个功能是"常规操作",那么PDF文档识别就是Umi-OCR的进阶大招。它支持pdfxpsepubmobifb2cbz等多种文档格式,能对付两种截然不同的场景:

场景一:提取电子书原有文本。某些PDF虽然自带文字层,但出于加密或格式原因无法复制,Umi-OCR可以直接把内嵌文本提取出来,速度飞快。

场景二:OCR扫描件,输出双层PDF。这才是重头戏。扫描版PDF本质上就是一张张图片,普通工具只能识别成纯文本,排版信息全丢了。Umi-OCR会生成一种"双层可搜索PDF":底层保留原始扫描图像,保证观感和版面不变;顶层叠放一层透明不可见的文本,让你能搜索、复制、选中。你可以把它想象成一块"三明治"——图像是面包,透明文本是夹心,两个图层按像素坐标精确对齐。

转换时同样支持"忽略区域",你可以框选掉每一页的页眉页脚,让生成的文本层干净整洁。相关细节在官方更新日志 CHANGE_LOG.md 中有完整记录,从v2.1.0引入文档识别到后续的坐标旋转修复、单层PDF支持,功能一直在持续打磨。

Umi-OCR命令行与HTTP接口:把离线OCR嵌入工作流

如果你以为Umi-OCR只是个人工操作的工具,那就低估它了。它还开放了命令行HTTP接口,这意味着你可以把它接进自己的脚本和工作流,实现真正的自动化。命令行调用入口就是主程序本身,所有指令都支持缩写:

# 鼠标框选截图并识别 umi-ocr --screenshot # 识别指定图片或文件夹,结果输出到文件 umi-ocr --path "D:/扫描件" --output "结果.txt" # 识别剪贴板里的二维码 umi-ocr --qrcode_read # 生成一个二维码图片 umi-ocr --qrcode_create "https://example.com" "D:/码.png"

底层机制很有意思:命令行指令其实是借助HTTP接口,在系统内部的本地环回地址(不经过物理网卡)把请求传给后台的Umi-OCR进程,所以通信不会泄露到外部,可以放心使用。HTTP接口的完整参数说明见 docs/http/api_doc.md,支持OCR、二维码识别/生成、文档识别等能力,用Python或Node写个几十行的脚本,就能把它变成你自己的离线OCR服务。

另外,二维码页还支持一图多码识别,兼容Code128、DataMatrix、PDF417等19种协议,配合生成功能,可以做很多有意思的小工具。

Umi-OCR使用避坑指南:识别不准、闪屏的解决办法

用了一段时间,你可能会遇到下面这些问题。别慌,大多数都有标准解法:

问题最快解决办法
超大长图识别失败或报错在页面"设置→文字识别→限制图像边长"里调高数值
识别准确率不理想切换另一套OCR引擎;检查识别语言是否包含目标语种;换用更合适的排版解析方案
截屏时画面闪烁、UI错位"全局设置→界面和外观→渲染器"切换渲染方案,或关闭硬件加速
批量任务处理到一半被中断v2.1.2起支持暂停任务,不退出软件,休眠后也能恢复
想排查某个Bug用命令行启动可看实时日志,ERROR级别日志保存在UmiOCR-data/logs目录

图为Umi-OCR全局设置界面:语言、主题、字体、渲染器等基础参数都可以在这里一次性配好。

软件启动时会根据系统语言自动切换界面语言,也支持手动在全局设置里改为简体中文、繁体中文、英语、日语、俄语等。如果你用的是Linux系统,从v2.1.3开始Umi-OCR也已官方支持,还提供了Docker部署方案。

总结:免费离线OCR,从今天开始解放双手

回顾一下,我们完成了从"三步上手"到"原理拆解",再到"截图、批量、PDF三大实战",最后打通"命令行与HTTP自动化"的完整闭环。Umi-OCR的价值其实就一句话:把文字识别这件事,彻底变成你本地电脑上随叫随到的免费服务——不花钱、不上传、不联网,还保留了从截图到批量文档处理的完整能力。

下一步,你可以这样做:

  1. 下载Umi-OCR解压运行,先用截图识别处理一份真实资料,感受一下速度;
  2. 阅读 docs/README_CLI.md 和 docs/http/api_doc.md,尝试把接口接进自己的脚本;
  3. 翻翻 CHANGE_LOG.md,了解每个版本的演进脉络;
  4. 如果遇到问题,带上日志去项目仓库提Issue,或者参与界面翻译,给开源社区添一把火。

扫描件、截图、论文、合同——从今天起,它们都会变成你随时可以搜索和复制的文字。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/15 12:08:10

大模型健康度监测:从基础设施到认知层的全链路运维实践

1. 项目概述:从“炼丹”到“养兵”,智能模型运维的必然之路在AI领域,尤其是大模型应用落地的深水区,一个普遍的现象是:团队花费数月甚至数年,投入巨大资源“炼丹”(训练模型)&#x…

作者头像 李华
网站建设 2026/8/15 12:04:39

Obsidian PDF标注效率翻倍:PDF++安装到进阶

Obsidian PDF标注效率翻倍:PDF安装到进阶 【免费下载链接】obsidian-pdf-plus PDF: the most Obsidian-native PDF annotation & viewing tool ever. Comes with optional Vim keybindings. 项目地址: https://gitcode.com/gh_mirrors/ob/obsidian-pdf-plus …

作者头像 李华
网站建设 2026/8/15 12:04:36

阿里巴巴对话交互面试,LLM指令解析光看还不够还得摸得准

继续阿里巴巴的连载。阿里巴巴篇聊完,这篇换到多模态对话与机器人执行工程师视角,把LLM指令解析单独拎出来说透。 LLM指令解析:从输入到异常,一条线讲完 阿里巴巴面试多模态对话与机器人执行工程师时,LLM指令解析是绕不开的考点。面试官喜欢让候选人先讲自己的理解,再逐…

作者头像 李华
网站建设 2026/8/15 12:02:29

麒麟系统密码重置:GRUB引导与救援模式实战指南

1. 项目概述:当系统密码成为“拦路虎”在国产化替代的大背景下,麒麟操作系统(包括银河麒麟和中标麒麟)正被越来越多的政府、企事业单位所采用。作为一名长期与各类操作系统打交道的IT运维人员,我经常遇到一个看似基础却…

作者头像 李华
网站建设 2026/8/15 12:01:55

Windows黑屏仅鼠标能动?从原理到实战的完整修复指南

1. 问题现象与核心原因剖析“电脑黑屏,只有鼠标箭头能动”,这大概是每个Windows用户最不想遇到,但又几乎都绕不开的经典故障之一。前一秒还在正常操作,下一秒屏幕就突然一黑,只剩下那个孤零零的鼠标指针,任…

作者头像 李华