news 2026/9/6 23:16:59

Umi-OCR 离线OCR使用指南:免费识别截图、图片与PDF

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 离线OCR使用指南:免费识别截图、图片与PDF

Umi-OCR 离线OCR使用指南:免费识别截图、图片与PDF

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源、离线运行的 OCR 软件。它把文字识别整个放在你本地电脑上完成,屏幕截图、图片文件、PDF 文档、二维码都能处理,不上传、不联网。内置多种语言识别库,解压即用。适合经常要从截图里抠文字、要批量转换扫描件、或想把识别能力接到自己脚本里的个人和团队。

🖥️ 装好软件,跑通第一次识别

获取方式二选一。想直接用预编译版,下载发行包(.7z压缩包或.7z.exe自解压包),解压后双击Umi-OCR.exe即可,无需安装。想从源码构建,则克隆仓库:

git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR

软件首次打开时,会按你系统的语言设置自动切换界面语言,之后可在“全局设置 → 语言”里手动改,支持简中、繁中、英文、日语等。

跑通第一次识别,走最短路径:

  1. 打开“截图OCR”标签页,按默认快捷键Ctrl+Shift+A框选屏幕一块区域。
  2. 几秒后,左侧预览栏显示原图,右侧记录栏显示识别出的文字。
  3. 在记录栏划选文字即可复制;或在预览栏用鼠标框选直接复制。

除了快捷键截图,还能在别处复制一张图片,直接粘贴进软件识别。看到结果出现在记录栏,说明环境已经跑通。

📄 拿它做什么:四类识别任务

Umi-OCR v2 由若干标签页组成,你按需打开。下面按“你想解决什么问题”来对应功能。

屏幕上的文字:截图OCR

适合从技术文档、聊天记录、报错弹窗里提取文字。左侧预览栏支持鼠标划选复制,右侧记录栏可以编辑文字,也能多选几条记录一起复制。对代码截图,切到“单栏-保留缩进”方案,行首空格和缩进会原样保留,复制进 IDE 基本不用再调。

成堆的图片:批量OCR

适合一次处理几百张扫描图、截图归档。把文件夹或一批图片拖进来即可,支持jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff,没有数量上限。识别结果可保存为txtjsonlmdcsv(Excel)四种格式,任务结束后还能设置自动关机或待机。遇到超长的图片,记得在“页面的设置 → 文字识别 → 限制图像边长”里把数值调高,避免大图被压缩丢字。

整本扫描件:文档识别

适合把 PDF 扫描件变成能搜索的文字。支持pdf / xps / epub / mobi / fb2 / cbz,对扫描件做 OCR,或提取已有文本,输出双层可搜索 PDF。也能设置忽略区域,把每页重复出现的页眉页脚排除掉。

码图:二维码识别与生成

适合从图片里读出二维码、条形码内容,或反过来把文本生成码图。识别支持一图多码,覆盖QRCodeDataMatrixPDF417EAN13等 19 种协议;生成时可设置纠错等级等参数。

🎯 识别结果不顺眼?这样调

识别出来的文字顺序乱了、格式不对,多半是排版没选对。Umi-OCR 用“排版解析方案”来整理识别结果的顺序和换行,按下表选:

你识别的是什么选哪个方案效果
双栏学术论文、报告多栏-按自然段换行(默认)自动识别多栏,按自然段换行
代码截图单栏-保留缩进保留行首缩进与行内空格
报纸杂志等密集排版多栏-总是换行每句话单独换行
普通单栏文本单栏-按自然段换行不区分多栏,按段换行
要原始输出不做处理直接给引擎原始结果

这些方案都自动兼容横排和竖排(竖排还需要引擎本身支持)。

结果里混进不想要的文字,比如水印、LOGO、页脚,用“忽略区域”:在批量页右栏进入忽略区域编辑器,按住右键画几个矩形框,把干扰区域整个包住。处于框内的整块文本会被丢弃,框外内容照常保留。

引擎方面,Umi-OCR 内置RapidOCR-jsonPaddleOCR-json两套离线引擎。日常识别用默认的 RapidOCR 兼容性好;追求速度可切到 PaddleOCR,在“全局设置 → 切换OCR插件”里换即可。

🔌 让脚本和别的系统调用它

命令行

入口就是主程序,umi-ocr --help查看全部说明。常用几条:umi-ocr --screenshot唤起截图识别,umi-ocr --path "D:/img1.png"识别指定文件或文件夹,结果用--clip复制到剪贴板、用--output "result.txt"写入文件。命令行依赖软件内置的 HTTP 服务通信(默认开启,主机选“仅本地”即可),过程只在系统本地环回进行。完整参数见 命令行手册。

HTTP 接口

在“全局设置”里勾选 HTTP 服务后,就能用 RESTful 接口调用。默认端口是1224,图片识别入口为http://127.0.0.1:1224/api/ocr,建议先请求/api/ocr/get_options查一次可传参数(语言、排版方案、忽略区域、返回格式等),再按需发起识别。文档识别、二维码各有独立接口。注意后端并发能力有限,尽量串行调用。详细字段见 HTTP接口手册。

更多资料在哪

遇到具体问题,建议按顺序查这几份材料:参数和字段以 HTTP接口手册 和 命令行手册 为准;界面功能细节看仓库根目录的 README.md;新功能与改动记录见 更新日志。

Umi-OCR 把识别能力留在本地,从一次截图到成批扫描、再到接口对接,都是同一套引擎在跑。先把上面四类任务各跑一遍,找到自己最常用的那个标签页,剩下的就是调排版和忽略区域这类细活。想深入定制语言库或引擎,或是对翻译、插件有兴趣,可以翻源码和插件目录,或在社区提问交流。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 23:03:26

PLECS栅极驱动建模全流程:从开关器件参数到Buck高精度仿真

最近在调试电力电子仿真模型时,反复在“开关器件模型怎么建才能既快又准”这个问题上纠结。直接用理想开关,波形推进快但丢失了驱动细节,一加上数据手册里的栅极电荷、门极电阻参数,仿真又经常不收敛。处理完一个完整的 Buck 变换…

作者头像 李华
网站建设 2026/9/6 23:01:20

【笔记】税务申报

1.每月要操作: 1.1社保缴费 电子税务局手机APP中【特色业务-社会保险费】1.2.个税申报 2.企业所得税 按季度申报 ———————————————— 电子税务局 1.1登录全国电子税务局 以公司身份登录,签 电子送达确认书 1.2 零申报 【增值税及附加税费申…

作者头像 李华
网站建设 2026/9/6 23:00:23

C语言期末考试高效刷题:考点地图与经典题型详解

简介:这是一份面向C语言初学者的期末复习练习题资料,以PDF格式提供,整体定位为基础巩固与考前自查。内容全面覆盖程序基本单位、main函数执行流程、标识符命名规则、简单数据类型、算术运算符、条件表达式与关系/逻辑表达式等高频考点&#x…

作者头像 李华
网站建设 2026/9/6 22:59:52

高频电子线路高效复习:考点拆解与题库使用指南

简介:高频电子线路课程期末备考专用题库,共十套模拟试卷及参考答案,面向电子、通信类本科生的期末复习与考研自测,也可供任课教师出题参考。内容覆盖小信号谐振放大器、调幅与检波、频谱搬移与非线性变换、LC/石英晶体振荡器、AGC…

作者头像 李华