news 2026/9/5 18:00:38

Umi-OCR:免费离线 OCR 一次搞定截图、批量图片与扫描 PDF

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR:免费离线 OCR 一次搞定截图、批量图片与扫描 PDF

Umi-OCR:免费离线 OCR 一次搞定截图、批量图片与扫描 PDF

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源、完全离线的 OCR 工具(OCR 即光学字符识别,把图片里的文字变成可编辑文本),支持 Windows 7 x64 与 Linux x64。截图、批量图片、扫描版 PDF 的取字全在本机完成,不联网、不上传,解压即用。

3 步出第一次识别结果

  1. 下载发布包:取仓库根目录的 Umi-OCR_Rapid_v2.1.5.7z(没有压缩软件的电脑可下.7z.exe自解压包);开发者也可直接git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。下载完成,你手里会有一个安装包文件。
  2. 解压到任意目录:软件是绿色免安装版,没有安装程序,也不挑路径,解压完即可看到Umi-OCR.exe
  3. 双击Umi-OCR.exe启动:主窗口打开,顶部有「截图OCR」「批量OCR」「全局设置」等标签页。
  4. 点左侧工具栏截屏图标,在屏幕上拖出矩形框:松开鼠标后自动开始识别。
  5. 看右侧「记录」区:识别出的文字出现在这里,右键就能复制走。

图中左侧是截取的代码图片,下方有「隐藏文本」开关与缩放比例;右侧「记录」区已列出识别出的文字,右上角是「滚动」开关与「清空」按钮。

文字从哪儿来:按场景走

把网页、聊天和代码截图里的文字抠下来

屏幕上的正文不用手敲,框一下就能带走。打开「截图OCR」标签页,点左侧截屏图标,拖出矩形框选区域,松开即识别;如果图片已在别处复制,也可以直接粘贴进窗口识别。取走结果时,在右侧记录里右键选「复制(Ctrl+C)」,或「全选(Ctrl+A)」后一次复制整段。

图中左侧是一张文档截图并选中了一块文字,右键菜单提供「复制、全选、复制图片、显示/隐藏文字」;右侧「记录」页签按时间顺序列出历次识别结果。

整个文件夹的图片一次转文字

几十张图片不用逐张打开。打开「批量OCR」标签页,点「选择图片」把文件或整个文件夹加入列表(支持 jpg、png、webp、tiff 等格式,无数量上限),在右侧「设置」里确认识别语言与排版参数,点「开始任务」。顶部进度条实时显示已耗时、完成数量与百分比,右侧「记录」逐张列出每份文件的识别文本,并标注各自的置信度。

图中左侧列表已排队 13 张图片,顶部进度条显示「1.4s 3/13 23%」,「开始任务」按钮在其右侧;右栏「记录」按文件名分组显示文字,每条附时间与置信度(如 0.92)。

从扫描版 PDF 提取文字,还能生成可搜索的双层 PDF

扫描件以后可以直接搜索、复制,版式观感不变。打开「文档识别」标签页,加入 PDF(也支持 xps、epub、mobi 等格式),选择输出为纯文本或「双层可搜索 PDF」——后者保留原始扫描画面,在上面叠加一层文字,之后在 PDF 里直接搜索复制即可。引擎与参数设置和批量页共用一套,不用重复配置;同样支持画「忽略区域」排除页眉页脚。

切换识别语言,中英日繁都能读

混合语言文档按文字主体选语言即可。在「截图OCR」或「批量OCR」页的右侧「设置」里切换「语言/模型库」(简体中文、English、日本語、繁體中文等);界面上的显示语言则在「全局设置」→「语言/Language」修改,同一页还能调主题与字体。

图中「全局设置」页上方是「快捷方式」区,可添加桌面、开始菜单快捷方式并设置开机自启;下方「界面和外观」列出语言、主题、字体、界面大小比例等选项。

提高识别准确率:先调这几个参数

选项适用情况说明
多栏-按自然段换行报纸、网页等多栏排版自动分栏切段,最通用
单栏-保留缩进代码截图、缩进文本保留行首缩进与行中空格
多栏-无换行表格、密集文本输出连续文本,不额外换行
单栏-总是换行每行独立短句每行文字后强制换行
忽略区域水印、页眉页脚干扰按住右键画矩形框,框内整块文字被舍弃
纠正文本方向文字倾斜或倒置先判方向再识别,速度略降
限制图像边长高清大图、长图默认 960,调大数值可提升大图精度

图中「记录」面板每条识别块上方标注「耗时 0.38s,置信 0.92」及识别时间;右键菜单可对记录执行「删除选中记录」「清空全部记录」等维护操作。

进阶调用:命令行与 HTTP 接口

前提是「全局设置」页允许 HTTP 服务(默认开启,仅本地访问)。命令行入口就是主程序本身:

umi-ocr --screenshot # 发起鼠标截屏识别 umi-ocr --path "D:/xxx.png" # 识别指定图片,也接受文件夹路径 umi-ocr --help # 查看全部参数

让其他程序接入时,HTTP 服务默认监听 1224 端口,图片识别调用 POST/api/ocr,请求体传 Base64 图片,data.format设为text即只取文本:

curl -X POST http://127.0.0.1:1224/api/ocr -H "Content-Type: application/json" \ -d '{"image":"Base64图片字符串","data.format":"text"}'

更多参数见 命令行手册 与 HTTP 接口手册。

出问题时:对照这张表排查

现象原因处理
高清大图识别不清边长超限制值被压缩页面「设置」→「文字识别」→「限制图像边长」调大数值
结果混入水印、页眉文字干扰区未排除在「忽略区域」里画多个矩形,完全包裹水印可能出现的位置
倾斜或倒置文字识别不准方向纠偏未开启勾选「纠正文本方向」,接受速度略降
命令行没有响应HTTP 服务被关掉「全局设置」中确认允许 HTTP 服务(默认开启)
混合语言文档错字多语言模型与文字主体不符按文字主体切换「语言/模型库」

只要你的需求是「从本机的图片和 PDF 里取文字、全程不上传」,Umi-OCR 解压后就能直接干 🎉

相关资源:命令行手册 · HTTP 接口手册 · 接口参数详解 · 更新日志 · 最新发布包 Umi-OCR_Rapid_v2.1.5.7z

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/5 17:57:06

MATLAB实现DSSS通信系统仿真:从原理到误码率验证

简介:本资源是一套面向电子工程、通信工程及计算机相关专业本科生的毕业设计与课程作业实践方案,聚焦直接序列扩频(DSSS)通信系统的核心原理与MATLAB仿真实现。资源完整覆盖扩频序列生成(M序列、Walsh码)、…

作者头像 李华
网站建设 2026/9/5 17:54:44

QN8035 FM收音机硬件量产级参考设计详解

简介:本资源是一套完整的QN8035 FM/AM收音机硬件开发参考方案,面向嵌入式硬件工程师、电子设计爱好者及高校电子类专业学生,解决收音机模块选型、射频电路设计、音频功放匹配与数码管驱动实现等典型工程问题。压缩包共含10余个核心文件&#…

作者头像 李华
网站建设 2026/9/5 17:51:32

SpringBoot+Vue3前后端分离员工考勤管理系统:权限设计与实践详解

SpringBoot、Vue3、前后端分离,这三个词放在一起,基本就是当前 Java Web 课程设计和毕设项目里出现频率最高的组合之一了。如果再加上“员工考勤管理系统”,一个典型的后台管理业务闭环就出来了:部门员工管理、考勤打卡、请假审批…

作者头像 李华