news 2026/8/31 20:01:32

Umi-OCR 完全上手指南:快速完成离线批量图片识别

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 完全上手指南:快速完成离线批量图片识别

Umi-OCR 完全上手指南:快速完成离线批量图片识别

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源的离线 OCR 软件,支持截图识别、批量导入图片、PDF 文档识别和二维码扫描,所有处理都在本地完成、不依赖网络。它适合需要把大量图片或文档转成文字,又希望数据不出自己电脑的办公用户和新手。

快速开始

  1. 拿到发布包:仓库根目录自带Umi-OCR_Rapid_v2.1.5.7z发行版压缩包,解压即可使用。
  2. 直接启动:软件无需安装,解压后双击Umi-OCR.exe启动,支持 Windows 7 x64 与 Linux x64。
  3. 检查界面:首次打开会跟随系统语言;需要切换时进入「全局设置 → 语言」,支持简中、英语、日语等。
  4. 第一次体验:打开「截图OCR」标签页,按快捷键划选屏幕上一块文字,识别结果会出现在右侧记录栏,也可以从别处复制图片直接粘贴进来识别。

核心功能解读

截图OCR:划选即识别

它做什么:用快捷键截图,选区内的文字立即被识别成可编辑文本。

怎么用:左侧图片预览栏支持鼠标划选复制,右侧记录栏保留历史结果,可编辑、可多选复制。

什么时候用:从屏幕、PDF 阅读器或网页中快速抠一段文字,或核对单条信息时最顺手。

批量OCR:一次处理几十张图片

它做什么:把多张图片导入后按顺序识别,并把结果保存为文件。

怎么用:在「批量OCR」标签页选择图片导入,支持 jpg、png、webp、tiff 等格式;右侧设置面板里调整识别语言、后处理方案和保存格式(txt、jsonl、md、csv/Excel),图片数量没有上限。

什么时候用:手头有一批照片、截图需要批量提取文字时;也可以在任务设置里开启完成后自动关机或休眠,挂机跑长任务。

文本后处理:把文字排成对的顺序

它做什么:OCR 引擎输出的原始文本块顺序经常是乱的,后处理负责按阅读顺序重新整理排版。

怎么用:在后处理设置中选择排版解析方案,如「多栏-按自然段换行」「单栏-保留缩进」「不做处理」等,所有方案都能自动处理横排和竖排文字。

什么时候用:论文、多栏文档选多栏方案;解析代码截图选「单栏-保留缩进」,能保留行首缩进和行中空格;普通单栏文档用「多栏-按自然段换行」基本够用。

一个完整实战案例:识别 30 页带页眉的书页

任务:一批扫描的书页图片,每页顶部有固定页眉文字,目标是把正文转成 Markdown 文件。

  1. 把 30 张图片放进同一个文件夹,打开「批量OCR」标签页导入该文件夹。
  2. 右侧设置中选择识别语言,进入「忽略区域」编辑器,按住右键在页面上部画一个矩形框,把页眉区域包起来——注意框要足够大,覆盖水印可能出现的所有位置。
  3. 后处理方案选「多栏-按自然段换行」,保存格式选 Markdown。
  4. 点击开始任务,等进度条走完,每页的识别结果就会按图片名保存,正文中不再混入页眉文字。

场景配置速查

场景推荐设置输出格式
多栏学术论文批量OCR,多栏-按自然段换行md
代码截图单栏-保留缩进,英文识别txt
带水印截图批量OCR + 忽略区域包住水印txt / jsonl
扫描件 PDF「文档识别」标签页,设忽略区域排除页眉页脚双层可搜索 PDF

常见问题

识别结果排版混乱、顺序不对原因:默认「不做处理」输出的是引擎原始顺序,多栏和竖排版面没有被整理。 解决:在后处理里切换成「多栏-按自然段换行」等方案重新跑任务。

大尺寸图片识别很慢原因:像素超大的长图会占用较多计算资源。 解决:在「批量OCR → 文字识别 → 限制图像边长」中调高数值,并把图片分成几批处理。

截图时界面闪烁、UI 错位原因:默认的显卡加速渲染与当前机器不兼容。 解决:在「全局设置 → 界面和外观 → 渲染器」中切换渲染方案,或关闭硬件加速。

水印或页脚文字混进结果原因:干扰区域没有被排除,整个文本块落在识别范围内。 解决:用忽略区域编辑器画矩形包住干扰区域;注意只有完整落在框内的文本块才会被忽略,框太小无效。

进阶

需要自动化时,Umi-OCR 也支持命令行调用,例如批量识别一个文件夹并写入文件:umi-ocr --path "D:/图片文件夹" --output result.txt。命令行与 HTTP 接口都走本地环回通信,数据不会离开机器。更多参数详见命令行手册,HTTP 集成方式见HTTP接口手册。

从解压到跑通第一次批量识别大约十分钟,完整功能说明可参考仓库内的 README.md。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 20:00:58

基于MAVSDK与MQTT的飞控数据采集传输系统设计

简介:本资源是一套面向无人机飞控开发者的C语言跨平台实时数据采集与传输系统,适用于嵌入式开发者、飞控算法工程师及物联网通信学习者,解决无人机遥测数据低延迟获取、MAVLink协议解析与云端/地面站高效分发的核心问题。压缩包共38个文件&am…

作者头像 李华
网站建设 2026/8/31 19:59:42

4台Mac Studio跑通Qwen3-235B:exo分布式AI集群从0到4节点RDMA实战

4台Mac Studio跑通Qwen3-235B:exo分布式AI集群从0到4节点RDMA实战 【免费下载链接】exo Run frontier AI locally. 项目地址: https://gitcode.com/GitHub_Trending/exo8/exo 手上有2~4台Mac Studio,但单机的统一内存装不下235B参数的模型——这正…

作者头像 李华
网站建设 2026/8/31 19:57:47

计算机视觉算法实习生笔试题全解析:核心考点与备赛攻略

又到了一年一度的实习生招聘季,不少学弟学妹跑来问我“计算机视觉算法实习生”的笔试到底考什么。我翻出当年整理过的网易2018实习生招聘笔试题(计算机视觉算法实习生方向),结合后来几年在校招里反复出现的高频考点,重…

作者头像 李华
网站建设 2026/8/31 19:55:40

百度研发岗笔试复盘:HashMap、TCP与算法设计题解析

2015年春招,我和一大群应届生一起坐在深圳的笔试教室里,面前是一张“百度研发工程师”的试卷。那会儿手机还不能拍照,草稿纸是发的一张白纸,答题时间两个半小时,题量不小,周围的翻卷声从第一页开始就没停过…

作者头像 李华
网站建设 2026/8/31 19:53:08

Google 2011笔试卷复盘:算法、系统设计与工程思维

前几天整理旧硬盘,翻出一份2011年的Google笔试卷电子版。看着那些熟悉的题目,我愣是坐那儿看了半小时——不是怀旧,是真的感慨:十几年过去了,互联网公司的面试题换了一茬又一茬,但Google这套笔试卷里的核心…

作者头像 李华