news 2026/9/11 11:12:09

Umi-OCR 离线图片转文字工具:3 步从扫描文档里提取文字

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 离线图片转文字工具:3 步从扫描文档里提取文字

Umi-OCR 离线图片转文字工具:3 步从扫描文档里提取文字

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

手头有一批扫描版 PDF,想把里面的文字变成可搜索、可编辑的内容;或者只想从屏幕上快速取一段文字。Umi-OCR 是一款免费、开源的离线 OCR 软件:识别全部在本地完成,不联网,数据不出设备。它覆盖截图、批量图片、PDF 文档识别和二维码读写,当前版本(v2.1.5)支持 Windows 与 Linux 两个平台。

下载、解压、启动:3 步完成首次识别

整个过程不用安装,拆成三步:

  1. 下载发行包。项目提供.7z压缩包和.7z.exe自解压包两种,后者在没有压缩软件的电脑上也能直接用。
  2. 解压并启动。Windows 解压后双击Umi-OCR.exe;Linux 用包内的umi-ocr.sh脚本启动。
  3. 做一次识别。首次打开会按系统语言自动选择界面语言。打开"截图OCR"标签页,按下截图快捷键,在屏幕上框选一段文字,结果就会自动出来。

界面采用标签页结构,左上角可以固定窗口置顶,右上角能锁定标签页防止误关,常用的页面保留着、不用的关掉即可。

截图文字识别:框一下就有结果

适用时机:从屏幕页面里取文字——网页段落、代码块、图表里的标注都算。打开"截图OCR"标签页后,按快捷键开始框选,松开后选区内文字会被识别,在左侧预览中高亮显示;右侧记录栏把每段文字连同置信度和时间存为一条记录,识别错了可以直接编辑修正。

拿到结果后,右键可以复制单条、全选或选中多条记录一起复制,也可以把识别的图片原样复制走。截图排版复杂时,在设置里挑一个排版解析方案:"多栏-按自然段换行"适合大多数情况;识别代码截图选"单栏-保留缩进",行首缩进和行内空格都会保留。如果文字是在别处复制的图片,直接粘贴到这个页面里同样能识别,按 Esc 可以随时取消截图。

批量图片识别:整个文件夹丢进去跑任务

适用时机:几十上百张图片要识别并导出,票据、书页照片、资料图都属此类。在"批量OCR"标签页点"选择图片"添加文件,支持 jpg、png、webp、bmp、tif 等 9 种格式,点"开始任务"后左上方出现进度条,左栏列出每张图的耗时与置信度,右栏逐条展示文字内容。

任务结束后,结果可保存为txtjsonlmdcsv(可直接用 Excel 打开)四种格式,数量不设上限,几百张图可以一次导入;也可以勾选任务完成后自动关机或待机。图片带水印、页眉页脚时,用右栏设置里的忽略区域编辑器:按住右键绘制矩形,落在区域内的文本块不会进入结果,矩形尽量画大一些,把水印可能出现的位置全包进去。列表中的文件还能用本地图片浏览器打开预览,导出前核对很方便。

顺带一提,"文档识别"标签页面向pdfxpsepubmobifb2cbz这几类文件:扫描页面可以整页识别,带文字层的 PDF 则直接提取原有文本,还能输出双层可搜索 PDF——页面外观不变,选中即可复制文字。把扫描版 PDF 变成可编辑文档,走这条路最稳妥。

按场景选引擎和输出格式

Umi-OCR 内置 PaddleOCR 与 RapidOCR 两套离线引擎,前者识别精度更高,后者处理速度更快,在"全局设置"里即可切换,对照场景选就行:

你的需求推荐引擎原因
扫描文档、多语言混排、代码截图PaddleOCR识别准确率更高,复杂排版处理更好
批量简单图片、快速过一遍RapidOCR速度更快,占用更轻

同一个"全局设置"标签页里还集中了其他常用项:界面语言(简体中文、繁体中文、英语、日本語、葡萄牙语、俄语、泰米尔语等)、亮暗主题、字体与界面大小比例、快捷方式与开机自启,第一次配置好之后基本不用动。

二维码标签页支持截图、粘贴或拖入图片来读取码,也支持输入文本生成码图片,二维码、条形码等协议共 19 种,一张图里有多个码也能一次读出。想把它接进脚本或服务流程,还有命令行与 HTTP 两种接口,详细说明在 docs/ 目录下。

提高识别准确率的几个办法

结果不理想时,先检查图片本身。文字发糊、对比度低的图,把无关区域裁掉、增强对比度,往往比反复调参数更有效。图片是超大长图的话,到批量页设置 → 文字识别 → 限制图像边长,把数值调高,否则超大的图会被先行缩放,细节就丢了。

其次是处理干扰文字。水印、页眉页脚混进结果时,用忽略区域排除,比事后手工删省事。仍有个别字认错时,先换 PaddleOCR 引擎试试,再核对识别语言库是否选对,识别效果与所选语言直接相关。最后是文字顺序混乱,通常是排版解析方案没对上版式,换成与栏数匹配的方案,多数情况一次就顺了。

参与项目

三个入口,各一行:

  • 文档:命令行手册、HTTP 接口手册
  • Issue:到项目 Issue 列表提交 bug 或功能建议
  • 贡献:界面翻译在 Weblate 平台协作完成,仓库里 dev-tools/i18n/ 附带翻译工具链

偶尔截屏取字、批量数字化扫描文档,Umi-OCR 都能接住。下载发行包试试吧,也欢迎给个 Star。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 11:10:32

微信小游戏AI开发实战:Cursor+Codex一人闭环上线

1. 项目概述:当一个人扛起产品、开发、测试、上线四重角色“一个人,4个岗位,20天:我用CursorCodex上线了一款微信小游戏”——这个标题不是营销噱头,而是我在上个月真实跑通的最小可行闭环。它背后藏着一个被很多人低估…

作者头像 李华
网站建设 2026/9/11 11:10:24

DeepSeek Harness本地评测实战:从环境搭建到模型验证

做了大半年云端接口调用,我直到今年年初才把评测体系搬回本地,属实是赶了个晚集。起因很现实:一次模型版本升级后,线上同一批业务问题突然集体换了一种回答风格,可因为之前所有验证都依赖云端API,既没法锁定…

作者头像 李华
网站建设 2026/9/11 11:10:02

用 MCP 终结 AI 的 API 幻觉:把 SpreadJS 官方知识库接入大模型

干我们这行的都知道,AI 写前端代码现在挺猛,但真要让它直接上手折腾 SpreadJS,十有八九会给你“一本正经地编 API”。SpreadJS 这货和普通 UI 组件不太一样,它是纯前端的表格控件,光类就几百个,方法上千个&…

作者头像 李华
网站建设 2026/9/11 11:09:31

Calico 镜像拉取加速:把镜像前缀换到 DaoCloud 镜像站 docker.m.daocloud.io

Calico 镜像拉取加速:把镜像前缀换到 DaoCloud 镜像站 docker.m.daocloud.io 【免费下载链接】public-image-mirror 很多镜像都在国外。比如 gcr 。国内下载很慢,需要加速。致力于提供连接全世界的稳定可靠安全的容器镜像服务。 项目地址: https://gitcode.com/Gi…

作者头像 李华
网站建设 2026/9/11 11:08:34

Arm-2D:Cortex-M上零动态内存的确定性2D像素操作原语

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 11:08:19

AI应用上下文管理实战:Context-Mode架构设计与实现

做 AI 应用的时间一长,大概率都会撞上同一个尴尬场景:用户聊了十几轮,突然提到第一轮交代过的背景,模型却开始"失忆"反问起来。这真不是模型变笨了,而是应用层没有真正把 context-mode(上下文模式…

作者头像 李华