Umi-OCR:免费离线 OCR 一次搞定截图、批量图片与扫描 PDF
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费、开源、完全离线的 OCR 工具(OCR 即光学字符识别,把图片里的文字变成可编辑文本),支持 Windows 7 x64 与 Linux x64。截图、批量图片、扫描版 PDF 的取字全在本机完成,不联网、不上传,解压即用。
3 步出第一次识别结果
- 下载发布包:取仓库根目录的 Umi-OCR_Rapid_v2.1.5.7z(没有压缩软件的电脑可下
.7z.exe自解压包);开发者也可直接git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。下载完成,你手里会有一个安装包文件。 - 解压到任意目录:软件是绿色免安装版,没有安装程序,也不挑路径,解压完即可看到
Umi-OCR.exe。 - 双击
Umi-OCR.exe启动:主窗口打开,顶部有「截图OCR」「批量OCR」「全局设置」等标签页。 - 点左侧工具栏截屏图标,在屏幕上拖出矩形框:松开鼠标后自动开始识别。
- 看右侧「记录」区:识别出的文字出现在这里,右键就能复制走。
图中左侧是截取的代码图片,下方有「隐藏文本」开关与缩放比例;右侧「记录」区已列出识别出的文字,右上角是「滚动」开关与「清空」按钮。
文字从哪儿来:按场景走
把网页、聊天和代码截图里的文字抠下来
屏幕上的正文不用手敲,框一下就能带走。打开「截图OCR」标签页,点左侧截屏图标,拖出矩形框选区域,松开即识别;如果图片已在别处复制,也可以直接粘贴进窗口识别。取走结果时,在右侧记录里右键选「复制(Ctrl+C)」,或「全选(Ctrl+A)」后一次复制整段。
图中左侧是一张文档截图并选中了一块文字,右键菜单提供「复制、全选、复制图片、显示/隐藏文字」;右侧「记录」页签按时间顺序列出历次识别结果。
整个文件夹的图片一次转文字
几十张图片不用逐张打开。打开「批量OCR」标签页,点「选择图片」把文件或整个文件夹加入列表(支持 jpg、png、webp、tiff 等格式,无数量上限),在右侧「设置」里确认识别语言与排版参数,点「开始任务」。顶部进度条实时显示已耗时、完成数量与百分比,右侧「记录」逐张列出每份文件的识别文本,并标注各自的置信度。
图中左侧列表已排队 13 张图片,顶部进度条显示「1.4s 3/13 23%」,「开始任务」按钮在其右侧;右栏「记录」按文件名分组显示文字,每条附时间与置信度(如 0.92)。
从扫描版 PDF 提取文字,还能生成可搜索的双层 PDF
扫描件以后可以直接搜索、复制,版式观感不变。打开「文档识别」标签页,加入 PDF(也支持 xps、epub、mobi 等格式),选择输出为纯文本或「双层可搜索 PDF」——后者保留原始扫描画面,在上面叠加一层文字,之后在 PDF 里直接搜索复制即可。引擎与参数设置和批量页共用一套,不用重复配置;同样支持画「忽略区域」排除页眉页脚。
切换识别语言,中英日繁都能读
混合语言文档按文字主体选语言即可。在「截图OCR」或「批量OCR」页的右侧「设置」里切换「语言/模型库」(简体中文、English、日本語、繁體中文等);界面上的显示语言则在「全局设置」→「语言/Language」修改,同一页还能调主题与字体。
图中「全局设置」页上方是「快捷方式」区,可添加桌面、开始菜单快捷方式并设置开机自启;下方「界面和外观」列出语言、主题、字体、界面大小比例等选项。
提高识别准确率:先调这几个参数
| 选项 | 适用情况 | 说明 |
|---|---|---|
| 多栏-按自然段换行 | 报纸、网页等多栏排版 | 自动分栏切段,最通用 |
| 单栏-保留缩进 | 代码截图、缩进文本 | 保留行首缩进与行中空格 |
| 多栏-无换行 | 表格、密集文本 | 输出连续文本,不额外换行 |
| 单栏-总是换行 | 每行独立短句 | 每行文字后强制换行 |
| 忽略区域 | 水印、页眉页脚干扰 | 按住右键画矩形框,框内整块文字被舍弃 |
| 纠正文本方向 | 文字倾斜或倒置 | 先判方向再识别,速度略降 |
| 限制图像边长 | 高清大图、长图 | 默认 960,调大数值可提升大图精度 |
图中「记录」面板每条识别块上方标注「耗时 0.38s,置信 0.92」及识别时间;右键菜单可对记录执行「删除选中记录」「清空全部记录」等维护操作。
进阶调用:命令行与 HTTP 接口
前提是「全局设置」页允许 HTTP 服务(默认开启,仅本地访问)。命令行入口就是主程序本身:
umi-ocr --screenshot # 发起鼠标截屏识别 umi-ocr --path "D:/xxx.png" # 识别指定图片,也接受文件夹路径 umi-ocr --help # 查看全部参数让其他程序接入时,HTTP 服务默认监听 1224 端口,图片识别调用 POST/api/ocr,请求体传 Base64 图片,data.format设为text即只取文本:
curl -X POST http://127.0.0.1:1224/api/ocr -H "Content-Type: application/json" \ -d '{"image":"Base64图片字符串","data.format":"text"}'更多参数见 命令行手册 与 HTTP 接口手册。
出问题时:对照这张表排查
| 现象 | 原因 | 处理 |
|---|---|---|
| 高清大图识别不清 | 边长超限制值被压缩 | 页面「设置」→「文字识别」→「限制图像边长」调大数值 |
| 结果混入水印、页眉文字 | 干扰区未排除 | 在「忽略区域」里画多个矩形,完全包裹水印可能出现的位置 |
| 倾斜或倒置文字识别不准 | 方向纠偏未开启 | 勾选「纠正文本方向」,接受速度略降 |
| 命令行没有响应 | HTTP 服务被关掉 | 「全局设置」中确认允许 HTTP 服务(默认开启) |
| 混合语言文档错字多 | 语言模型与文字主体不符 | 按文字主体切换「语言/模型库」 |
只要你的需求是「从本机的图片和 PDF 里取文字、全程不上传」,Umi-OCR 解压后就能直接干 🎉
相关资源:命令行手册 · HTTP 接口手册 · 接口参数详解 · 更新日志 · 最新发布包 Umi-OCR_Rapid_v2.1.5.7z
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考