Umi-OCR 离线图片转文字工具:3 步从扫描文档里提取文字
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
手头有一批扫描版 PDF,想把里面的文字变成可搜索、可编辑的内容;或者只想从屏幕上快速取一段文字。Umi-OCR 是一款免费、开源的离线 OCR 软件:识别全部在本地完成,不联网,数据不出设备。它覆盖截图、批量图片、PDF 文档识别和二维码读写,当前版本(v2.1.5)支持 Windows 与 Linux 两个平台。
下载、解压、启动:3 步完成首次识别
整个过程不用安装,拆成三步:
- 下载发行包。项目提供
.7z压缩包和.7z.exe自解压包两种,后者在没有压缩软件的电脑上也能直接用。 - 解压并启动。Windows 解压后双击
Umi-OCR.exe;Linux 用包内的umi-ocr.sh脚本启动。 - 做一次识别。首次打开会按系统语言自动选择界面语言。打开"截图OCR"标签页,按下截图快捷键,在屏幕上框选一段文字,结果就会自动出来。
界面采用标签页结构,左上角可以固定窗口置顶,右上角能锁定标签页防止误关,常用的页面保留着、不用的关掉即可。
截图文字识别:框一下就有结果
适用时机:从屏幕页面里取文字——网页段落、代码块、图表里的标注都算。打开"截图OCR"标签页后,按快捷键开始框选,松开后选区内文字会被识别,在左侧预览中高亮显示;右侧记录栏把每段文字连同置信度和时间存为一条记录,识别错了可以直接编辑修正。
拿到结果后,右键可以复制单条、全选或选中多条记录一起复制,也可以把识别的图片原样复制走。截图排版复杂时,在设置里挑一个排版解析方案:"多栏-按自然段换行"适合大多数情况;识别代码截图选"单栏-保留缩进",行首缩进和行内空格都会保留。如果文字是在别处复制的图片,直接粘贴到这个页面里同样能识别,按 Esc 可以随时取消截图。
批量图片识别:整个文件夹丢进去跑任务
适用时机:几十上百张图片要识别并导出,票据、书页照片、资料图都属此类。在"批量OCR"标签页点"选择图片"添加文件,支持 jpg、png、webp、bmp、tif 等 9 种格式,点"开始任务"后左上方出现进度条,左栏列出每张图的耗时与置信度,右栏逐条展示文字内容。
任务结束后,结果可保存为txt、jsonl、md、csv(可直接用 Excel 打开)四种格式,数量不设上限,几百张图可以一次导入;也可以勾选任务完成后自动关机或待机。图片带水印、页眉页脚时,用右栏设置里的忽略区域编辑器:按住右键绘制矩形,落在区域内的文本块不会进入结果,矩形尽量画大一些,把水印可能出现的位置全包进去。列表中的文件还能用本地图片浏览器打开预览,导出前核对很方便。
顺带一提,"文档识别"标签页面向pdf、xps、epub、mobi、fb2、cbz这几类文件:扫描页面可以整页识别,带文字层的 PDF 则直接提取原有文本,还能输出双层可搜索 PDF——页面外观不变,选中即可复制文字。把扫描版 PDF 变成可编辑文档,走这条路最稳妥。
按场景选引擎和输出格式
Umi-OCR 内置 PaddleOCR 与 RapidOCR 两套离线引擎,前者识别精度更高,后者处理速度更快,在"全局设置"里即可切换,对照场景选就行:
| 你的需求 | 推荐引擎 | 原因 |
|---|---|---|
| 扫描文档、多语言混排、代码截图 | PaddleOCR | 识别准确率更高,复杂排版处理更好 |
| 批量简单图片、快速过一遍 | RapidOCR | 速度更快,占用更轻 |
同一个"全局设置"标签页里还集中了其他常用项:界面语言(简体中文、繁体中文、英语、日本語、葡萄牙语、俄语、泰米尔语等)、亮暗主题、字体与界面大小比例、快捷方式与开机自启,第一次配置好之后基本不用动。
二维码标签页支持截图、粘贴或拖入图片来读取码,也支持输入文本生成码图片,二维码、条形码等协议共 19 种,一张图里有多个码也能一次读出。想把它接进脚本或服务流程,还有命令行与 HTTP 两种接口,详细说明在 docs/ 目录下。
提高识别准确率的几个办法
结果不理想时,先检查图片本身。文字发糊、对比度低的图,把无关区域裁掉、增强对比度,往往比反复调参数更有效。图片是超大长图的话,到批量页设置 → 文字识别 → 限制图像边长,把数值调高,否则超大的图会被先行缩放,细节就丢了。
其次是处理干扰文字。水印、页眉页脚混进结果时,用忽略区域排除,比事后手工删省事。仍有个别字认错时,先换 PaddleOCR 引擎试试,再核对识别语言库是否选对,识别效果与所选语言直接相关。最后是文字顺序混乱,通常是排版解析方案没对上版式,换成与栏数匹配的方案,多数情况一次就顺了。
参与项目
三个入口,各一行:
- 文档:命令行手册、HTTP 接口手册
- Issue:到项目 Issue 列表提交 bug 或功能建议
- 贡献:界面翻译在 Weblate 平台协作完成,仓库里 dev-tools/i18n/ 附带翻译工具链
偶尔截屏取字、批量数字化扫描文档,Umi-OCR 都能接住。下载发行包试试吧,也欢迎给个 Star。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考