300张扫描件、500页PDF全部变成可搜索文字:Umi-OCR免费离线OCR的3个场景实测
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
半个月前,我手上压着两样"见不得光"的材料:300 多张书页照片,和一本 500 多页、没有文字层的旧书 PDF。我想把它们全部变成能搜索、能复制的文字,全程又不能上云。最后我用一款叫 Umi-OCR 的免费离线OCR软件全部搞定:13 张测试图 14 秒跑完,300 多张照片一次任务导出 Excel,那本 PDF 变成了可全文搜索的双层 PDF。
先说结论:值不值得用
我的判断是:如果你的材料"量大 + 不能联网",它几乎是目前唯一省心的选择。三条理由:
- 真离线:识别全部在本地完成,断网照跑,通信只走本机环回,不经过物理网卡;
- 解压即用:没有安装步骤,双击
Umi-OCR.exe就启动,界面语言跟着系统自动切换; - 批量能力扎实:图片、PDF 都能成批处理,没有数量上限,跑完还能自动关机。
官方文档里把功能分得很清楚,本文只讲我真实走过的三条任务线。
场景一:从屏幕抠一段代码,原样粘进编辑器
这是最简单的任务。我打开截图OCR标签页,按预设快捷键框住目标,松手右侧立刻出结果。真正拉开差距的是"排版解析方案":识别代码截图时我选了"单栏-保留缩进",行首缩进和行内空格都照原样保留,直接粘进编辑器不用重排;换成读多栏论文,就切"多栏-按自然段换行",左右栏按阅读顺序输出,不会交叉错乱。输入方式我也试了三种:屏幕框选、别处复制图片直接粘贴、本地图片拖进窗口,都能跑。右侧记录栏支持划选多条一起复制,很顺手。
场景二:300多张照片拖进批量任务,一次导出Excel
单张截图只是热身。我的 300 多张书页照片,一张张截显然不现实。做法:在批量OCR页把图片全部拖进任务列表,点"开始任务",剩下的交给进度条。它支持jpg、png、webp、bmp、tif等常见格式,没有数量上限,结果可导出txt、jsonl、md、csv(Excel)四种格式——我给同事整理资料时导过一次 Excel,直接省掉一步人工录入。实测 13 张图约 14 秒跑完,平均每张 1 秒左右;任务结束还能设置自动关机,睡前挂上就行。
场景三:500页扫描书变成可搜索的双层PDF
如果说批量是量大,扫描件 PDF 就是硬。那本 500 多页的书没有文字层,翻页等于看照片。文档识别页支持pdf、xps、epub、mobi、fb2、cbz等格式,对扫描件做完 OCR 后输出"双层可搜索PDF"——原图在底,透明文字浮在上面。成品既能像原书一样翻页看,又能全文搜索、划词复制:我把一个术语丢进搜索框,几秒内相关段落全部跳出来,比一页页翻省太多。几百页的书每页页眉页脚都有书名和页码,我在文档识别页提前画好忽略框(后面细说),输出立刻干净。多个大文件可以排队处理,配合自动关机,挂上一晚上。
场景四:把OCR能力接进自己的小工具📌
最复杂的一条线是自动化。Umi-OCR 开放了命令行和 HTTP 两种接口:umi-ocr --screenshot直接截屏识别,umi-ocr --path "D:/xxx.png"指定图片或文件夹批量处理(传文件夹会递归扫所有子文件夹),umi-ocr --qrcode_create "文本内容" "输出.png"一行命令生成二维码图片;结果可以用--clip进剪贴板、--output "file.txt"写文件。命令行细节在命令行手册里,HTTP 接口(HTTP接口手册)则能把 OCR、文档识别、二维码都嵌进自己的脚本里。界面本地化也很省心:简体中文、繁体中文、英文、日文、俄语等随系统自动切换,也能在全局设置里手动改,我平时中英日三语资料混着看,切来切去毫无压力。
翻车现场与调优
坑一:超长截图后半段文字丢了。我截一张很长的代码长图,结果只有上半截出了字。定位后发现是页面设置里"文字识别→限制图像边长"在拦:边长超限的图片会被压缩处理。把数值调大后重跑,长图完整输出。
坑二:识别结果里混进一堆"2024-05-12"。我的书页照片右上角总有拍摄时间水印,PDF 页脚又带页码,不处理的话正文被大量重复文字污染。解法是批量页的"忽略区域"编辑器:按住右键画矩形框,把水印可能出现的位置整个包住,任务执行时这些区域被整体跳过。注意一点:只有完全落在框内的"整个文本块"会被忽略,所以框尽量画大些。
另外两个已知局限,我能接受:离线引擎对手写体和低清老照片的识别率确实不如云端,但"资料见不得光"是我选离线的原因,牺牲极限准确率换不上云,划算;HTTP 接口并发能力弱,文档里明确建议不要并发调用,做自动化时我都是串行发请求,没踩过雷。
谁适合 + 三步上手
适合两类人:手里压着扫描件、课件截图、旧 PDF 的人;以及有"材料不能出本机"这类硬性要求的人。上手只需三步:
- 下载发行包解压——
.7z需要解压工具,.7z.exe是自解压包,没装压缩软件也能直接双击; - 进入文件夹双击
Umi-OCR.exe启动,首次打开会按系统语言显示界面; - 打开截图OCR页,按快捷键框一块区域,把右侧第一段结果复制出来。
如果你的收藏夹里还躺着一个在线OCR网站,不如现在花十分钟把上面三步走完——当第一段离线识别出的文字出现在右侧面板时,你大概率会把它删掉。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考