Umi-OCR离线识别全攻略:从新手到自动化流水线的快速上手指南
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
当你拿到一批扫描版合同、上课拍的板书照片,或者保存了一堆无法复制的网页截图时,最崩溃的事莫过于只能看着文字"躺"在图片里却拿不出来。市面上不少OCR工具要么按次收费,要么必须联网上传,敏感文档根本不敢送出去。今天要介绍的Umi-OCR是一款完全免费、开源的离线OCR软件:解压即用、无需联网、支持Windows与Linux,把"截图识字、批量提词、PDF转文本"这几件高频琐事全部打包解决。无论你是偶尔整理资料的新手,还是需要批量处理的效率党,这篇文章都能帮你快速上手并玩出进阶花样。
一、为什么你需要一款"不联网"的OCR工具
先讲一个真实场景:某出版社编辑小林需要把历年的纸质校对稿录入系统,总量约1.2万张扫描图。最初他用在线工具逐张上传,单张等十几秒不说,中途还因网络波动中断两次,更麻烦的是部分稿件内容涉及未公开书目,公司明令禁止外传。改用离线方案后,他先把图片按章节分类丢进文件夹,再交给Umi-OCR批量跑,三个工作日就完成了全部录入,抽检准确率稳定在97%以上,敏感资料全程没有离开过本地电脑。
这个案例背后其实是两类痛点的叠加:
- 隐私与合规:离线识别意味着图片与文字始终留在本机,不经过任何第三方服务器。
- 规模与速度:本地引擎不存在排队与限流,批量任务可以长时间无人值守地运行。
如果你也遇到类似情况,Umi-OCR就是那个"装上就能用、用上就回不去"的工具。
二、5分钟快速上手:从解压到第一次识别
Umi-OCR是绿色软件,无需安装。按以下四步走完,你就能完成第一次识别:
- 下载解压:获取压缩包后解压到任意目录(建议路径中避免中文与空格),双击
Umi-OCR.exe(Linux下运行umi-ocr.sh)启动程序。 - 确认引擎:首次启动会自动加载内置的离线OCR引擎与语言库,主界面顶部的标签栏会显示"截图OCR""批量OCR"等页面,说明引擎就绪。
- 截图识别:打开"截图OCR"标签页,按下默认唤起的截图快捷键框选屏幕区域,松开鼠标后识别结果会立刻出现在右侧记录栏,点击即可复制。
- 批量识别:切到"批量OCR"标签页,把图片直接拖进左侧列表,点"开始任务",顶部进度条会显示处理进度与剩余数量。
批量识别页支持一次拖入几十上百张图片,逐张显示耗时与状态,任务完成后结果自动落盘。
从第二步开始,你就已经拥有了一个随时待命的"离线识图助手"。
三、核心功能逐个拆解
Umi-OCR的能力可以归纳为四大板块,各有各的适用场景:
| 功能板块 | 面向场景 | 一句话亮点 |
|---|---|---|
| 截图OCR | 课件、聊天记录、网页截取 | 框选即识别,结果可编辑可复制 |
| 批量OCR | 成百上千张图片的整理归档 | 支持常见图片格式,无数量上限 |
| 文档识别 | PDF、EPUB等扫描件转文本 | 支持双层可搜索PDF输出 |
| 二维码工具 | 扫码与批量生成 | 兼容19种码制协议 |
3.1 截图OCR:随手一框,文字即来
截图OCR是整个软件使用频率最高的入口。除了框选识别,它还支持把剪贴板里的图片直接粘贴进来处理;左侧预览区可以用鼠标划选局部文字,右侧记录区允许跨条目编辑和复制。识别完成后若想微调,直接在记录里改动即可,不用重跑任务。
截图识别页左侧为图片预览,右侧为可编辑的识别记录,支持划选复制与局部校对。
3.2 批量OCR:一次导入,睡醒收工
批量页是"整理狂魔"的最爱:支持jpg、png、webp、bmp、tif等常见格式,识别结果可保存为txt、jsonl、md、csv四种格式。它还内置了"忽略区域"功能——画几个矩形框,任务就会自动跳过框内文字,批量处理带水印或页眉页脚的图片时效果立竿见影。对于任务量特别大的情况,你甚至可以在设置里勾选"完成后自动关机",把耗时活留给深夜。
3.3 文档识别:让扫描PDF重新变得可搜索
面对扫描版PDF,Umi-OCR既能对整页做OCR提取文本,也能生成"双层PDF":上层保留原始页面图像,下层嵌入可复制的文字层,存档与检索两不误。忽略区域同样适用于文档任务,用来排除页眉页脚最合适不过。
3.4 二维码:识码与造码一体
在二维码页中,粘贴或拖入图片即可读取二维码、条形码,支持一图多码;反过来,输入文本也能生成指定尺寸与纠错等级的新码。前端同学调试登录流程、运营做物料投放,都省得再单独装一个扫码小工具。
四、让效率翻倍的实用技巧
功能会用只是及格,以下三个技巧才是拉开效率差距的关键:
- 排版解析方案:识别结果默认按段落分行,遇到多栏报纸或两栏PPT时,切到"多栏-按自然段换行",输出顺序就会从"先左后右、逐栏阅读"变成符合阅读习惯的连贯文本;处理代码截图则选"单栏-保留缩进",行首空格不会丢失。
- 忽略区域务必画大:矩形框要完全包住水印可能出现的所有位置,否则框外的半个文本块仍会被识别出来,反而更乱。
- 按用途选输出格式:
| 输出格式 | 适合用途 |
|---|---|
| txt / md | 快速编辑、笔记沉淀 |
| jsonl | 二次程序处理、数据挖掘 |
| csv | 表格化统计、Excel归档 |
| 双层PDF | 保留原版式、长期存档 |
五、进阶玩法:命令行与HTTP接口
当识别需求进入"定时任务、批量脚本"阶段,图形界面就有些笨拙了。Umi-OCR提供了命令行入口,主程序本身就是CLI程序:
# 对指定图片或文件夹执行识别,结果追加写入文件 umi-ocr --path "D:/扫描件/2025" --output_append "结果.txt" # 调用截图识别,无需鼠标框选,直接截取指定屏幕区域 umi-ocr --screenshot screen=0 rect=100,100,800,600 # 生成一个二维码图片,宽度128像素 umi-ocr --qrcode_create "https://example.com" "D:/码.png" 128开发人员还可以通过HTTP接口(默认端口1224)把识别能力接进自己的系统。例如用curl上传一张图片触发OCR:
curl -X POST "http://127.0.0.1:1224/api/ocr" \ -d '{"base64": "'"$(base64 -w0 test.png)"'"}'配合任务计划程序,你就能搭出"凌晨自动扫描文件夹→识别→结果入库"的全自动流水线。更妙的是,命令行支持参数简写(如--screenshot可简写为--sc),写脚本时能省不少字符。
六、常见问题排查清单
遇到问题时先对照这份清单,大部分情况都能自己解决:
- 启动后界面空白或截图闪烁→ 多半是显卡渲染不兼容,到"全局设置"里切换渲染器,或直接关闭硬件加速。
- 长图/大图识别报错→ 在批量页设置中调高"限制图像边长"的数值,给大图留足处理空间。
- 水印没被过滤干净→ 检查忽略区域是否完整包住目标文本块,并确认框选的是"整块文字"而不是单个字符。
- 命令行指令没反应→ 确认HTTP服务已开启(默认开启),且使用的是主程序入口而非备用启动脚本。
- 想换更快的引擎→ Umi-OCR支持插件化引擎,可随时导入并切换不同的离线OCR引擎插件。
结语:从"能用"到"用好"
回看这一路:从解压即用的快速上手,到批量处理、忽略区域、排版解析的效率技巧,再到命令行与HTTP接口的自动化玩法,Umi-OCR的价值恰恰在于"零成本起步、高上限进阶"——普通用户十分钟就能跑通流程,开发人员又能把它嵌入任意工作流。项目本身保持着活跃更新,接口文档与命令行手册(见项目docs目录下的README_CLI.md与http手册)值得随时翻阅。建议你现在就下载一份,挑一张压箱底的旧截图试一次,感受一下"不联网也能秒出文字"的畅快。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考