Umi-OCR 本地 OCR 实操:从单张识别到批量跑 40 页扫描
2026/8/31 8:03:59 网站建设 项目流程

Umi-OCR 本地 OCR 实操:从单张识别到批量跑 40 页扫描

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

下午三点,桌上摊着 40 页扫描合同,老板要下班前改完签字页。逐字手敲不现实。把图片文件夹拖进 Umi-OCR,点一下「开始任务」,批量 OCR 全程在本地跑,40 张 PNG 大约 6 分钟变成一份能编辑的 txt。这篇讲的就是我用了两周的真实流程,只说有用的。

📦 它到底能做什么

Umi-OCR 是一款免费开源的桌面 OCR 软件,识别模型跑在你自己的机器上,图片不离开机器。它提供两个主要入口:截图 OCR 和批量 OCR。前者负责从屏幕上抠一段文字或一段代码,后者负责一次性处理一整个文件夹的图片。内置 Rapid-OCR 和 Paddle-OCR 两套引擎,还带多语言识别库,覆盖简体中文、繁体中文、英文、日文等。PDF 文档识别、二维码和条形码的读取与生成也有。下图是一次典型的截图识别:左栏是代码图片,右栏是对应的文本,复制就能用。

🛠️ 从打开到出结果:批量识别一个文件夹的完整闭环

选一个最典型的场景:把文件夹里所有图片批量识别。整个闭环分四步。

第一步,拿到工具。从项目 Releases 页下载最新压缩包,解压到一个目录,双击 Umi-OCR.exe 就能运行。没有安装环节,也不依赖系统环境,整个文件夹拷走就能用。

第二步,基本设置。首次打开,去「全局设置」页看一眼:界面语言跟随系统,也可以手动切换;主题选浅色或深色;再确认一下 OCR 引擎。

第三步,执行任务。打开批量 OCR 页,点「选择图片」加入文件夹,或者直接把图片拖进列表。在右侧设置里确定保存目录和输出文件类型,然后按下「开始任务」。顶部进度条显示总体进度,列表里能看到每张图的耗时和置信度。

第四步,拿到输出。任务结束后,结果按你选的格式写成文件(txt、jsonl、md、csv),右侧记录栏保留每张图片的文字,右键可以复制单条或全选,方便抽查。想把这步放进脚本,命令行一句话就够:

umi-ocr --path "D:/contract_scan"

传入文件夹路径,它会把里面所有图片识别完,也可以再加--clip之类的输出参数。

⚠️ 批量 OCR 的三个常见坑,怎么绕过去

水印和页眉混进结果:用忽略区域

一批带公司 logo 或水印的图片,识别结果里总会混进水印文字。打开批量页右侧设置里的忽略区域编辑器,按住鼠标右键画矩形,框内文字在任务中不输出。两个实际要点:框画大一点,把水印可能出现的位置整个包进去;忽略的单位是整个文本块,不是单个字符,框得随意了把正文一行包进去,那一行会整个被跳过。

输出格式怎么选

默认 txt 够人读,一张图一个文件。结果要喂给脚本,选 JSONL,一行一张图的结果和置信度,jq 或 pandas 都好解析。要进 Excel 核对就选 csv。用图片直接拼文档的话,md 合适。

排版顺序怎么保对

识别引擎输出的是一个个「文本块 + 坐标」,最终阅读顺序由「排版解析」方案拼出来。双栏论文选多栏-按自然段换行,左右两栏的段落不会串;代码截图选单栏-保留缩进,源码的缩进和空行原样保留。日常单栏文字用默认方案就行,不用动它。

⚖️ 跟云端 OCR 服务放在一起看

云端 OCR 服务是成熟选项:传文件、拿结果,弹性好、不用自己维护。代价是图片要过网,通常按次计费,文件敏感度也有讲究。Umi-OCR 的长处正好相反:模型本地推理,不联网、不按张收费、数量不设限,内网和涉密场景里能用。代价是速度受本机 CPU 限制,首次调用加载模型,略慢。一句话分法:少量、一次性、高并发的需求适合云端,日常办公和处理敏感文档,本地更省心。

👥 谁适合用,谁可以跳过

如果你经常处理扫描件、截图、代码图片,或者一次要处理几百张图,这就是为你准备的工具。多语言团队也可以放心,界面内置简体中文、繁体中文、英文、日文等,一键切换。

每月只识别个三五张图的,可以跳过,系统截图加手工修正足够。对复杂表格或手写字的精度要求极高的,本地和云端一样,纯 OCR 都需要人工复核。

下一步:打开项目 Releases 页,下载最新压缩包,解压,把一个文件夹拖进去试。跑完一批 40 张图,这篇文章里的功能你就都摸到了。更多命令行参数和服务配置,见仓库里的命令行手册与HTTP 接口手册。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询