☰
免费离线OCR完整上手:Umi-OCR 截图OCR、批量图片文字识别与扫描版PDF提取文字实测
2026/9/29 5:26:37 网站建设 项目流程

免费离线OCR完整上手:Umi-OCR 截图OCR、批量图片文字识别与扫描版PDF提取文字实测

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费离线 OCR工具:代码全开源,识别全程在本机完成,断网照跑,没有登录和上传环节。我实测了大约两周,用它处理完 300 多张书页照片和一本 500 多页的旧 PDF,全程没有连过一次网。

上手:从解压发行包到出第一条识别结果

免费 OCR 能不能信?标准就一条:代码摆不摆在明面上。Umi-OCR 全部代码开源,你在意的细节都能翻源码核实;图片从头到尾不离开本机,不存在登录、上传环节;中文、英文、日文等多语言识别库内置,切换语言不用下载模型。

📦 发行包分两种后缀:.7z需要解压软件,.7z.exe是自解压包,没装压缩工具就双击后者。解压后双击Umi-OCR.exe启动,全程零安装。首次打开,界面跟随系统语言显示,标签页共五个:截图OCR、批量OCR、文档识别、二维码、全局设置。建议先点右上角的锁把标签页锁定,防止误关。之后进截图OCR页框选一块屏幕文字,就能拿到第一条结果——实测从解压到这一步不超过 5 分钟。

场景一:截图OCR,把屏幕上的文字变成可复制文本

任务很直接:屏幕上有一段文字(代码、论文、聊天记录),要变成能复制的文本。截图OCR给三种输入方式:按快捷键框选屏幕、把别处复制的图片粘贴进来、或把本地图直接拖进窗口。常规截图基本即时出结果。

决定复制效果好不好用的,是「排版解析方案」这个设置项:识别代码截图时选单栏-保留缩进,行首缩进和行内空格原样保留,复制进编辑器不用重新排版;读左右两栏的论文时选多栏-按自然段换行,两栏文字按阅读顺序输出,不会左右交错。右侧记录栏里划选多条记录,可以一起复制或存成 txt。

场景二:批量图片文字识别,几百张一次拖完

任务升级:一次要识别大量图片。我在批量OCR页把 300 多张书页照片一次性拖进任务列表,点「开始任务」,之后就不用管了。支持的常见格式有jpg / png / webp / bmp / tif,数量没有上限。

结果能存成txt、jsonl、md、csv四种格式,其中 csv 直接进 Excel 就能看。有一批结果我导出成 csv 进了 Excel,省去了逐条录入。

素材里有重复干扰项的话,先处理。我的照片右上角带拍摄时间水印、页脚有阴影:打开「忽略区域」编辑器,按住右键把水印可能出现的位置框出来,执行时这些区域的文字会被整块跳过,导出来的结果就干净了。

场景三:扫描版PDF提取文字,输出双层可搜索PDF

任务:没有文字层的旧书 PDF,翻起来等于翻照片。那本 500 多页的旧 PDF 就是这样。文档识别页支持pdf、xps、epub、mobi、fb2、cbz等格式,对扫描件做完 OCR 后输出「双层可搜索 PDF」:底层是原图,保持原书排版;上层是透明文字,可以全文搜索、划词复制。在成品里搜一个术语,几秒内就能列出所有相关段落。

文档识别同样支持忽略区域:那本几百页的书,每页页眉页脚都印着书名和页码,提前把忽略框画好,正文里就不会混进这些重复的字。多个大文件可以排队处理,再配合任务完成后的自动关机,睡前把任务挂上,机器跑完自己关机。

避坑与边界:先知道这三件事再开跑

现象原因应对
超长截图后半段文字丢失默认有边长保护,过长的图会被截断识别到页面设置里把「限制图像边长」调高,重跑一遍
结果混进水印、时间戳、页码水印、页眉页脚被当成正文识别忽略区域编辑器里按住右键框住固定位置,且框要完整包住文本块才生效
手写体、低清老照片识别率明显下降离线本地引擎的固有极限,没有设置可调改善拍摄与素材清晰度;极限准确率需求只能走云端方案

第三行没有配置能救。说句实话:离线引擎对潦草手写体、低清老照片的识别率,确实不如云端大厂的在线 OCR。我的素材以打印体和清晰截图为主,这个取舍对我的用途够用了;但如果你的素材以手写和低清为主,下载前就把这条算进成本。⚠️

从桌面工具到自动化接口:二维码、命令行与 HTTP

二维码页能干两件事:识别19 种码制协议,支持一图多码;反向也行,输入文本直接生成二维码图片,纠错等级可调。

想把 OCR 嵌进自己的工作流,命令行和 HTTP 接口都开放了,手册分别在 docs/README_CLI.md 和 docs/http/README.md:🔌

  • 命令行:umi-ocr --path "D:/imgs" --output result.txt,整个文件夹批量识别并输出到 txt
  • HTTP:向http://127.0.0.1:1224/argv发送 JSON 指令列表(如["--screenshot"])

界面默认跟随系统语言,内置简中、繁中、英、日等,也可在「全局设置 → 语言/Language」手动切换。

下载前自问三个问题

  1. 资料能不能离开本机?工作文档、论文扫描件、旧书 PDF,隐私是刚需 → Umi-OCR 全程本机识别、解压即用零安装,正好对路。
  2. 工作量是几张清晰截图,还是几百张批量任务?要批量处理大量图片、把扫描件变成双层可搜索 PDF,或计划用命令行、HTTP 做集成 → 都支持,排队处理和自动关机也备着。
  3. 素材是清晰打印体,还是潦草手写、低清老照片?以后者为主且追求极限识别率 → 本地引擎打不过云端,换方案;系统不是 Windows x64 / Linux x64(比如 Mac),或者想要云端那种"传完即出、按量付费"的模式 → 也不用选它。❓

资料出不了本机?现在把 Umi-OCR 解压起来,框一块屏幕上的文字跑一遍试试。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询