免费离线OCR软件完整上手:用 Umi-OCR 把截图、批量图片和PDF扫描件快速转成可编辑文字
2026/9/6 14:05:34 网站建设 项目流程

免费离线OCR软件完整上手:用 Umi-OCR 把截图、批量图片和PDF扫描件快速转成可编辑文字

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费开源、完全离线的OCR文字识别软件:截图、批量图片、PDF扫描件里的文字,都能在本地快速提取为可编辑文本,全程不联网。无论你是学生、办公族还是开发者,读完这篇文章就能直接上手,把零散的文字素材变成可搜索、可复制的资产。

图片里的字,什么时候最让人抓狂?

你一定遇到过这些场景:

  • 网课截图、网页长图里的文字"钉"在图片上,复制不了、搜不到
  • 扫描版合同、旧书PDF只能看不能选,想引用就得一个字一个字手敲
  • 批量截图里混着水印、LOGO,识别结果全是乱码广告

用在线OCR工具呢?图片要上传云端,隐私没底;免费额度少、还要排队;断网就彻底抓瞎。

而 Umi-OCR 把这些问题一次打包解决了:免费、开源、纯离线运行,识别过程不离开你的电脑,截图识别、批量识别、PDF文档识别、二维码扫描生成全都有,还内置多国语言识别库。

不装软件不联网,两分钟把工具"捡"到电脑上

Umi-OCR 是绿色免安装设计,跑起来比想象中快:

  1. 克隆项目仓库:git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR
  2. 找到压缩包Umi-OCR_Rapid_v2.1.5.7z,解压到任意文件夹
  3. Windows 双击Umi-OCR.exe启动;Linux 用户运行umi-ocr.sh

第一次启动,软件会自动跟随你的系统语言切换界面,无需任何配置就能用。

划重点:所有识别都在本机完成,拔掉网线照样干活。图片不出电脑,隐私问题天然解决。

第一板斧:截图识别,把"不能复制的画面"变成文字

截图OCR 是你最先用上的功能,三步出结果:

  1. 打开「截图OCR」标签页
  2. 按默认快捷键Ctrl+Alt+Z(可在全局设置中修改)唤起截图框
  3. 框选目标区域,松开鼠标,文字即刻出现在右侧记录栏

识别结果可以直接Ctrl+C复制,也可以在记录栏里编辑修正;甚至从别处复制一张图片直接粘贴进来就能识别,不必走截图流程。

值得注意:结果顺序乱糟糟?去「文本后处理→排版解析方案」里选。多栏杂志选"多栏-按自然段换行",代码截图选"单栏-保留缩进",竖排(从右到左)文本也能自动整理。

第二板斧:几百张图片批量转文字,还能自动躲开水印

批量OCR 页面是处理大量图片的利器:

  • 点击「选择图片」或直接拖拽文件进列表,支持 jpg、png、webp、bmp、tif 等常见格式
  • 结果可保存为 txt、md、csv(Excel 直接打开)、jsonl 四种格式
  • 没有数量上限,几百张图排队处理,实时显示进度和耗时

其中最实用的功能叫忽略区域:图片角落的水印、页眉、LOGO,按住右键画几个矩形框住,任务中这些位置的文字会被自动跳过,不会再混进结果里。

任务跑完后还可以选择自动关机或休眠——晚上挂机处理几百张图,机器干完活自己休息。

第三板斧:PDF扫描件转可搜索文本,甚至能输出双层PDF

在「文档识别」标签页,你可以导入 pdf、xps、epub、mobi 等格式的文档。扫描版PDF会整本识别,并支持输出为双层可搜索PDF:外观仍是原图,但底层文字可选中、可复制、可全文搜索。

这个页面同样支持忽略区域,专门用来排除页眉页脚;任务完成后可自动关机或休眠,适合夜里批量处理厚文件。

二维码功能也顺手包了

除了文字识别,Umi-OCR 还内置了完整的二维码工具:

  • 扫码:截图、粘贴或拖入带码的图片,自动读取内容,一张图多个码也能全识别
  • 生成码:输入文本直接生成二维码图片

支持 19 种编码协议,包括 QRCode、DataMatrix、PDF417、Code128、EAN 等,还可调节纠错等级。

调成顺手的样子:语言、主题、快捷键,还能命令行调用

「全局设置」页面有几个值得先动手的地方:

  1. 语言/Language:可手动切换简体中文、繁体中文、英语、日语等界面语言
  2. 主题:多套亮色/暗色主题随意换
  3. 快捷键:截图、重复上次截图等均可自定义
  4. 快捷方式与开机自启:一键创建桌面入口

如果你是开发者,还有两条自动化路径:命令行手册见 docs/README_CLI.md,支持umi-ocr --path "D:/图片目录"批量识别、umi-ocr --qrcode_read读码等指令;HTTP 接口文档见 docs/http/README.md,本地起服务后就能在自己的程序里调用识别能力。

新手最容易踩的四个坑

  1. 界面闪烁、截图错位:多半是显卡渲染的问题。去「全局设置→界面和外观→渲染器」,切换渲染方案或关闭硬件加速即可。
  2. 超大长图识别失败:到批量页「设置→文字识别→限制图像边长」,把数值调高再试。
  3. 结果里混入水印广告:不要靠肉眼挑,用「忽略区域」画框排除,一劳永逸。
  4. 竖排文字识别不出:确认已安装对应语言包,排版解析虽然能整理竖排顺序,但前提是引擎本身支持该语言。

动手吧,它一直在更新

Umi-OCR 免费、开源、离线,功能覆盖从截图到整本扫描书,入门门槛却低到几乎为零。clone 仓库或直接解压发行包,两分钟内就能跑起来。想跟进最新功能与改进,不妨偶尔翻一翻项目里的 CHANGE_LOG.md——这款工具还在持续进化,现在上手,正当时。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询