免费离线OCR软件完整上手:用 Umi-OCR 把截图、批量图片和PDF扫描件快速转成可编辑文字
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费开源、完全离线的OCR文字识别软件:截图、批量图片、PDF扫描件里的文字,都能在本地快速提取为可编辑文本,全程不联网。无论你是学生、办公族还是开发者,读完这篇文章就能直接上手,把零散的文字素材变成可搜索、可复制的资产。
图片里的字,什么时候最让人抓狂?
你一定遇到过这些场景:
- 网课截图、网页长图里的文字"钉"在图片上,复制不了、搜不到
- 扫描版合同、旧书PDF只能看不能选,想引用就得一个字一个字手敲
- 批量截图里混着水印、LOGO,识别结果全是乱码广告
用在线OCR工具呢?图片要上传云端,隐私没底;免费额度少、还要排队;断网就彻底抓瞎。
而 Umi-OCR 把这些问题一次打包解决了:免费、开源、纯离线运行,识别过程不离开你的电脑,截图识别、批量识别、PDF文档识别、二维码扫描生成全都有,还内置多国语言识别库。
不装软件不联网,两分钟把工具"捡"到电脑上
Umi-OCR 是绿色免安装设计,跑起来比想象中快:
- 克隆项目仓库:
git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR - 找到压缩包
Umi-OCR_Rapid_v2.1.5.7z,解压到任意文件夹 - Windows 双击
Umi-OCR.exe启动;Linux 用户运行umi-ocr.sh
第一次启动,软件会自动跟随你的系统语言切换界面,无需任何配置就能用。
划重点:所有识别都在本机完成,拔掉网线照样干活。图片不出电脑,隐私问题天然解决。
第一板斧:截图识别,把"不能复制的画面"变成文字
截图OCR 是你最先用上的功能,三步出结果:
- 打开「截图OCR」标签页
- 按默认快捷键
Ctrl+Alt+Z(可在全局设置中修改)唤起截图框 - 框选目标区域,松开鼠标,文字即刻出现在右侧记录栏
识别结果可以直接Ctrl+C复制,也可以在记录栏里编辑修正;甚至从别处复制一张图片直接粘贴进来就能识别,不必走截图流程。
值得注意:结果顺序乱糟糟?去「文本后处理→排版解析方案」里选。多栏杂志选"多栏-按自然段换行",代码截图选"单栏-保留缩进",竖排(从右到左)文本也能自动整理。
第二板斧:几百张图片批量转文字,还能自动躲开水印
批量OCR 页面是处理大量图片的利器:
- 点击「选择图片」或直接拖拽文件进列表,支持 jpg、png、webp、bmp、tif 等常见格式
- 结果可保存为 txt、md、csv(Excel 直接打开)、jsonl 四种格式
- 没有数量上限,几百张图排队处理,实时显示进度和耗时
其中最实用的功能叫忽略区域:图片角落的水印、页眉、LOGO,按住右键画几个矩形框住,任务中这些位置的文字会被自动跳过,不会再混进结果里。
任务跑完后还可以选择自动关机或休眠——晚上挂机处理几百张图,机器干完活自己休息。
第三板斧:PDF扫描件转可搜索文本,甚至能输出双层PDF
在「文档识别」标签页,你可以导入 pdf、xps、epub、mobi 等格式的文档。扫描版PDF会整本识别,并支持输出为双层可搜索PDF:外观仍是原图,但底层文字可选中、可复制、可全文搜索。
这个页面同样支持忽略区域,专门用来排除页眉页脚;任务完成后可自动关机或休眠,适合夜里批量处理厚文件。
二维码功能也顺手包了
除了文字识别,Umi-OCR 还内置了完整的二维码工具:
- 扫码:截图、粘贴或拖入带码的图片,自动读取内容,一张图多个码也能全识别
- 生成码:输入文本直接生成二维码图片
支持 19 种编码协议,包括 QRCode、DataMatrix、PDF417、Code128、EAN 等,还可调节纠错等级。
调成顺手的样子:语言、主题、快捷键,还能命令行调用
「全局设置」页面有几个值得先动手的地方:
- 语言/Language:可手动切换简体中文、繁体中文、英语、日语等界面语言
- 主题:多套亮色/暗色主题随意换
- 快捷键:截图、重复上次截图等均可自定义
- 快捷方式与开机自启:一键创建桌面入口
如果你是开发者,还有两条自动化路径:命令行手册见 docs/README_CLI.md,支持umi-ocr --path "D:/图片目录"批量识别、umi-ocr --qrcode_read读码等指令;HTTP 接口文档见 docs/http/README.md,本地起服务后就能在自己的程序里调用识别能力。
新手最容易踩的四个坑
- 界面闪烁、截图错位:多半是显卡渲染的问题。去「全局设置→界面和外观→渲染器」,切换渲染方案或关闭硬件加速即可。
- 超大长图识别失败:到批量页「设置→文字识别→限制图像边长」,把数值调高再试。
- 结果里混入水印广告:不要靠肉眼挑,用「忽略区域」画框排除,一劳永逸。
- 竖排文字识别不出:确认已安装对应语言包,排版解析虽然能整理竖排顺序,但前提是引擎本身支持该语言。
动手吧,它一直在更新
Umi-OCR 免费、开源、离线,功能覆盖从截图到整本扫描书,入门门槛却低到几乎为零。clone 仓库或直接解压发行包,两分钟内就能跑起来。想跟进最新功能与改进,不妨偶尔翻一翻项目里的 CHANGE_LOG.md——这款工具还在持续进化,现在上手,正当时。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考