免费离线OCR软件Umi-OCR,不联网也能把图片变成可编辑文字
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
你有没有遇到过这样的场景:网页上的文字被禁止复制,只能对着屏幕一个字一个字地敲;老师发来的PDF扫描件是图片,想引用其中的段落只能手动打一遍;收藏的上百张截图里有重要的信息,却没人有空去整理。面对这些"看得见却拿不到"的文字,绝大多数人的第一反应是打开某个在线OCR网站——把图片传上去,等它转成文字,再复制回来。
可在线方案真的省心吗?把工作文件、学习资料上传到别人的服务器,本身就让人心里打鼓;免费额度用完后频繁限流,识别速度慢到怀疑人生;网络一波动,整个流程直接卡死。这篇文章想跟你介绍一个完全不同的选择:Umi-OCR,一款免费、开源的离线OCR软件。它把整个文字识别引擎都装在你的电脑里,断网也能干活,截图识别、批量图片识别、PDF扫描件转文字、二维码工具全部内置,解压就能用。接下来,我按从简单到进阶的顺序,带你把它真正用起来。
🚀 第一步:本地部署,5分钟从下载到首次识别
Umi-OCR采用的是绿色免安装设计。你不需要运行安装向导,也不需要配置什么环境变量,整个过程只有三步:
- 从项目仓库下载最新发行版压缩包
Umi-OCR_Rapid_v2.1.5.7z(仓库地址:https://gitcode.com/GitHub_Trending/um/Umi-OCR );如果你想研究源码,也可以用git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR把整个仓库拉下来。 - 把压缩包解压到任意文件夹——桌面、D盘、甚至U盘都行,位置自由。
- 双击
Umi-OCR.exe启动(Linux用户运行umi-ocr.sh)。
首次启动后,软件会自动按照你系统的语言显示界面。它支持Windows 7 x64和Linux x64,老电脑也能跑得动。有一点特别贴心:软件完全离线运行,所有识别都在本机完成,文件不会上传到任何地方。
小提示:解压后如果弹出缺少运行库的报错,多半是系统缺少VC运行库,装一下微软官方运行库即可解决,项目自带的
Help 帮助.txt里也有详细的排查说明。
📸 截图识别:遇到不能复制的文字,一键框选搞定
日常使用频率最高的功能,非截图识别莫属。浏览器里禁止复制的文章、视频里的字幕、软件界面上的报错信息……只要屏幕上显示得出来,就能变成可编辑的文字。
操作方法非常直观:
- 打开「截图OCR」标签页。
- 按下快捷键(默认
Ctrl+Alt+Z),屏幕会进入截图模式。 - 按住鼠标框选想要识别的区域,松开后,文字立刻出现在右侧识别结果栏里。
识别结果支持直接复制、划选编辑,还能保存为TXT、JSONL、MD等格式。如果你经常重复截图同一片区域(比如每次截同一个软件的界面),试试Ctrl+Alt+X重复上一次截图,效率直接翻倍。
这里藏着一个容易被忽略但很实用的功能:排版解析方案。OCR引擎按行输出文字,但"一行"不等于"一句话"。比如双栏排版的论文截图,如果不做处理,左栏和右栏的文字会交错在一起。在设置里选择合适的排版方案(例如"多栏-按自然段换行"),软件会自动理顺阅读顺序,输出接近原文的段落结构,连代码截图也能保留缩进。
🗂️ 批量图片识别:几百张图,一次任务全部处理完
如果你的需求是"把一堆图片里的文字都提取出来",一张张截图显然不现实。切换到「批量OCR」标签页,把图片文件夹整个拖进列表,剩下的交给任务队列。
批量任务支持jpg、png、webp、bmp、tif等常见格式,一次可以导入几百张,没有数量上限。识别结果能按需选择保存格式:
| 输出格式 | 适用场景 |
|---|---|
| TXT | 纯文本阅读,通用性最强 |
| MD | 带标题结构的标记文档 |
| CSV | 用Excel直接打开做表格 |
| JSONL | 开发者做数据处理 |
批量模式里还有一个杀手级功能:忽略区域。很多资料图片上带着水印、页眉、页脚,这些文字会混进识别结果里,干扰阅读。你可以进入忽略区域编辑器,用鼠标在预览图上画几个矩形框,把水印可能出现的区域框起来——这些区域内的文字会被整体跳过,不会出现在结果里。
📄 PDF扫描件:从"不能复制"到"全文可搜索"
纸质教材扫描成PDF后,里面的文字就是一张张图片,既不能复制,也搜索不到。Umi-OCR的「文档识别」标签页就是为这类文件准备的,支持pdf、epub、mobi、cbz等多种文档格式。
操作流程是:导入PDF → 选择输出格式 → 启动任务。软件会自动分页识别每一页,输出成可编辑的文本。更强大的是双层可搜索PDF:底层保留原始扫描图像,上层叠加识别出的文字层。生成的PDF看起来跟原文件一模一样,但文字可以复制、可以搜索,发出去给别人用也毫无障碍。
批量识别里提到的「忽略区域」在这里同样适用——遇到带页眉页脚的扫描文档,提前把页眉页脚的位置框起来,识别结果会干净很多。如果文件很长,还可以设置任务完成后自动关机或休眠,晚上挂着跑,早上起来直接收结果。
🔧 进阶玩法:二维码工具、命令行调用与多语言
把最常用的几个功能用熟之后,Umi-OCR还有不少值得挖掘的能力。
二维码工具。它不只是识别,还能生成。扫码支持一图多码,覆盖QRCode、DataMatrix、PDF417等19种编码协议;生成码时可以自定义纠错等级和图片尺寸,做名片、做物料都够用。
命令行调用。开发者或喜欢自动化操作的用户,可以用命令行直接驱动OCR:
# 指定图片路径识别 umi-ocr --path "D:/xxx.png" # 识别剪贴板里的图片 umi-ocr --clipboard # 生成二维码 umi-ocr --qrcode_create "文本内容" "D:/输出图片.jpeg"命令行把Umi-OCR变成了一个可以被脚本调用的"文字提取引擎",配合定时任务或自动化工具,能拼出很多有意思的玩法。完整的参数说明在项目文档docs/README_CLI.md里;如果想把OCR能力集成到自己的程序里,还有HTTP接口文档可用。
多语言与界面定制。Umi-OCR内置多国语言识别库,界面本身也支持简体中文、繁体中文、英语、日语等多种语言切换,在「全局设置 → 语言/Language」里即可调整。
「全局设置」页面还集中了主题切换(浅色/深色)、字体大小、渲染器方案、快捷键管理等选项。如果遇到界面闪烁或错位,试着把「渲染器」切换为其他方案或关闭硬件加速,大多能解决。
写在最后
回看整个体验,Umi-OCR最打动我的三点是:
- 真正的离线与免费:识别完全在本地完成,隐私有保障,不用看任何服务商的脸色;
- 绿色免安装:解压即用、拷走即走,不污染系统,适合各种受限环境;
- 能力完整:截图、批量、PDF、二维码、命令行一条龙,覆盖了普通人到开发者的大部分需求。
如果你也受够了"图片里的文字复制不出来",现在就下载一个试试吧。从框选一张截图开始,你可能会发现,自己再也回不去对着屏幕逐字打字的日子了。遇到问题或想提建议,可以去项目仓库的Issues区聊聊;项目还在持续更新,留意仓库的更新日志,说不定下一个版本就会多出你期待的功能。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考