从扫描件到可编辑文字:离线OCR软件 Umi-OCR 手把手实操指南
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
深夜加班,桌上摊着一摞只能看、不能复制的材料:扫描版合同、聊天记录截图、PDF 会议纪要。逐字重打要熬到天亮?其实一款免费、离线的 OCR 软件就能救场。Umi-OCR就是这样一款开源免费的文字识别工具,截图、批量、PDF、二维码一应俱全,而且全程无需联网,图片不会离开你的电脑。
本文不打算按功能手册平铺罗列,而是顺着一条更真实的主线走:先确认工具靠不靠谱,再逐个解决"屏幕截图、成批图片、PDF 扫描件"这三类你迟早会遇到的场景,最后聊聊那些让效率翻倍的附加功能。
开工前,先确认它靠不靠谱
OCR(光学字符识别)的原理,是把图片里的文字"读"出来,变成可以复制、搜索、编辑的文本。判断一款 OCR 软件是否值得长期使用,通常看三件事:
- 是否离线:识别完全在本机完成,敏感文件不出门,断网照样能用;
- 是否免费:不设字数上限、不卖会员、不会偷偷上传你的资料;
- 是否易上手:绿色免安装,解压就能跑。
Umi-OCR 三点全占。获取方式也很简单:用git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR拉取源码,或直接解压仓库里的Umi-OCR_Rapid_v2.1.5.7z。Windows 双击Umi-OCR.exe启动,Linux 用户运行umi-ocr.sh。
💡 小贴士:电脑上没有压缩软件的话,可以改用自解压版本(
.7z.exe),双击即自动完成解压,连装软件这步都省了。
场景一:屏幕上的字,三步变可编辑文本
工作中最频繁的尴尬,是屏幕上明明有文字却复制不了——网页里的段落、聊天记录、报错提示,全都只能干瞪眼。截图文字识别就是为这个场景准备的:随时唤起截图工具,框选即识别。
操作只需三步:
- 打开软件,停留在「截图OCR」标签页;
- 按下默认快捷键
Ctrl+Alt+Z唤起截图工具; - 拖拽出矩形选框,把想提取的文字圈进去,松开鼠标即可。
识别完成后,在结果区右键即可复制或全选,还可以隐藏文字层与原图对照,检查有没有认错的地方。结果可直接保存为 TXT、MD 等格式。
💡 小贴士:快捷键不顺手?去「全局设置 → 快捷键」随时改。想重复截取同一片区域,用
Ctrl+Alt+X即可。
场景二:几十张图片要转文字,别一张张来
截图适合零散需求,可一旦面对"几十张照片、上百页资料",逐张识别就成了一场灾难。此时该请出批量图片转文字功能。
在「批量OCR」标签页中:
- 点击「选择图片」,或者把文件直接拽进列表区;
- 支持 JPG、PNG、WebP、BMP、TIFF 等常见格式,一次可挂入数百张;
- 点「开始任务」,进度条走完后,结果按文件分条展示,并附置信度参考。
批量结果支持一次性导出,格式任选:纯文本 TXT、表格 CSV(Excel 可直接打开)、标记语言 MD、面向开发者的 JSONL。
场景三:PDF扫描件转文本,"只能看"变"能搜"
纸质资料扫描成的 PDF,本质上是一堆图片,文字既不能复制也不能搜索。Umi-OCR 能把这类PDF扫描件转文本,甚至生成双层 PDF。
入口依然在「批量OCR」:点击「选择文件」导入 PDF,软件会自动分页识别。输出方式有两种,按需选择:
| 输出类型 | 适用场景 |
|---|---|
| 纯文本 | 只要文字内容,用于整理、翻译、归档 |
| 双层 PDF | 保留原始扫描图,同时让文字可复制、可搜索 |
💡 小贴士:扫描件常有页眉页脚或水印干扰识别。用「忽略区域」功能把这些位置框出来,软件会自动跳过,识别结果干净得多。
进阶惊喜:二维码与个性化设置
处理完正事,Umi-OCR 还有两样"顺手工具"值得一试。
二维码扫码与生成。粘贴或截图任意二维码图片,即可识别其中内容;反过来,输入一段文本也能生成自己的二维码。支持 QRCode、DataMatrix、PDF417 等 19 种编码格式。
界面按你的习惯来。在「全局设置」标签页中,可以一键切换界面语言与主题(浅色、深色都有)、调整快捷键、配置默认输出格式。软件界面本身已翻译成多国语言,配合内置的多国语言识别库,中文、英文、日文、韩文等 50+ 语言都能处理。
💡 小贴士:识别结果不理想时,优先检查三件事——图片是否清晰、框选区域是否精准、排版解析方案是否选对(如"多栏-按自然段换行")。
卡住的时候,去哪找答案
- 想在命令行里批量处理图片?参考 docs/README_CLI.md;
- 想把自己开发的程序接入 OCR 能力?接口文档在 docs/http/README.md;
- 想了解版本演进与新增功能?关注根目录的 CHANGE_LOG.md。
现在就动手,把文字掌控权拿回来
从"对着扫描件叹气"到"几分钟批量转文字",Umi-OCR 把文字提取的门槛降到了最低:免费、离线、解压即用,截图、批量、PDF、二维码四大场景全覆盖。下次再遇到复制不了的文字,别再手动打字了——下载一份,先跑通第一次截图识别,你马上就能感受到差距。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考