免费离线OCR工具Umi-OCR完整上手教程:从截图识别到PDF批量处理
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
每天打开电脑,你是不是也遇到过这样的场景:刚截了一张网页图片,想把里面的文字复制下来,却发现是图片没法选中;同事发来一份扫描版PDF,急需要里面的文字,却只能一页页手打。别急着叹气,今天要介绍的这款免费开源软件——Umi-OCR,就是专门解决这类"看得见却复制不了"的文字提取难题的。它是一款完全离线运行、解压即用的OCR(光学字符识别)工具,不需要联网、不注册账号、不充值会员,装好就能把图片和文档里的文字"抠"出来。这篇文章会带你从零开始,一步步把它用起来。
快速认识它:一句话说清Umi-OCR是什么
Umi-OCR 是一款免费、开源、完全离线的桌面文字识别软件,支持 Windows 7 64位 与 Linux x64 平台。你可以把它理解成一个"本地文字搬运工":凡是图片里、扫描件里的文字,它都能原样识别出来,变成可以复制、搜索、编辑的普通文本。
在开始之前,先花30秒看看它的"亮点速览",判断它是否适合你:
| 亮点 | 说明 |
|---|---|
| 🆓 完全免费 | 所有代码开源,无内购、无广告、无次数限制 |
| 🔌 解压即用 | 无需安装,解压后双击Umi-OCR.exe即可运行 |
| 🌐 离线运行 | 识别全程在本机完成,断网也能用,数据不外传 |
| 🖼️ 四大标签页 | 截图OCR、批量OCR、文档识别、二维码,各司其职 |
| 🌍 多国语言 | 界面支持中英日俄等多语言,OCR模型同样多语言可选 |
| ⚡ 外部调用 | 支持命令行与HTTP接口,可接入自动化工作流 |
适合谁用?
- 经常需要从截图、照片、PDF扫描件中提取文字的学生和上班族
- 注重隐私、不愿意把文档上传到云端识别的用户
- 需要批量处理大量图片或文档的图书管理员、档案整理人员
- 想给软件写自动化脚本的开发者
不太适合谁?
- 追求"识别即排版"的极致还原(Umi-OCR 注重文字内容提取,复杂表格精确还原仍在开发计划中)
- 需要在线云服务、多设备同步的用户
如果您曾经用过在线OCR网站或某些收费识别工具,对比之下会发现:Umi-OCR 不限制识别张数、不压缩图片画质、不上传你的文件,这是它最实在的差异化优势。
第一次上手指南:从下载到完成第一次识别
第一步:获取软件包
Umi-OCR 发布的是.7z压缩包或.7z.exe自解压包,您可以从官方发布渠道下载。自解压包的好处是:即使电脑上没装压缩软件,双击也能自己解压。如果您是开发者,也可以通过 Git 克隆源码仓库https://gitcode.com/GitHub_Trending/um/Umi-OCR自行构建,不过普通用户建议直接下载发行版。
第二步:解压并启动
- 把压缩包解压到一个纯英文路径下(例如
D:\Tools\Umi-OCR),避免个别识别引擎对中文路径过敏。 - 进入解压后的文件夹,双击
Umi-OCR.exe。 - 首次启动时,软件会按您电脑的系统语言自动切换界面语言;第一次打开稍等几秒,加载OCR引擎后即可使用。
成功标准:看到主窗口出现"截图OCR""批量OCR""文档识别""二维码"等标签页,说明启动成功。首次运行时若弹出安全提示,选择"仍要运行"即可,因为软件为离线绿色版本,未做数字签名。
第三步:完成第一个任务——截图识别文字
- 切换到截图OCR标签页,此时软件进入待命状态。
- 按下截图快捷键(默认可在设置中自定义),屏幕出现取色框,用鼠标框选想要识别的区域。
- 松开鼠标,右侧"记录"面板会立刻显示识别出的文字。
- 用鼠标划选识别结果,按
Ctrl+C复制,粘贴到任何地方。
成功标准:截图框选后右侧出现与图片内容一致的文本,且可以正常复制,恭喜您已经完成了第一次识别!
体验心得:截图OCR 页面左侧是图片预览栏,可直接用鼠标划选复制图片上的文字框;右侧是识别记录栏,支持跨记录划选复制,非常适合快速处理零散内容。
核心功能拆解:四个最值得用的能力
1. 截图OCR:随截随识的"文字快照"
它是干什么的?把屏幕任意区域"拍照",立刻转成可复制的文字,适合网页、聊天记录、视频字幕等场景。
具体怎么用?在截图OCR页面按下快捷键唤起截图,框选区域即可;您也可以直接在其他地方复制一张图片,粘贴到Umi-OCR窗口里识别。
效果如何?识别结果支持即时编辑、复制;如果识别顺序不对,还可以在页面右侧的"文本后处理"里调整排版解析方案,让输出更符合阅读习惯。
这里特别提一下排版解析方案,它决定OCR结果按什么顺序、什么格式输出,预设方案包括:
| 方案 | 适用场景 |
|---|---|
| 多栏-按自然段换行 | 大部分情况,自动识别多栏布局,按自然段换行 |
| 多栏-总是换行 / 无换行 | 需要每句换行或强制合并单行时 |
| 单栏-按自然段换行 | 普通单栏文档,不区分多栏 |
| 单栏-保留缩进 | 识别代码截图,保留行首缩进与行中空格 |
| 不做处理 | 使用OCR引擎原始输出 |
2. 批量OCR:几百张图片一键搞定
它是干什么的?一次性把整个文件夹的图片批量识别成文字,没有数量上限。
具体怎么用?切到批量OCR标签页,把图片拖进左侧列表(支持jpg, jpeg, png, webp, bmp, tif, tiff等格式),点击"开始任务"即可。识别结果可保存为txt, jsonl, md, csv(Excel)四种格式。
效果如何?每个文件有独立进度显示,任务支持暂停,即使中途待机或休眠,只要不退出软件,回来后还能继续。如果处理的图片像素特别大,记得在"设置→文字识别→限制图像边长"中把数值调高(默认960,可调至2880甚至无限制),否则长图边缘的小字可能识别不全。
批量OCR 还内置一个隐藏利器——忽略区域:按住鼠标右键在图片预览上画几个矩形框,框内的文字(比如水印、LOGO、页眉页脚)就会被整块跳过,非常适合批量处理带统一水印的图片。
3. 文档识别:把PDF扫描件变成可搜索文本
它是干什么的?这是Umi-OCR的重头戏。它基于PyMuPDF引擎解析文档,支持pdf, xps, epub, mobi, fb2, cbz六种格式,可以把扫描件PDF里的文字提取出来,甚至输出双层可搜索PDF(底层是扫描原图,上层是透明文字层,搜索、复制、选中都OK)。
具体怎么用?在文档识别标签页拖入PDF文件,按需设置后开始任务。针对"既有扫描图又有原生文本"的混合文档,它有四种内容提取模式:
| 模式 | 含义 | 适用场景 |
|---|---|---|
| 混合OCR/原文本 | 有文本层直接拷贝,图片部分走OCR | 大多数电子版+扫描混排文档 |
| 整页强制OCR | 整页都走OCR识别 | 扫描质量参差的文档 |
| 仅OCR图片 | 只识别图片区域 | 图文混排、只需图中文字 |
| 仅拷贝原有文本 | 只提取PDF自带文本层 | 原生电子PDF(非扫描) |
效果如何?输出支持pdfLayered(双层可搜索PDF)和纯文本TXT,还能配合忽略区域排除页眉页脚,批量处理几百页的学术论文也不在话下。识别完成的双层PDF放进阅读器里,可以直接全文搜索关键词,从此告别"对着扫描件一页页翻"的苦日子。
4. 二维码:识别与生成一体
它是干什么的?既是扫码枪也是生成器:从图片中读取二维码、条形码,或把文字生成二维码图片。
具体怎么用?在二维码标签页中,截图、粘贴或拖入图片即可扫码,支持一图多码,兼容QRCode、Aztec、PDF417、DataMatrix、EAN13等19种码制协议。反向操作时,输入文本并选择协议与纠错等级,一键生成二维码图片。
效果如何?生成参数调整后二维码会自动刷新预览,所见即所得。顺带一提,v2.1.5 之后大部分标签页可以手动切换左右/上下双栏模式,浏览和操作更灵活。
避坑与常见误区:新手最容易踩的五个坑
误区1:图片越大越清晰,识别就一定更准其实不然。过大的图片会被引擎压缩处理,过度放大反而引入噪声。建议把"限制图像边长"设置在合理区间(普通文档960、大图2880),在精度和速度之间找平衡。真遇到模糊图,先自己锐化、调对比度再喂给软件。
误区2:忽略区域只用来去水印忽略区域的本意是"排除不需要的文字区域",页眉页脚、广告栏、签名印章都能用它划掉。批量处理论文时,把页眉页脚框起来,输出结果会干净得多。注意:它是按"整个文本块"来忽略的,矩形框尽量画大、完整包住要排除的内容。
误区3:识别结果一出来就直接用离线引擎再强也有识别率上限。关键文档建议先预览一遍,用Preview1.png这类预览功能对比原图与结果,再决定是否交付。
误区4:遇到界面错乱就以为软件坏了如果出现截屏闪烁、UI错位,先别急着卸载。到"全局设置→界面和外观→渲染器"切换渲染方案,或关闭硬件加速,多数问题迎刃而解。
误区5:忽略了输出格式的选择txt适合快速编辑,jsonl适合程序处理,csv可以直接用Excel打开,双层PDF适合存档。先想清楚用途再选格式,能省下二次转换的时间。
效率提升锦囊:批量、快捷键与自动化
最省心的批量处理方案
在"全局设置"里可以一键添加桌面快捷方式或设置开机自启。批量任务跑起来后,还可以设置任务完成后自动关机/待机,晚上挂着处理,第二天直接收结果,主打一个省心。
值得记住的快捷键
| 快捷键 | 功能 |
|---|---|
Ctrl+O | 快速添加文件 |
Ctrl+R | 开始/暂停任务 |
Esc | 隐藏主窗口 / 中断截图(v2.1.5起) |
命令行调用:让识别进入你的工作流
Umi-OCR 自带命令行接口(入口即主程序Umi-OCR.exe,前提是在全局设置中允许HTTP服务,默认开启)。几个常用指令:
# 鼠标框选截图并识别,结果存入文件 umi-ocr --screenshot --output result.txt # 识别剪贴板中的图片 umi-ocr --clipboard # 批量识别指定文件夹(含子目录) umi-ocr --path "D:/scans" # 识别二维码图片 / 生成二维码 umi-ocr --qrcode_read "D:/qrcode.png" umi-ocr --qrcode_create "Hello Umi" "D:/out.png"所有指令支持简写(如--sc代表--screenshot),还能配合--clip直接把结果复制到剪贴板。对于开发者,还有完整的HTTP接口(默认端口1224),支持图片OCR、PDF文档识别、二维码识别/生成,详见项目内docs/http/目录的接口手册。
多语言环境配置
Umi-OCR 内置简体中文、英文、日文、韩文、俄语等多种OCR模型,界面语言同样多国可切。在"全局设置→语言/Language"里切换后重启即生效,让外语材料识别也毫无压力。
不同电脑的性能推荐配置
- 低配(4GB内存):限制图像边长960、并行任务数1、关闭方向纠正,保证流畅不卡顿
- 标准(8GB内存):限制图像边长1920、并行任务数2、开启方向纠正,兼顾速度与精度
- 高配(16GB+内存):限制图像边长2880、并行任务数4,开启全部高级功能
常见问题FAQ
Q1:Umi-OCR需要联网吗?不需要。识别引擎完全在本地运行,断网可用,文档和数据都不会上传到任何服务器。
Q2:识别中文效果好吗?需要额外下载模型吗?简体中文是默认内置模型,开箱即用;繁体、英文、日文、韩文等模型库在插件里可切换,无需额外付费。
Q3:为什么我的长图识别不全?多半是"限制图像边长"数值太低。到批量OCR的设置里调高到2880或更高即可。
Q4:识别PDF可以保留原来的排版吗?可以输出双层可搜索PDF,视觉上保留原扫描排版,同时获得可搜索的文字层;纯文本TXT输出则会按排版方案重排。
Q5:能处理加密的PDF吗?文档识别支持输入密码解密后处理,前提是您知道文档密码。
Q6:软件更新会影响我已有的设置吗?配置文件保存在UmiOCR-data/.settings中,正常更新不会丢失。日志文件则存放在UmiOCR-data/logs目录,方便排查问题。
结语与行动号召
看到这里,Umi-OCR 的四大能力您应该都摸清了:随截随识的截图OCR、批量处理的图片识别、能把扫描件变可搜索文档的PDF识别,还有顺手的二维码工具。它的最大价值在于离线、免费、无上限——那些散落在截图和扫描件里的信息,从此都能一键变成可复用的文字资产。
下一步,建议您直接下载一个发行版试试水,先用截图OCR识别一张网页截图找找感觉;再丢一本扫描PDF进去,体验一次"双层可搜索"的惊喜。想要更深入,可以翻阅项目内的CHANGE_LOG.md了解版本演进,或参考docs/目录下的命令行与HTTP接口文档探索自动化玩法。
推荐仓库地址:https://gitcode.com/GitHub_Trending/um/Umi-OCR(如需自行构建可从该地址克隆源码)。
好用的工具不需要花哨,能实实在在帮您省下时间,就是好工具。愿 Umi-OCR 成为您日常办公里的那个"隐形助手"。现在就动手,识别你的第一张图吧!
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考