本地离线OCR快速上手指南:免费开源 Umi-OCR 让截图、批量图片与扫描版PDF全部变成可编辑文字
2026/8/20 10:53:41 网站建设 项目流程

本地离线OCR快速上手指南:免费开源 Umi-OCR 让截图、批量图片与扫描版PDF全部变成可编辑文字

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

先把结论放在最前面,方便你快速判断这篇文章值不值得读下去:Umi-OCR 是一款免费、开源、完全离线的文字识别软件。它把截屏识别、批量图片文字提取、PDF 文档识别、二维码生成/扫描和多国语言支持统统装进一个本地程序里,不联网、不注册、不上传,解压就能用。下面的内容不堆术语,只按你日常最容易遇到的几个问题,一节一节讲清楚。

先别急着装:把最近的"搬字"经历盘一遍

说个真实场景。上个月我帮朋友整理考研复习资料,几十份扫描版讲义、手机拍的书页、群聊里发的课件截图堆了满满一个文件夹。想搜一下"罗尔定理到底出现在哪一页",结果文件夹里全是图片和扫描 PDF,Ctrl+F 按下去,屏幕只回我一行字:找不到。没办法,只好一页页翻、一段段手打引用,一个晚上过去,眼睛酸了,目录才整理到一半。

如果你也经历过类似的"搬字"时刻——比如复制不了文字的合同、截图里想引用的一句话、一堆待归档的老照片扫描件——那 Umi-OCR 大概率就是你要找的那把"本地文字剪刀"。它的核心逻辑只有一句话:所有文字识别都在你自己的电脑上完成,图片和文档不离开硬盘。

下面我用问答式带你把这款本地离线OCR过一遍,一共六问六答加一个彩蛋,每个问题都对应一类真实需求:

  1. 不是技术党,这软件装起来难不难?
  2. 屏幕上的文字,怎么最快抓下来?
  3. 攒了几百张图片,能不能一口气处理完?
  4. 扫描版 PDF 复制不了,怎么救?
  5. 识别出来的文字乱序、带水印,怎么调教?
  6. 界面语言和性能,还有哪些值得调?

问题一:离线OCR软件解压即用,三分钟快速上手

先回答最让人发怵的问题:Umi-OCR 是绿色软件,不需要安装,这也是它最省心的地方。你拿到手的只是一个压缩包,全程只需要三步:

  1. 下载:从项目发布页获取.7z压缩包;如果电脑没装压缩软件,就选自解压包,双击自己就能解开。
  2. 解压:放到任意目录,比如D:/Tools/Umi-OCR。唯一的小建议是路径里别带中文和空格,能省掉不少莫名其妙的兼容问题。
  3. 启动:Windows 双击Umi-OCR.exe,Linux 运行umi-ocr.sh

第一次启动,软件会自动读取系统语言把界面切成对应语言。整个程序主体像浏览器的标签栏,由截图OCR、批量OCR、文档识别、二维码、全局设置等标签页组成,想用哪个点哪个,常用的还能锁住防止误关。

顺带提醒一句:如果启动后闪退,先检查杀毒软件的白名单。因为程序内置了本地 OCR 引擎和运行库,部分杀软会误报,把软件目录加进白名单能省去后面很多烦恼。

问题二:截图OCR识别文字,一秒把屏幕上看到的字抓下来

日常最高频的需求,就是看到一段字想立刻复制。切到"截图OCR"标签页,按下快捷键唤起截图框,划出目标区域,识别结果瞬间出现在右侧记录栏,整个过程两秒都不到。

这个标签页里有三个很实用的小细节:

  • 不用截图也能识别:在聊天窗口里复制一张图片,回到 Umi-OCR 直接 Ctrl+V 粘贴,它照样帮你把文字抠出来。
  • 结果可以二次编辑:右侧记录栏里的文字能直接改错,还能划选多条记录合并复制,识别完顺手就整理成了你想要的格式。
  • 竖排文字不用怕:排版解析会自动处理横排和从右到左的竖排文本,只要 OCR 引擎本身支持竖排即可。

截图识别算是开胃菜,真正体现效率的还在后面。

问题三:批量图片文字提取,几百张图一口气处理完

遇到几十上百张截图、扫描件、相册照片,一张张截屏就太亏了。切到"批量OCR"标签页,把图片直接拖进窗口,支持jpg、png、webp、bmp、tif、tiff等常见格式,一次拖几百张也没有数量上限。

点下"开始任务",右侧会逐张显示每张图片的耗时、置信度和识别结果。任务跑完,可以按需输出成txt、jsonl、md、csv四种格式——其中 csv 用 Excel 直接就能打开,做资料归档很方便。如果你有深夜挂机的习惯,它还支持任务完成后自动关机或待机:睡前扔进去几百张图,醒来直接拿结果,一个字都不用你盯着。

问题四:扫描版PDF转可搜索文档,三步实现全文可复制

如果说前面是热身,文档识别就是 Umi-OCR 的压轴功能。它支持pdf、xps、epub、mobi、fb2、cbz六种格式,其中扫描版 PDF 是最典型的应用场景。

底层逻辑可以概括成三步:解析 → 识别 → 重组。PDF 先被解析引擎拆开,区分出"本来就带文字层的页面"和"只有扫描图片的页面";扫描图片交给本地 OCR 引擎逐页识别;最后按阅读顺序重新拼装,输出成你指定的格式。有两个亮点值得展开:

  • 双层可搜索 PDF:这是很多人的刚需。对扫描版 PDF 做 OCR 后,输出为"底层是原图、上层是透明文字"的双层 PDF。外观和原扫描件一模一样,但里面的文字可以搜索、复制、划线。给公司做合同归档、给学校做论文数字化,这个功能都能直接顶上。
  • 灵活的提取模式:程序会优先提取 PDF 自带的文本层(速度快、零识别误差),只有遇到纯扫描页才自动切换 OCR。你也可以主动选择整页强制 OCR,或者反过来只提取原文本;新版还支持输出单层纯文本 PDF,想要体积小、好编辑的文件时选它最合适。

文档识别同样支持忽略区域(可按页码范围设置),用来排除扫描件的页眉页脚。家里要是有一堆扫描版书想转成可搜索存档,这个标签页能帮你省下大量人工。

问题五:给OCR识别结果"排座位",顺便让水印自动隐身

OCR 引擎吐出来的文字往往是"散装"的,谁先谁后取决于排版解析怎么安排。Umi-OCR 内置了多套预设方案,选对方案,输出的文本才符合阅读习惯

排版方案适用场景
多栏-按自然段换行两栏/三栏排版的论文、书籍,自动按段落断行,最常用
多栏-总是换行每句独立成行,适合后续按行处理
多栏-无换行强制整段合并成一行
单栏-按自然段换行单栏文档,段落自然换行
单栏-保留缩进代码截图专用,保留行首缩进和行中空格
不做处理OCR 引擎原始输出,不做任何整理

其中"单栏-保留缩进"值得单独表扬:把代码截图扔进去,输出能基本保持缩进结构,配合截图 OCR 简直是小程序员的福音。如果你不确定选哪个,直接选**"多栏-按自然段换行"**就对了,它能覆盖大多数场景。

另一个高频痛点是图片角落的水印、LOGO、页眉页脚,每次都会混进结果里。在批量识别页的忽略区域编辑器里,按住右键在图上绘制矩形框,把水印可能出现的位置全部框住,识别时这些区域内的文字就会被自动排除。这里有个必须记住的机制:只有完全处于矩形框内部的整个文本块才会被忽略,而不是单个字符。所以画框时宁可大一点,把水印所有可能出现的位置都包住,否则漏一次,结果里就混进一行杂音。

问题六:界面语言、识别语言与性能的配置方法

多语言界面:一套软件,多国面孔

界面语言支持中文、繁体中文、英文、日文、俄语、葡萄牙语等多种,由社区译者协作维护。切换路径是:全局设置 → 语言/Language

这里要分清两件事:界面语言和识别语言库是两码事。界面语言管按钮菜单长什么样,识别语言库管 OCR 引擎认哪种文字,后者可以在各标签页的"文字识别"设置里单独选择或下载。比如界面用中文、日常却识别日文书籍,二者完全可以搭配使用。

性能微调:长图、内存与渲染器

三个常见性能问题的应对方法:

  • 识别长图/大图不完整:去"文字识别"设置里调高限制图像边长。默认边长限制是为了平衡速度与内存,遇到像素特别大的长截图,适当调高即可。
  • 内存占用偏高:如果用的是 PaddleOCR 插件,新版起默认内存占用被限制在系统总内存的一半以内,想进一步压内存可以在插件配置里调低线程数。
  • 截屏闪烁或界面错位:这是显卡渲染兼容问题,去全局设置 → 界面和外观 → 渲染器,切换渲染方案或直接关闭硬件加速,通常能解决。

彩蛋:让这台"文字打印机"自动打工

对普通用户来说,图形界面已经够用;但如果你想把它嵌进自己的工作流,Umi-OCR 还留了两条"程序化通道"。

命令行模式,入口就是主程序本身,几个常用姿势:

  • umi-ocr --screenshot --clip:截屏识别,结果直接进剪贴板;
  • umi-ocr --path "扫描件.png" --output result.txt:识别指定图片并输出到文件;
  • umi-ocr --path "D:/scans" --> all_result.txt:识别整个文件夹(含子目录)。

配合快捷键工具,还能实现"按一个键自动截指定区域并识别"的骚操作。指令的完整参数和简写规则见项目内的 docs/README_CLI.md。

HTTP 接口:程序启动后,本地 HTTP 服务提供 OCR、文档识别、二维码等接口,接口文档在 docs/http/api_doc.md。开发者可以用几十行代码把它封装成小工具,实现"上传图片 → 返回 JSON 识别结果"的自动化流程。

引擎与版本演进也值得一提:软件默认内置 Rapid-OCR 引擎(兼容性好)与 PaddleOCR 引擎(速度快一些),在全局设置里随时可以切换。版本更新日志记录在 CHANGE_LOG.md——v2.1.2 加入单层纯文本 PDF 与任务暂停,v2.1.3 登陆 Linux 并支持 Docker 部署,v2.1.5 修复了 PDF 页面旋转导致的文本错位问题。如果你手头有旋转过方向的扫描件,一定要用最新版。

写在最后:把"复制不了"从你的字典里删掉

回到开头那个整理复习资料的夜晚。如果当时我手里有 Umi-OCR,故事会变成这样:扫描版讲义拖进文档识别,几分钟后变成全文可搜索的双层 PDF;手机拍的书页扔进批量 OCR,导出成 csv 表格;群里那张看不清的课件截图,直接粘贴进截图 OCR,引用文字秒到手。一晚上能做完的事,压缩成了十几分钟。

总结成三句话:Umi-OCR 免费、开源、离线运行,解压就能用截屏、批量、文档识别三大功能覆盖了从日常摘抄到批量归档的绝大多数场景遇到问题别慌,排版方案、忽略区域、渲染器这几个旋钮能解决大部分麻烦

下次再收到扫描版文件或一堆带水印的图片时,打开它,你会发现自己已经不再需要在线工具和手动抄录了。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询