Umi-OCR 完整指南:免费离线 OCR 软件如何识别屏幕文字与批量图片
2026/8/31 9:07:14 网站建设 项目流程

Umi-OCR 完整指南:免费离线 OCR 软件如何识别屏幕文字与批量图片

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源、离线的 OCR 文字识别软件,支持 Windows 7 x64 和 Linux x64。它的运行逻辑很简单:识别引擎、语言模型库全部打包在软件里,全程不联网、不上传图片,也不设识别字数上限。你截个图、丢个文件夹进去,它就还你一段能复制、能编辑的文字。

软件本身没有安装过程——下载压缩包,解压,双击Umi-OCR.exe就能用。下面按"拿到软件 → 认识界面 → 各场景用法 → 自动化调用"的顺序,把日常会用到的部分讲清楚。

三分钟拿到 Umi-OCR:下载或命令行安装

方式一:直接下载压缩包

发布包是.7z压缩包(或.7z.exe自解压包,没有装压缩软件时用它)。解压到任意目录,双击Umi-OCR.exe启动即可。软件会把设置、日志等数据统一放在同级的UmiOCR-data目录里,迁移时把整个文件夹搬走就行。

方式二:Scoop 安装

如果你习惯用 Scoop 这类命令行包管理器,两条命令搞定:

scoop bucket add extras scoop install extras/umi-ocr

第二条命令有可选变体:extras/umi-ocr内置Rapid-OCR引擎,兼容性好;extras/umi-ocr-paddle内置Paddle-OCR引擎,速度稍快。两者不要同时装,快捷方式会互相覆盖。之后想换引擎,导入对应插件就能切换,不用重装。

认识主界面:标签页结构与语言设置

v2 版的主界面由一排标签页组成,按自己的习惯开哪几个、关哪几个即可。常见的是:截图OCR、批量OCR、文档识别、二维码、全局设置。标签栏左上角可切换窗口置顶,右上角能锁定标签页,防止误触关闭。

第一次打开时,软件会按系统语言自动切换界面。需要手动改的话,路径是全局设置 → 语言/Language,改完生效即可。项目内置简中、繁中、英语、日语、俄语、葡萄牙语、泰米尔语等多种语言,翻译工作由社区在 Weblate 平台上协作完成。

截图 OCR 是日常使用频率最高的功能:打开该标签页,用快捷键唤起截图,框选屏幕任意区域,文字就会出现在右侧记录栏里。

几个实用细节:

  • 左侧图片预览栏支持直接用鼠标划选复制文字;
  • 右侧记录栏里文字可编辑,还能划选多条记录一起复制;
  • 不用截图也可以:在其他地方复制一张图片,直接粘贴进 Umi-OCR 就能识别;
  • Esc可以随时取消截图。

排版解析:从"认出来了"到"好用"

OCR 引擎的原始输出是一堆按位置排列的文本块,顺序常常是乱的。Umi-OCR 内置的排版解析会按你选的规则重新组织顺序,这是它识别结果可读性好的关键。预设方案:

  • 多栏-按自然段换行:适合大部分场景,自动识别多栏版面,按自然段换行;
  • 多栏-总是换行 / 无换行:每句都换行,或全部合并成一行;
  • 单栏-按自然段换行 / 总是换行 / 无换行:同上,但不区分多栏;
  • 单栏-保留缩进:专门给代码截图用的,保留行首缩进和行内空格;
  • 不做处理:直接输出引擎原始结果。

横排、竖排(从右到左)的版面都能自动处理,竖排还要求 OCR 引擎本身支持。以代码为例,选中"保留缩进"方案后,识别结果能保持函数嵌套结构:

批量 OCR:一次跑几百张图

把图片或文件夹拖进"批量OCR"页,点开始任务。要点:

  • 支持输入格式:jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff
  • 结果可存为txt、jsonl、md、csv(csv 默认 ANSI 编码,直接兼容 Excel);
  • 没有数量上限,几百张一起跑没问题,完成后还能自动关机/待机;
  • 批量页同样支持上面讲的排版解析;
  • 遇到像素超大的长图识别不完整,去页面的设置 → 文字识别 → 限制图像边长,把数值调高。

忽略区域:把水印从结果里剔除

批量识别带水印的图片时,水印文字会混进结果。"忽略区域"就是为此设计的:

  1. 在批量页右栏设置里打开忽略区域编辑器;
  2. 按住右键,在水印可能出现的位置画若干矩形框;
  3. 画的时候尽量框大一点,把水印所有可能位置都包进去。

注意规则:只有完整落在框内的文本块会被忽略,压在框边缘的文字块照样保留。

文档识别:扫描件 PDF 变可搜索文本

"文档识别"页处理pdf, xps, epub, mobi, fb2, cbz格式的文件:

  • 对扫描件做 OCR,或直接提取 PDF 里已有的文本层;
  • 结果可以输出为双层可搜索 PDF——底层是原图,上层叠加可搜索的文字,适合归档;
  • 同样支持忽略区域,用来排除页眉页脚;
  • 支持任务完成后自动关机/休眠。

v2.1.0 起批量文档任务还允许暂停:不退出软件,待机或休眠后回来还能恢复任务。

二维码页:识别和生成都行

  • 扫码:截图、粘贴或拖入图片,读取其中的二维码/条形码,一张图里有多个码也能全部读出;支持 QRCode、EAN13、Code128、PDF417 等 19 种协议;
  • 生成码:输入文本生成二维码图片,同样支持这 19 种协议,还能调纠错等级等参数。

命令行调用 Umi-OCR

Umi-OCR 的命令行入口就是主程序本身。注意:命令行依赖软件内置的 HTTP 服务做跨进程通信(走本地环回,不经过网卡),所以必须在全局设置里保持 HTTP 服务开启——默认是开的,主机选"仅本地"即可。

常用指令一览(umi-ocr可简写,等价于Umi-OCR.exe):

指令作用
umi-ocr --help查看全部说明
umi-ocr --screenshot鼠标截图并识别
umi-ocr --screenshot screen=1 rect=50,100,300,200无需划选,直接截第 2 块屏幕指定区域
umi-ocr --clipboard识别剪贴板里的图片
umi-ocr --path "D:/img1.png" "D:/test"识别指定图片或文件夹(可多个)
umi-ocr --screenshot --clip识别结果复制到剪贴板
umi-ocr --screenshot "-->" test.txt识别结果写入文件(-->>为追加)
umi-ocr --qrcode_read "D:/xxx.png"识别二维码图片
umi-ocr --qrcode_create "文本" "D:/out.jpeg" 128生成 128px 二维码图
umi-ocr --show / --hide / --quit / --reload显示/隐藏主窗口、退出、重载配置文件

两点提醒:

  • 指令支持前缀简写,如--sc就是--screenshot
  • OCR 类指令复用"截图OCR"标签页里的参数设定(识别语言、是否弹窗等),不想命令行任务弹出主窗口,就去该标签页关掉对应选项。

完整手册见 docs/README_CLI.md,里面还有调用任意标签页函数的高级指令,适合想深挖的开发者。

HTTP 接口:把 OCR 嵌进自己的程序

如果你要写个小程序调用 OCR,不必折腾命令行,直接用它的 HTTP 接口。同样需要在全局设置中开启 HTTP 服务:

  • 本机自用:主机保持"仅本地";
  • 让局域网内其他设备访问:主机改为"任何可用地址"。

接口覆盖图片 OCR(Base64 传图)、文档识别、二维码识别/生成等场景,参数文档在 docs/http/README.md 和 api_doc.md 中。两个使用注意:后端并发能力有限,建议串行调用;长时间大批量请求偶尔出现ECONNREFUSED类报错,重试即可。

常见问题速查

截图时屏幕闪烁、界面错位?全局设置 → 界面和外观 → 渲染器,换一种渲染方案,或关闭硬件加速。软件默认启用显卡加速渲染,个别机器不兼容时这样处理。

识别准确率低?按顺序排查:图片本身是否清晰;排版解析方案是否选对(代码截图选"保留缩进",多栏版面选多栏方案);大图是否被边长限制截断(调高限制图像边长)。

命令行没反应?检查全局设置里 HTTP 服务是否开启。另外 v2.1.5 起软件带日志机制,命令行启动时可看实时日志,Umi-OCR/UmiOCR-data/logs目录会保存指定级别以上的日志,排错时很有用。

配置文件在哪?UmiOCR-data/.settings(ini 格式),可以手改,改完用umi-ocr --reload重载生效。

版本历史、各分支的变更说明都在 CHANGE_LOG.md,当前最新稳定版本为 v2.1.5。

收尾:一张一次性配置清单

Umi-OCR 没有"学习成本",但有几处配置值得在第一次使用时就定好,之后基本不用再动:

  1. 固定安装位置:解压到目录名不含空格的稳定路径,方便命令行调用;
  2. 快捷方式:全局设置里勾选桌面/开始菜单快捷方式,需要常开就加开机自启;
  3. 截图快捷键:按手顺改一个,之后全程不碰鼠标;
  4. 界面语言与主题:亮色/暗色主题、字体和界面大小比例,都在全局设置里一次调完;
  5. 排版解析方案:按主要用途选默认方案——文档类用"多栏-按自然段换行",代码类换"单栏-保留缩进";
  6. 渲染器:一切正常就不动,出现闪烁再切。

配置完这一轮,剩下的就是用了。离线识别、数据不出本机、开源免费,这三点决定了它适合长期留在电脑里,作为处理文字图片的常驻工具。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询