Umi-OCR 完整指南:免费离线 OCR 软件如何识别屏幕文字与批量图片
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费、开源、离线的 OCR 文字识别软件,支持 Windows 7 x64 和 Linux x64。它的运行逻辑很简单:识别引擎、语言模型库全部打包在软件里,全程不联网、不上传图片,也不设识别字数上限。你截个图、丢个文件夹进去,它就还你一段能复制、能编辑的文字。
软件本身没有安装过程——下载压缩包,解压,双击Umi-OCR.exe就能用。下面按"拿到软件 → 认识界面 → 各场景用法 → 自动化调用"的顺序,把日常会用到的部分讲清楚。
三分钟拿到 Umi-OCR:下载或命令行安装
方式一:直接下载压缩包
发布包是.7z压缩包(或.7z.exe自解压包,没有装压缩软件时用它)。解压到任意目录,双击Umi-OCR.exe启动即可。软件会把设置、日志等数据统一放在同级的UmiOCR-data目录里,迁移时把整个文件夹搬走就行。
方式二:Scoop 安装
如果你习惯用 Scoop 这类命令行包管理器,两条命令搞定:
scoop bucket add extras scoop install extras/umi-ocr第二条命令有可选变体:extras/umi-ocr内置Rapid-OCR引擎,兼容性好;extras/umi-ocr-paddle内置Paddle-OCR引擎,速度稍快。两者不要同时装,快捷方式会互相覆盖。之后想换引擎,导入对应插件就能切换,不用重装。
认识主界面:标签页结构与语言设置
v2 版的主界面由一排标签页组成,按自己的习惯开哪几个、关哪几个即可。常见的是:截图OCR、批量OCR、文档识别、二维码、全局设置。标签栏左上角可切换窗口置顶,右上角能锁定标签页,防止误触关闭。
第一次打开时,软件会按系统语言自动切换界面。需要手动改的话,路径是全局设置 → 语言/Language,改完生效即可。项目内置简中、繁中、英语、日语、俄语、葡萄牙语、泰米尔语等多种语言,翻译工作由社区在 Weblate 平台上协作完成。
截图 OCR 是日常使用频率最高的功能:打开该标签页,用快捷键唤起截图,框选屏幕任意区域,文字就会出现在右侧记录栏里。
几个实用细节:
- 左侧图片预览栏支持直接用鼠标划选复制文字;
- 右侧记录栏里文字可编辑,还能划选多条记录一起复制;
- 不用截图也可以:在其他地方复制一张图片,直接粘贴进 Umi-OCR 就能识别;
Esc可以随时取消截图。
排版解析:从"认出来了"到"好用"
OCR 引擎的原始输出是一堆按位置排列的文本块,顺序常常是乱的。Umi-OCR 内置的排版解析会按你选的规则重新组织顺序,这是它识别结果可读性好的关键。预设方案:
- 多栏-按自然段换行:适合大部分场景,自动识别多栏版面,按自然段换行;
- 多栏-总是换行 / 无换行:每句都换行,或全部合并成一行;
- 单栏-按自然段换行 / 总是换行 / 无换行:同上,但不区分多栏;
- 单栏-保留缩进:专门给代码截图用的,保留行首缩进和行内空格;
- 不做处理:直接输出引擎原始结果。
横排、竖排(从右到左)的版面都能自动处理,竖排还要求 OCR 引擎本身支持。以代码为例,选中"保留缩进"方案后,识别结果能保持函数嵌套结构:
批量 OCR:一次跑几百张图
把图片或文件夹拖进"批量OCR"页,点开始任务。要点:
- 支持输入格式:
jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff; - 结果可存为
txt、jsonl、md、csv(csv 默认 ANSI 编码,直接兼容 Excel); - 没有数量上限,几百张一起跑没问题,完成后还能自动关机/待机;
- 批量页同样支持上面讲的排版解析;
- 遇到像素超大的长图识别不完整,去
页面的设置 → 文字识别 → 限制图像边长,把数值调高。
忽略区域:把水印从结果里剔除
批量识别带水印的图片时,水印文字会混进结果。"忽略区域"就是为此设计的:
- 在批量页右栏设置里打开忽略区域编辑器;
- 按住右键,在水印可能出现的位置画若干矩形框;
- 画的时候尽量框大一点,把水印所有可能位置都包进去。
注意规则:只有完整落在框内的文本块会被忽略,压在框边缘的文字块照样保留。
文档识别:扫描件 PDF 变可搜索文本
"文档识别"页处理pdf, xps, epub, mobi, fb2, cbz格式的文件:
- 对扫描件做 OCR,或直接提取 PDF 里已有的文本层;
- 结果可以输出为双层可搜索 PDF——底层是原图,上层叠加可搜索的文字,适合归档;
- 同样支持忽略区域,用来排除页眉页脚;
- 支持任务完成后自动关机/休眠。
v2.1.0 起批量文档任务还允许暂停:不退出软件,待机或休眠后回来还能恢复任务。
二维码页:识别和生成都行
- 扫码:截图、粘贴或拖入图片,读取其中的二维码/条形码,一张图里有多个码也能全部读出;支持 QRCode、EAN13、Code128、PDF417 等 19 种协议;
- 生成码:输入文本生成二维码图片,同样支持这 19 种协议,还能调纠错等级等参数。
命令行调用 Umi-OCR
Umi-OCR 的命令行入口就是主程序本身。注意:命令行依赖软件内置的 HTTP 服务做跨进程通信(走本地环回,不经过网卡),所以必须在全局设置里保持 HTTP 服务开启——默认是开的,主机选"仅本地"即可。
常用指令一览(umi-ocr可简写,等价于Umi-OCR.exe):
| 指令 | 作用 |
|---|---|
umi-ocr --help | 查看全部说明 |
umi-ocr --screenshot | 鼠标截图并识别 |
umi-ocr --screenshot screen=1 rect=50,100,300,200 | 无需划选,直接截第 2 块屏幕指定区域 |
umi-ocr --clipboard | 识别剪贴板里的图片 |
umi-ocr --path "D:/img1.png" "D:/test" | 识别指定图片或文件夹(可多个) |
umi-ocr --screenshot --clip | 识别结果复制到剪贴板 |
umi-ocr --screenshot "-->" test.txt | 识别结果写入文件(-->>为追加) |
umi-ocr --qrcode_read "D:/xxx.png" | 识别二维码图片 |
umi-ocr --qrcode_create "文本" "D:/out.jpeg" 128 | 生成 128px 二维码图 |
umi-ocr --show / --hide / --quit / --reload | 显示/隐藏主窗口、退出、重载配置文件 |
两点提醒:
- 指令支持前缀简写,如
--sc就是--screenshot; - OCR 类指令复用"截图OCR"标签页里的参数设定(识别语言、是否弹窗等),不想命令行任务弹出主窗口,就去该标签页关掉对应选项。
完整手册见 docs/README_CLI.md,里面还有调用任意标签页函数的高级指令,适合想深挖的开发者。
HTTP 接口:把 OCR 嵌进自己的程序
如果你要写个小程序调用 OCR,不必折腾命令行,直接用它的 HTTP 接口。同样需要在全局设置中开启 HTTP 服务:
- 本机自用:主机保持"仅本地";
- 让局域网内其他设备访问:主机改为"任何可用地址"。
接口覆盖图片 OCR(Base64 传图)、文档识别、二维码识别/生成等场景,参数文档在 docs/http/README.md 和 api_doc.md 中。两个使用注意:后端并发能力有限,建议串行调用;长时间大批量请求偶尔出现ECONNREFUSED类报错,重试即可。
常见问题速查
截图时屏幕闪烁、界面错位?去全局设置 → 界面和外观 → 渲染器,换一种渲染方案,或关闭硬件加速。软件默认启用显卡加速渲染,个别机器不兼容时这样处理。
识别准确率低?按顺序排查:图片本身是否清晰;排版解析方案是否选对(代码截图选"保留缩进",多栏版面选多栏方案);大图是否被边长限制截断(调高限制图像边长)。
命令行没反应?检查全局设置里 HTTP 服务是否开启。另外 v2.1.5 起软件带日志机制,命令行启动时可看实时日志,Umi-OCR/UmiOCR-data/logs目录会保存指定级别以上的日志,排错时很有用。
配置文件在哪?UmiOCR-data/.settings(ini 格式),可以手改,改完用umi-ocr --reload重载生效。
版本历史、各分支的变更说明都在 CHANGE_LOG.md,当前最新稳定版本为 v2.1.5。
收尾:一张一次性配置清单
Umi-OCR 没有"学习成本",但有几处配置值得在第一次使用时就定好,之后基本不用再动:
- 固定安装位置:解压到目录名不含空格的稳定路径,方便命令行调用;
- 快捷方式:全局设置里勾选桌面/开始菜单快捷方式,需要常开就加开机自启;
- 截图快捷键:按手顺改一个,之后全程不碰鼠标;
- 界面语言与主题:亮色/暗色主题、字体和界面大小比例,都在全局设置里一次调完;
- 排版解析方案:按主要用途选默认方案——文档类用"多栏-按自然段换行",代码类换"单栏-保留缩进";
- 渲染器:一切正常就不动,出现闪烁再切。
配置完这一轮,剩下的就是用了。离线识别、数据不出本机、开源免费,这三点决定了它适合长期留在电脑里,作为处理文字图片的常驻工具。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考