Umi-OCR 实用指南:5 分钟搞定免费离线文字识别
2026/9/13 9:57:53 网站建设 项目流程

Umi-OCR 实用指南:5 分钟搞定免费离线文字识别

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费开源的离线 OCR 软件:解压即用、不联网也能识别文字。它支持截图取字、批量图片识别、PDF 文档转文本、二维码扫描与生成,内置中、英、日、韩等多国语言识别库。适合经常处理截图、扫描件、图片文档的办公用户,也适合想把 OCR 能力嵌进自动化流程的开发者。支持 Windows 7 及以上 x64 系统和 Linux x64。

一、认识 Umi-OCR:装好就能用的功能清单

功能一览

软件主界面由多个标签页组成,按需打开即可。核心功能与对应入口如下:

功能标签页适合场景
截图 OCR截图OCR提取屏幕上的文字、代码
批量 OCR批量OCR一次性识别几百张图片
文档识别文档识别PDF 扫描件提取文本
二维码二维码扫码、生成二维码图片
全局设置全局设置语言、主题、引擎、快捷键

安装与启动

无需安装:下载发行包(.7z压缩包或.7z.exe自解压包),解压后直接运行Umi-OCR.exe即可。软件会自动读取./UmiOCR-data/.settings配置文件,界面上做的所有调整都会保存进去,方便手动微调。

二、截图提取文字:从划框到复制只要三下

调出截图并识别

打开「截图OCR」标签页,用默认快捷键唤起截图(快捷键可在全局设置中自定义),框选屏幕区域后自动开始识别。识别结果出现在右侧记录栏,可以直接划选复制,也支持编辑文字、合并多条记录一起复制。如果刚在别处复制了图片,也可以直接粘贴进 Umi-OCR 识别。

排版解析方案怎么选

识别出的原始文字块需要按排版规则重排,Umi-OCR 提供了多套预设方案(tbpu.parser参数):

方案参数值适用情况
多栏-按自然段换行multi_para默认方案,适合大部分文档
多栏-总是换行multi_line每句话都强制换行
单栏-保留缩进single_code代码截图,保留行首缩进
单栏-无换行single_none把多行合并成一段
不做处理none引擎原始输出

提取代码片段时选「单栏-保留缩进」,缩进和行内空格都能保住,复制出来即可直接粘贴进编辑器。

三、批量 OCR:几百张扫描图一次跑完

批量处理的操作步骤

  1. 打开「批量OCR」标签页,拖入图片或整个文件夹(支持嵌套子文件夹);
  2. 右侧选择输出格式与保存路径,输出支持txtjsonlmdcsv(Excel)
  3. 如需排除水印或页眉页脚,进入「忽略区域」编辑器(见下);
  4. 点击开始任务,可勾选完成后自动关机或待机,适合下班前挂机跑完。
输入格式输出格式备注
jpg / jpeg / png / webp / bmp / tif / tifftxt纯文本,与文件名一一对应
同上jsonl结构化数据,含文本框坐标
同上md / csv方便归档和表格处理

忽略区域:把水印挡在门外

批量识别带固定水印的图片时,可在右栏设置中打开忽略区域编辑器,按住右键在预览图上绘制矩形框,框内的文字会被整体跳过。注意两点:矩形要画得足够大,完整包住水印可能出现的所有位置;只有整个文本块落在框内才会被忽略,只被框住一半的文本块仍会保留。

大图识别要调的参数

识别像素很大的长图、大图时,请调整「页面的设置 → 文字识别 → 限制图像边长」,把数值调高。该参数(ocr.limit_side_len,默认 960)会压缩超大的图片,数值越小速度越快、精度越低,按图片实际大小权衡即可。

四、PDF 文档识别与二维码工具

文档识别的两个用途

「文档识别」标签页支持pdf, xps, epub, mobi, fb2, cbz格式,主要干两件事:一是对扫描件做 OCR 提取文本;二是把结果输出为双层可搜索 PDF,保留原始版式的同时支持文字检索。同样支持设置忽略区域排除页眉页脚,以及任务完成后自动关机。

二维码识别与生成

二维码标签页支持截图、粘贴、拖入图片三种输入方式,可识别一张图中的多个码,覆盖 19 种协议(QRCode、EAN13、Code128、PDF417 等),并支持条形码。反向操作也内置了:输入文本即可生成二维码图片,可设置纠错等级和输出尺寸。

五、常见问题快速排查

识别结果不准怎么办

按顺序检查三件事:

  • 语言模型选错:识别英文代码用了中文模型,错字会明显变多,在全局设置里切换对应语言;
  • 图片被过度压缩:小字、长图场景把「限制图像边长」调高,或启用「纠正文本方向」(ocr.cls),代价是速度变慢;
  • 排版乱:换个排版解析方案,多栏文档用multi_para,代码用single_code

批量任务太慢怎么提速

批量页支持同时处理大量图片,遇到速度瓶颈时可以:调大识别并发(在页面设置中调整)、输出格式选 txt 而不是 jsonl(数据量小,写入更快)、提前用忽略区域去掉大片无关区域。如果机器空闲,任务排好后挂到晚上跑完直接关机是最省心的方案。

命令行调不出来结果

命令行依赖 HTTP 服务做跨进程通信,确认两件事:全局设置里HTTP 服务已启用(默认开启,主机选「仅本地」即可);一次多图识别耗时较长,等当前命令结束再输入下一条。结果回传受系统管道限制可能收不到,需要用程序调用时,改用 HTTP 转发命令行 更稳。

六、命令行与 HTTP 接口:把 OCR 接进自动化

常用命令行指令

命令行入口就是主程序,常用指令如下(完整列表见 命令行手册):

umi-ocr --screenshot --clip # 截图识别,结果进剪贴板 umi-ocr --path "D:/imgs" "-->" result.txt # 识别文件夹,结果写入文件 umi-ocr --qrcode_read "D:/qr.png" # 识别二维码

指令支持简写(如--screenshot可写成--sc),--output也可用箭头"-->"代替。

HTTP 接口调用

在「全局设置」中确认 HTTP 服务开启后(默认端口 1224),就能用标准 HTTP 请求调用识别能力。图片识别接口为POST /api/ocr,传入 base64 编码图片和可选参数;GET /api/ocr/get_options可先查询当前引擎支持的全部参数及默认值。一个最小调用示例:

import base64, json, requests img_b64 = base64.b64encode(open("a.png", "rb").read()).decode() resp = requests.post( "http://127.0.0.1:1224/api/ocr", json={"base64": img_b64, "options": {"ocr.language": "models/config_chinese.txt", "tbpu.parser": "multi_para", "data.format": "text"}}) print(resp.json()["data"])

常用参数对照见 图片OCR接口文档,完整手册见 HTTP接口手册。注意接口对并发支持有限,建议串行调用;长时间大批量连续调用偶发连接错误时,重试即可。

七、全局设置:值得顺手改的几项

高频设置项

设置项说明
语言 / Language切换界面语言,首次启动按系统语言自动匹配
主题与字体多种亮/暗主题,可调字号与字体
OCR 引擎切换识别插件(如 RapidOCR / PaddleOCR)
快捷键自定义截图、剪贴板识别等快捷键
开机自启 / 快捷方式一键配置
渲染器出现截屏闪烁、UI 错位时切换渲染方案或关闭硬件加速

界面语言切换

在「全局设置」→「语言/Language」中可手动切换简体中文、English、日本語 等界面语言,翻译文件位于UmiOCR-data/i18n/目录,想补充新语言可参考 dev-tools/i18n/README.md 中的翻译流程。


Umi-OCR 把"截图取字、批量跑图、PDF 转文本、二维码"这四类高频需求装进了同一个离线工具里,配合命令行和 HTTP 接口还能无缝接入自动化脚本。想深入参数细节,从 官方说明 和 docs/ 目录 入手即可。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询