Umi-OCR 实用指南:5 分钟搞定免费离线文字识别
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费开源的离线 OCR 软件:解压即用、不联网也能识别文字。它支持截图取字、批量图片识别、PDF 文档转文本、二维码扫描与生成,内置中、英、日、韩等多国语言识别库。适合经常处理截图、扫描件、图片文档的办公用户,也适合想把 OCR 能力嵌进自动化流程的开发者。支持 Windows 7 及以上 x64 系统和 Linux x64。
一、认识 Umi-OCR:装好就能用的功能清单
功能一览
软件主界面由多个标签页组成,按需打开即可。核心功能与对应入口如下:
| 功能 | 标签页 | 适合场景 |
|---|---|---|
| 截图 OCR | 截图OCR | 提取屏幕上的文字、代码 |
| 批量 OCR | 批量OCR | 一次性识别几百张图片 |
| 文档识别 | 文档识别 | PDF 扫描件提取文本 |
| 二维码 | 二维码 | 扫码、生成二维码图片 |
| 全局设置 | 全局设置 | 语言、主题、引擎、快捷键 |
安装与启动
无需安装:下载发行包(.7z压缩包或.7z.exe自解压包),解压后直接运行Umi-OCR.exe即可。软件会自动读取./UmiOCR-data/.settings配置文件,界面上做的所有调整都会保存进去,方便手动微调。
二、截图提取文字:从划框到复制只要三下
调出截图并识别
打开「截图OCR」标签页,用默认快捷键唤起截图(快捷键可在全局设置中自定义),框选屏幕区域后自动开始识别。识别结果出现在右侧记录栏,可以直接划选复制,也支持编辑文字、合并多条记录一起复制。如果刚在别处复制了图片,也可以直接粘贴进 Umi-OCR 识别。
排版解析方案怎么选
识别出的原始文字块需要按排版规则重排,Umi-OCR 提供了多套预设方案(tbpu.parser参数):
| 方案 | 参数值 | 适用情况 |
|---|---|---|
| 多栏-按自然段换行 | multi_para | 默认方案,适合大部分文档 |
| 多栏-总是换行 | multi_line | 每句话都强制换行 |
| 单栏-保留缩进 | single_code | 代码截图,保留行首缩进 |
| 单栏-无换行 | single_none | 把多行合并成一段 |
| 不做处理 | none | 引擎原始输出 |
提取代码片段时选「单栏-保留缩进」,缩进和行内空格都能保住,复制出来即可直接粘贴进编辑器。
三、批量 OCR:几百张扫描图一次跑完
批量处理的操作步骤
- 打开「批量OCR」标签页,拖入图片或整个文件夹(支持嵌套子文件夹);
- 右侧选择输出格式与保存路径,输出支持
txt、jsonl、md、csv(Excel); - 如需排除水印或页眉页脚,进入「忽略区域」编辑器(见下);
- 点击开始任务,可勾选完成后自动关机或待机,适合下班前挂机跑完。
| 输入格式 | 输出格式 | 备注 |
|---|---|---|
| jpg / jpeg / png / webp / bmp / tif / tiff | txt | 纯文本,与文件名一一对应 |
| 同上 | jsonl | 结构化数据,含文本框坐标 |
| 同上 | md / csv | 方便归档和表格处理 |
忽略区域:把水印挡在门外
批量识别带固定水印的图片时,可在右栏设置中打开忽略区域编辑器,按住右键在预览图上绘制矩形框,框内的文字会被整体跳过。注意两点:矩形要画得足够大,完整包住水印可能出现的所有位置;只有整个文本块落在框内才会被忽略,只被框住一半的文本块仍会保留。
大图识别要调的参数
识别像素很大的长图、大图时,请调整「页面的设置 → 文字识别 → 限制图像边长」,把数值调高。该参数(ocr.limit_side_len,默认 960)会压缩超大的图片,数值越小速度越快、精度越低,按图片实际大小权衡即可。
四、PDF 文档识别与二维码工具
文档识别的两个用途
「文档识别」标签页支持pdf, xps, epub, mobi, fb2, cbz格式,主要干两件事:一是对扫描件做 OCR 提取文本;二是把结果输出为双层可搜索 PDF,保留原始版式的同时支持文字检索。同样支持设置忽略区域排除页眉页脚,以及任务完成后自动关机。
二维码识别与生成
二维码标签页支持截图、粘贴、拖入图片三种输入方式,可识别一张图中的多个码,覆盖 19 种协议(QRCode、EAN13、Code128、PDF417 等),并支持条形码。反向操作也内置了:输入文本即可生成二维码图片,可设置纠错等级和输出尺寸。
五、常见问题快速排查
识别结果不准怎么办
按顺序检查三件事:
- 语言模型选错:识别英文代码用了中文模型,错字会明显变多,在全局设置里切换对应语言;
- 图片被过度压缩:小字、长图场景把「限制图像边长」调高,或启用「纠正文本方向」(
ocr.cls),代价是速度变慢; - 排版乱:换个排版解析方案,多栏文档用
multi_para,代码用single_code。
批量任务太慢怎么提速
批量页支持同时处理大量图片,遇到速度瓶颈时可以:调大识别并发(在页面设置中调整)、输出格式选 txt 而不是 jsonl(数据量小,写入更快)、提前用忽略区域去掉大片无关区域。如果机器空闲,任务排好后挂到晚上跑完直接关机是最省心的方案。
命令行调不出来结果
命令行依赖 HTTP 服务做跨进程通信,确认两件事:全局设置里HTTP 服务已启用(默认开启,主机选「仅本地」即可);一次多图识别耗时较长,等当前命令结束再输入下一条。结果回传受系统管道限制可能收不到,需要用程序调用时,改用 HTTP 转发命令行 更稳。
六、命令行与 HTTP 接口:把 OCR 接进自动化
常用命令行指令
命令行入口就是主程序,常用指令如下(完整列表见 命令行手册):
umi-ocr --screenshot --clip # 截图识别,结果进剪贴板 umi-ocr --path "D:/imgs" "-->" result.txt # 识别文件夹,结果写入文件 umi-ocr --qrcode_read "D:/qr.png" # 识别二维码指令支持简写(如--screenshot可写成--sc),--output也可用箭头"-->"代替。
HTTP 接口调用
在「全局设置」中确认 HTTP 服务开启后(默认端口 1224),就能用标准 HTTP 请求调用识别能力。图片识别接口为POST /api/ocr,传入 base64 编码图片和可选参数;GET /api/ocr/get_options可先查询当前引擎支持的全部参数及默认值。一个最小调用示例:
import base64, json, requests img_b64 = base64.b64encode(open("a.png", "rb").read()).decode() resp = requests.post( "http://127.0.0.1:1224/api/ocr", json={"base64": img_b64, "options": {"ocr.language": "models/config_chinese.txt", "tbpu.parser": "multi_para", "data.format": "text"}}) print(resp.json()["data"])常用参数对照见 图片OCR接口文档,完整手册见 HTTP接口手册。注意接口对并发支持有限,建议串行调用;长时间大批量连续调用偶发连接错误时,重试即可。
七、全局设置:值得顺手改的几项
高频设置项
| 设置项 | 说明 |
|---|---|
| 语言 / Language | 切换界面语言,首次启动按系统语言自动匹配 |
| 主题与字体 | 多种亮/暗主题,可调字号与字体 |
| OCR 引擎 | 切换识别插件(如 RapidOCR / PaddleOCR) |
| 快捷键 | 自定义截图、剪贴板识别等快捷键 |
| 开机自启 / 快捷方式 | 一键配置 |
| 渲染器 | 出现截屏闪烁、UI 错位时切换渲染方案或关闭硬件加速 |
界面语言切换
在「全局设置」→「语言/Language」中可手动切换简体中文、English、日本語 等界面语言,翻译文件位于UmiOCR-data/i18n/目录,想补充新语言可参考 dev-tools/i18n/README.md 中的翻译流程。
Umi-OCR 把"截图取字、批量跑图、PDF 转文本、二维码"这四类高频需求装进了同一个离线工具里,配合命令行和 HTTP 接口还能无缝接入自动化脚本。想深入参数细节,从 官方说明 和 docs/ 目录 入手即可。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考