Umi-OCR:免费离线OCR工具指南,3步拿到屏幕与PDF里的文字
2026/9/6 21:37:14 网站建设 项目流程

Umi-OCR:免费离线OCR工具指南,3步拿到屏幕与PDF里的文字

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

Umi-OCR 是一款免费、开源、完全离线运行的 OCR 软件(OCR 即光学字符识别,把图片里的文字转成可编辑文本)。它支持截图文字识别、批量图片转文本、PDF 扫描件识别,还能扫描和生成二维码,所有识别都在本机完成,图片与文字不会上传到任何服务器。

一、离线OCR工具能解决的3类日常问题

屏幕上的文字复制不了

有些界面(截图、扫描件、部分 App 内嵌图片)里的文字只能看、不能选中。在线识别服务要把图片传上云端才能用,遇到合同、病历、内部数据这类内容,传到别人服务器总归不放心。Umi-OCR 的全部识别过程发生在你的电脑上,断网也能用,图片不出本机。

一文件夹扫描件,逐个录入太费事

归档的扫描图、批量截图、发票照片,一张一张手动录入成本很高。批量 OCR 功能没有数量上限,官方说明里提到可以一次性导入几百张图片排队处理,做完一轮长任务还能设置完成后自动关机或待机。

PDF 是扫描件,Ctrl+F 搜不到东西

扫描生成的 PDF 本质是一张张图片叠在一起,全文搜索自然失效。文档识别功能可以对扫描件做 OCR,也可以提取 PDF 里原有的文本层,最终输出"双层可搜索 PDF"——底层是原始图像、上层是隐形文字,肉眼看到的内容不变,Ctrl+F 却能直接搜中。

二、首次截图识别:3步走完

解压即用,不装任何依赖

发布包是.7z压缩包或.7z.exe自解压包,解压后直接点击Umi-OCR.exe启动,不需要安装流程。自解压包适合没装压缩软件的电脑。软件支持 Windows 7 x64 和 Linux x64,目前维护到 v2.1.5。

截图、识别、复制,完成第一次识别

打开"截图OCR"标签页,按下快捷键唤起截图,划选区域后识别结果自动出现在右侧记录栏。左侧图片预览可以直接用鼠标划选文字复制;右侧记录支持编辑、划选多条记录一起复制。在别处复制了一张图片,也可以直接粘贴进 Umi-OCR 识别,不必再截一次。

代码截图要选对排版解析方案

识别结果默认是"语句逐条换行"的原始输出,对普通文章够用,但对代码截图会打乱缩进。在"文本后处理"里可以切换排版解析方案,常用几种:

  • 多栏-按自然段换行:适合大部分文章,自动识别多栏布局,按段落规则换行;
  • 单栏-保留缩进:解析代码截图,保留行首缩进和行内空格;
  • 多栏-总是换行:每段语句都单独换行,适合报刊类密排文本;
  • 不做处理:保留 OCR 引擎的原始输出。

这些方案都能自动处理横排与竖排文字(竖排还需引擎本身支持)。

三、批量图片转文本与PDF文档识别

批量OCR:不限数量,拖入即排队

批量 OCR 页面用于导入本地图片识别,支持的输入格式:jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff。选图后点"开始任务",左侧列表显示每张的耗时与状态,右侧记录栏按文件逐条展示结果。与截图页一样支持文本后处理。

用"忽略区域"排除水印与页眉页脚

批量识别带水印的图片时,水印文字会混进结果。批量页右栏的"忽略区域编辑器"里,按住右键在图上画几个矩形框,框住水印可能出现的位置;任务运行时,落在框内的整个文本块会被跳过。注意它是按文本块而非单字符过滤:框内的文件名会被忽略,而刚好跨在框外的相邻文本块会保留,所以矩形尽量画大、画准。

文档识别:扫描件变成可搜索PDF

文档识别支持pdf, xps, epub, mobi, fb2, cbz六类格式:扫描件走 OCR,带文本层的文档直接提取原文,输出为双层可搜索 PDF。同样支持忽略区域(适合排除页眉页脚),也能在任务完成后自动关机或休眠。

4种输出格式,按用途选

输出格式适用场景
txt最通用,体积最小,直接阅读
jsonl每行一个 JSON 对象,方便脚本处理结构化数据
md (Markdown)保留文档结构,适合整理成笔记
csv (Excel)表格化结果,Excel 可直接打开

四、进阶自动化:命令行与HTTP接口调用

命令行:一行完成截图识别

日常重复操作可以交给命令行,入口就是主程序本身。常用指令:鼠标截屏识别并复制到剪贴板、识别指定路径(支持文件夹,含嵌套子文件夹):

umi-ocr --screenshot --clip umi-ocr --path "D:/scan_docs" --output result.txt

指令还支持前缀简写(如--sc代替--screenshot),更多参数如范围截屏、粘贴图片识别、二维码读写等,见 命令行手册。

HTTP接口:让你的脚本调用OCR

全局设置中的 HTTP 服务默认开启、默认仅监听本机。开启后可以用自己的脚本发请求完成图片 OCR、文档识别、二维码读写,文档见 HTTP接口手册。官方提醒两点:后端对并发支持较弱,尽量串行调用;长时间大批量连续调用时偶发连接报错,重试即可。

五、上手前了解这些细节

两套离线引擎,多语言识别库内置

内置 PaddleOCR 与 RapidOCR 两套离线引擎(Rapid 兼容性更好,Paddle 速度稍快),可在全局设置中切换;识别语言库也内置在发布包里,中文、英文等常用语言开箱可用,无需联网下载模型。

多语言界面与主题,一键调整

首次启动会跟随系统语言自动切换界面,已内置简中、繁中、英文、日文、葡萄牙语、俄语、泰米尔语等语言。全局设置页里还能切换亮/暗主题、调整字号与字体,机器较旧出现界面异常时可尝试切换渲染器方案关闭硬件加速。


如果"把图里的文字变成可编辑文本"是你的高频需求,下载发布包解压,按第二节走完 3 步即可上手;任务量变大后,再翻 更新日志 和命令行手册,把它接进你的日常流程。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询