图片里的文字复制不出来?Umi-OCR 离线识别工具,截图、批量、PDF 一篇搞定
2026/8/21 6:48:56 网站建设 项目流程

图片里的文字复制不出来?Umi-OCR 离线识别工具,截图、批量、PDF 一篇搞定

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

每天都有无数人卡在同一个坎上:图片里的字明明看得见,却复制不出来。网页上的 OCR(文字识别)工具不是要登录,就是限量限大小,敏感资料还得先传到别人服务器。这篇 Umi-OCR 离线识别软件使用指南,就是为被这事折磨的你准备的——读完照着做,截图、批量、PDF 全都能自己搞定。

一句话先给结论:Umi-OCR 是一款免费、开源、完全离线的 OCR 文字识别软件。它不需要注册账号,不需要联网,解压就能用;截图识别、批量图片、PDF 文档、二维码扫描与生成全部内置,还自带多国语言识别库。你可以把它理解成一位住在你电脑里的"文字速记员"——随叫随到、口风严密,图片和文档从头到尾不离开你的硬盘。

两分钟开箱:解压就算装完,真的不用安装

Umi-OCR 是纯绿色软件,上手只需要三步:

  1. 下载:去项目发布页拿.7z压缩包;电脑没装解压软件就选.7z.exe自解压包,双击自己解开。
  2. 解压:解压到任意目录(比如D:/Tools/Umi-OCR),路径里别带中文和空格,能省掉不少莫名其妙的兼容问题。
  3. 启动:双击Umi-OCR.exe(Windows),Linux 用户运行umi-ocr.sh即可。

第一次启动,软件会自动读取系统语言并把界面切成对应语言;想手动切换,随时去全局设置里改。

程序主体是一排标签页——截图OCR、批量OCR、文档识别、二维码、全局设置,用法和浏览器标签栏一样。常用页面右上角有个"锁定"按钮,点了就再也不会误关。

小提醒:启动前,最好把软件目录加进杀毒软件白名单。因为内置了本地 OCR 引擎和运行库,个别杀软会误报,加个白名单能省掉很多"为什么突然闪退"的烦恼。

三大高频任务:截图、批量、PDF,各有各的省事姿势

与其背功能列表,不如直接看这三个最常用的场景。它们覆盖了从日常摘抄到批量归档的绝大多数需求。

任务一:屏幕上的字,划一下就进剪贴板

切到"截图OCR"标签页,按下快捷键唤起截图框,划出目标区域,识别结果立刻出现在右侧记录栏里。

几个顺手的小习惯:

  • 图片不用"先保存再打开":在聊天窗口复制一张图,回到 Umi-OCR 直接粘贴就能识别。
  • 结果当场可改:右侧记录栏的文字能直接编辑,还能划选多条一起复制,识别完顺手就能整理成想要的格式。
  • 竖排也不怕:排版解析会自动处理横排和竖排(从右到左)的文字,只要当前识别库支持竖排即可。

任务二:上百张图,一次全喂进去

切到"批量OCR"标签页,把图片直接拖进窗口,支持jpg、png、webp、bmp、tif、tiff等常见格式,没有数量上限,一次拖几百张也行。

点下"开始任务",右侧会逐张显示耗时、置信度和识别内容。跑完可以输出成txt、jsonl、md、csv(Excel 能直接打开)四种格式。想挂机?设置"任务完成后自动关机/待机",睡前丢进去几百张,醒来直接收结果。中途要休息也没关系,v2.1.2 起支持暂停任务,只要软件不退出,待机回来还能继续跑。

加分项:让水印、页眉页脚自动"隐身"

批量识别有个高频痛点:图片角落的水印、LOGO、页眉页脚总是混进结果,还得人工删。在批量页右侧设置里进入"忽略区域"编辑器,按住右键在图上画出多个矩形框,把这些位置框住,识别时框内文字就会被自动排除。

这里有个必须记牢的机制:只有完全落在框里的整个文本块才会被忽略,单个字符可不会。所以画框宁可大一点,把所有可能出现水印的位置都包住,否则漏框一次,结果里就多一行杂音。

任务三:扫描版 PDF,变回"能搜能复制"的文档

文档识别是压轴戏,支持pdf、xps、epub、mobi、fb2、cbz六种格式,最典型的用法就是把扫描版 PDF 变成可搜索文本。它的工作逻辑可以概括为三步:解析 → 识别 → 重组。PDF 先被拆开,区分出"本来就带文本层"和"需要 OCR 的扫描图片层";扫描层交给本地引擎逐页识别;最后按阅读顺序重新拼装,输出成你指定的格式。

两个亮点值得展开:

  • 双层可搜索 PDF:OCR 后输出"底层原图、上层透明文字"的双层 PDF。外观和原扫描件一模一样,但文字可以搜索、复制、划线。历史合同归档、论文数字化,这个功能能直接顶上去。
  • 灵活的提取策略:软件会优先提取 PDF 自带的文本层(速度快、零识别误差),遇到纯扫描页才自动切到 OCR。你也可以主动选整页强制 OCR,或反过来只提取原文。v2.1.2 起还能输出单层纯文本 PDF,想要体积小、好编辑的文件就选它。

文档识别同样支持忽略区域(可按页码范围设置),用来排掉扫描件的页眉页脚;也能设置任务完成后自动关机。

三个旋钮:语言、排版、性能,按需拧

界面语言 vs 识别语言库:两码事

界面语言支持中文、繁体中文、英文、日文、俄语、葡萄牙语等,在"全局设置 → 语言/Language"里切换。

但注意,界面语言和识别语言库是两回事:界面语言管按钮菜单长什么样,识别语言库管 OCR 引擎认哪种文字,后者在各标签页的"文字识别"设置里单独选择或下载。界面用中文、日常识别日文书,完全可以搭配着来。

排版方案:给识别结果"排座位"

OCR 引擎吐出的字是"散装"的,谁先谁后要靠排版解析来管。内置的预设方案不少,挑对了才省事:

方案典型场景一句话点评
多栏-按自然段换行两栏/三栏论文、书籍拿不准就选它,覆盖绝大多数场景
多栏-总是换行需要按行处理的场景每句独立成行
多栏-无换行想整段合并成一行强制压成一行
单栏-按自然段换行单栏文档段落自然断行
单栏-保留缩进代码截图保住行首缩进和行中空格
不做处理想要原始输出引擎默认原样返回

其中"单栏-保留缩进"值得单独表扬:把代码截图丢进去,输出能基本保持缩进结构,配合截图 OCR 一起用,堪称程序员小帮手。

性能:大图、内存、闪烁各有一招

  • 长图识别不完整:到"文字识别"设置里调高限制图像边长。默认限制是为了平衡速度与内存,遇到像素特别大的长截图,适当调高数值就行,但别盲目放大原图——过度放大会增加噪点,反而降低准确率。
  • 内存占用偏高:PaddleOCR 插件从 v2.1.4 起默认把内存占用限制在系统总内存的一半以内;还想再省,去插件配置里调低线程数。
  • 截屏闪烁、界面错位:多半是显卡渲染兼容问题。去"全局设置 → 界面和外观 → 渲染器"换个渲染方案,或直接关掉硬件加速,通常能解决。

新手避坑:8 个高频疑问,对号入座

把最常见的报错和误区整理成一张诊断表,遇到问题直接找原因:

症状原因解法
忽略区域画了没效果文本块没有完全落在框内把框画大、整块包住;确认保存了忽略区域配置
长图识别缺胳膊少腿图像边长超出默认限制调高"限制图像边长",而不是放大原图
截图时屏幕闪烁、错位显卡渲染兼容问题切换渲染器或关闭硬件加速
命令行指令没反应HTTP 服务被关闭了在全局设置里打开 HTTP 服务(默认开启,仅监听本地环回、不经过物理网卡,数据不会外泄)
批量任务想中途休息版本太老升级到 v2.1.2 及以上,支持暂停,待机后继续
代码截图排版全乱排版方案不对换"单栏-保留缩进"
多栏论文顺序串行排版方案不对换"多栏-按自然段换行"
超大文件夹加载很卡文件数量太多v2.1.5 起已优化异步加载,等进度条走完再操作

进阶玩法:命令行、HTTP 接口与引擎生态

对普通用户来说,图形界面已经够用;但想把它嵌进自己的工作流,还有两条"程序化通道"。

命令行模式,入口就是主程序本身:

# 截屏识别,结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片,结果写到文件 umi-ocr --path "D:/扫描件.png" --output result.txt # 识别整个文件夹(含子目录),--> 是 --output 的简写 umi-ocr --path "D:/scans" --> result.txt # 生成二维码 umi-ocr --qrcode_create "你好,Umi-OCR" "D:/qrcode.png" 256

所有指令都支持用前几个字母简写,比如--screenshot写成--sc。配合 HotkeysCMD 之类的快捷键工具,还能实现"按一个键就自动截固定屏幕区域并识别"的骚操作。完整参数说明见命令行手册 docs/README_CLI.md。

HTTP 接口:启动后,本地 HTTP 服务会提供 OCR、文档识别、二维码等接口,接口文档在 docs/http/api_doc.md。开发者可以用几十行代码把它封装成小工具,或接入自己的自动化流程,实现"上传图片 → 返回 JSON 识别结果"。

引擎与插件生态:软件默认内置 Rapid-OCR(兼容性好)和 PaddleOCR(速度稍快)两套引擎,全局设置里随时切换;项目还有独立的插件库,可以扩展更多 OCR 引擎。公式识别等功能则列在开发路线图上,属于远期计划,可以保持关注。

版本别落后CHANGE_LOG.md记录了每个版本的演进——v2.1.0 加入文档识别,v2.1.2 支持单层纯文本 PDF 与任务暂停,v2.1.3 登陆 Linux 并支持 Docker 部署,v2.1.5 修复了 PDF 页面旋转导致的文本错位问题。如果你手头有旋转过方向的扫描件,一定要用最新版。

写在最后

三句话总结:Umi-OCR 免费、开源、离线运行,装好就能用截图、批量、PDF 三大场景,从日常摘抄到批量归档全都覆盖遇到问题别慌,忽略区域、排版方案、渲染器这几个旋钮能解决大部分麻烦

下次再收到扫描版合同、带水印的图片,或是一堆等着整理的截图时,打开 Umi-OCR——你会发现,自己已经不需要在线工具,也不用再逐字手打了。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询