离线OCR一步到位:截图抓字、批量转换与PDF识别实战指南
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
同事甩来一份扫描版PDF合同,你全选、复制,屏幕上只回敬一句"无法从此PDF复制文字";转头打开在线识别网站,又撞上"单日免费额度已用完",还得先把敏感文件上传到别人的服务器。这类让人抓狂的瞬间,正是离线OCR软件 Umi-OCR 存在的理由——免费、开源、完全本地运行,图片和文档全程不出你的硬盘,识别多少张、多大多小,都由你说了算。
Umi-OCR 帮你省掉的是:注册账号、联网、上传文件、计费额度,以及"把敏感文档交给陌生人服务器"的提心吊胆。它把整套 OCR 引擎搬进你的电脑,解压双击就能用。
三分钟启动:离线OCR软件的解压即用路径
Umi-OCR 是绿色软件,不需要安装,上手压缩成三个动作:
- 下载:从项目发布页拿
.7z压缩包或.7z.exe自解压包。电脑没装压缩软件的话,选自解压包,双击就能自己解开。 - 解压:解到任意目录,比如
D:/Tools/Umi-OCR。路径里别带中文和空格,能省掉很多莫名奇妙的兼容问题。 - 启动:双击
Umi-OCR.exe(Linux 用户运行umi-ocr.sh)。首次启动会自动读取你的系统语言来切换界面。
⚠️易错提醒:启动前把软件目录加进杀毒软件白名单。Umi-OCR 内置了本地 OCR 引擎和运行库,部分杀软会误报成风险程序直接拦掉,加白名单能避免后面一连串"为什么闪退"的排查。
场景一:截图识别——屏幕上的字,划一下就进剪贴板
最常见的需求往往是随手一划:看到一段文字想立刻复制,手动敲一遍太蠢,网页截图工具又要求上传。打开"截图OCR"标签页,按下快捷键唤起截图框,划出目标区域,识别结果马上出现在右侧记录栏里。
几个顺手的小习惯值得记下:
- 不用截图也能识别:在聊天窗口复制一张图片,回到 Umi-OCR 直接粘贴,一样给你识别。
- 结果可以二次编辑:记录栏里的文字能直接改错,还能划选多条记录一起复制,识别完顺手就能整理格式。
- 竖排文字也不怕:排版解析会自动处理横排和竖排(从右到左)的文本,只要 OCR 引擎本身支持竖排即可。
效果收益:识别即所得,最快的路径是"快捷键唤起 → 划框 → Ctrl+V 带走",全程不过两三秒。
进阶小技巧:截图识别同样受"文本后处理"里的排版方案影响。识别代码截图时,切到"单栏-保留缩进",输出能基本保持缩进结构,配合截图 OCR 简直是搬代码的福音。
场景二:批量图片识别——几百张图一次拖进去,水印自动隐身
手头攒了几十上百张截图、扫描件或相册照片,一张张截屏识别就太亏了。切到"批量OCR"标签页,把图片直接拖进窗口——支持jpg、png、webp、bmp、tif、tiff等常见格式,一次拖几百张也没有数量上限。
点下"开始任务",右侧会逐张显示文件耗时、置信度和识别结果。任务跑完,可以按需输出成txt、jsonl、md、csv四种格式,csv 可以直接用 Excel 打开。深夜挂机党还有福利:任务支持完成后自动关机或待机,睡前扔进去几百张图,醒来直接拿结果。
效果收益:批量导入 + 多格式导出,把"逐张人工截图识别"从几小时压缩到几分钟。
进阶小技巧——忽略区域:批量识别有个高频痛点——图片角落的水印、LOGO、页眉页脚,每次都会混进结果里。在批量识别页右侧设置里进入忽略区域编辑器,按住右键绘制多个矩形框,把水印可能出现的位置都框住,识别时这些区域内的文字就会被自动排除。注意一个关键机制:只有完全处于矩形框内部的整个文本块才会被忽略,而不是单个字符。所以画框时宁可大一点,把水印所有可能出现的位置都包住,否则漏框一次,结果里就混进一行杂音。
场景三:文档识别——扫描版PDF变成可搜索文本
扫描版 PDF 是 OCR 的经典难题:整份文件就是一张张大图,没有任何文字信息,复制、搜索、标注全都做不了。Umi-OCR 的"文档识别"标签页就是为这类文件准备的,支持pdf、xps、epub、mobi、fb2、cbz六种格式。
底层逻辑可以概括为三步:解析 → 识别 → 重组。PDF 先被解析引擎拆开,区分出"本来就有的文本层"和"需要 OCR 的扫描图片层";扫描图片交给本地 OCR 引擎逐页识别;最后按阅读顺序重新拼装输出。
两个亮点值得展开:
- 双层可搜索 PDF:对扫描版做 OCR 后,输出"底层是原图、上层是透明文字"的双层 PDF。外观和原扫描件一模一样,但里面的文字可以搜索、复制、划线。给公司做合同归档、给学校做论文数字化,这个功能直接顶上去。
- 灵活的提取模式:Umi-OCR 会优先提取 PDF 自带的文本层(速度快、零识别误差),只有遇到纯扫描页才自动切换到 OCR。你也可以主动选择整页强制 OCR,或反过来只提取原文本;v2.1.2 起还支持输出单层纯文本 PDF,想要体积小、好编辑的文件时选它。
效果收益:扫描版合同、论文、旧书,一次转换全部变成可检索、可复制的数字文本,省下大量人工抄录。
进阶小技巧:文档识别同样支持忽略区域,而且可以按页码范围设置,专门用来排除扫描件的页眉页脚;它也支持任务完成后的自动关机。另外,v2.1.5 修复了 PDF 页面旋转导致的文本错位问题——如果你手头有旋转过方向的扫描件,务必用最新版。
场景四:命令行与HTTP接口——把离线OCR塞进自己的工具链
GUI 用顺手了,有些人还想更进一步:把 OCR 接进自己的脚本和工作流。Umi-OCR 的命令入口就是主程序本身,前提是全局设置里的 HTTP 服务保持开启(默认开启,且仅监听本地环回、不经过物理网卡,数据不会外泄)。几个拿来即用的姿势:
# 截屏识别,结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片,结果输出到文件 umi-ocr --path "D:/扫描件.png" --output result.txt # 识别整个文件夹(含子目录),结果追加到同一个文件 umi-ocr --path "D:/scans" "-->>" all_result.txt # 生成二维码图片 umi-ocr --qrcode_create "你好,Umi-OCR" "D:/qrcode.png" 256效果收益:配合快捷键工具(如 HotkeysCMD),可以实现"按一个键自动截指定屏幕区域并识别"的骚操作;开发者也几十行代码就能封装成局域网小工具。
进阶小技巧:命令支持前缀简写,比如--screenshot可以写成--sc;更完整的参数说明见 docs/README_CLI.md,HTTP 接口文档在 docs/http/api_doc.md,接口文档本身还带可交互的在线示例页。
三个旋钮:把识别结果调得更顺手
OCR 引擎吐出来的文字往往是"散装"的,谁先谁后、怎么断行,取决于下面几个设置。只挑影响最大的三个讲:
旋钮一:排版解析方案。这是对结果观感影响最大的一项。预设方案里,"多栏-按自然段换行"自动识别两栏/三栏布局并按段落断行,覆盖大部分场景;"单栏-保留缩进"是代码截图专用,保留行首缩进和行中空格;"多栏-总是换行"适合后续要按行处理的场景。不确定选哪个,直接选"多栏-按自然段换行"就对了。
旋钮二:限制图像边长。遇到识别长图/大图不完整,去"文字识别"设置里调高限制图像边长。默认边长限制是为了平衡速度与内存,遇到像素特别大的长截图适当调高即可。注意别反过来盲目放大原图——过度放大只会增加噪声,降低准确率。
旋钮三:渲染器。截屏时界面闪烁、错位,多半是显卡渲染兼容问题,去全局设置 → 界面和外观 → 渲染器,切换渲染方案或直接关闭硬件加速,通常能解决。
顺带一提:界面语言和识别语言库是两回事。界面语言管按钮菜单长什么样,在全局设置 → 语言/Language 里切换,支持中、繁中、英、日、俄、葡等;识别语言库管 OCR 引擎认哪种文字,在各标签页的"文字识别"设置里单独选择或下载。界面用中文、识别日文书,二者完全可以搭配。
新手避坑速查表:8个高频问题的标准答案
遇到报错别慌,按这张表对号入座:
- 忽略区域画了却没效果:原因多半是框不够大。只有整个文本块完全在框内才会被忽略,确认矩形框是否包住所有可能出现的位置,且保存了配置。
- 长图识别结果缺胳膊少腿:调高"限制图像边长",而不是盲目放大原图,过度放大反而降低准确率。
- 截图时界面闪烁、错位:显卡渲染兼容问题,切换渲染器或关闭硬件加速。
- 命令行指令没反应:确认全局设置里 HTTP 服务已开启(默认开启),并且是用主程序
Umi-OCR.exe而非备用启动器(如RUN_GUI.bat)作为入口。 - 批量任务想中途休息:v2.1.2 起支持暂停任务,只要软件不退出,待机/休眠后可以继续跑。
- 代码截图排版全乱了:切到"单栏-保留缩进"。
- 多栏论文输出顺序串行:切到"多栏-按自然段换行"。
- 文件夹里有几万个文件加载很卡:v2.1.5 优化了异步加载机制,超大文件夹稍等加载进度走完再操作,预览界面会显示加载进度。
三句话收个尾:Umi-OCR 是免费、开源、离线运行的本地 OCR 工具,截图、批量、文档三大场景覆盖了从随手摘抄到批量归档的绝大多数需求;遇到问题先查上面的速查表,忽略区域、排版方案、渲染器这三个旋钮能解决大部分麻烦;现在就去下载一份解压启动,把第一张图丢进去试试,你会发现在线工具和手动抄录都不再需要了。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考