硬字幕转外挂SRT:本地免费支持87种语言的完整视频字幕提取指南
【免费下载链接】video-subtitle-extractor视频硬字幕提取,生成srt文件。无需申请第三方API,本地实现文本识别。基于深度学习的视频字幕提取框架,包含字幕区域检测、字幕内容提取。A GUI tool for extracting hard-coded subtitle (hardsub) from videos and generating srt files.项目地址: https://gitcode.com/gh_mirrors/vi/video-subtitle-extractor
做视频字幕提取,多数方案的路子是把视频上传到在线服务。开源项目 video-subtitle-extractor 反着来:字幕区域检测和文字识别全部在本地完成,视频不出机器,也不依赖任何第三方 API,支持 87 种语言,输出标准 SRT。本文按一次真实提取把流程走一遍,顺带讲清新手最常踩的坑。
硬字幕为什么难搞
视频字幕分两种:外挂字幕是独立文件,可以直接编辑;硬字幕则烧录在画面里,想抄一句台词只能对着屏幕手打,批量处理更不可能。
这个工具把硬字幕当成图像问题处理:先自动检测字幕出现的区域,再对区域逐帧做 OCR 识别,最后把结果按时间轴拼回 SRT。全程本地运行、免费,视频不需要离开你的电脑。
📂 第一次使用:从打开视频到生成 SRT
拿到仓库后先克隆下来:
git clone https://gitcode.com/gh_mirrors/vi/video-subtitle-extractor普通用户直接运行图形界面程序即可;开发者也可以运行python gui.py启动。操作本身就三步:
- 点「打开」加入视频,可以一次选多个文件,它们会进入右侧任务列表排队处理;
- 预览窗会自动检测字幕位置,用绿色边框标出识别区域;
- 点「运行」,日志区出现"字幕文件生成成功"即结束,SRT 直接生成在视频同目录。
界面上还有几个实用开关:视频语言、识别模式、硬件加速(GPU 或 ONNX 后端)、生成 TXT 文本字幕、重新分词。日志会写清当前语言、模式和所用模型,出问题好排查。
⚙️ 识别模式怎么选,不准时调哪里
| 模式 | 定位 |
|---|---|
| 快速 | 走轻量 mobile 模型,出结果最快 |
| 自动 | 日常默认项 |
| 精准 | 走重量级 server 模型,精度优先 |
识别不准按顺序排查:先看右侧面板的视频语言选没选对,这是最常见的翻车点;再手动拖一下绿框,确认区域框得准;画面里有水印、台标时,工具的过滤机制能处理一部分,顽固干扰还是靠收窄区域解决。置信度阈值也可调:调高则宁缺毋滥,调低则召回更多但误报也更多。
📄 批量处理与输出整理
多个视频按队列逐个跑完,每个视频单独生成一份 SRT,文件名跟源视频走。输出侧几个开关值得记住:生成 TXT 文本字幕适合只要纯文本、不要时间轴的场景;重新分词专门解决英文等语句之间没空格的问题;配置里还能写文本替换规则,把常错的字词批量纠正,顺便去重、整理排版。
💻 硬件要求与速度预期
| 档位 | 配置 |
|---|---|
| 基础可用 | 双核 CPU、4GB 内存、2GB 可用空间 |
| 推荐 | 支持 GPU 加速的显卡、8GB 内存、固态硬盘 |
速度可以参考官方演示里的日志:一段 3597 帧(约 2 分钟)的视频,快速模式约 39 秒生成完 SRT;开启硬件加速后还能更快,具体收益看显卡。
⚠️ 新手最容易踩的两个坑
- 路径带中文或特殊字符:程序可能启动异常,项目放在纯英文路径最稳;
- 用任务管理器判断加速是否生效:官方明确提示过,现代显卡每秒可处理上千张图,GPU 占用率低很正常,正确做法是对比 CPU 版与 GPU 版在快速/精准模式下的耗时差异。
两条实用建议:第一次先用仓库 test 目录里的测试视频跑一遍快速模式,确认语言选择正确再处理正式视频;SRT 残留水印文字时,优先手动收窄字幕区域,别反复重跑。
【免费下载链接】video-subtitle-extractor视频硬字幕提取,生成srt文件。无需申请第三方API,本地实现文本识别。基于深度学习的视频字幕提取框架,包含字幕区域检测、字幕内容提取。A GUI tool for extracting hard-coded subtitle (hardsub) from videos and generating srt files.项目地址: https://gitcode.com/gh_mirrors/vi/video-subtitle-extractor
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考