Buzz 离线语音转文字完整指南:本地 Whisper 转录与字幕生成
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
给两小时的讲座录音出字幕,先别急着把音频传云端。Buzz 是一款本地运行的离线语音转文字工具,基于 OpenAI 的 Whisper 模型,转录全程在机器里完成。
云端转录 vs Buzz:隐私、费用、断网三点差在哪
两套方案差别就三件事:音频存在哪、钱怎么算、断网了怎么办。云端服务把完整音频送到远程服务器,隐私交给第三方;账单跟着音频时长和调用量走,用得多花得多;网络一断,离线机器只能干瞪眼。Buzz 把这三条反过来做:文件不出本机,不分钟计费,模型缓存完就照跑。
| 云端转录服务 | Buzz |
|---|---|
| 音频上传远程服务器处理,平台留存处理记录 | 只在本地处理,文件不离开机器 |
| 按音频时长或调用量计费,量越大越贵 | 免费开源,不按次收钱 |
| 必须在线,断网即不可用 | 模型缓存后离线照常转录 |
Windows、macOS、Linux 三种装法
三个平台都有现成安装包,差别只在装法。
Windows:未签名警告这样处理
从发布渠道拿到安装程序直接运行。程序没有签名,安装时会弹出安全警告,点"更多信息"再选"仍要运行"即可继续。
macOS:拖进 .dmg 就行
下载 .dmg 后拖进应用程序文件夹即可。注意较新版本只面向 Apple Silicon,Intel Mac 只能装到 1.4.5 为止的旧版。
Linux:一条命令装好
flatpak install flathub io.github.chidiwilliams.Buzz不管哪个平台,第一次启动都要进模型设置挑一个模型下载,缓存之后断网也能用。
音频进去,文字出来:输入、引擎、加工三层看
流程分三层看:喂什么素材进去、哪个引擎干活、出来的文字怎么收拾。
输入层。三类素材都能进:
- 本地音频:WAV、MP3、FLAC 这类格式直接导入
- 视频文件:MP4、AVI 直接抽音轨转录
- 在线链接:贴一个 YouTube 地址,自动下载再转录
引擎层。后端共四种,都属 Whisper 家族:
- OpenAI Whisper(原版)
- Faster Whisper:速度优先,适合 6GB 以上显存的独显
- Whisper.cpp:C++ 实现,最省资源,Mac 与集显的推荐选择
- Hugging Face 兼容模型;另支持接 OpenAI API 走服务端
有 NVIDIA 独显的话开 CUDA 加速,出字速度能快一截。实时场景有录音转录模式,边说边出字,配一个投大屏的演示窗口,文字还能实时导成 TXT 喂给 OBS。吵的录音先跑语音分离再转录,多人对话能标出不同说话人。
加工层。文字出来还没完:
- 转录查看器:能搜索、播放、调倍速,文字与时间戳逐段可改
- 导出有三种格式:TXT 对应文稿,SRT 与 VTT 对应字幕
- 字幕 Resize:长行按标点拆、短行合并、显示时长延长
- 文件夹监控,文件丢进去自动转录;命令行接口能嵌进自动化脚本;插件系统还有 AI 摘要这类扩展
五个模型大小速度对照
选模型其实是一道权衡题:硬件愿意为准确率让出多少。
| 模型 | 大小 | 速度 | 准确度 |
|---|---|---|---|
| tiny | 约 75MB | 最快 | 一般 |
| base | 约 142MB | 快 | 可用 |
| small | 约 466MB | 中等 | 较好 |
| medium | 约 1.5GB | 慢 | 高 |
| large | 约 2.9GB | 最慢 | 最高 |
平时速记选 base 或 small,值得反复听的重要资料再上 large。转录慢别先怪模型,把后端切到 Whisper.cpp,它更快也更省内存。
几个值得动一次的设置:
- 语言:别依赖自动检测,手动选定一种,口音重的素材更稳
- 初始提示:把人名、术语填进去,专有名词的错字会少一截
- 词级时间戳:后面要逐词精调字幕才开,平时关着
三种角色的典型用法
同一个工具,三种角色各有一套用法。
访谈研究员,整理多人对话。需求:两小时访谈变成带说话人标记的文字稿。操作:转录前打开语音分离,文字出来后在转录查看器里逐段指定说话人,再导出 TXT。产出:带时间戳、区分"发言人 A / B"的文字稿,可边听边改。
播客剪辑师,出字幕文件。需求:两小时节目配一份能直接进剪辑软件的字幕。操作:拖入 MP3,语言手动选中文,词级时间戳打开,格式选 SRT,再用 Resize 按标点拆行、限制每行长度。产出:时间码对齐的 SRT,导入即用。
活动组织者,现场大字幕。需求:把现场发言即时打到屏上。操作:选录音转录任务,选好麦克风,打开演示窗口,点录制,同时启用实时文本导出。产出:大屏字幕画面,外加一份可供 OBS 同步的 TXT。
四个高频坑:先给结论再排查
这四个问题出现频率最高,每个都先给结论,再按顺序查。
转录不准。结论:先别换模型。依次查:语言有没有手动指定、录音是否嘈杂(开语音分离)、模型是否偏小(升一级试试)。专有名词反复错,把那几个词直接填进初始提示。
完全断网的机器。结论:可以用。先在有网电脑下好模型,从"偏好设置 → 模型 → 显示文件位置"打开模型文件夹,整体拷到离线机同一路径。仓库里的模型批量下载脚本能一次备齐多个后端。
转录太慢、机器卡。结论:换后端或降模型。先切 Whisper.cpp,或把模型降一级;NVIDIA 独显显存 6GB 以上可试 Faster Whisper。实时录音转录务必选小模型,否则跟不上说话速度。
录音没声音、报 PaErrorCode。结论:多半是麦克风权限。系统隐私设置里先放行 Buzz 使用麦克风,再排除杀毒软件的拦截。
三步上手,数据留在本机
三步就能上手:装好 Buzz 导入一段短音频,选 base 模型点运行,完成后双击结果核对,顺手导出文件。想深入某个功能,先翻官方文档目录和命令行接口说明。从这一天起,你录的每一段音、每一场会,文字和字幕都留在自己机器上。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考