Buzz 离线语音转文字:四步把一小时音频变成带时间轴的字幕文稿
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一个跑在你自己电脑上的本地语音转文字工具,基于 OpenAI 的 Whisper 模型,把音频、视频甚至在线链接离线转成带时间轴的文字稿。装好之后,你五分钟就能拿到第一份文稿和一份 SRT 字幕,所有文件都只留在你的设备里。
为什么值得试
- 完全离线:音频全程不出你的机器,客户访谈、会议录音放心转,不担心数据被第三方服务器存底。
- 输入格式宽:MP3、WAV 等音频,MP4、AVI 等视频,以及在线视频链接,都能直接导入。
- 模型家族齐全:Whisper 从 tiny 到 large 全系列都支持,在设置里下载、两下点完完成切换,不用重装软件。
- 三端通吃:Windows、macOS、Linux 都有对应版本;你习惯命令行的话,也有 Python 包可以直接装在服务器上跑。
Buzz 安装命令行
- Windows:从项目发布页下载安装程序,双击按提示走完;程序未签名,提示时选「More info」→「Run anyway」。
- macOS:从发布页下载
.dmg,拖进应用程序文件夹即可。 - Linux:
sudo snap install buzz安装,再执行sudo snap connect buzz:password-manager-service授权密码存储。 - Python:
pip install buzz-captions装包,之后用python -m buzz启动界面。
首次启动时,软件会引导你下载所选模型,体积从几十 MB 到两百多 MB 不等。这是一次性投入,之后所有转写都在本地完成,不再需要联网。
第一次转录:五分钟出结果
主流程一共四步:
- 第一步:把文件拖进主界面,或按
Ctrl + O选择;想转在线视频,直接粘贴链接。 - 第二步:在任务行选择任务类型(转写或翻译)和模型,语言可以自动检测,也可以手动指定。
- 第三步:点 Run,任务进入队列,主界面实时显示排队、处理和进度百分比;关掉窗口任务也会后台跑完。
- 第四步:状态变成 Completed 后,双击该行,打开转录详情,看到带时间轴的文稿。
批量处理也不费劲,一次丢几十个文件,每一行的文件、模型、任务类型和进度都清清楚楚。
模型档位速查
速度和准确率是一对矛盾,Whisper 用模型大小来调节这个天平:
| 模型 | 速度 | 准确率 | 适合场景 |
|---|---|---|---|
| tiny | 最快 | 一般 | 实时转写、快速试听 |
| base | 快 | 尚可 | 日常笔记、语音备忘 |
| small | 中等 | 良好 | 会议纪要、访谈初稿 |
| medium | 较慢 | 很高 | 重要内容的精转 |
| large | 最慢 | 最高 | 字幕制作、交付级文本 |
结论很直接:随手记梗概用 base 就够,要出能交付的字幕就直接上 large。有 NVIDIA 显卡的话,在设置里打开 CUDA 加速,large 的速度会快上好几倍。
模型的下载和切换都在 Models 设置页完成,已安装的和可下载的列得清清楚楚,还支持填自定义下载地址,方便你用第三方优化过的 Whisper 变体。
转录编辑与字幕导出
转录详情页本身就是一个迷你字幕编辑器:
- 转录详情页:每段文字带精确的开始、结束时间,点击任意片段就跳到对应音频位置,边播放边改文本,改动自动保存。
- Resize(字幕调整):设定目标字幕长度,按标点拆长句,按音频里的静音间隙合并过短碎片,一键对整个文件生效。
- 多格式导出:TXT、SRT、VTT 一键导出;转写时勾选词级时间戳,配合 Resize 能把字幕切得更贴合阅读节奏。
更多参数细节可以看编辑与调整文档。
常见场景速查
| 场景 | 做法 |
|---|---|
| 会议纪要 | 导入音频,选 base 或 small,直接导出 TXT |
| 视频字幕 | 转写时勾选词级时间戳,用 Resize 拆分后导出 SRT |
| 外语播客转中文 | 任务类型选 translate,指定目标语言 |
| 团队协作 | 开文件夹监控,新音频丢进去自动开始转写 |
| 讲座会议现场 | 接麦克风实时录音转写,用演示窗口投给观众看 |
| 服务器自动化 | 一行buzz add命令入队,支持脚本化批量处理 |
命令行参数细节在官方 CLI 文档里有完整列表。
常见卡点怎么办
- 转得太慢 → 模型档位偏高或并行任务太多 → 先换小一号模型,再开 GPU 加速。
- 准确率不理想 → 录音噪音大 → 重录清晰版本,或换 large 重跑。
- 任务一直排队 → 模型还没下载完 → 回 Models 设置页确认下载完成,再添加任务。
- 内存告急 → 单个文件太长 → 分批处理。
决策参考
它适合你:长期处理采访录音、会议纪要或视频字幕,且数据不能出本地设备的人。它不适合你:只是偶尔转一小段短句,或者硬件太老、无法接受纯 CPU 转大模型的等待时间。
验证起来很简单:先拿一段 3 分钟的录音试一次,导入、选 base、看拿到的时间轴文稿是否符合预期。Buzz 的转写、翻译和字幕导出全部跑在你的电脑上,模型下载完成之后,后续使用不再依赖网络。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考