Buzz 本地语音转录:离线跑通 Whisper 的完整上手指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
会议录音攒了几十条,字幕却迟迟没整理。丢给在线转写服务,文件又得上传到别人的服务器。Buzz 就是为此做的:Whisper 模型跑在你自己的电脑上,音频转文字全程离线,文件不出本机。
Buzz 离线音频转文字:核心能力一览
- 全程离线:转录和翻译都在本机跑,不联网也能用
- 常见格式通吃:MP3、WAV、FLAC、M4A、MP4、AVI、MOV
- 模型可选:标准 Whisper、更快的 Faster Whisper、支持 GPU 加速的 Whisper.cpp
- 实时转写:接上麦克风,边说边出文字
- 字幕导出:结果可存为 TXT、SRT、VTT
安装 Buzz 并跑通第一条本地转录
三种装法,挑一种就行:
- Windows / macOS:从官网下载安装包,双击装完即可
- Linux:一行命令
flatpak install flathub io.github.chidiwilliams.Buzz - Python:
pip install buzz-captions,再运行python -m buzz
打开应用,点工具栏的"+"按钮把音频加进来。一次可以加多个文件,Buzz 会按顺序排队处理。选好模型点开始,它就后台干活了。跑完后双击任务列表里的条目,带时间戳的转录结果直接可编辑。
Whisper 模型怎么选:快和准怎么权衡
模型在偏好设置里挑,三档的取舍很直接:
- 小型模型:处理最快,准确性略低,日常速记够用
- 中型模型:速度和准确性的平衡点,大多数场景选它
- 大型模型:准确性最高,留给重要会议和专业内容
拿不准就看录音质量:环境吵、音质差,往上加大一档;录音清晰,小模型跑得又快又稳。
字幕行太长或太碎?调一下就好
原始转录的字幕经常有超长行或碎句。Buzz 内置字幕调整功能,可以合并或拆分字幕行:
- 设一个最大长度,超长的行自动拆
- 按标点符号自动分割
- 根据时间间隙把短字幕合并
导出前调一轮,字幕观感会好很多。
实时语音转文字:麦克风边说边转
工具栏上有麦克风按钮,点下去 Buzz 就开始监听并实时转写。会议记录、讲座转录、实时字幕都是现成用途。无论文件转录还是实时转写,结果都落在同一个查看界面里:左边时间轴,右边文字,支持播放对照和文本编辑。
三个真实场景的设置建议
- 学生整理课堂录音:音频是特定语言,先把语言设对,准确性更稳;整场讲座建议中型以上模型
- 记者处理采访:多段采访一次性拖进队列批量跑,完事导出 SRT 交给剪辑同事
- 创作者做视频字幕:先转录,再用字幕调整把长行拆开,最后导出 SRT 或 VTT 上轨
源码里看这三个目录
- buzz/transcriber/:各引擎的转录器实现
- buzz/widgets/:全部界面组件
- buzz/db/:转录任务的存储与管理
常见问题快答
转录准确率怎么样?基于 OpenAI Whisper,大多数场景准确率都很高,清晰人声表现最好。
能把结果翻译成其他语言吗?能。Buzz 除了转写还支持翻译,转完可以接着翻。
快捷键能自定义吗?可以,在设置里查看和修改。
挑一条攒着的录音试跑一次,从导入到导出 SRT 的完整流程,一遍就能走熟。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考