Buzz 离线语音转文字:把会议录音和访谈音频变成可检索的文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
录了一场 90 分钟的访谈,声音还有点杂,逐字听太花时间,手动打字又太累。Buzz 是一款运行在本地电脑的离线语音转文字工具,基于 OpenAI Whisper,把音频或视频文件转成文字,还能顺带翻译。录音不需要上传到任何服务器,对访谈、咨询、会议这类敏感内容尤其友好。
Buzz 支持 macOS、Windows、Linux,支持音频和视频文件导入,也支持麦克风实时转录,导出格式包括 TXT、SRT、VTT。装好以后不需要额外配置,导入文件就能开始转写。
Buzz 离线安装:三个平台各一步
- 📦macOS:从发布页下载
.dmg,拖入应用程序即可 - 🪟Windows:下载安装程序运行;程序未签名,安装时看到安全提示,选"仍要运行"
- 🐧Linux:用 Flatpak 或 Snap 安装,命令行一行搞定:
flatpak install flathub io.github.chidiwilliams.Buzz习惯从源码跑的用户也可以用pip install buzz-captions(需要本机装好 ffmpeg)。
第一次转录只需 4 步:
- 点"+"导入音频文件,MP3、WAV、FLAC、M4A 和常见视频格式都支持
- 在任务行选择转录模型,并明确指定语言,比自动检测更稳
- 点运行,看任务队列跑完
- 双击任务打开转录查看器,对照播放校对,然后导出
离线 Whisper 模型怎么选:速度与精度的取舍
速度与精度主要看一个选择:模型大小。模型越大越准,但更慢、对硬件要求更高;模型小则快,错字多一些。Buzz 内置 Tiny 到 Large 各档 Whisper 模型:
| 模型 | 大小 | 速度 | 准确率 | 适用场景 |
|---|---|---|---|---|
| Tiny | 约 75 MB | 最快 | 基础 | 快速试跑、低配设备 |
| Base | 约 142 MB | 较快 | 良好 | 日常通用转录 |
| Small | 约 466 MB | 中等 | 优秀 | 均衡之选,多数场景 |
| Medium | 约 1.5 GB | 较慢 | 优秀 | 准确率要求高 |
| Large | 约 3.1 GB | 最慢 | 最佳 | 专业级、敏感内容 |
模型下载一次就存在本机,之后离线可用,在设置的"模型"页随时增删。
GPU 加速设置
- 有 NVIDIA 显卡(约 6GB 显存以上)且装了 CUDA 12,选Faster Whisper后端,一小时录音通常几分钟内完成
- 非 N 卡或集显,选Whisper.cpp后端,可走 Vulkan 加速
- Mac 上直接用 Whisper.cpp,Apple Silicon 有原生支持
纯 CPU 场景
- 优先选Whisper.cpp后端,纯 CPU 下比原版 Whisper 更高效
- 长音频优先用 Small 及以下模型,避免大模型跑太久
- Whisper.cpp 默认线程数约为 CPU 核心数的一半,可用环境变量
BUZZ_WHISPERCPP_N_THREADS微调;官方实测调好线程数约有 15% 左右的提速
三个实战转录场景
整理访谈与会议记录
- 推荐设置:Small 模型;明确指定会议语言;开启说话人识别,区分不同发言者
- 操作步骤:导入录音 → 任务行设置模型与语言 → 运行 → 打开查看器校对全文
- 导出格式:TXT 归档;需要可播放版本时选 VTT 或 SRT
给视频配字幕
- 推荐设置:Whisper.cpp 加 Small 模型;在高级选项里打开词级时间戳
- 操作步骤:导入 MP4 视频 → 开启词级时间戳 → 转录完成 → 打开"转录调整"把字幕按行合并拆分
- 导出格式:SRT,可直接导入剪辑软件
播客与课程批量归档
- 推荐设置:开启文件夹监控,固定一套模型与语言;配合"跳过已转录"插件,避免重复劳动
- 操作步骤:设置里启用文件夹监控并指定目录 → 新文件丢进文件夹 → Buzz 自动排队转录 → 每周在任务列表里集中校对
- 导出格式:TXT,文件名模板可包含源文件名、日期等变量,方便归档
自动化与扩展:三个内建帮手
- ✨AI 摘要:转录完成后调用 OpenAI 兼容接口(本地 Ollama 也可以)生成摘要,写入备注或存成文本文件,长会议先看摘要即可
- 转录调整(Resize Transcript):把带词级时间戳的结果自动合并拆分成字幕大小的短行,按停顿合并、限制单行长度
- 文件夹监控:监视目录里的新文件自动加入转录队列,固定流程还可以用 CLI 写成脚本批量处理
插件在菜单"帮助 → 插件"里启用、排序和配置,每个插件都很小,可以直接看 插件源码 理解行为。
排障速查:常见症状与处理
- 转录太慢:换更小模型,或改用 Whisper.cpp 后端;有 GPU 时确认已装 CUDA 12
- 识别准确率偏低:不要留空语言,明确指定;换更大模型;专业术语多的内容在高级设置里加提示词
- 模型下载失败或程序异常:在设置"模型"页删除未下载完的模型,重新下载
- 麦克风录不到声音,报 PaErrorCode-9999:检查系统麦克风权限,临时关掉杀毒软件试试
- 完全离线的电脑:先在联网机器上下载模型,把模型文件夹拷到离线机的同一位置;也可用 模型下载脚本 提前备好模型缓存
- Buzz 无法启动:CPU 需支持 AVX2 指令集,太老的机器无法运行
现在就可以开始
打开 Buzz,导入你最久没听的那段录音,几分钟后会有一份能搜索、能编辑的文字稿。想深入了解各个功能,可以翻翻 官方文档。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考