Buzz 离线语音转文字:把会议录音和访谈音频变成可检索的文字
2026/9/6 18:40:06 网站建设 项目流程

Buzz 离线语音转文字:把会议录音和访谈音频变成可检索的文字

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

录了一场 90 分钟的访谈,声音还有点杂,逐字听太花时间,手动打字又太累。Buzz 是一款运行在本地电脑的离线语音转文字工具,基于 OpenAI Whisper,把音频或视频文件转成文字,还能顺带翻译。录音不需要上传到任何服务器,对访谈、咨询、会议这类敏感内容尤其友好。

Buzz 支持 macOS、Windows、Linux,支持音频和视频文件导入,也支持麦克风实时转录,导出格式包括 TXT、SRT、VTT。装好以后不需要额外配置,导入文件就能开始转写。

Buzz 离线安装:三个平台各一步

  • 📦macOS:从发布页下载.dmg,拖入应用程序即可
  • 🪟Windows:下载安装程序运行;程序未签名,安装时看到安全提示,选"仍要运行"
  • 🐧Linux:用 Flatpak 或 Snap 安装,命令行一行搞定:
flatpak install flathub io.github.chidiwilliams.Buzz

习惯从源码跑的用户也可以用pip install buzz-captions(需要本机装好 ffmpeg)。

第一次转录只需 4 步:

  1. 点"+"导入音频文件,MP3、WAV、FLAC、M4A 和常见视频格式都支持
  2. 在任务行选择转录模型,并明确指定语言,比自动检测更稳
  3. 点运行,看任务队列跑完
  4. 双击任务打开转录查看器,对照播放校对,然后导出

离线 Whisper 模型怎么选:速度与精度的取舍

速度与精度主要看一个选择:模型大小。模型越大越准,但更慢、对硬件要求更高;模型小则快,错字多一些。Buzz 内置 Tiny 到 Large 各档 Whisper 模型:

模型大小速度准确率适用场景
Tiny约 75 MB最快基础快速试跑、低配设备
Base约 142 MB较快良好日常通用转录
Small约 466 MB中等优秀均衡之选,多数场景
Medium约 1.5 GB较慢优秀准确率要求高
Large约 3.1 GB最慢最佳专业级、敏感内容

模型下载一次就存在本机,之后离线可用,在设置的"模型"页随时增删。

GPU 加速设置

  • 有 NVIDIA 显卡(约 6GB 显存以上)且装了 CUDA 12,选Faster Whisper后端,一小时录音通常几分钟内完成
  • 非 N 卡或集显,选Whisper.cpp后端,可走 Vulkan 加速
  • Mac 上直接用 Whisper.cpp,Apple Silicon 有原生支持

纯 CPU 场景

  • 优先选Whisper.cpp后端,纯 CPU 下比原版 Whisper 更高效
  • 长音频优先用 Small 及以下模型,避免大模型跑太久
  • Whisper.cpp 默认线程数约为 CPU 核心数的一半,可用环境变量BUZZ_WHISPERCPP_N_THREADS微调;官方实测调好线程数约有 15% 左右的提速

三个实战转录场景

整理访谈与会议记录

  • 推荐设置:Small 模型;明确指定会议语言;开启说话人识别,区分不同发言者
  • 操作步骤:导入录音 → 任务行设置模型与语言 → 运行 → 打开查看器校对全文
  • 导出格式:TXT 归档;需要可播放版本时选 VTT 或 SRT

给视频配字幕

  • 推荐设置:Whisper.cpp 加 Small 模型;在高级选项里打开词级时间戳
  • 操作步骤:导入 MP4 视频 → 开启词级时间戳 → 转录完成 → 打开"转录调整"把字幕按行合并拆分
  • 导出格式:SRT,可直接导入剪辑软件

播客与课程批量归档

  • 推荐设置:开启文件夹监控,固定一套模型与语言;配合"跳过已转录"插件,避免重复劳动
  • 操作步骤:设置里启用文件夹监控并指定目录 → 新文件丢进文件夹 → Buzz 自动排队转录 → 每周在任务列表里集中校对
  • 导出格式:TXT,文件名模板可包含源文件名、日期等变量,方便归档

自动化与扩展:三个内建帮手

  • AI 摘要:转录完成后调用 OpenAI 兼容接口(本地 Ollama 也可以)生成摘要,写入备注或存成文本文件,长会议先看摘要即可
  • 转录调整(Resize Transcript):把带词级时间戳的结果自动合并拆分成字幕大小的短行,按停顿合并、限制单行长度
  • 文件夹监控:监视目录里的新文件自动加入转录队列,固定流程还可以用 CLI 写成脚本批量处理

插件在菜单"帮助 → 插件"里启用、排序和配置,每个插件都很小,可以直接看 插件源码 理解行为。

排障速查:常见症状与处理

  • 转录太慢:换更小模型,或改用 Whisper.cpp 后端;有 GPU 时确认已装 CUDA 12
  • 识别准确率偏低:不要留空语言,明确指定;换更大模型;专业术语多的内容在高级设置里加提示词
  • 模型下载失败或程序异常:在设置"模型"页删除未下载完的模型,重新下载
  • 麦克风录不到声音,报 PaErrorCode-9999:检查系统麦克风权限,临时关掉杀毒软件试试
  • 完全离线的电脑:先在联网机器上下载模型,把模型文件夹拷到离线机的同一位置;也可用 模型下载脚本 提前备好模型缓存
  • Buzz 无法启动:CPU 需支持 AVX2 指令集,太老的机器无法运行

现在就可以开始

打开 Buzz,导入你最久没听的那段录音,几分钟后会有一份能搜索、能编辑的文字稿。想深入了解各个功能,可以翻翻 官方文档。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询