Buzz 完全指南:免费快速完成离线音频转录与视频字幕生成
2026/9/6 15:09:47 网站建设 项目流程

Buzz 完全指南:免费快速完成离线音频转录与视频字幕生成

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款基于 OpenAI Whisper 的离线音频转录工具,面向需要会议记录、视频字幕或外语学习材料的普通用户,全部计算都在你自己的电脑上完成。比如刚结束一场会议,把录音文件拖进 Buzz,几分钟后就能得到一份带时间戳的 SRT 字幕和纯文本记录,音频文件从头到尾没有离开过本机。

各平台安装步骤:从下载到看到第一个结果

按你的系统选最短路径:

  • Windows:从官方发布页下载安装程序。程序未做签名,首次运行会弹出安全警告,点"更多信息"→"仍要运行"即可。
  • macOS:从官方发布页下载 .dmg 安装包,支持 Intel 和 Apple Silicon。
  • Linux:通过 Flatpak 或 Snap 安装,Flatpak 包名为 io.github.chidiwilliams.Buzz;Snap 方式安装后记得连接密码管理器接口。
  • Python 环境(跨平台)
pip install buzz-captions python -m buzz

Linux 下用 pip 方式可能需要先补装一些系统库(ffmpeg、libportaudio2 等),详见 安装文档。

启动后进入主界面:点工具栏"+"号(或按 Ctrl/Cmd+O)导入一个音频文件,选择任务和语言,点 Run,状态列变成 Completed 后双击该行,就能看到第一条转录结果。模型文件会下载到用户缓存目录(如 Linux 的 ~/.cache/Buzz),下载后即可离线使用。

第一次文件转录:从导入到输出 TXT / SRT / VTT

目标是把一段音频或视频变成可交付的文字或字幕文件。操作路径:

  1. 导入媒体文件:File 菜单的 Import Media File,或直接拖入。视频文件会自动提取音轨。
  2. 设置任务参数:任务(转录 / 翻译成英文)、语言、模型类型和大小;高级选项里可勾选导出格式(TXT / SRT / VTT)、词级时间戳、语音提取(从嘈杂音频中先抽出人声)。
  3. 运行并查看:完成后双击任务行打开转录查看器,支持文本搜索、播放进度跟随、播放速度调节、片段循环。
  4. 导出:在查看器里导出为选定的格式,文件名模板可在偏好设置中自定义变量。

翻译任务:任务选 Translate to English 可把外语音频直接转成英文文本;若要转成英文之外的语言,可以配合 OpenAI 兼容 API 做 AI 翻译,翻译结果与原文并排显示,也可单独导出为 .translated.txt。

实时录音设置:麦克风、语言与模型的配合

适合会议、讲座、访谈这类"边讲边要文字"的场景。操作:

  1. 在主界面切到实时录音区域,选择任务(Transcribe / Translate to English)、语言、麦克风。
  2. 点 Record 开始;文字按句子实时追加,可开启演示窗口在大屏上展示实时字幕。
  3. 偏好设置里可选择三种追加模式:Append below、Append above、Append and correct(后者会回头修正上一句的错字,但更吃性能)。

官方文档明确提示:默认 Whisper 模型做实时转录资源消耗很大,建议改用 Whisper.cpp 并选小模型(base/small),这样才能在普通笔记本上接近实时。想录"电脑里播放的声音"(而非麦克风),需要先配置虚拟音频设备(macOS 用 BlackHole、Windows 用 VB CABLE、Linux 用 PulseAudio 路由),再在 Buzz 里选中它作为输入源,步骤见 实时录音文档。

说话人区分与字幕重排:两个进阶产出

说话人识别:在转录查看器里点 Identify speakers,Buzz 会把每句话标注为不同说话人,可试听任意一段 10 秒音频确认身份,并把自动标签改成本人的真实姓名;保存时可勾选把同一人的连续句子合并成一段。注意该功能在 Intel Mac 上不可用。

字幕重排(Resize):如果转录时勾选了词级时间戳,可以在 Resize 面板里按"单行字幕最大长度、是否按标点断句"重新分块,还能给每条字幕的结束时间统一延长若干秒,让字幕在屏幕上停留更久。若原始音频文件仍在,工具会分析静音间隙来切分,效果更好。

插件扩展:1.4.5 版起 Buzz 内置插件系统,在 Help → Plugins 里可开关、排序、配置。内置插件包括:AI Summary(调 OpenAI 兼容 API 生成摘要)、Enhanced Language Detection(转录前用本地模型先识别语言)、Export to DOCX(导出 Word,可带时间戳)、Resize Transcript(转录后自动重排字幕)、DeepFilterNet 降噪(转录前去除背景噪音)、Skip Already Transcribed(重复导入时跳过已有结果)。插件机制与源码结构见 插件文档。

偏好设置里值得动的手柄

  • 语言:已知音频语言就手动指定,别依赖自动检测,多数情况下准确率更好。
  • Initial prompt:音频里频繁出现的人名、产品名、术语写进初始提示,能明显减少拼错。
  • 模型管理:在 Models 页下载、删除模型;Whisper.cpp 还支持粘贴自定义 .bin 模型下载地址,以及 q5 等量化版本省内存。
  • 高级项:走环境变量配置,比如 BUZZ_FORCE_CPU(GPU 有问题时强制 CPU)、BUZZ_WHISPERCPP_N_THREADS(16 线程笔记本设为 8 可提速约 15%)、BUZZ_REDUCE_GPU_MEMORY(8bit 量化省显存)。

模型与后端选型对照:什么场景选什么

你的情况后端模型建议依据
Mac / 无 NVIDIA 显卡 / 想跑实时Whisper.cppbase、small纯 C++ 实现,任何品牌 GPU 或纯 CPU 都能跑,集显笔记本也能接近实时
NVIDIA 显卡且显存 ≥6GBFaster Whispersmall、medium比原版快一个数量级以上,显存占用更低
追求最高准确率、不赶时间Whisper 原版large-v3最准但最慢、内存占用大;注意 large-v3 偶尔会"编造"音频里没有的词
冷门语言或想试社区微调模型Hugging FaceMMS(1000+ 语言)、Parakeet、Qwen3-ASR 等支持范围最广,含 PEFT 微调模型
本地算力不足、可接受用 APIOpenAI Whisper API由云端决定需在偏好设置填 API Key,也兼容其他 OpenAI 格式服务

通用判断:小模型快但错得多,大模型准但慢且吃硬件;官方 FAQ 的建议是"最可靠的方法是拿自己的语言把所有候选模型各测一遍"。量化模型(如 q5)适合内存紧张时跑更大的模型。

局限与常见坑:容易失败的地方和规避办法

  • 老机器跑不起来:CPU 必须支持 AVX2,很老的电脑直接不支持。
  • 首次运行报麦克风错误(PaErrorCode-9999):多半是系统麦克风权限被挡,检查 Windows 的 隐私→麦克风 设置,或临时关闭可能拦截的杀毒软件。
  • 模型下载不完整会闪退:到 帮助→偏好设置→模型 里删除已损坏的模型文件重新下载。
  • 实时转录未必真实时:这是资源密集型任务,默认 Whisper 模型基本跑不动,换 Whisper.cpp + 小模型才现实;Append and correct 模式下要盯着队列,积压了就调大转录步长。
  • Windows GPU 有门槛:安装包自带 GPU 支持但要求 CUDA 12,旧驱动环境会退回 CPU。
  • 录系统声音要额外配置:Buzz 只从输入设备取声,录软件播放的声音必须先建虚拟音频设备。
  • 完全离线要用好"搬模型"技巧:在有网机器上下载模型,把整个模型缓存目录拷到离线机器的相同位置(如 Linux 的 .cache/Buzz/models),仓库里的 scripts/download-models.py 就是为这件事准备的。
  • 说话人识别在 Intel Mac 上不可用,规划功能时先排除这条。

适合谁,不适合谁

适合

  • 处理敏感音频(企业会议、内部访谈),数据不能出本机的人
  • 经常需要 SRT / VTT / TXT 字幕文件的视频和播客创作者
  • 需要区分说话人、事后整理纪要的会议组织者
  • 有离线环境、或不想为云转录按量付费的用户

不适合

  • 期待在老旧电脑上获得"秒级"实时字幕效果的人
  • 只想点一下网页链接就出结果、不愿装桌面应用、也不愿下载模型文件的人
  • 依赖 1000+ 低资源语言且不想折腾 Hugging Face 模型的普通用户
  • 追求"上传即出稿"、可接受数据上云的场景(那种直接用云 API 更省事)

下一步

更多细节看仓库内的 官方文档,模型下载位置、GPU 加速、离线部署等问题可查 FAQ,插件的钩子与写法在 plugins/ 源码里都能直接参考。把第一个文件转录完,你就掌握了 Buzz 的 80%。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询