Buzz 使用教程:四步完成离线音频转录与字幕导出
2026/9/7 6:00:45 网站建设 项目流程

Buzz 使用教程:四步完成离线音频转录与字幕导出

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款完全离线的音频转录桌面工具,基于 OpenAI Whisper 在你的个人电脑上本地完成转录与翻译。文件不离开你的机器,转写完成后可按时间戳导出为 TXT、SRT 或 VTT 字幕。没有订阅费,不上传任何数据,整个过程跑在你自己的硬件上。

什么情况下你需要离线转录?

先想到三种情况:

  • 录音涉及敏感内容,比如内部会议、访谈或客户沟通,不希望文件流向任何第三方服务
  • 机器处在弱网环境,Buzz 只需要本地缓存的模型,下载过一次之后断网也能转写
  • 需要批量处理大量长文件,云端转写通常有时长和并发限制,Buzz 可以排队本地逐个跑完

Buzz 覆盖了“导入 → 转写 → 校对 → 导出”的完整链路,也能接入直播字幕等实时场景。

首次使用:安装与最小转录流程

按平台选一种安装方式:

  • Windows:下载安装包,首次启动会有未签名提示,点“更多信息”→“仍要运行”即可
  • macOS:下载 DMG 拖入应用程序文件夹
  • Linuxflatpak install flathub io.github.chidiwilliams.Buzz
  • 开发环境(Python 3.12 + ffmpeg):pip install buzz-captions,然后用python -m buzz启动

第一步:导入文件并选模型

  1. 点工具栏“+”号,或按Ctrl/Cmd+O,导入音频或视频文件(视频会自动提取音轨),也可以直接粘贴 YouTube 链接
  2. 在任务行里选择任务(转写或翻译)、语言和模型
  3. 点“运行”,一次导入多个文件会排队依次处理

第二步:校对、编辑并导出字幕

转写完成后双击任务打开查看器:文本按时间戳分段,点击某一段即可定位播放到对应位置,支持调节播放速度和搜索文本。哪句转错了直接改,也可以用 Resize 功能拆分、合并片段并调整起止时间;多人对话还能启用说话人识别。确认无误后,一键导出 TXT、SRT 或 VTT。

实时转录与批量自动化

🎙️ 麦克风实时转写

会议或讲座正在进行时,切到实时模式:选好麦克风,点击开始录音,文字会实时出现(默认转录延迟 20 秒)。它还提供专门的演示窗口,活动期间可以单独投屏;实时稿还能随生成随写入文本文件,接进 OBS Studio 就能出直播字幕。

⚙️ 监听文件夹与命令行

文件是陆续到达的话,启用监听文件夹,放进目录的新文件会被自动转写。脚本化场景则更推荐命令行,一条命令转写并直接产出字幕:

buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt ./meeting.mp4

完整参数见 docs/docs/cli.md;plugins/ 目录下还有 AI 摘要、导出 Docx、自动调整字幕行长等现成扩展。

Whisper 后端与模型尺寸怎么选

四个后端对号入座

  • Faster Whisper:Nvidia GPU 显存 6GB 以上时首选,比原版快一个量级
  • Whisper.cpp:C++ 实现,走 Vulkan 加速,任何品牌 GPU(含核显)甚至纯 CPU 都能跑,Mac 上的默认选项
  • Whisper:原版实现,准确但慢,吃内存
  • Hugging Face:支持社区自定义模型,包括覆盖上千种语言的 MMS 系列

模型尺寸与离线缓存

模型尺寸从 tiny 到 large,越大越准也越慢。Large-V3精度最高,Turbo在速度和精度之间取平衡;赶时间就降到 small 或 base,先用一段短音频试转对比一下。

模型首次使用时下载并缓存在磁盘(Linux 上是~/.cache/Buzz)。给完全离线的机器准备时,在联网电脑上下好模型,把文件夹拷到离线机相同位置即可;scripts/download-models.py 可以预生成离线模型缓存,更多常见问题见 docs/docs/faq.md。

技术结构:各部分在哪里

Buzz 用 Python + PyQt6 构建,模块边界清晰:

  • transcriber/:转录核心逻辑,每个后端一个独立类
  • widgets/:全部界面组件
  • db/:转录历史的 SQLite 存取
  • settings/store/:偏好设置与密钥安全存储
  • plugins/:插件加载机制与基类

项目采用 MIT 许可证,想加一个新后端或插件,从plugins/base.py的基类读起即可。

拿一段短音频把“导入 → 转写 → 编辑 → 导出”完整走一遍,再试几个不同的模型,你就能找到适合自己硬件的速度精度平衡点。之后会议纪要、视频字幕、播客文稿都可以留在本地处理。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询