Buzz 使用教程:四步完成离线音频转录与字幕导出
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款完全离线的音频转录桌面工具,基于 OpenAI Whisper 在你的个人电脑上本地完成转录与翻译。文件不离开你的机器,转写完成后可按时间戳导出为 TXT、SRT 或 VTT 字幕。没有订阅费,不上传任何数据,整个过程跑在你自己的硬件上。
什么情况下你需要离线转录?
先想到三种情况:
- 录音涉及敏感内容,比如内部会议、访谈或客户沟通,不希望文件流向任何第三方服务
- 机器处在弱网环境,Buzz 只需要本地缓存的模型,下载过一次之后断网也能转写
- 需要批量处理大量长文件,云端转写通常有时长和并发限制,Buzz 可以排队本地逐个跑完
Buzz 覆盖了“导入 → 转写 → 校对 → 导出”的完整链路,也能接入直播字幕等实时场景。
首次使用:安装与最小转录流程
按平台选一种安装方式:
- Windows:下载安装包,首次启动会有未签名提示,点“更多信息”→“仍要运行”即可
- macOS:下载 DMG 拖入应用程序文件夹
- Linux:
flatpak install flathub io.github.chidiwilliams.Buzz - 开发环境(Python 3.12 + ffmpeg):
pip install buzz-captions,然后用python -m buzz启动
第一步:导入文件并选模型
- 点工具栏“+”号,或按
Ctrl/Cmd+O,导入音频或视频文件(视频会自动提取音轨),也可以直接粘贴 YouTube 链接 - 在任务行里选择任务(转写或翻译)、语言和模型
- 点“运行”,一次导入多个文件会排队依次处理
第二步:校对、编辑并导出字幕
转写完成后双击任务打开查看器:文本按时间戳分段,点击某一段即可定位播放到对应位置,支持调节播放速度和搜索文本。哪句转错了直接改,也可以用 Resize 功能拆分、合并片段并调整起止时间;多人对话还能启用说话人识别。确认无误后,一键导出 TXT、SRT 或 VTT。
实时转录与批量自动化
🎙️ 麦克风实时转写
会议或讲座正在进行时,切到实时模式:选好麦克风,点击开始录音,文字会实时出现(默认转录延迟 20 秒)。它还提供专门的演示窗口,活动期间可以单独投屏;实时稿还能随生成随写入文本文件,接进 OBS Studio 就能出直播字幕。
⚙️ 监听文件夹与命令行
文件是陆续到达的话,启用监听文件夹,放进目录的新文件会被自动转写。脚本化场景则更推荐命令行,一条命令转写并直接产出字幕:
buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt ./meeting.mp4完整参数见 docs/docs/cli.md;plugins/ 目录下还有 AI 摘要、导出 Docx、自动调整字幕行长等现成扩展。
Whisper 后端与模型尺寸怎么选
四个后端对号入座
- Faster Whisper:Nvidia GPU 显存 6GB 以上时首选,比原版快一个量级
- Whisper.cpp:C++ 实现,走 Vulkan 加速,任何品牌 GPU(含核显)甚至纯 CPU 都能跑,Mac 上的默认选项
- Whisper:原版实现,准确但慢,吃内存
- Hugging Face:支持社区自定义模型,包括覆盖上千种语言的 MMS 系列
模型尺寸与离线缓存
模型尺寸从 tiny 到 large,越大越准也越慢。Large-V3精度最高,Turbo在速度和精度之间取平衡;赶时间就降到 small 或 base,先用一段短音频试转对比一下。
模型首次使用时下载并缓存在磁盘(Linux 上是~/.cache/Buzz)。给完全离线的机器准备时,在联网电脑上下好模型,把文件夹拷到离线机相同位置即可;scripts/download-models.py 可以预生成离线模型缓存,更多常见问题见 docs/docs/faq.md。
技术结构:各部分在哪里
Buzz 用 Python + PyQt6 构建,模块边界清晰:
transcriber/:转录核心逻辑,每个后端一个独立类widgets/:全部界面组件db/:转录历史的 SQLite 存取settings/与store/:偏好设置与密钥安全存储plugins/:插件加载机制与基类
项目采用 MIT 许可证,想加一个新后端或插件,从plugins/base.py的基类读起即可。
拿一段短音频把“导入 → 转写 → 编辑 → 导出”完整走一遍,再试几个不同的模型,你就能找到适合自己硬件的速度精度平衡点。之后会议纪要、视频字幕、播客文稿都可以留在本地处理。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考