Buzz 完整指南:本地离线 AI 音频转录,把录音免费变成可编辑字幕
2026/9/10 7:29:52 网站建设 项目流程

Buzz 完整指南:本地离线 AI 音频转录,把录音免费变成可编辑字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款本地离线 AI 音频转录工具,基于 OpenAI 的 Whisper 模型,能把电脑里的录音和视频变成文字和时间轴字幕,全程不用联网。这篇指南把从安装、调参到进阶玩法的坑都踩过一遍整理出来,你照着走就能出结果,不用再自己翻文档。

你的痛点,它替你解决

如果你用在线转写网站时被按时长收费,或者稍长的文件就要付费墙拦着。 如果你担心会议录音、访谈素材上传到第三方服务器后泄露。 如果你所在的环境经常断网,而在线服务一断网就彻底罢工。

Buzz 把音频处理全部留在本机:不上传、不计时、不联网。如果你中过上面任何一条,继续往下读。

它和在线转写差在哪

维度在线转写服务Buzz
数据流向上传到第三方服务器全程留在本机
费用按时长计费或订阅开源免费
离线能力断网不可用完全可用
平台覆盖大多只有网页版Windows / macOS / Linux
性能上限受服务器排队影响GPU 加速,纯 CPU 也能跑
  • 数据不出本机
  • 开源,永远免费
  • 有显卡更快,没有也能跑

⚡ 从安装到拿到第一份文稿

  1. 先装好客户端:Windows 双击安装包走完向导,macOS 下载 .dmg 安装,Linux 用 Flatpak/Snap,或pip install buzz-captions后运行python -m buzz,细节见 安装说明
  2. 把文件丢进去,三种方式任选:
    • 点工具栏的+按钮
    • 按快捷键Ctrl+O(macOS 是Cmd+O
    • 直接把文件拖进窗口;YouTube 链接也能粘贴进去直接导入
  3. 选参数、点运行:在任务面板选好任务类型、语言、模型和输出格式,点运行,任务进队列,多个文件会排队并发处理
  4. 拿结果:处理完在转录窗口看到逐句带时间戳的文字,可复制,也可导出 TXT、SRT、VTT

🎚 三个决定输出质量的开关

  • 任务类型:选转录,输出和原音频同语言的文本;选翻译,非英语内容直接输出英文。选错的话,你只是想要文字稿却拿到一份英文翻译
  • 语言:自动检测对长音频够用,但短片段、多语言混杂时手动指定更稳。支持 99 种语言,中文、日语、德语等主流语种全覆盖
  • 模型大小:tiny/base 最快,适合实时转录;small/medium 是日常甜点区间;large 精度最高,留给重要材料。选小了漏关键词,选大了等得久

更多选项见设置面板里的模型管理,已下载的模型和可下载的模型一目了然。

🔍 容易被忽略的能力

字幕整形 Resize

解决"字幕行要么太长看不完、要么太碎频繁跳"的问题。打开转录窗口进入 Resize 工具,设定目标长度,它会按标点和时间间隔自动重新断句、合并过碎的字幕、拆分超长句,给 B 站或 YouTube 适配格式就是改几个数字的事。

实时转录 + 演示窗口

解决"会议、课堂上说话的人还在讲,文字还没出来"的问题。点麦克风按钮就开始吃麦克风输入,说话的同时屏幕出字,还能投到专门的演示窗口放大展示,直播加字幕、现场出纪要都能用。

说话人识别

解决"多人录音分不清谁说了什么"的问题。转录完成后它自动给不同发言者打标签,会议记录、访谈整理不用再来回猜。

🤖 让它自己干活

文件夹监控

在设置里指定一个监控文件夹,之后新音频丢进去就自动开始转录,全程不用碰鼠标,适合定期更新的播客和批量堆积的课程录音,入口在 监控设置源码 对应的偏好面板。

插件机制

内置插件按需开关:AI 摘要生成、字幕优化、跳过已转录文件、增强语言检测、导出 DOCX,拼一套自己的工作流即可,源码在 buzz/plugins/。

命令行

适合批量任务和定时脚本,示例:

# 转录单个文件并指定中文 buzz add --task transcribe --language zh audio.mp3 # 用 Whisper.cpp 后端 small 模型转录,同时导出 SRT 和 VTT 字幕 buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt interview.mp4 # 把一批文件翻译成英文 buzz add --task translate *.mp3

完整参数见 CLI 文档。

找到你的位置

  • 学生/老师:导入课程录音 → 导出 TXT 笔记 → 按时间戳跳知识点
  • 视频创作者:导入视频 → Resize 统一行宽 → 导出 SRT 进剪辑软件
  • 职场人:实时转录 + 说话人识别 → 直接产出结构化会议纪要
  • 研究者:批量导入访谈 → 按说话人区分 → 导出文本做分析

少走弯路的几个提醒

  1. 先用小模型摸底:tiny/base 快速过一遍全部文件,重要的再换 large 重跑
  2. 让硬件配得上模型:NVIDIA 记得开 CUDA,Apple Silicon 直接用优化版,纯 CPU 就选小一号模型
  3. 先清理输入再转录:环境嘈杂时先勾选提取语音,准确率提升明显
  4. 把专有名词填进初始提示词:人名、地名、术语填进去,识别率肉眼可见地变好
  5. 批量任务开"跳过已转录"插件:重复跑同一批文件时自动跳过已完成项

❓ 你可能想问的

Q:必须联网吗?A:不用。所有处理在本机完成,只有主动选 OpenAI API 后端时才需要网络。

Q:支持多少种语言?A:99 种,中、英、日、德等主流语言都覆盖,转录和翻译都支持。

Q:能处理多长的音频?A:没有硬性限制,几秒到几小时的录音都可以。

Q:结果存到哪里?A:可在转录窗口直接查看和导出,所选格式的 TXT/SRT/VTT 文件随源文件一起生成。

Q:没有显卡会慢很多吗?A:会,但纯 CPU 照样能跑,用 tiny 或 small 模型保持速度即可。

一句话总结

从把"听写"外包给第三方,到变成完全可控的本地能力,Buzz 让声音变成可搜索的文字资产。现在就下载它,导入第一段录音,看字幕长出来。

官方文档:docs/docs/

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询