Buzz 语音转文字完整指南:4 种安装方式、离线转录与字幕排版的 7 个实操模块
2026/9/14 3:23:40 网站建设 项目流程

Buzz 语音转文字完整指南:4 种安装方式、离线转录与字幕排版的 7 个实操模块

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款免费、离线、跨平台的开源语音转文字工具,内置 OpenAI 的 Whisper 模型并完全跑在本机:音频从导入到出稿不离开电脑,没有上传,没有按次计费,Windows、macOS、Linux 全支持,还自带字幕排版与多种格式导出。本文按"装上 → 转文件 → 改稿 → 排版 → 自动化"的任务链,把 Buzz 语音转文字从入门到交付一次讲完。

Windows、macOS、Linux、PyPI 四种安装方式怎么选

Buzz 的安装覆盖了几乎所有常见场景,挑一种适合自己的即可:

  • Windows:从项目发布页下载安装包,双击安装。安装包未签名,系统弹出安全警告时选择"更多信息 → 仍要运行"。
  • macOS:一条 Homebrew 命令完成安装。
brew install --cask buzz
  • Linux:Snap 与 Flatpak 两种渠道都支持。
sudo snap install buzz
  • Python 用户:直接从 PyPI 安装,要求 Python 3.12 及以上环境,并预装 ffmpeg;有 NVIDIA 显卡想启用 GPU 加速的,README 里附了 CUDA 相关指引。
pip install buzz-captions python -m buzz

装完打开就是任务主界面:表格一行对应一个文件,列出模型、任务类型与实时状态。

模型怎么选:tiny 快、medium 均衡、large 准

Buzz 不是"只能跑一个引擎"的封闭工具,而是内置多套可切换的后端:Whisper.cpp(本机运行、速度突出)、Faster Whisper、Hugging Face 上的 Whisper 系列模型,另有 OpenAI Whisper API 作为可选的联网模式。换句话说,模型引擎是"可插拔"的,按机器性能和用途切换。

选模型档位,记住这张对照表就够:

档位特点适用场景
Tiny / Base速度最快实时转录、先出草稿
Small / Medium速度与准确度平衡日常批量转写
Large精度最高,速度较慢重要内容、专业字幕

首次选择某个模型时,Buzz 会把它下载到本地缓存(首次约 200MB),之后离线复用。偏好设置里的"模型"页可以下载、删除模型,Whisper.cpp 后端还支持粘贴自定义模型的下载链接。

文件导入、选模型与运行:把录音变文字的流程

拿到一份录音,Buzz 的处理流程很短:

  1. 添加文件:拖入本地音频、视频文件,或者直接粘贴 YouTube 链接。
  2. 选模型与任务:指定 Whisper 模型,任务类型填"转录"或"翻译"(Whisper 原生的翻译任务会把内容译成英文)。
  3. 点运行:任务进入队列,状态从 Queued(排队中)→ In Progress(处理中)→ Completed(已完成)实时刷新,可以一次丢进去多个文件批量跑。

转录校对、搜索与导出:TXT、SRT、VTT 一次导出

双击任务列表里的转录结果,进入查看器界面。它的几项能力对应的是"改到能交付"这一步:

  • 时间轴对齐:每句话都带精确的起止时间戳,文字与音轨逐句对齐。
  • 播放校对:底部播放器边放音频边核对,发现识别错误直接在句子里改,改完自动保存。
  • 搜索定位:长音频里找某段讨论,搜索框输入关键词即可跳到对应位置。
  • 一键导出:TXT、SRT、VTT 三种格式任选,导出的字幕文件可直接丢进剪辑软件使用。

字幕排版:用 Resize 把字幕重排到能直接上屏

转录软件大多停在"把话说对",Buzz 的 Resize 面板专门解决"字幕怎么切才好看"。默认分句直接生成字幕往往会出现超长句,Resize 能自动重排:

  • 按最大长度拆分:设定字符上限,超长字幕自动断开,保证不超出一行。
  • 按标点拆分:优先在句号、逗号处断开,断句更符合阅读习惯。
  • 按间隙合并:检测到音频停顿超过设定阈值时,把相邻短句合并成一条。

还有一个容易忽略的细节:转录时如果开启了词级时间戳(word-level timings),Resize 会进一步分析原音频里的静音位置,用它来优化字幕的切分边界——这一步很多收费工具都不提供。

实时录音、文件夹自动转录与说话人识别

Buzz 还能把"转写"这件小事扩展成完整工作流:

  • 实时录音转录:接上麦克风,说话的同时文字实时上屏,另带一个适合投屏的演示窗口,会议开完纪要初稿也就有了。
  • 文件夹监控:在偏好里指定一个目录,之后丢进去的新音频自动进入转录队列,适合团队协作或定期批量处理。
  • 多语言翻译:除 Whisper 自带的"译成英文"外,还能通过 OpenAI 兼容 API 把结果翻译成任意语言;Base URL 指向本地跑的 Ollama 或 LM Studio 即可,翻译环节同样离线。
  • 说话人识别:多人对话转录后自动标记不同说话人,能试听片段核对、把自动标签改成真实姓名,访谈和会议纪要里非常实用。

用 CLI 把 Buzz 语音转文字接入自动化流水线

追求更彻底自动化时,命令行接口是正解。buzz add一条命令即可发起转录任务,指定文件、模型、输出格式和输出目录:

# 把整个文件夹的录音批量转成 SRT 字幕 buzz add --srt --output-directory ./subtitles recordings/*.mp4

加上--hide-gui可以隐藏主窗口,把 Buzz 语音转文字挂进自己的脚本与 CI 流水线里跑。

至此,Buzz 语音转文字从安装、转录、校对、字幕排版到自动化的完整链路就走通了:免费、离线、跨平台,录音和文稿始终留在本机,装完就能开工。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询