☰
Buzz 语音转文字:离线 Whisper 转写的完整本地方案
2026/10/7 21:03:39 网站建设 项目流程

Buzz 语音转文字:离线 Whisper 转写的完整本地方案

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

两小时的会议录音存了三个月,整理文案的时间比开会还长。Buzz 让语音转文字这件事在你自己的电脑上离线完成,音频不出本地,断网也能用。

这篇文章带你装好 Buzz、跑通第一次离线 Whisper 转写,并搞懂模型怎么选、字幕怎么导出、卡住了怎么办。

适合谁用:Buzz 的能力边界

  • 音频不上云:转写完全在本地运行,基于 Whisper(OpenAI 的语音识别模型),适合合同录音、采访素材这类不想上传的音频。
  • 免费无调用费:不像在线转写服务按分钟收费,本地跑没有 API 费用。
  • 不是在线服务:它不提供服务端部署,也不能多人共享一个转录库,是单机桌面工具。
  • 不吃特殊硬件:普通 CPU 电脑可用 Whisper.cpp 引擎,Nvidia 显卡可装 CUDA 加速;没有显卡也不会卡死,只是慢。
  • 不适合的场景:如果你需要网页端团队协作、或者音频格式极特殊(如电话回路的单声道老磁带),Buzz 帮不上忙。

五分钟跑通第一次转录

按最短路径走:装好 → 导入 → 出字。

平台操作注意点
Windows从 SourceForge 下载官方安装包双击安装安装包未签名,弹警告时选"仍要运行";首次会下载基础模型,预留约 1GB 空间
macOS下载.dmg直接安装仅支持 Apple 芯片,Intel Mac 需使用 1.4.5 及更早版本
Linux执行flatpak install flathub io.github.chidiwilliams.Buzz(从 Flathub 安装)snap 方式装完还需执行sudo snap connect buzz:password-manager-service接入系统密码管理器

装好后做这三步:

  1. 按Ctrl+O导入一个 mp3 或 wav 文件,左侧任务列表出现一条新任务;
  2. 模型保持默认(Base 就够验证),等进度条走完;
  3. 双击结果,右侧逐句显示文字和时间戳——流程通了。

更细的系统依赖和 pip 安装方式见 docs/docs/installation.md。

三个最常用的使用场景

把已有音频转成带时间戳的文档

  • 目标:一段录音变成可校对、可改错、可导出的文字稿。
  • 步骤:Ctrl+O导入文件 → 选语言和模型 → 等待完成 → 双击结果进入查看器 → 点中任何一句直接改字(不用重跑),Ctrl+P边听边校对。
  • 产出物:TXT 纯文本或 SRT/VTT 字幕,导出按钮在结果区右上角。Ctrl+E看纯文本、Ctrl+T看时间戳、Ctrl+L看译文。

开会边说边出字

  • 目标:会议、讲座进行中实时生成字幕。
  • 步骤:Ctrl+R打开录音窗口 → 选麦克风和语言 → 模型选 Base 或 Small(实时场景速度比准确率要紧)→ 选转录模式(新句子排末尾或排最前,直播字幕选"追加在上方")→ 点录制。
  • 产出物:实时刷新的文字流;在偏好里打开 Live transcript exports 后,文字还会同步写进 txt 文件,可以接 OBS 做投屏字幕。

导出能直接用的字幕文件

  • 目标:把碎句合并、长句拆开,输出长度均匀的字幕。
  • 步骤:转录时开启 word-level timings → 结果区点"Resize" → 设定每行最大长度 → 按规则自动合并拆分 → 导出 SRT 或 VTT。
  • 产出物:符合字幕规范的 SRT/VTT 文件,可直接挂到播放器或视频软件上。

模型怎么选:看电脑配置和用途

引擎层面,Whisper.cpp 最适合大多数人(本地跑、支持量化、CPU 也能用);Hugging Face / Faster Whisper 适合有 Nvidia 显卡想要 CUDA 加速的情况;OpenAI Whisper API 则把音频发出去处理,与"不上云"的定位相悖,除非你只是测试。

你的情况直接选
会议录音、日常转写Small:主流配置跑得快,准确率足够
实时录音Base 或 Tiny:跟得上说话速度是第一优先
正式文稿、长文档定稿Medium 或 Large:慢,但错字最少
磁盘紧张、只要个草稿Tiny:1–2 分钟就能出结果

会议录音选 Small 就够了,Large 纯属浪费算力。偏好窗口(Ctrl+,)可以下载和删除模型,不用自己去网页找文件;选 Whisper.cpp 时还能填.bin文件的下载链接加载任意量化模型(如q_5)。

两个真正改变体验的调优

现象原因一条解法
长音频转得慢默认线程数是 CPU 核心数的一半,未必是这台机器的最优值设环境变量BUZZ_WHISPERCPP_N_THREADS=8(官方测试 16 线程笔记本设 8 提速约 15%,再往上反而变慢)
显存不够、长音频爆掉模型占满 GPU 内存偏好里开"Reduce GPU RAM",等价于BUZZ_REDUCE_GPU_MEMORY=true,用 8bit 量化压缩模型

环境变量写在启动脚本里最省事(Linux/macOS):

#!/bin/bash export BUZZ_WHISPERCPP_N_THREADS=8 export BUZZ_FAVORITE_LANGUAGES=zh,en,ja buzz

BUZZ_FAVORITE_LANGUAGES把常用语言置顶,BUZZ_FORCE_CPU=true可在显卡出问题时强制走 CPU,BUZZ_MODEL_ROOT用来给模型换存储盘。完整清单见 docs/docs/preferences.md。

卡住了怎么办:故障速查

现象处理办法
转得太慢换小一号模型(Small→Base);把BUZZ_WHISPERCPP_N_THREADS调到核心数一半左右
模型下载中断、加载失败偏好窗口删掉该模型重新下载;磁盘满了设BUZZ_MODEL_ROOT换目录
GPU 报错、驱动冲突BUZZ_FORCE_CPU=true强制 CPU 模式,慢一点但稳
实时转录跟不上说话速度实时场景换 Small 或 Base,别用 Medium/Large
语言列表太长找不到BUZZ_FAVORITE_LANGUAGES=zh,en置顶常用语言

常用快捷键都在偏好窗口的快捷键页里可改,完整定义在 buzz/settings/shortcut.py;Ctrl+O导入文件、Ctrl+R录音、Ctrl+F搜文字、Ctrl+X取消当前转录。


下一步:丢一段 1–2 分钟的音频,用 Base 模型跑一遍,确认流程通了再挑大模型处理正式素材。Buzz 的价值在于把"语音变文字"从付费云服务变成了本地免费工具,音频全程不出机器。想扩展能力,可以在 Help → Plugins 里启用 AI 摘要、导出 Word、说话人识别等内置插件,用法见 docs/docs/usage/7_plugins.md。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询