离线语音转文字 3 分钟出字幕:Buzz 让数据不出本地
2026/9/7 16:04:15 网站建设 项目流程

离线语音转文字 3 分钟出字幕:Buzz 让数据不出本地

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款离线语音转文字工具:把 MP3、MP4 这类音频视频丢进去,得到 TXT 文稿或 SRT 字幕。转录全程在本地完成,基于 OpenAI 的 Whisper 模型,录音不上传任何服务器。适合不想把会议录音、采访素材交给云端的个人和小团队,本地音频转录、不上传数据的转字幕都靠它。

离线安装 Buzz:三种路径

Windows / macOS:从发布渠道下载安装包直接装。Windows 上应用未签名,弹出安全提示时选"更多信息 → 仍要运行"即可。

Linux:一条命令装 Flatpak 版(也有 Snap 版可装),装完直接打开:

flatpak install flathub io.github.chidiwilliams.Buzz

跟最新代码:克隆仓库,用 Python 3.12 环境装好依赖后,运行python -m buzz启动;不想碰源码也可以从 PyPI 装:pip install buzz-captions

git clone https://gitcode.com/GitHub_Trending/buz/buzz

打开应用后是一个任务列表界面:所有录音的转录任务都排在这里,状态、进度一目了然。

一条录音转成带时间戳的字幕

工具栏点 "+"(或按 Ctrl/Cmd + O),选一个音频或视频文件,MP3、WAV、MP4 都能直接丢进去。导入后为它定三样东西:任务(转录原文 / 翻译成英文)、语言(知道就说具体语言,别用自动检测,开头几秒听不清就会猜错)、模型

点 Run,等状态变成 Completed,双击这一行就打开转录查看器:每行文字带开始/结束时间戳,可以搜索(Ctrl+F)、按 0.5 倍到 2 倍速播放、在"时间戳 / 纯文本"视图间切换。

人名、专有名词容易被听错,把它们写进"高级 → Initial prompt",识别时会照着这个拼法来。

导出格式按需选:

格式适合
TXT纯文稿,归档、二次编辑
SRT视频字幕,导入剪辑软件
VTT网页字幕

整个文件夹丢进去,自动批量转

一次可以添加多个文件,它们进同一个队列按顺序跑,你可以继续干别的,进度在任务列表里实时刷新。

想彻底不管它,开偏好设置里的Folder Watch(文件夹监控):指定一个目录,往里丢什么音频就自动转什么。再启用Skip Already Transcribed插件,重扫文件夹时已生成过 .srt/.txt/.vtt 的文件会被直接跳过,不重复跑模型。

💡 需要脚本化、一次挂一堆参数时,用命令行buzz add --srt 文件即可静默跑任务,参数细节见 CLI 用法。

开会现场录音,实时出字

Live Recording 面板选好任务、语言和麦克风,点 Record,话音落下就实时出字。实时模式建议用whisper.cpp后端加小模型——默认 Whisper 模型吃资源,实时容易卡。

演示、分享场景有现成的Presentation window(演示窗口),把大字实时字幕投到副屏。

要录"电脑里放出来的声音"(网课、电话会议),先装一个虚拟声卡把系统声音导出来(macOS 用 BlackHole、Windows 用 VB CABLE),再把它选成 Buzz 的麦克风即可。

识别错的字怎么救

改字:打开转录查看器,直接编辑错误的文字。

对齐时间戳:选中某一行,Ctrl/Cmd + ←/→ 以 0.5 秒为单位挪开始时间,加 Shift 挪结束时间,边听边挪。

合并字幕:转录时勾上 Word-Level Timings,每个字都有时间点;之后点 Resize,就能按标点、静音间隙把碎片重新拼成一行行字幕,还能设单行最大长度、给每条字幕加停留时间。

分说话人:开启 Speaker identification,自动把不同人的话标成 Speaker 1、Speaker 2。

再翻译:默认任务可把语音直接转成英文文本;要译成其他语言,配一个 OpenAI 兼容的 API(本地 Ollama 也行),点 Translate 即可。

模型怎么选:速度、准确率、离线机器

模型大小取舍
tiny / base最快,准确率一般,适合试跑和实时
small / medium日常够用
large-v3准确率最高,偶发"加戏"编词
turbo速度与准确率的折中

后端(whisper type)决定跑在哪:

  • whisper:OpenAI 原始实现,准但慢、吃内存
  • faster-whisper:有 6GB 以上显存的 NVIDIA 显卡首选,快一个量级
  • whisper.cpp:任何显卡、纯 CPU 都能跑,Mac 首选,集显也能实时
  • huggingface:跑自定义模型,还支持 1000+ 语言的 MMS 系列

.En的模型只认英文。NVIDIA 显卡需要 CUDA 12,Windows 安装包已内置。

🎯 完全离线的电脑(内网、涉密环境):先在联网机器上下载模型,"帮助 → 偏好设置 → Models → Show file location" 找到目录(Linux 是~/.cache/Buzz),把整个 models 文件夹拷到离线机器同一位置,Buzz 就能脱网工作。

几个常见卡点

  • 跑得慢:换更小的模型,或切到 whisper.cpp;显存够(≥6GB)就上 faster-whisper
  • 麦克风报错 PaErrorCode-9999:系统权限没给到 Buzz,Windows 去"设置 → 隐私 → 麦克风"放行
  • 启动崩溃:多半是模型下载不完整,在 Models 页删掉重下;另外 CPU 需支持 AVX2,太老的机器跑不了
  • 还想看更多:FAQ 全文

打开终端装好 Buzz,把第一段录音拖进任务列表——3 分钟后,你的第一份带时间戳的字幕就躺在旁边。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询