离线语音转文字 3 分钟出字幕:Buzz 让数据不出本地
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款离线语音转文字工具:把 MP3、MP4 这类音频视频丢进去,得到 TXT 文稿或 SRT 字幕。转录全程在本地完成,基于 OpenAI 的 Whisper 模型,录音不上传任何服务器。适合不想把会议录音、采访素材交给云端的个人和小团队,本地音频转录、不上传数据的转字幕都靠它。
离线安装 Buzz:三种路径
Windows / macOS:从发布渠道下载安装包直接装。Windows 上应用未签名,弹出安全提示时选"更多信息 → 仍要运行"即可。
Linux:一条命令装 Flatpak 版(也有 Snap 版可装),装完直接打开:
flatpak install flathub io.github.chidiwilliams.Buzz跟最新代码:克隆仓库,用 Python 3.12 环境装好依赖后,运行python -m buzz启动;不想碰源码也可以从 PyPI 装:pip install buzz-captions。
git clone https://gitcode.com/GitHub_Trending/buz/buzz打开应用后是一个任务列表界面:所有录音的转录任务都排在这里,状态、进度一目了然。
一条录音转成带时间戳的字幕
工具栏点 "+"(或按 Ctrl/Cmd + O),选一个音频或视频文件,MP3、WAV、MP4 都能直接丢进去。导入后为它定三样东西:任务(转录原文 / 翻译成英文)、语言(知道就说具体语言,别用自动检测,开头几秒听不清就会猜错)、模型。
点 Run,等状态变成 Completed,双击这一行就打开转录查看器:每行文字带开始/结束时间戳,可以搜索(Ctrl+F)、按 0.5 倍到 2 倍速播放、在"时间戳 / 纯文本"视图间切换。
人名、专有名词容易被听错,把它们写进"高级 → Initial prompt",识别时会照着这个拼法来。
导出格式按需选:
| 格式 | 适合 |
|---|---|
| TXT | 纯文稿,归档、二次编辑 |
| SRT | 视频字幕,导入剪辑软件 |
| VTT | 网页字幕 |
整个文件夹丢进去,自动批量转
一次可以添加多个文件,它们进同一个队列按顺序跑,你可以继续干别的,进度在任务列表里实时刷新。
想彻底不管它,开偏好设置里的Folder Watch(文件夹监控):指定一个目录,往里丢什么音频就自动转什么。再启用Skip Already Transcribed插件,重扫文件夹时已生成过 .srt/.txt/.vtt 的文件会被直接跳过,不重复跑模型。
💡 需要脚本化、一次挂一堆参数时,用命令行buzz add --srt 文件即可静默跑任务,参数细节见 CLI 用法。
开会现场录音,实时出字
Live Recording 面板选好任务、语言和麦克风,点 Record,话音落下就实时出字。实时模式建议用whisper.cpp后端加小模型——默认 Whisper 模型吃资源,实时容易卡。
演示、分享场景有现成的Presentation window(演示窗口),把大字实时字幕投到副屏。
要录"电脑里放出来的声音"(网课、电话会议),先装一个虚拟声卡把系统声音导出来(macOS 用 BlackHole、Windows 用 VB CABLE),再把它选成 Buzz 的麦克风即可。
识别错的字怎么救
改字:打开转录查看器,直接编辑错误的文字。
对齐时间戳:选中某一行,Ctrl/Cmd + ←/→ 以 0.5 秒为单位挪开始时间,加 Shift 挪结束时间,边听边挪。
合并字幕:转录时勾上 Word-Level Timings,每个字都有时间点;之后点 Resize,就能按标点、静音间隙把碎片重新拼成一行行字幕,还能设单行最大长度、给每条字幕加停留时间。
分说话人:开启 Speaker identification,自动把不同人的话标成 Speaker 1、Speaker 2。
再翻译:默认任务可把语音直接转成英文文本;要译成其他语言,配一个 OpenAI 兼容的 API(本地 Ollama 也行),点 Translate 即可。
模型怎么选:速度、准确率、离线机器
| 模型大小 | 取舍 |
|---|---|
| tiny / base | 最快,准确率一般,适合试跑和实时 |
| small / medium | 日常够用 |
| large-v3 | 准确率最高,偶发"加戏"编词 |
| turbo | 速度与准确率的折中 |
后端(whisper type)决定跑在哪:
- whisper:OpenAI 原始实现,准但慢、吃内存
- faster-whisper:有 6GB 以上显存的 NVIDIA 显卡首选,快一个量级
- whisper.cpp:任何显卡、纯 CPU 都能跑,Mac 首选,集显也能实时
- huggingface:跑自定义模型,还支持 1000+ 语言的 MMS 系列
带.En的模型只认英文。NVIDIA 显卡需要 CUDA 12,Windows 安装包已内置。
🎯 完全离线的电脑(内网、涉密环境):先在联网机器上下载模型,"帮助 → 偏好设置 → Models → Show file location" 找到目录(Linux 是~/.cache/Buzz),把整个 models 文件夹拷到离线机器同一位置,Buzz 就能脱网工作。
几个常见卡点
- 跑得慢:换更小的模型,或切到 whisper.cpp;显存够(≥6GB)就上 faster-whisper
- 麦克风报错 PaErrorCode-9999:系统权限没给到 Buzz,Windows 去"设置 → 隐私 → 麦克风"放行
- 启动崩溃:多半是模型下载不完整,在 Models 页删掉重下;另外 CPU 需支持 AVX2,太老的机器跑不了
- 还想看更多:FAQ 全文
打开终端装好 Buzz,把第一段录音拖进任务列表——3 分钟后,你的第一份带时间戳的字幕就躺在旁边。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考