Buzz 离线语音转文字完整指南:10分钟从安装到导出字幕
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
两小时的会议录音,散会后你还得逐句手抄?外语播客想摘金句,只能反复暂停打字?急着给视频配字幕,云端服务却动不动超时?Buzz 是一款跑在你自己电脑上的离线语音转文字工具,用 OpenAI 的 Whisper 模型把音频转成文字、顺便还能翻译——不联网、不上传、不限时长。这篇文章带你从安装开始,跑通第一条转录,最后把字幕导出成能直接用的文件。
为什么选本地转录:Buzz 的定位
先想一个问题:你的录音里装的是什么?客户名字、项目数字、没公开的方案。上传给云端服务换一纸文字稿,等于把机密交出去。Buzz 的取舍很干脆:所有处理都在本机完成,数据不出电脑。
离线还带来"确定感":不怕断网、没有按分钟计费、不用排队限流。Whisper 覆盖约 99 种语言,纯 CPU 能跑,有 NVIDIA 显卡还能开 CUDA 加速。
记住它的基本心智模型,后面就不迷路了:
- 图形界面:处理单个文件、实时录音,给普通用户用;
- 命令行:批量任务、自动化,给效率党用;
- 两个入口底下是同一个转录引擎。
装起来之前先说清:Buzz 提供安装包和命令行两种方式,下一节直接上。
分平台安装 Buzz 的推荐方式
每个系统都有省事的途径,一张表说清:
| 系统 | 推荐方式 | 一条命令搞定 |
|---|---|---|
| Windows | 官方安装包 | 从项目发布页下载,双击安装 |
| macOS | 官方安装包(.dmg) | 下载后拖进 Applications |
| Linux | Flatpak 或 Snap | flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz |
| 任意系统 | pip 安装(需 Python 3.12 + ffmpeg) | pip install buzz-captions后运行python -m buzz |
⚠️Windows 用户注意:安装包未做代码签名,安装时会弹安全警告。点"更多信息"→"仍要运行"即可,这是正常现象。
想追最新未发布功能,也可以克隆仓库跑源码:git clone https://gitcode.com/GitHub_Trending/buz/buzz,再按 readme/README.zh_CN.md 的指引装依赖。
安装完成后,我们直接走最小流程。
第一次转录:5步最小可行流程
第 1 步:导入文件。菜单"文件 → 导入媒体文件"(快捷键Ctrl/Cmd + O),或点工具栏"+"。MP3、WAV、MP4、MOV 都行,Buzz 自己负责解码。
第 2 步:配好三个关键参数。导入弹窗里最重要的三个下拉框:
- Task(任务):Transcribe 转同语言文字;Translate to English 直接给你英文稿;
- Language(语言):默认自动检测。知道是什么语言就手动选,中文务必手动选
zh,准确率明显更高; - Model(模型):新用户选
base或small即可,进阶选择后面细讲。
第 3 步:点"Run"。任务进队列,主界面显示实时进度。文件越大、模型越大,耗时越长,正常现象。
第 4 步:等状态变成 Completed。任务列表里能看到每条任务用的模型、任务类型和耗时。
第 5 步:双击任务行。进入转录查看器,逐段看到带时间戳的文字——你的第一份转录稿诞生了。
跑通这 5 步,你就掌握了 Buzz 的 80%。剩下的事,就是把稿子"加工"到能用的程度。
整理与校对:把转录稿改干净
转录只是起点,Whisper 会听错专有名词。这一节解决"怎么快速改稿"。
查看器左上角的视图按钮提供三种模式:时间戳模式(每段文字+起止时间,适合校对做字幕)、纯文本模式(合并全文,适合复制进文档)、翻译模式(显示翻译结果)。
改稿操作路径很直接:
- 在时间戳表格里双击文本单元格,直接改,保存自动落盘;
- 播放核对:
Ctrl/Cmd + P播放/暂停; - 微调时间轴:
Ctrl/Cmd + ←/→改当前片段的开始时间,Ctrl/Cmd + Shift + ←/→改结束时间; Ctrl/Cmd + G快速滚到当前播放位置,长文稿找位置很省事。
改完稿,下一步就是把字幕断句理顺。
用 Resize 把字幕打磨到专业级
做字幕的人最头疼断句:长句被拦腰切断,或该换行的没换行。查看器工具栏的"Resize"按钮就是干这个的——设置字幕最大长度,按标点分割、按静音间隙合并,一键重组出规整的字幕行。
前提:Resize 的部分重组能力依赖词级时间戳。转录前记得勾选,事后无法补。
字幕理顺了,接着解决"交付":导出成什么格式、要不要翻译。
交付与导出:TXT、SRT、VTT 一次说清
查看器工具栏点"Export",格式一览:
| 格式 | 用途 |
|---|---|
| TXT | 纯文本,直接进文档 |
| SRT / VTT | 字幕文件,喂给剪映、Premiere 等剪辑软件 |
| JSON | 含完整时间戳元数据,适合程序处理 |
| DOCX | Word 文档,由 plugins/export_docx/ 插件提供 |
翻译有两条路:
- 离线自带:任务类型选"Translate to English",任何语言音频直接出英文稿;
- 任意目标语言:在偏好设置里填一个 OpenAI 兼容的 API 地址和密钥,查看器里点"Translate"并给 AI 一句翻译指令。本地用 Ollama 之类的兼容模型也能接上,等于搭一套全离线翻译管线。
导出路径和默认文件名模板可以在偏好设置里自定义,一次设好,之后自动套用。更多参数细节见 docs/docs/preferences.md。
文件一条条导出效率低了?下一节看批量和实时两条自动化的路。
批量与实时:CLI 和会议现场出稿
批量转录:Buzz 的命令行buzz add支持一次丢多个文件,参数可定制。一个典型例子:
buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 访谈.mp3 会议录音.wav这条命令用 Whisper.cpp 的 small 模型转两个文件,直接产出 SRT 和 VTT 字幕。常用参数:--language zh指定语言、--prompt传入提示词(把人名、产品名写进去能减少错字)。全部参数见 docs/docs/cli.md。再配合偏好设置里的文件夹监控功能,新文件丢进目录就自动转,夜里挂机、早上收稿。
实时录音:主界面切到"Live Recording"标签页,选好麦克风、语言和模型,点红色"Record",文字边说边出。
- 实时转录吃性能,一定用 Whisper.cpp 后端 + tiny/base 小模型,否则文字跟不上语速;
- 想要"边说边修正",把录制模式从"Append below"切为"Append and correct",代价是更吃硬件;
- 录音中可打开演示窗口,把实时字幕投到外接屏,做演讲字幕、会议看稿都很合适。
能力散点已经齐了,下一节把它们串成一条固定流水线。
一条可复用的完整工作流
把前面的能力拼起来,你以后每次都可以照这个顺序走:
- 转:导入文件,手动指定语言,模型选
small,勾选词级时间戳,点 Run; - 校:双击进查看器,按
Ctrl/Cmd + P播放,边听边双击修错; - 顺:点 Resize,设最大长度 42 左右,勾上按标点分割,一键合并;
- 译(可选):需要英文稿就再跑一遍 Translate to English;
- 交:Export 出 SRT 给剪辑,TXT 存档,JSON 留作程序处理。
同一批文件超过十个,就把第 1 步换成 CLI 一条命令,其余照旧。流程固定之后,剩下唯一变量就是模型——选错了,又慢又不准。
模型怎么选不纠结:速度与精度的甜点区
Whisper 模型从小到大:tiny→base→small→medium→large。每升一档准确率提升,耗时和内存也跟着涨。我的建议很直接:
| 场景 | 推荐 |
|---|---|
| 低配电脑、实时录音、只要大意 | tiny/base |
| 日常转录(甜点区) | small+ Whisper.cpp 后端 |
| 口音复杂、术语密集的专业录音 | medium/large,建议有 GPU |
| 省内存/显存 | Whisper.cpp 的量化模型(如q_5) |
模型管理在"偏好设置 → Models":左边已下载、右边待下载,勾选后点 Download,还能粘贴自定义模型地址。
几条加速判断:
- NVIDIA 显卡:偏好设置里看到 CUDA 选项就启用,large 模型从"小时级"降到"分钟级";
- 核显/普通显卡:Whisper.cpp 后端可开 Vulkan 加速;
- 想稳:纯 CPU 也够用,
small以下模型体感很好。
选完模型,最后把新手最容易栽的坑一次排掉。
避坑清单:新手最容易栽的5个坑
- 语言没指定,自动检测翻车:中文音频务必手动选
zh,别信"自动检测"; - 实时转录卡顿跟不上语速:换 Whisper.cpp 后端 +
tiny/base小模型; - Resize 的合并功能用不了:转录时没勾"词级时间戳",重跑一次并勾选;
- GPU 没生效:先确认驱动装好、模型偏好里能看到 CUDA 选项;确认没问题再考虑强制纯 CPU;
- Windows 安装弹警告不敢动:未签名属正常,"更多信息"→"仍要运行";第一次用某模型会先下载,属正常现象,别反复取消。
坑都排完了,回到开头那几段录音。
你的声音数据,只属于你
两场两小时的会议、那段反复暂停的外语播客、那部急着配字幕的视频——Buzz 给的解法是同一个:在本地、用开源模型,把音频变成你能搜索、能编辑、能导出、能复用的文字。素材不用交给任何服务商,录音文件永远躺在你自己的硬盘里。
现在就能做的下一步:打开 Buzz,导入手头最急需整理的那份录音,指定语言,点 Run——10 分钟后你就有一份带时间戳的转录稿。觉得顺手,去项目仓库点个 Star 支持一下;遇到问题或新想法,也欢迎反馈给社区。文件夹监控、说话人分离、插件生态都在持续迭代,这套本地转录工作流,值得成为你数字工具箱里的常驻成员。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考