Buzz离线音频转录工具:5分钟免费转录你的音频
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款免费的离线音频转录与翻译工具:它跑在你自己的电脑上,所有识别工作由本地的 Whisper 模型(OpenAI 开源的语音识别模型)完成,音频文件不会离开你的设备。如果你经常整理会议录音、采访素材,或者不想把敏感音频交给云端服务,它解决的就是这件事。Buzz 支持转录音视频文件和 YouTube 链接,也能对着麦克风实时转写,结果可导出 TXT、SRT、VTT 三种格式。
Buzz 主界面:导入的文件以任务列表呈现,每行显示进度与状态,双击打开结果查看器
安装 Buzz 并跑通第一次转录
按系统选一种安装方式即可:
- Windows / macOS:从官方发布页(SourceForge)下载安装包(.exe / .dmg)按提示安装。Windows 上应用未签名会弹警告,点"更多信息 → 仍要运行"即可。
- Linux:一条命令装好
flatpak install flathub io.github.chidiwilliams.Buzz也可用
sudo snap install buzz。 - 开发者:通过 PyPI 安装
pip install buzz-captions,然后运行python -m buzz。需要 Python 3.12,并提前装好 ffmpeg。
装完后的第一次转录路径:点左上角"+"→ 选一个音视频文件 → 选任务(转录 / 翻译成英语)、语言、模型 → 点"运行"。状态变成 Completed 后,双击该行打开查看器。
偏好设置里的模型页:可下载和删除 Whisper 模型,新手建议先从 base 或 small 开始
实时录音转写:边说边出字的 3 种模式
Buzz 直接对麦克风录音并持续产出文字草稿,适合会议、演讲、采访。选好转写任务、语言、模型和麦克风,点"录音"就开始。偏好设置里可以切换三种录音模式:
- 追加在下方 / 追加在上方:新句子加在末尾或顶部,中间空一行,现场展示最直观。
- 追加并校正:新句子接到文末,同时回头修正前文的错误,准确率更高,但更吃硬件。
两个实用配置:
- 演示窗口:开始录音后可调出一个大字体的展示窗口,把实时转写投给会场观众。
- 录电脑里播放的声音:macOS / Windows 上把系统声音接到虚拟音频设备(如 BlackHole、VB CABLE),再把它选为"麦克风",就能直接转写应用播放的音频。
转录完成后:字幕重排、说话人识别、AI 翻译
文件转写完毕后,双击打开查看器,这里集中了三个最常用的操作:
转录查看器:每段文字都有独立时间轴,可逐段播放核对,支持搜索与语速调节
- 调整大小(Resize):如果转录时勾选了"词级时间戳",点"Resize"可以把单词按字幕行重新分组,能设最大长度、按标点断行,还会分析原音频的静音段让断点更准。
- 说话人识别:点"识别说话人",不同人的话会自动打标签;每个标签可以试听 10 秒随机语句,再改名成真实姓名;勾选"合并同一说话人的连续语句"保存后,整篇就是清晰的对话结构。注意该功能在 Intel 芯片的 Mac 上不可用。
- AI 翻译:内置翻译走 Whisper 的能力(目标是英语);要翻成其他语言,在偏好里配置任意 OpenAI 兼容 API(含本地部署的模型),并在"给 AI 的指示"里写清目标语言。文档估算 1 小时音频的翻译成本约 1 美元。
Resize 面板:设置字幕最大长度与合并规则,重排后导出 SRT / VTT
自动化流水线:监视文件夹、CLI 与 6 个内置插件
熟悉之后,可以让 Buzz 自己干活:
- 文件夹监视:在偏好里指定一个目录,新音频丢进去就自动转写,会议录音不用手动处理。
- 命令行(CLI):适合脚本和批量场景,一条命令转录并直接导出 SRT + VTT:
buzz add --model-type whispercpp --model-size small --srt --vtt 会议.mp4加
--task translate --language fr还可以做法语转英语。 - 插件系统(1.4.5 起):在"帮助 → 插件"里开关、排序、配置。内置 6 个:AI 摘要(转写后生成摘要存进备注或文本文件)、导出 DOCX、增强语言检测(用本地模型先自动判断语种)、转录自动重排、DeepFilterNet 降噪(转写前先去噪)、跳过已转录(同文件不重复转)。插件源码在 buzz/plugins/,照着写自己的也不难。
新手避坑清单:开始之前的 6 件事
- 手动指定语言。"检测语言"只靠开头几秒猜测,官方文档明确建议已知语言时自己选,否则容易翻车。
- 实时场景用小模型。默认 Whisper 模型吃资源,官方建议实时转写用 Whisper.cpp 后端 + tiny / base 模型,有 GPU(CUDA / Vulkan)会更快。
- 用初始提示喂专有名词。"高级..."按钮下有 Initial prompt,把人名、术语填进去,能明显减少错拼。
- 量化模型省内存。模型设置里 Whisper.cpp 支持 q_5 等量化版本;环境变量
BUZZ_REDUCE_GPU_MEMORY可全局启用 8bit 量化,显存占用大幅下降。 - 线程不是越多越好。把
BUZZ_WHISPERCPP_N_THREADS设为核心数的一半左右,文档实测有约 15% 提速,再往上反而变慢。 - 模型下载位置。默认存在用户缓存目录,磁盘紧张时用
BUZZ_MODEL_ROOT环境变量换到别的盘。
常见问题:速度、准确率、格式支持
- 速度慢怎么办:换 tiny / base 模型;PyPI 安装的版本给 Nvidia 显卡装 CUDA 版 torch(README 里有具体版本命令);老显卡行为异常时用
BUZZ_FORCE_CPU=true强制走 CPU。 - 准确率不够怎么办:在安静环境重录、手动指定语言、打开"提取语音"(把人声单独抽到一条音轨再转写)、给专有名词加初始提示。
- 支持哪些格式:ffmpeg 能读的音视频都行(MP3、WAV、MP4 等,视频会自动取音轨);导出 TXT / SRT / VTT,加 DOCX 插件后还能出 Word 文档。
- 支持多少语言:CLI 语言参数里列了 99 个语言代码,从南非语到中文。实时转写还可以开启"实时导出",边说边把结果写进 txt 文件,方便接 OBS 等外部工具。
上手三步清单
- 安装 Buzz,在模型页下载一个 base 或 small 模型。
- 导入一段短音频,手动指定语言跑一次转录,打开查看器核对结果。
- 会议场景开启文件夹监视 + 说话人识别,形成你的固定工作流。
完整功能说明在 docs/docs/,主程序代码在 buzz/。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考