Buzz 本地语音转文字完整指南:在自己的电脑上离线转录音频
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
周五深夜,三小时的访谈录音躺在桌面上,你盯着 Buzz 的导入按钮,心里清楚:点下去之后,转录、翻译、字幕全部在你自己的电脑上完成,一个字节都不用上传。
这就是 Buzz 的定位——一款基于 OpenAI Whisper 的本地离线音频转录工具,音频识别、翻译、字幕生成全程不碰网络。接下来这篇指南,带你从安装到出片走一遍完整流程。
三分钟装完 Buzz
Buzz 是一个跨平台的桌面应用,MIT 协议开源免费。它和云端转录服务的区别很简单:
- 数据不出本机:录音、转录结果都留在你的硬盘上,敏感内容不经过任何第三方服务器
- 一次装好,终身免费:没有订阅制,装完离线就能用(模型下载后)
- 多后端可选:Whisper、Whisper.cpp、Faster Whisper 都能用,N 卡、苹果芯片、纯 CPU 都有对应方案
- 不只是转录:翻译、字幕拆分合并、说话人区分、插件扩展都内置了
各平台安装命令
macOS:去官方发布页下载 dmg,或用 Homebrew:
brew install --cask buzzWindows:下载官方安装包直接安装。提示"未知发布者"时选「更多信息 → 仍要运行」,这是未签名程序的正常现象。
Linux:Snap 或 Flatpak 任选其一:
sudo snap install buzzflatpak install flathub io.github.chidiwilliams.BuzzPython 环境(适合想改代码折腾的人,需 Python 3.12 和 ffmpeg):
pip install buzz-captions python -m buzz首次启动注意
第一次跑任务前,Buzz 需要下载 Whisper 模型。打开帮助 → 首选项 → 模型,选一个模型下载即可。模型会存在这里(记不住没关系,首选项里有"显示文件位置"按钮):
- Linux:
~/.cache/Buzz - macOS:
~/Library/Caches/Buzz - Windows:
%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache
如果你的电脑完全不能联网,可以先在别的机器上下载好模型,把 models 文件夹整个拷过去就行,仓库里还有 scripts/download-models.py 脚本帮你批量备模型。
核心功能巡礼:按使用频率排序
1. 导入文件,批量转录
你手上有一堆音频视频文件时,这是最高频的操作。
- 点菜单
文件 → 导入媒体文件(或Ctrl/Cmd + O、工具栏的 + 号) - 选中文件,选择任务(转录/翻译)、语言、模型
- 点 Run,任务排队自动跑,状态列实时显示进度
- 完成后双击该行,打开转录结果查看器
几个值得一看的选项:导出格式可选 TXT、SRT、VTT;「初始提示」(Advanced 按钮里)可以填入人名、专业术语,能明显减少错拼。官方建议手动指定语言而不是自动检测,效果更稳。
2. 转录查看器:边听边改
转录不是终点,双击任务行进入查看器后,你可以逐条对照播放、调整每段字幕的起止时间、直接改错别字,最后从工具栏导出 SRT/VTT/TXT。带搜索、播放控制和倍速,长文档改起来不累。
3. 实时录音转录
开会或做演讲时,Buzz 可以直接当实时速记用:
- 选任务、语言、麦克风设备
- 点 Record,文本随说话实时出现在窗口里
- 需要投屏展示时,点出「演示窗口」,大字号实时字幕
- 结束后转录稿随任务一起保存,可导出
注意:实时转录吃资源,官方建议搭配 Whisper.cpp 后端和小模型使用。
4. 字幕重排:把流水账变成能看的字幕
你在做视频字幕时,可以这样:导入时勾选「词级时间戳」,转录完成后双击结果,点 Resize 按钮,设置字幕最大长度、是否按标点断句,Buzz 会把碎句合并成节奏合理的字幕行,还能给每句加停留时间。
模型到底怎么选
模型选大小就像挑相机像素——够清晰就行,别盲目拉满。
| 模型 | 速度 | 大致内存/显存 | 适用 |
|---|---|---|---|
| Tiny / Base | 快 | 1~2GB | 实时转录、快速草稿 |
| Small / Medium | 中等 | 3~8GB | 日常主力、批量处理 |
| Large / Large-V3-Turbo | 慢 | 8GB 以上 | 高精度需求;Turbo 在速度和精度间取平衡 |
后端(whisper 类型)的选择同样关键:
| 后端 | 特点 | 适合谁 |
|---|---|---|
| Whisper | 原版实现,准确但慢、吃内存 | 内存充裕的机器 |
| Faster Whisper | 快几个数量级、更省内存 | N 卡且显存 ≥6GB |
| Whisper.cpp | C++ 实现,任意显卡(含核显)甚至纯 CPU 都能跑 | 无 N 卡用户,Mac 首选 |
| HuggingFace | 支持自定义模型、MMS 家族(1000+ 语言) | 需要特定语言优化的场景 |
名字带.En的模型只支持英语,别选错。
只改这几个配置,体验变化最大
首选项入口:Ctrl/Cmd + ,,或者直接菜单帮助 → 首选项。
- 转录语言:默认"自动检测" → 推荐手动指定 → 检测靠开头几秒猜,指定更准
- 导出文件名模板:默认纯文件名 → 推荐
{{ input_file_name }} ({{ task }}d on {{ date_time }})→ 批量导出后不会混在一起 - 实时转录导出:默认关 → 直播党推荐开 → 文字实时写入 txt 文件,方便接 OBS 等外部应用
- 实时转录模式:默认"下方追加" → 硬件够的话换"追加并纠错" → 会自动修正上一句的识别错误,延迟略增
- 监控文件夹:默认空 → 设一个目录 → 新音频丢进去自动开始转录,配合批量工作流很省事
模型下载和清理也在这里,删掉用不到的模型可以省下几个 GB 磁盘:
三条工作流,跟着做就行
给视频做字幕:导入 MP4,导出格式选 SRT,勾选词级时间戳,选 Small 或 Medium 模型跑完。双击结果进查看器,顺手改掉几个错字,再点 Resize 把每行控制在 40~50 字符、按标点断句,导出 SRT 直接拖进剪辑软件。适合视频创作者和自媒体。
开会实时出纪要:选语言、选麦克风,点 Record 开始录;重要发言多的话切到"追加并纠错"模式。需要给会议室大屏展示就开演示窗口。结束后导出 TXT 归档。适合记者、产品经理、经常开会的人。
批量囤积访谈音频:设一个监控文件夹,每天把新录音扔进去自动转录;追求自动化的话用命令行:buzz add --model-type whispercpp --model-size small --srt 音频文件.mp3,可以写进脚本定时跑。完整参数见 docs/docs/cli.md。适合处理大量素材的研究者、播客制作人。
转录太慢?三步提速
硬件需求速查(以本地跑模型为准):
| 目标模型 | 内存/显存 | 参考配置 |
|---|---|---|
| Tiny / Base | ~1~2GB | 8GB 内存 + 普通 CPU |
| Small / Medium | ~3~8GB | 16GB 内存,N 卡更佳 |
| Large / Turbo | ≥8GB 显存 | 16GB+ 内存 + N 卡 |
高频问题,按"现象 → 原因 → 处理"排:
转得太慢→ 模型太大或跑在 CPU 上 → 换 Tiny/Base 或 Whisper.cpp 后端;有 N 卡(显存 ≥6GB)切 Faster Whisper;GPU 反而更慢时设环境变量BUZZ_FORCE_CPU=true强制用 CPU
启动或转录时崩溃→ 模型文件下载不完整 → 在首选项 → 模型里删掉重下;还不行就去帮助 → 关于 Buzz → 显示日志看日志反馈
报错Unanticipated host error [PaErrorCode-9999]→ 系统没给麦克风权限 → Windows 查「设置 → 隐私 → 麦克风」,临时关掉杀软试试
识别老出错、术语全拼错→ 音频有噪音或没给上下文 → 手动指定语言;在初始提示里填入人名术语;开启"提取语音"选项降噪;重要内容换大模型
老电脑装不上/跑不动→ CPU 不支持 AVX2 → 过老的 CPU 不受支持,这是硬性门槛
想深入折腾的话,可以翻翻这些
- 插件系统:buzz/plugins/ 下有六个官方插件——AI 摘要、DeepFilterNet 降噪、增强语言检测、DOCX 导出、跳过已转录、字幕重排,插件架构在 buzz/plugins/base.py,照着写一个自己的不难
- CLI 文档:docs/docs/cli.md,
buzz add支持批量文件、URL 导入、静默后台跑 - 使用文档:docs/docs/ 下的 usage、preferences、faq 系列,比这篇指南细
- 转录后端源码:buzz/transcriber/ 里每个后端一个文件,想看 Whisper.cpp 怎么被调起来的,从 buzz/transcriber/whisper_cpp.py 入手
写在最后
回到开头那个周五深夜:三小时的访谈,导入、转录、导出 SRT,全程没碰云端。Buzz 把专业级语音转文字搬回了你自己的电脑。
觉得有用的话,去 docs/docs/ 看看 FAQ 里没展开的细节吧。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考