Buzz 离线语音转文字实战:三步转出第一份带时间戳的稿子
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款跑在你自己电脑上的离线语音转文字工具,基于 OpenAI 的 Whisper 模型。音频不用上传,会议录音、直播、播客直接在本地转成文字或字幕。下面按任务带你走完安装、第一次转录和两个高频场景。
Buzz 安装:四步转出第一份稿子
第一次用不用碰代码,四步就能拿到结果:
- 备好环境。走源码安装需要 Python 3.12 和 ffmpeg(负责解析音视频);Windows、macOS 也可以直接装发布页的安装包,Linux 用 Flatpak 或 Snap。
- 装好启动。从 PyPI 安装只需两条命令:
pip install buzz-captions python -m buzz- 导入文件。点工具栏的 "+"(或菜单里的 Import Media File,快捷键 Ctrl+O),选一个音频或视频文件。任务栏里选"Transcribe"(转写)或"Translate to English"(翻译成英文),选好语言,点 Run。
- 看结果。状态变成 Completed 后双击该行,打开的是带时间戳的转录文本,可以直接编辑、导出 TXT、SRT、VTT 三种格式。
一个 10 分钟的录音,用 Small 模型在普通笔记本上大约一两分钟出稿,具体取决于你的硬件。
Buzz 模型选择:按需求对着挑
模型别闭眼选,先看你的用途和硬件:
| 你的情况 | 推荐选择 | 说明 |
|---|---|---|
| 快速出稿,准确率要求不高 | Tiny / Base | 小模型秒级响应,CPU 也能跑 |
| 日常通用 | Small + Whisper.cpp | C++ 实现,任意显卡或纯 CPU 都快,Mac 上首选 |
| 正式文档,要尽量准 | Large-V3 或 Turbo | Large-V3 准确率最高但偶尔"幻觉";Turbo 是速度与准确率的平衡项 |
| NVIDIA 显卡(≥6GB 显存) | Faster Whisper | 比原版 Whisper 快几个数量级,省内存 |
两个前提先说清楚:GPU 加速目前只有 NVIDIA 显卡(需 CUDA 12)走 Faster Whisper,其他厂商的显卡靠 Whisper.cpp 的 Vulkan 路线;带.En后缀的模型只支持英文。想省心得话,模型设置里可以直接在线下载,不用手动搬文件。
实战一:会议录音转成带时间戳的逐字稿
你会遇到的情况:一段 30 分钟的会议录音,要发给团队留档。
配置上三个要点:
- 语言别选自动检测。知道说什么语言就直接指定,识别质量通常更稳。
- 导出格式选 SRT(默认 TXT)。要逐句对应时间轴的话,SRT 直接能当字幕用。
- 专有名词多的,点"Advanced..."加 Initial prompt。把容易拼错的产品名、人名、术语写进去,能明显减少错别字。
点 Run,等状态变 Completed,双击行打开转录查看器:左边文本、右边音频波形,点某句话音频就跳到对应位置,核对起来不用来回拖进度条。
实战二:实时录音,边开会边出字 🎧
直播、讲课、线上会议这类"说完就要文字"的场景,走实时录音:
- 打开实时录音页,选任务、语言、麦克风;
- 点 Record,文字开始实时滚动,说完再停;
- 演讲、活动场合可以打开演示窗口,把实时转录投到大屏上。
实时场景对速度敏感:默认 Whisper 模型算力开销大,官方建议改用 Whisper.cpp 并选小模型,现代笔记本(哪怕只有集显)也能跑。如果队列越长越多,说明系统跟不上,把模型再降一档。
卡住了?三项自检清单
⚠️ 现象一:提示找不到模型文件自查:模型默认存在用户缓存目录(Linux 上是~/.cache/Buzz/models/,可用BUZZ_MODEL_ROOT环境变量改路径)。解法:优先在 Buzz 里在线重新下载;手动下载的话把.bin文件放进这个目录并确认有读取权限。
⚠️ 现象二:导入的音频格式无法识别自查:Buzz 依赖 ffmpeg 解析音视频,问题多半出在 ffmpeg 缺失或版本过旧。解法:装好 ffmpeg 后重试;还不行就先转成 MP3 或 WAV 再导入。
⚠️ 现象三:实时录音没有波形、转不出字自查顺序:系统麦克风权限(Windows 在"设置 → 隐私 → 麦克风"里看 Buzz 是否被允许)→ 确认选对了输入设备 → 用系统自带录音工具录一段验证麦克风本身正常。
资料入口
想深入看:安装指南讲各系统安装细节,文件导入和实时录音是两篇操作文档,常见问题收录了模型选择与 GPU 加速的完整说明,CLI 文档适合想批量、脚本化跑 Buzz 的人。遇到本文没覆盖的报错,先翻一遍 FAQ——模型选错、显卡驱动缺失这两类问题,里面都有对应答案。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考