Buzz 离线语音转文字实战:三步转出第一份带时间戳的稿子
2026/9/7 23:15:47 网站建设 项目流程

Buzz 离线语音转文字实战:三步转出第一份带时间戳的稿子

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款跑在你自己电脑上的离线语音转文字工具,基于 OpenAI 的 Whisper 模型。音频不用上传,会议录音、直播、播客直接在本地转成文字或字幕。下面按任务带你走完安装、第一次转录和两个高频场景。

Buzz 安装:四步转出第一份稿子

第一次用不用碰代码,四步就能拿到结果:

  1. 备好环境。走源码安装需要 Python 3.12 和 ffmpeg(负责解析音视频);Windows、macOS 也可以直接装发布页的安装包,Linux 用 Flatpak 或 Snap。
  2. 装好启动。从 PyPI 安装只需两条命令:
pip install buzz-captions python -m buzz
  1. 导入文件。点工具栏的 "+"(或菜单里的 Import Media File,快捷键 Ctrl+O),选一个音频或视频文件。任务栏里选"Transcribe"(转写)或"Translate to English"(翻译成英文),选好语言,点 Run。
  2. 看结果。状态变成 Completed 后双击该行,打开的是带时间戳的转录文本,可以直接编辑、导出 TXT、SRT、VTT 三种格式。

一个 10 分钟的录音,用 Small 模型在普通笔记本上大约一两分钟出稿,具体取决于你的硬件。

Buzz 模型选择:按需求对着挑

模型别闭眼选,先看你的用途和硬件:

你的情况推荐选择说明
快速出稿,准确率要求不高Tiny / Base小模型秒级响应,CPU 也能跑
日常通用Small + Whisper.cppC++ 实现,任意显卡或纯 CPU 都快,Mac 上首选
正式文档,要尽量准Large-V3 或 TurboLarge-V3 准确率最高但偶尔"幻觉";Turbo 是速度与准确率的平衡项
NVIDIA 显卡(≥6GB 显存)Faster Whisper比原版 Whisper 快几个数量级,省内存

两个前提先说清楚:GPU 加速目前只有 NVIDIA 显卡(需 CUDA 12)走 Faster Whisper,其他厂商的显卡靠 Whisper.cpp 的 Vulkan 路线;带.En后缀的模型只支持英文。想省心得话,模型设置里可以直接在线下载,不用手动搬文件。

实战一:会议录音转成带时间戳的逐字稿

你会遇到的情况:一段 30 分钟的会议录音,要发给团队留档。

配置上三个要点:

  • 语言别选自动检测。知道说什么语言就直接指定,识别质量通常更稳。
  • 导出格式选 SRT(默认 TXT)。要逐句对应时间轴的话,SRT 直接能当字幕用。
  • 专有名词多的,点"Advanced..."加 Initial prompt。把容易拼错的产品名、人名、术语写进去,能明显减少错别字。

点 Run,等状态变 Completed,双击行打开转录查看器:左边文本、右边音频波形,点某句话音频就跳到对应位置,核对起来不用来回拖进度条。

实战二:实时录音,边开会边出字 🎧

直播、讲课、线上会议这类"说完就要文字"的场景,走实时录音:

  1. 打开实时录音页,选任务、语言、麦克风;
  2. 点 Record,文字开始实时滚动,说完再停;
  3. 演讲、活动场合可以打开演示窗口,把实时转录投到大屏上。

实时场景对速度敏感:默认 Whisper 模型算力开销大,官方建议改用 Whisper.cpp 并选小模型,现代笔记本(哪怕只有集显)也能跑。如果队列越长越多,说明系统跟不上,把模型再降一档。

卡住了?三项自检清单

⚠️ 现象一:提示找不到模型文件自查:模型默认存在用户缓存目录(Linux 上是~/.cache/Buzz/models/,可用BUZZ_MODEL_ROOT环境变量改路径)。解法:优先在 Buzz 里在线重新下载;手动下载的话把.bin文件放进这个目录并确认有读取权限。

⚠️ 现象二:导入的音频格式无法识别自查:Buzz 依赖 ffmpeg 解析音视频,问题多半出在 ffmpeg 缺失或版本过旧。解法:装好 ffmpeg 后重试;还不行就先转成 MP3 或 WAV 再导入。

⚠️ 现象三:实时录音没有波形、转不出字自查顺序:系统麦克风权限(Windows 在"设置 → 隐私 → 麦克风"里看 Buzz 是否被允许)→ 确认选对了输入设备 → 用系统自带录音工具录一段验证麦克风本身正常。

资料入口

想深入看:安装指南讲各系统安装细节,文件导入和实时录音是两篇操作文档,常见问题收录了模型选择与 GPU 加速的完整说明,CLI 文档适合想批量、脚本化跑 Buzz 的人。遇到本文没覆盖的报错,先翻一遍 FAQ——模型选错、显卡驱动缺失这两类问题,里面都有对应答案。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询