如何用 Buzz + Faster-Whisper 搭好离线转录环境:三步完成你的第一次语音转文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
两小时的会议录音躺在下载文件夹里,在线转写要上传、要排队,隐私还说不清。用 Buzz 搭配 Faster-Whisper 做离线转录,语音转文字全部跑在你自己的电脑上:不上传、不联网、不限时长。
30秒看懂:读完你能做什么
- 能做什么:把你电脑上的会议录音、播客、课程音频转成带时间戳的文字,还能顺手翻译成英文
- 需要什么硬件:一台普通笔记本即可,GPU 可选不必须,CPU 四核以上体验就不错
- 花多少时间:首次配置约 15~20 分钟(大头是模型下载),之后每次转写只要两步操作
- 难度:新手友好,全程 3 条命令 + 几次界面点击
环境准备:三步装好 Buzz 离线转写环境
第一步,拿到代码
git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz第二步,装依赖
Buzz 要求 Python 3.12。建一个干净的环境,一次性装全:
python -m venv .venv source .venv/bin/activate # Windows 用 .venv\Scripts\activate pip install -e . # 连同全部依赖一起安装 Buzz第三步,确认 faster-whisper 就绪
Faster-Whisper 本来就是 Buzz 的核心依赖,第二步跑完它就已经装好了,验证一下即可:
pip show faster-whisper # 看到版本号(1.x)就说明就绪用python main.py启动程序,能打开主界面即大功告成。
它为什么更快:Faster-Whisper 对照表
同一套 Whisper 模型权重,差别在运行引擎。标准 Whisper 走 PyTorch,Faster-Whisper 换到 CTranslate2 上跑,并默认开启 int8 量化:
| 维度 | 标准 Whisper | Faster-Whisper |
|---|---|---|
| 运行后端 | PyTorch | CTranslate2 |
| CPU 速度 | 基准 | 约快 2~4 倍 |
| 内存占用 | 较高 | int8 量化后明显更低 |
| 转录精度 | 基准 | 基本持平 |
一句话结论:精度几乎不变,纯 CPU 场景下速度翻倍还多,这正是离线场景的胜负手。Buzz 里这套引擎的实现在 buzz/transcriber/,模型下载逻辑在 buzz/model_loader.py,想深挖可以顺着看。
一次性配置模型:首选项里选档并下载
- 打开程序后,从菜单进入首选项(Preferences)
- 切到 Models 标签页
- 引擎选择 Faster-Whisper,档位默认 medium 即可
- 点 Download,进度条走完就结束
磁盘提醒:medium 权重约 1.5GB,large-v3 超过 3GB。文件会放进 Hugging Face 的本地缓存(Linux 下是~/.cache/huggingface),下载一次、永久本地,所以点下载前先看一眼剩余空间。
完成第一次转录:从导入音频到看结果
- 点主界面左上角的 "+",挑一个 MP3、WAV 或 FLAC 文件
- 设置弹窗里:语言选录音实际说的语种(不确定就留自动检测);任务选 Transcribe,想要英文就选 Translate
- 确认后任务进入队列,进度条自己会跑
- 跑完双击那行,进入播放 + 逐句对照的查看界面
提速清单:模型选型速查与并行参数
模型档位有点像视频清晰度:tiny 最流畅但最模糊,large 最清晰但最费劲。原则是先在能流畅跑完的档位里选最高的。
| 模型档位 | 磁盘占用(约) | 速度 | 适合场景 |
|---|---|---|---|
| tiny | 75MB | 最快 | 低配机器、快速预览 |
| base | 145MB | 快 | 日常随手记 |
| medium | 1.5GB | 中等 | 默认推荐,质量速度均衡 |
| large-v3 | 3GB+ | 最慢 | 专业用途、高配机器 |
并行参数方面,Buzz 的默认策略是"CPU 核心数一半"作为推理线程、CPU 上走 int8 量化,逻辑见 buzz/transcriber/whisper_file_transcriber.py,关键几行供你对照:
device = "auto" # 自动探测显卡,没有则回退 CPU compute_type = "int8" # int8 量化,CPU 更友好 cpu_threads = (os.cpu_count() or 8) // 2 # 线程数取核心数一半GPU 是选项不是前提:有 NVIDIA 显卡时,装好 CUDA 相关依赖后可在高级设置里改用 GPU 计算类型;没有显卡可以整段忽略。
避坑清单:三个常见问题的排查表
| 问题 | 可能原因 | 解决办法 |
|---|---|---|
| 模型下载失败或卡住 | 网络到不了模型仓库 | 换网络环境重试;或手动把模型文件放进 HF 缓存目录后重启程序 |
| 转录速度很慢 | 档位偏高、后台程序抢占 CPU | 降一档(medium→base);关掉大占用应用;有显卡再上 GPU |
| 转录准确率低 | 源语言没选对、档位偏低、录音有杂音 | 指定正确源语言;换更大模型;重录或先降噪 |
下一步
- 用法细节:docs/ 里有文件导入、实时录音、翻译等章节
- 想看界面与引擎怎么协作:从 buzz/widgets/ 入手
模型下载好之后,你电脑里的每段录音就都是可转写的了 🎙️
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考