Buzz 本地语音转文字完整指南:在自己的电脑上离线转录音频
2026/9/7 5:16:46 网站建设 项目流程

Buzz 本地语音转文字完整指南:在自己的电脑上离线转录音频

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

周五深夜,三小时的访谈录音躺在桌面上,你盯着 Buzz 的导入按钮,心里清楚:点下去之后,转录、翻译、字幕全部在你自己的电脑上完成,一个字节都不用上传。

这就是 Buzz 的定位——一款基于 OpenAI Whisper 的本地离线音频转录工具,音频识别、翻译、字幕生成全程不碰网络。接下来这篇指南,带你从安装到出片走一遍完整流程。

三分钟装完 Buzz

Buzz 是一个跨平台的桌面应用,MIT 协议开源免费。它和云端转录服务的区别很简单:

  • 数据不出本机:录音、转录结果都留在你的硬盘上,敏感内容不经过任何第三方服务器
  • 一次装好,终身免费:没有订阅制,装完离线就能用(模型下载后)
  • 多后端可选:Whisper、Whisper.cpp、Faster Whisper 都能用,N 卡、苹果芯片、纯 CPU 都有对应方案
  • 不只是转录:翻译、字幕拆分合并、说话人区分、插件扩展都内置了

各平台安装命令

macOS:去官方发布页下载 dmg,或用 Homebrew:

brew install --cask buzz

Windows:下载官方安装包直接安装。提示"未知发布者"时选「更多信息 → 仍要运行」,这是未签名程序的正常现象。

Linux:Snap 或 Flatpak 任选其一:

sudo snap install buzz
flatpak install flathub io.github.chidiwilliams.Buzz

Python 环境(适合想改代码折腾的人,需 Python 3.12 和 ffmpeg):

pip install buzz-captions python -m buzz

首次启动注意

第一次跑任务前,Buzz 需要下载 Whisper 模型。打开帮助 → 首选项 → 模型,选一个模型下载即可。模型会存在这里(记不住没关系,首选项里有"显示文件位置"按钮):

  • Linux:~/.cache/Buzz
  • macOS:~/Library/Caches/Buzz
  • Windows:%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache

如果你的电脑完全不能联网,可以先在别的机器上下载好模型,把 models 文件夹整个拷过去就行,仓库里还有 scripts/download-models.py 脚本帮你批量备模型。

核心功能巡礼:按使用频率排序

1. 导入文件,批量转录

你手上有一堆音频视频文件时,这是最高频的操作。

  1. 点菜单文件 → 导入媒体文件(或Ctrl/Cmd + O、工具栏的 + 号)
  2. 选中文件,选择任务(转录/翻译)、语言、模型
  3. 点 Run,任务排队自动跑,状态列实时显示进度
  4. 完成后双击该行,打开转录结果查看器

几个值得一看的选项:导出格式可选 TXT、SRT、VTT;「初始提示」(Advanced 按钮里)可以填入人名、专业术语,能明显减少错拼。官方建议手动指定语言而不是自动检测,效果更稳。

2. 转录查看器:边听边改

转录不是终点,双击任务行进入查看器后,你可以逐条对照播放、调整每段字幕的起止时间、直接改错别字,最后从工具栏导出 SRT/VTT/TXT。带搜索、播放控制和倍速,长文档改起来不累。

3. 实时录音转录

开会或做演讲时,Buzz 可以直接当实时速记用:

  1. 选任务、语言、麦克风设备
  2. 点 Record,文本随说话实时出现在窗口里
  3. 需要投屏展示时,点出「演示窗口」,大字号实时字幕
  4. 结束后转录稿随任务一起保存,可导出

注意:实时转录吃资源,官方建议搭配 Whisper.cpp 后端和小模型使用。

4. 字幕重排:把流水账变成能看的字幕

你在做视频字幕时,可以这样:导入时勾选「词级时间戳」,转录完成后双击结果,点 Resize 按钮,设置字幕最大长度、是否按标点断句,Buzz 会把碎句合并成节奏合理的字幕行,还能给每句加停留时间。

模型到底怎么选

模型选大小就像挑相机像素——够清晰就行,别盲目拉满。

模型速度大致内存/显存适用
Tiny / Base1~2GB实时转录、快速草稿
Small / Medium中等3~8GB日常主力、批量处理
Large / Large-V3-Turbo8GB 以上高精度需求;Turbo 在速度和精度间取平衡

后端(whisper 类型)的选择同样关键:

后端特点适合谁
Whisper原版实现,准确但慢、吃内存内存充裕的机器
Faster Whisper快几个数量级、更省内存N 卡且显存 ≥6GB
Whisper.cppC++ 实现,任意显卡(含核显)甚至纯 CPU 都能跑无 N 卡用户,Mac 首选
HuggingFace支持自定义模型、MMS 家族(1000+ 语言)需要特定语言优化的场景

名字带.En的模型只支持英语,别选错。

只改这几个配置,体验变化最大

首选项入口:Ctrl/Cmd + ,,或者直接菜单帮助 → 首选项

  • 转录语言:默认"自动检测" → 推荐手动指定 → 检测靠开头几秒猜,指定更准
  • 导出文件名模板:默认纯文件名 → 推荐{{ input_file_name }} ({{ task }}d on {{ date_time }})→ 批量导出后不会混在一起
  • 实时转录导出:默认关 → 直播党推荐开 → 文字实时写入 txt 文件,方便接 OBS 等外部应用
  • 实时转录模式:默认"下方追加" → 硬件够的话换"追加并纠错" → 会自动修正上一句的识别错误,延迟略增
  • 监控文件夹:默认空 → 设一个目录 → 新音频丢进去自动开始转录,配合批量工作流很省事

模型下载和清理也在这里,删掉用不到的模型可以省下几个 GB 磁盘:

三条工作流,跟着做就行

给视频做字幕:导入 MP4,导出格式选 SRT,勾选词级时间戳,选 Small 或 Medium 模型跑完。双击结果进查看器,顺手改掉几个错字,再点 Resize 把每行控制在 40~50 字符、按标点断句,导出 SRT 直接拖进剪辑软件。适合视频创作者和自媒体。

开会实时出纪要:选语言、选麦克风,点 Record 开始录;重要发言多的话切到"追加并纠错"模式。需要给会议室大屏展示就开演示窗口。结束后导出 TXT 归档。适合记者、产品经理、经常开会的人。

批量囤积访谈音频:设一个监控文件夹,每天把新录音扔进去自动转录;追求自动化的话用命令行:buzz add --model-type whispercpp --model-size small --srt 音频文件.mp3,可以写进脚本定时跑。完整参数见 docs/docs/cli.md。适合处理大量素材的研究者、播客制作人。

转录太慢?三步提速

硬件需求速查(以本地跑模型为准):

目标模型内存/显存参考配置
Tiny / Base~1~2GB8GB 内存 + 普通 CPU
Small / Medium~3~8GB16GB 内存,N 卡更佳
Large / Turbo≥8GB 显存16GB+ 内存 + N 卡

高频问题,按"现象 → 原因 → 处理"排:

转得太慢→ 模型太大或跑在 CPU 上 → 换 Tiny/Base 或 Whisper.cpp 后端;有 N 卡(显存 ≥6GB)切 Faster Whisper;GPU 反而更慢时设环境变量BUZZ_FORCE_CPU=true强制用 CPU

启动或转录时崩溃→ 模型文件下载不完整 → 在首选项 → 模型里删掉重下;还不行就去帮助 → 关于 Buzz → 显示日志看日志反馈

报错Unanticipated host error [PaErrorCode-9999]→ 系统没给麦克风权限 → Windows 查「设置 → 隐私 → 麦克风」,临时关掉杀软试试

识别老出错、术语全拼错→ 音频有噪音或没给上下文 → 手动指定语言;在初始提示里填入人名术语;开启"提取语音"选项降噪;重要内容换大模型

老电脑装不上/跑不动→ CPU 不支持 AVX2 → 过老的 CPU 不受支持,这是硬性门槛

想深入折腾的话,可以翻翻这些

  • 插件系统:buzz/plugins/ 下有六个官方插件——AI 摘要、DeepFilterNet 降噪、增强语言检测、DOCX 导出、跳过已转录、字幕重排,插件架构在 buzz/plugins/base.py,照着写一个自己的不难
  • CLI 文档:docs/docs/cli.md,buzz add支持批量文件、URL 导入、静默后台跑
  • 使用文档:docs/docs/ 下的 usage、preferences、faq 系列,比这篇指南细
  • 转录后端源码:buzz/transcriber/ 里每个后端一个文件,想看 Whisper.cpp 怎么被调起来的,从 buzz/transcriber/whisper_cpp.py 入手

写在最后

回到开头那个周五深夜:三小时的访谈,导入、转录、导出 SRT,全程没碰云端。Buzz 把专业级语音转文字搬回了你自己的电脑。

觉得有用的话,去 docs/docs/ 看看 FAQ 里没展开的细节吧。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询