Buzz 本地语音转录工具评测与入门指南:免费离线音频转文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款开源的离线语音转录工具,基于 OpenAI Whisper,在你的电脑上把音频和视频转成文字。它同时支持音频翻译、实时录音转录和字幕导出,覆盖 Windows、macOS 与 Linux,适合需要整理会议录音、制作视频字幕,又在意隐私与成本的用户。
它是什么、能做什么:一分钟看懂
- 本地离线转录:导入音频或视频文件,在本地生成带时间戳的文字稿,文件无需上传到任何云端。
- 音频翻译:把语音内容识别为文字并翻译成英语,方便整理跨语言素材。
- 实时录音转录:直接录入麦克风并即时出文字,内置演示窗口,适合会议、演讲场合。
- 字幕导出:结果可导出为 TXT、SRT、VTT 等格式,配合字幕重排功能直接生成可用字幕。
- 多引擎与硬件加速:提供 Whisper、Faster Whisper、Whisper.cpp、Hugging Face 等多种后端,支持 NVIDIA GPU(CUDA)、Apple Silicon 以及 Vulkan 加速。
- 跨平台:Windows、macOS、Linux 都有对应安装方式。
安装与上手
普通用户,按系统选一条路径即可:
- macOS:从官方发布渠道下载
.dmg安装包,双击安装。 - Windows:下载安装程序。程序未签名,安装时系统会提示警告,选择"更多信息" → "仍要运行"即可继续。
- Linux:用 Flatpak 执行
flatpak install flathub io.github.chidiwilliams.Buzz,或用 Snap 执行sudo snap install buzz。
开发者:需要 Python 3.12 环境,并先安装好 ffmpeg。先克隆仓库git clone https://gitcode.com/GitHub_Trending/buz/buzz,然后执行pip install buzz-captions,再用python -m buzz启动。
首次启动后的操作路径很短:按Ctrl/Cmd + O导入一个音频文件,选择任务(转录或翻译)、语言和模型,点击运行;状态显示完成后,双击该行即可打开转录查看器。
功能走读
离线优先:音频不出本机 🔒
结论:Buzz 的核心卖点就是"处理发生在你的机器上"。识别、翻译全程本地完成,对律师、记者、医疗等处理敏感内容的场景很关键。模型首次使用需要联网下载一次,之后缓存在系统目录(Linux 为~/.cache/Buzz,macOS 为~/Library/Caches/Buzz),断网机器可通过拷贝模型目录的方式离线使用。GPU 配置逻辑在 buzz/cuda_setup.py,转录各后端的实现在 buzz/transcriber/ 目录。
多引擎与硬件加速:按机器选后端 🚀
结论:没有万能引擎,按硬件挑最合适的。Whisper(原版)最稳定但慢、吃内存;Faster Whisper 快得多且省内存,需要至少 6GB 显存的 NVIDIA GPU;Whisper.cpp 是 C++ 实现,能跑在任意 GPU(含集显,走 Vulkan)甚至纯 CPU,是 Mac 用户的最佳选择;Hugging Face 后端支持社区模型,从 1.4.0 起还支持 Meta MMS 系列(覆盖上千种语言)等。引擎与模型大小的选择入口在 模型偏好界面,官方 FAQ 中有各后端的详细对比(docs/docs/faq.md)。
从转录到导出:一条完整工作流
结论:转录查看器是整理成果的枢纽。它提供时间戳表格、纯文本、翻译三种视图,支持全文搜索、播放控制、0.5 倍到 2 倍调速、片段循环播放,还能用方向键按 0.5 秒步进微调每段文字的起止时间,改完直接从导出菜单生成 TXT、SRT、VTT 或 JSON。相关代码在 转录查看器模块。
任务管理与插件扩展
结论:主窗口就是一个任务队列。可以连续导入多个文件排队处理,也可以开启文件夹监听(folder watch),把新放进目录的音频自动加入转录队列,入口在 文件夹监听组件。插件系统(1.4.5 起)内置 AI 摘要、自动语言检测、DOCX 导出、字幕重排、DeepFilterNet 降噪、跳过已转录文件等,在"帮助 → 插件"里开关和排序,代码位于 buzz/plugins/。
实战场景:什么时候用它 🎬
视频做字幕:从成片到 SRT问题:成片做好了,手工打字幕又慢、时间轴还容易错。 步骤:导入视频文件(MP4 等格式可直接处理)→ 任务选"转录"、导出格式选 SRT → 完成后在查看器里用"Resize"功能对字幕重新分组(支持按静音间隙合并、按标点分割、限制字幕长度)→ 微调个别时间点。 结果:一份标准 SRT/VTT 字幕文件,可直接导入剪辑软件。
会议与演讲:实时录音转录问题:会议进行到一半,你需要实时文字而不是事后补。 步骤:选择实时录音任务、语言、模型和麦克风 → 点击录制 → 需要投屏时打开演示窗口,把实时文字显示在大屏上。文字更新有三种模式(下追加、上追加、追加并修正),可按场合切换。 结果:文字近实时产出,结束后整段文字稿可直接导出再编辑。
批量整理一批录音问题:几十个音频文件逐个操作太费时间。 步骤:在偏好设置中开启文件夹监听并指定目录,同时启用"Skip Already Transcribed"插件,避免重复处理已转录的文件。 结果:把文件丢进目录即可离开,文字稿自动排队生成。
实用技巧 💡
- 模型怎么选:小模型(tiny、base)快但错得多,大模型准但重。Large-v2 更稳定,Large-v3 精度最高但偶尔会"幻觉"出没说的话,Turbo 是速度与精度的折中。最稳妥的办法是用自己的语言素材逐个试一遍。
- 开启 GPU 加速的方法:NVIDIA 显卡且有 6GB 以上显存,选 Faster Whisper;其他品牌或核显,选 Whisper.cpp(Vulkan 加速);Mac 直接用 Whisper.cpp。若某台机器的 GPU 反而比 CPU 慢,可用环境变量
BUZZ_FORCE_CPU强制走 CPU。 - 自定义导出文件名:偏好设置里的"Default export file name"支持变量,例如
{{input_file_name}} ({{task}}d on {{date_time}}),批量导出时文件名会自动带上任务类型和时间,省去手动整理。 - 命令行批量处理:Buzz 自带 CLI(buzz/cli.py),脚本化转录长这样:
buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 会议录音.mp3完整的参数说明见 CLI 文档。
常见问题 ❓
没有网络的环境能Buzz吗?可以。先在有网的机器上把模型下载好,再把模型缓存目录(Linux 为~/.cache/Buzz,macOS 为~/Library/Caches/Buzz,Windows 在用户目录的AppData\Local\Buzz下)整体拷到离线机器的相同位置。在偏好设置的模型页面点"显示文件位置"可以直接定位目录,项目里还有 scripts/download-models.py 脚本可批量准备离线模型。
转录太慢,从哪里入手?按顺序尝试:换更小的模型(tiny、base);换更省的后端,Whisper.cpp 在现代笔记本的核显甚至纯 CPU 上也能接近实时;有 NVIDIA GPU 且显存 6GB 以上的话,Faster Whisper 通常最快。
模型会不会每次重复下载?不会。模型只下载一次,之后走本地缓存。偏好设置中的模型页面可以统一管理下载和删除;想改存放目录,用环境变量BUZZ_MODEL_ROOT指定即可。
Windows 安装时弹出警告正常吗?正常。Windows 安装包没有签名,安装时选择"更多信息" → "仍要运行"即可。另外注意 Buzz 要求 CPU 支持 AVX2 指令集,非常老的机器无法运行。
适合谁、怎么开始
推荐对象:需要把会议录音、访谈和讲座转成文字的人;赶时间做字幕的视频创作者;处理敏感内容、不希望音频上传云端的律师、记者、医疗工作者;以及配置较老、希望用 Whisper.cpp 纯 CPU 路线跑通的机器。
一个可执行的第一步:下载对应系统的安装包,找一段两分钟的音频,用 tiny 模型转录一次——从导入到打开结果大概五分钟内,就能判断它是否适合你的工作流。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考