Buzz 离线语音转文字完整指南:10分钟从安装到导出字幕
2026/9/7 5:40:18 网站建设 项目流程

Buzz 离线语音转文字完整指南:10分钟从安装到导出字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

两小时的会议录音,散会后你还得逐句手抄?外语播客想摘金句,只能反复暂停打字?急着给视频配字幕,云端服务却动不动超时?Buzz 是一款跑在你自己电脑上的离线语音转文字工具,用 OpenAI 的 Whisper 模型把音频转成文字、顺便还能翻译——不联网、不上传、不限时长。这篇文章带你从安装开始,跑通第一条转录,最后把字幕导出成能直接用的文件。

为什么选本地转录:Buzz 的定位

先想一个问题:你的录音里装的是什么?客户名字、项目数字、没公开的方案。上传给云端服务换一纸文字稿,等于把机密交出去。Buzz 的取舍很干脆:所有处理都在本机完成,数据不出电脑

离线还带来"确定感":不怕断网、没有按分钟计费、不用排队限流。Whisper 覆盖约 99 种语言,纯 CPU 能跑,有 NVIDIA 显卡还能开 CUDA 加速。

记住它的基本心智模型,后面就不迷路了:

  • 图形界面:处理单个文件、实时录音,给普通用户用;
  • 命令行:批量任务、自动化,给效率党用;
  • 两个入口底下是同一个转录引擎。

装起来之前先说清:Buzz 提供安装包和命令行两种方式,下一节直接上。

分平台安装 Buzz 的推荐方式

每个系统都有省事的途径,一张表说清:

系统推荐方式一条命令搞定
Windows官方安装包从项目发布页下载,双击安装
macOS官方安装包(.dmg)下载后拖进 Applications
LinuxFlatpak 或 Snapflatpak install flathub io.github.chidiwilliams.Buzzsudo snap install buzz
任意系统pip 安装(需 Python 3.12 + ffmpeg)pip install buzz-captions后运行python -m buzz

⚠️Windows 用户注意:安装包未做代码签名,安装时会弹安全警告。点"更多信息"→"仍要运行"即可,这是正常现象。

想追最新未发布功能,也可以克隆仓库跑源码:git clone https://gitcode.com/GitHub_Trending/buz/buzz,再按 readme/README.zh_CN.md 的指引装依赖。

安装完成后,我们直接走最小流程。

第一次转录:5步最小可行流程

第 1 步:导入文件。菜单"文件 → 导入媒体文件"(快捷键Ctrl/Cmd + O),或点工具栏"+"。MP3、WAV、MP4、MOV 都行,Buzz 自己负责解码。

第 2 步:配好三个关键参数。导入弹窗里最重要的三个下拉框:

  • Task(任务):Transcribe 转同语言文字;Translate to English 直接给你英文稿;
  • Language(语言):默认自动检测。知道是什么语言就手动选,中文务必手动选zh,准确率明显更高;
  • Model(模型):新用户选basesmall即可,进阶选择后面细讲。

第 3 步:点"Run"。任务进队列,主界面显示实时进度。文件越大、模型越大,耗时越长,正常现象。

第 4 步:等状态变成 Completed。任务列表里能看到每条任务用的模型、任务类型和耗时。

第 5 步:双击任务行。进入转录查看器,逐段看到带时间戳的文字——你的第一份转录稿诞生了。

跑通这 5 步,你就掌握了 Buzz 的 80%。剩下的事,就是把稿子"加工"到能用的程度。

整理与校对:把转录稿改干净

转录只是起点,Whisper 会听错专有名词。这一节解决"怎么快速改稿"。

查看器左上角的视图按钮提供三种模式:时间戳模式(每段文字+起止时间,适合校对做字幕)、纯文本模式(合并全文,适合复制进文档)、翻译模式(显示翻译结果)。

改稿操作路径很直接:

  1. 在时间戳表格里双击文本单元格,直接改,保存自动落盘;
  2. 播放核对:Ctrl/Cmd + P播放/暂停;
  3. 微调时间轴:Ctrl/Cmd + ←/→改当前片段的开始时间,Ctrl/Cmd + Shift + ←/→改结束时间;
  4. Ctrl/Cmd + G快速滚到当前播放位置,长文稿找位置很省事。

改完稿,下一步就是把字幕断句理顺。

用 Resize 把字幕打磨到专业级

做字幕的人最头疼断句:长句被拦腰切断,或该换行的没换行。查看器工具栏的"Resize"按钮就是干这个的——设置字幕最大长度,按标点分割、按静音间隙合并,一键重组出规整的字幕行。

前提:Resize 的部分重组能力依赖词级时间戳。转录前记得勾选,事后无法补。

字幕理顺了,接着解决"交付":导出成什么格式、要不要翻译。

交付与导出:TXT、SRT、VTT 一次说清

查看器工具栏点"Export",格式一览:

格式用途
TXT纯文本,直接进文档
SRT / VTT字幕文件,喂给剪映、Premiere 等剪辑软件
JSON含完整时间戳元数据,适合程序处理
DOCXWord 文档,由 plugins/export_docx/ 插件提供

翻译有两条路:

  • 离线自带:任务类型选"Translate to English",任何语言音频直接出英文稿;
  • 任意目标语言:在偏好设置里填一个 OpenAI 兼容的 API 地址和密钥,查看器里点"Translate"并给 AI 一句翻译指令。本地用 Ollama 之类的兼容模型也能接上,等于搭一套全离线翻译管线。

导出路径和默认文件名模板可以在偏好设置里自定义,一次设好,之后自动套用。更多参数细节见 docs/docs/preferences.md。

文件一条条导出效率低了?下一节看批量和实时两条自动化的路。

批量与实时:CLI 和会议现场出稿

批量转录:Buzz 的命令行buzz add支持一次丢多个文件,参数可定制。一个典型例子:

buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 访谈.mp3 会议录音.wav

这条命令用 Whisper.cpp 的 small 模型转两个文件,直接产出 SRT 和 VTT 字幕。常用参数:--language zh指定语言、--prompt传入提示词(把人名、产品名写进去能减少错字)。全部参数见 docs/docs/cli.md。再配合偏好设置里的文件夹监控功能,新文件丢进目录就自动转,夜里挂机、早上收稿。

实时录音:主界面切到"Live Recording"标签页,选好麦克风、语言和模型,点红色"Record",文字边说边出。

  • 实时转录吃性能,一定用 Whisper.cpp 后端 + tiny/base 小模型,否则文字跟不上语速;
  • 想要"边说边修正",把录制模式从"Append below"切为"Append and correct",代价是更吃硬件;
  • 录音中可打开演示窗口,把实时字幕投到外接屏,做演讲字幕、会议看稿都很合适。

能力散点已经齐了,下一节把它们串成一条固定流水线。

一条可复用的完整工作流

把前面的能力拼起来,你以后每次都可以照这个顺序走:

  1. :导入文件,手动指定语言,模型选small勾选词级时间戳,点 Run;
  2. :双击进查看器,按Ctrl/Cmd + P播放,边听边双击修错;
  3. :点 Resize,设最大长度 42 左右,勾上按标点分割,一键合并;
  4. (可选):需要英文稿就再跑一遍 Translate to English;
  5. :Export 出 SRT 给剪辑,TXT 存档,JSON 留作程序处理。

同一批文件超过十个,就把第 1 步换成 CLI 一条命令,其余照旧。流程固定之后,剩下唯一变量就是模型——选错了,又慢又不准。

模型怎么选不纠结:速度与精度的甜点区

Whisper 模型从小到大:tinybasesmallmediumlarge。每升一档准确率提升,耗时和内存也跟着涨。我的建议很直接:

场景推荐
低配电脑、实时录音、只要大意tiny/base
日常转录(甜点区)small+ Whisper.cpp 后端
口音复杂、术语密集的专业录音medium/large,建议有 GPU
省内存/显存Whisper.cpp 的量化模型(如q_5

模型管理在"偏好设置 → Models":左边已下载、右边待下载,勾选后点 Download,还能粘贴自定义模型地址。

几条加速判断:

  • NVIDIA 显卡:偏好设置里看到 CUDA 选项就启用,large 模型从"小时级"降到"分钟级";
  • 核显/普通显卡:Whisper.cpp 后端可开 Vulkan 加速;
  • 想稳:纯 CPU 也够用,small以下模型体感很好。

选完模型,最后把新手最容易栽的坑一次排掉。

避坑清单:新手最容易栽的5个坑

  1. 语言没指定,自动检测翻车:中文音频务必手动选zh,别信"自动检测";
  2. 实时转录卡顿跟不上语速:换 Whisper.cpp 后端 +tiny/base小模型;
  3. Resize 的合并功能用不了:转录时没勾"词级时间戳",重跑一次并勾选;
  4. GPU 没生效:先确认驱动装好、模型偏好里能看到 CUDA 选项;确认没问题再考虑强制纯 CPU;
  5. Windows 安装弹警告不敢动:未签名属正常,"更多信息"→"仍要运行";第一次用某模型会先下载,属正常现象,别反复取消。

坑都排完了,回到开头那几段录音。

你的声音数据,只属于你

两场两小时的会议、那段反复暂停的外语播客、那部急着配字幕的视频——Buzz 给的解法是同一个:在本地、用开源模型,把音频变成你能搜索、能编辑、能导出、能复用的文字。素材不用交给任何服务商,录音文件永远躺在你自己的硬盘里。

现在就能做的下一步:打开 Buzz,导入手头最急需整理的那份录音,指定语言,点 Run——10 分钟后你就有一份带时间戳的转录稿。觉得顺手,去项目仓库点个 Star 支持一下;遇到问题或新想法,也欢迎反馈给社区。文件夹监控、说话人分离、插件生态都在持续迭代,这套本地转录工作流,值得成为你数字工具箱里的常驻成员。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询