Buzz 离线语音转文字:十分钟跑通第一条本地转录
2026/9/6 20:41:46 网站建设 项目流程

Buzz 离线语音转文字:十分钟跑通第一条本地转录

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

录音堆了一抽屉,文字稿却迟迟不出?Buzz 的回答是:在本地转。它把 OpenAI 的 Whisper 模型跑在你自己的电脑上,99 种语言开箱即用,数据不出本机。这篇文章带你从安装、第一条转录,走到编辑、批量处理,全程离线。

装上就能跑:一次说清安装与启动

三个平台各有一条最短安装路径,一张表说清:

平台包管理器命令
Windowswingetwinget install ChidiWilliams.Buzz
macOSHomebrewbrew install --cask buzz
LinuxFlatpak / Snapflatpak install flathub io.github.chidiwilliams.Buzzsudo snap install buzz

装好后在终端输入buzz,主窗口打开即代表安装成功。不想走包管理器,也可以到发布页下载对应平台的安装包。Buzz 有两套入口:图形界面处理单个文件和实时录音,命令行处理批量任务,底层共用同一套转录引擎。

注意:Windows 安装包未做代码签名,安装时弹出安全警告属正常现象,点"更多信息"再"仍要运行"即可,项目本身开源可查。

想追未发布的改动,克隆仓库git clone https://gitcode.com/GitHub_Trending/buz/buzz,按 README 装依赖即可。

你的第一条转录:最小路径五步

  1. 导入:菜单栏"文件 → 导入媒体文件"(Ctrl/Cmd + O),或点工具栏的加号图标。MP3、WAV、MP4、MOV 都能选,解码由内置能力完成。
  2. 选参数:弹窗里三个下拉框,按下表填即可。
参数怎么选
Task(任务)同语言转录选 Transcribe,直接出英文选 Translate to English
Language(语言)知道语言就手动指定,自动检测偶尔判断失误
Model(模型)新手从 base 或 small 起步
  1. 运行:点Run,任务进入队列,主界面实时显示进度。文件越大、模型越大,耗时越长,属正常现象。
  2. 等待完成:状态变为 Completed,列表会记下每条任务用的模型、任务类型和最终耗时。
  3. 查看结果:双击任务行,打开转录查看器,带时间戳的文字逐段呈现。

到这一步,第一份转录稿已经落库。

让文字真正能用:编辑、断句、导出三件套

双击即改:在时间戳表格里双击文本单元格直接编辑,改动自动落盘,不用手动点保存。播放/暂停用Ctrl/Cmd + P。微调片段起止时间:Ctrl/Cmd + ←/→调开始,Ctrl/Cmd + Shift + ←/→调结束。查看器还有三种视图,时间戳表、纯文本、翻译,按需切换。

断句重组:字幕最怕断句生硬,长句被拦腰截断。点工具栏的 Resize,可设字幕最大长度、按标点分割、按静音间隙合并,一键重组成规整字幕行。前提只有一个:转录前勾选了词级时间戳,否则这部分功能不可用。

改到满意就导出。导出路径和默认文件名模板可在偏好设置里自定义:

格式一句话用途
TXT纯文本,直接放进文档
SRT / VTT字幕文件,导入剪映、Premiere、B 站
JSON带完整元数据,供程序处理
DOCXWord 文档,继续排版

性能与质量的平衡杆:模型选择策略

模型从小到大为 tiny、base、small、medium、large,每升一档,准确率、内存、耗时同步上调。纯 CPU 就能跑,有 NVIDIA 显卡再上 CUDA 加速。按"你的硬件 × 你的场景"对号入座:

  • 低配机或实时场景:whisper.cpp 后端加 tiny/base,秒级出结果;
  • 日常批量转录:small 到 medium,速度和准确率的折中点;
  • 口音复杂、术语密集:上 large,建议配 GPU 使用;
  • 内存吃紧:选 whisper.cpp 的量化版(如 q_5),用一点精度换速度和显存。

NVIDIA 用户在偏好设置里看到 CUDA 选项就打开它,large 模型的转录能从小时级压到分钟级。模型管理在"偏好设置 → Models",已下载的和待下载的分别在左右两栏,勾选后点 Download 即可。

从单条到批量:录音、翻译、CLI 三条扩展线

如果你还需要录音出稿:切到 Live Recording 标签,选麦克风、语言和模型,点 Record,文字随语音逐行生成。实时转录吃性能,务必用 whisper.cpp 加小模型。想要"边说边改",把录制模式切到 Append and correct,它会回头修正刚生成的句子,代价是更吃硬件。

演示窗口能把实时字幕投到外接屏或直播间,演讲同传很好用。要转录系统声音(播客、会议软件):Windows 装 VB-CABLE 虚拟声卡,macOS 装 BlackHole 并在音频 MIDI 设置里建多输出设备,Linux 用 pavucontrol 把应用音频重定向给 Buzz。

如果你还要多语言:任务选 Translate to English 是 Whisper 原生翻译,离线可用。翻到其它目标语言,需在偏好设置填一个 OpenAI 兼容的 API 地址和密钥,再在查看器点 Translate 并附一句翻译指令。本地用 Ollama、LM Studio 跑个兼容模型也能接上。云端翻译一小时音频约 1 美元量级,全本地则零花费。

如果你要批量:buzz add一次吃进多个文件——

buzz add --task transcribe --model-type whispercpp \ --model-size small --srt --vtt 访谈.mp3 会议录音.wav

常用参数:--language zh指定语言、--prompt写入专有名词减少错字、--task translate切换翻译任务。

五个高频故障的 30 秒修复

  1. 中文识别不准:语言停在自动检测了,手动指定 zh 重新转录。
  2. 实时转录跟不上语速:换 whisper.cpp 后端加 tiny 或 base 小模型。
  3. Resize 断句不可用:转录时没勾词级时间戳,重新转录并勾选该项。
  4. GPU 没生效:确认驱动装好且偏好设置里出现 CUDA 选项;想强制纯 CPU,设BUZZ_FORCE_CPU=true
  5. 国内下载模型慢:设HF_ENDPOINT=https://hf-mirror.com走镜像,细节见官方文档。

现在就去跑你的第一条转录

抽屉里那堆录音,从今天起有了出口:装上 Buzz,把最急的那份录音丢进去,点 Run,收一份能搜索、能编辑、能导出的文字。觉得顺手,给仓库点个 Star;遇到故障或新想法,提 Issue 或 PR 都行。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询