Buzz 离线语音转文字:十分钟跑通第一条本地转录
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
录音堆了一抽屉,文字稿却迟迟不出?Buzz 的回答是:在本地转。它把 OpenAI 的 Whisper 模型跑在你自己的电脑上,99 种语言开箱即用,数据不出本机。这篇文章带你从安装、第一条转录,走到编辑、批量处理,全程离线。
装上就能跑:一次说清安装与启动
三个平台各有一条最短安装路径,一张表说清:
| 平台 | 包管理器 | 命令 |
|---|---|---|
| Windows | winget | winget install ChidiWilliams.Buzz |
| macOS | Homebrew | brew install --cask buzz |
| Linux | Flatpak / Snap | flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz |
装好后在终端输入buzz,主窗口打开即代表安装成功。不想走包管理器,也可以到发布页下载对应平台的安装包。Buzz 有两套入口:图形界面处理单个文件和实时录音,命令行处理批量任务,底层共用同一套转录引擎。
注意:Windows 安装包未做代码签名,安装时弹出安全警告属正常现象,点"更多信息"再"仍要运行"即可,项目本身开源可查。
想追未发布的改动,克隆仓库git clone https://gitcode.com/GitHub_Trending/buz/buzz,按 README 装依赖即可。
你的第一条转录:最小路径五步
- 导入:菜单栏"文件 → 导入媒体文件"(
Ctrl/Cmd + O),或点工具栏的加号图标。MP3、WAV、MP4、MOV 都能选,解码由内置能力完成。 - 选参数:弹窗里三个下拉框,按下表填即可。
| 参数 | 怎么选 |
|---|---|
| Task(任务) | 同语言转录选 Transcribe,直接出英文选 Translate to English |
| Language(语言) | 知道语言就手动指定,自动检测偶尔判断失误 |
| Model(模型) | 新手从 base 或 small 起步 |
- 运行:点Run,任务进入队列,主界面实时显示进度。文件越大、模型越大,耗时越长,属正常现象。
- 等待完成:状态变为 Completed,列表会记下每条任务用的模型、任务类型和最终耗时。
- 查看结果:双击任务行,打开转录查看器,带时间戳的文字逐段呈现。
到这一步,第一份转录稿已经落库。
让文字真正能用:编辑、断句、导出三件套
双击即改:在时间戳表格里双击文本单元格直接编辑,改动自动落盘,不用手动点保存。播放/暂停用Ctrl/Cmd + P。微调片段起止时间:Ctrl/Cmd + ←/→调开始,Ctrl/Cmd + Shift + ←/→调结束。查看器还有三种视图,时间戳表、纯文本、翻译,按需切换。
断句重组:字幕最怕断句生硬,长句被拦腰截断。点工具栏的 Resize,可设字幕最大长度、按标点分割、按静音间隙合并,一键重组成规整字幕行。前提只有一个:转录前勾选了词级时间戳,否则这部分功能不可用。
改到满意就导出。导出路径和默认文件名模板可在偏好设置里自定义:
| 格式 | 一句话用途 |
|---|---|
| TXT | 纯文本,直接放进文档 |
| SRT / VTT | 字幕文件,导入剪映、Premiere、B 站 |
| JSON | 带完整元数据,供程序处理 |
| DOCX | Word 文档,继续排版 |
性能与质量的平衡杆:模型选择策略
模型从小到大为 tiny、base、small、medium、large,每升一档,准确率、内存、耗时同步上调。纯 CPU 就能跑,有 NVIDIA 显卡再上 CUDA 加速。按"你的硬件 × 你的场景"对号入座:
- 低配机或实时场景:whisper.cpp 后端加 tiny/base,秒级出结果;
- 日常批量转录:small 到 medium,速度和准确率的折中点;
- 口音复杂、术语密集:上 large,建议配 GPU 使用;
- 内存吃紧:选 whisper.cpp 的量化版(如 q_5),用一点精度换速度和显存。
NVIDIA 用户在偏好设置里看到 CUDA 选项就打开它,large 模型的转录能从小时级压到分钟级。模型管理在"偏好设置 → Models",已下载的和待下载的分别在左右两栏,勾选后点 Download 即可。
从单条到批量:录音、翻译、CLI 三条扩展线
如果你还需要录音出稿:切到 Live Recording 标签,选麦克风、语言和模型,点 Record,文字随语音逐行生成。实时转录吃性能,务必用 whisper.cpp 加小模型。想要"边说边改",把录制模式切到 Append and correct,它会回头修正刚生成的句子,代价是更吃硬件。
演示窗口能把实时字幕投到外接屏或直播间,演讲同传很好用。要转录系统声音(播客、会议软件):Windows 装 VB-CABLE 虚拟声卡,macOS 装 BlackHole 并在音频 MIDI 设置里建多输出设备,Linux 用 pavucontrol 把应用音频重定向给 Buzz。
如果你还要多语言:任务选 Translate to English 是 Whisper 原生翻译,离线可用。翻到其它目标语言,需在偏好设置填一个 OpenAI 兼容的 API 地址和密钥,再在查看器点 Translate 并附一句翻译指令。本地用 Ollama、LM Studio 跑个兼容模型也能接上。云端翻译一小时音频约 1 美元量级,全本地则零花费。
如果你要批量:buzz add一次吃进多个文件——
buzz add --task transcribe --model-type whispercpp \ --model-size small --srt --vtt 访谈.mp3 会议录音.wav常用参数:--language zh指定语言、--prompt写入专有名词减少错字、--task translate切换翻译任务。
五个高频故障的 30 秒修复
- 中文识别不准:语言停在自动检测了,手动指定 zh 重新转录。
- 实时转录跟不上语速:换 whisper.cpp 后端加 tiny 或 base 小模型。
- Resize 断句不可用:转录时没勾词级时间戳,重新转录并勾选该项。
- GPU 没生效:确认驱动装好且偏好设置里出现 CUDA 选项;想强制纯 CPU,设
BUZZ_FORCE_CPU=true。 - 国内下载模型慢:设
HF_ENDPOINT=https://hf-mirror.com走镜像,细节见官方文档。
现在就去跑你的第一条转录
抽屉里那堆录音,从今天起有了出口:装上 Buzz,把最急的那份录音丢进去,点 Run,收一份能搜索、能编辑、能导出的文字。觉得顺手,给仓库点个 Star;遇到故障或新想法,提 Issue 或 PR 都行。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考