Buzz 本地离线 AI 音频转录实战指南:一次把录音变成可搜索、可导出的文本
2026/9/10 8:43:44 网站建设 项目流程

Buzz 本地离线 AI 音频转录实战指南:一次把录音变成可搜索、可导出的文本

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

你桌上可能正压着一批"必须听完还得整理"的录音:访谈、课程、会议。不想把文件上传到在线转写服务,也不想按分钟计费。Buzz 就是为此而生的本地离线 AI 音频转录工具:它把 OpenAI 的 Whisper 模型跑在你自己的电脑上,负责转录与翻译音频,全程免费、开源,不联网也能完成绝大部分工作。这篇指南带你从安装一路走到字幕导出,并讲清楚哪些设置真正影响成品质量。

先看清楚:Buzz 适合谁、和在线转写的根本差异

你关心的事Buzz 的做法
数据去向音频全程留在本机,不经过任何第三方服务器
费用开源免费(MIT 协议),无按时长计费、无订阅
网络依赖核心流程零联网;只有选择调用 OpenAI 在线 API 时才需要网络
系统覆盖Windows / macOS / Linux 全平台,支持 NVIDIA CUDA、Apple Silicon、Vulkan 三类加速
能力边界转录、翻译成英语、麦克风实时转写、说话人识别、字幕整形、文件夹自动监控

一句话定位:它不是"网页版转写工具",而是一个装在本机的离线工作流——导入、识别、导出都发生在你的硬盘里。

任务链:从装好到拿到第一份转录文本

装好它。Windows 用户下载官方安装包直接走向导即可;注意 Buzz 的 Windows 安装包未签名,安装时若弹出警告,点"更多信息 → 仍要运行"放行。macOS 下载.dmg挂载安装。Linux 走 Flatpak 或 Snap 包管理器:

flatpak install flathub io.github.chidiwilliams.Buzz

如果偏好源码安装,也可以用pip install buzz-captions(需 Python 3.12 环境,并自行安装 ffmpeg),然后python -m buzz启动。

把文件送进去。三种导入方式任选:点工具栏的"+"图标、按Ctrl+O(macOS 为Cmd+O)、直接把文件拖进窗口。Buzz 识别主流音视频格式,MP3、WAV、FLAC、MP4、AVI 都常见于日常。还有一个隐藏技能:直接粘贴 YouTube 链接做 URL 导入,它会自动拉取音频进入流程,省掉"先下载视频"这一步。

跑任务。文件导入后进入任务队列,每个任务可以选择任务类型(转录/翻译)、语言、模型后端与大小、输出格式。多个文件会排队依次处理,主界面随时能看到每个任务的进度和状态。

拿结果。任务完成后双击转录条目,打开转录查看器:逐句文本带时间戳,可以搜索(Ctrl+F)、点击定位播放、调节倍速,再按需导出 TXT / SRT / VTT。

效果杠杆:最影响成品质量的几个开关

新手第一次转录"效果不好",多半不是工具不行,而是下面这些开关没按影响大小去调。

1. 模型档位——准确率的第一变量。Tiny 到 Large 共五档,档位越大识别越准,代价是更慢、更吃显存。经验值:Tiny / Base 快,适合实时转写和先摸底的粗转;Small / Medium 是大多数日常场景的甜点区间;Large 留给重要访谈、专业术语密集的内容。硬件有限时,Whisper.cpp 后端可以下载量化版本(如 q5)的大模型,用更小的显存占用换可接受的速度。模型在哪下载?打开首选项(Ctrl/Cmd + ,)的模型管理页,能看到哪些已下载、哪些可以一键下载。

2. 输入音频质量——决定上限的地基。环境再好的模型也救不了糊成一团的录音。嘈杂素材在转录前勾选"提取语音"(先做语音分离再识别);想要更强的降噪,可以启用 DeepFilterNet 插件,它在转录前自动去掉背景噪声并另存一份处理后的音频。

3. 语言——手动指定通常比自动检测稳。它支持超过 99 种语言,中英文日韩法德等主流语种全覆盖。你如果事先知道录音是什么语言,就手动选上;只有完全拿不准时再交给自动检测(或让"增强语言检测"插件先用本地 Tiny 模型探一遍)。

4. 任务类型——转录还是翻译。选"转录",输出与原音频同语言;选"翻译",非英语内容会被直接转成英语文本。跨语言素材(法语访谈要出英文稿)靠它,注意翻译任务只输出英语。

5. 输出格式——按用途勾选,可多选。纯文字稿选 TXT,给视频配字幕选 SRT 或 VTT。勾选多个格式,一次处理同时产出多份文件。

6. 初始提示词——专名和术语的救命绳。音频里反复出现人名、地名、专业词?把它们写进高级设置里的提示词框(命令行对应-p参数),这些词的识别率会明显提升,技术讲座、医学访谈这类场景尤其值得填。

字幕行太长怎么救:Resize 整形

原始 Whisper 输出按语义断句,一行可能长到观众读不完。转录查看器里点"Resize"按钮进入整形面板:设定每行最大字符数,它按标点把长句拆开、按时间间隔把过碎的条目合并。

注意一个前置条件:细粒度的拆分合并依赖"词级时间戳"。任务里勾选词级时间戳后,整形工具才能按标点切分;未勾选时只能按最大长度重新组合。另外它还能给每条字幕统一延长结束时间(比如多停留 1 秒),让字幕在屏幕上可读性更好。B 站、YouTube 对字幕行宽的要求不同,改几个数字就能适配。

实时转写与说话人识别

除了处理文件,Buzz 也能直接吃麦克风输入:边说话边出字,配合专门的演示窗口放大展示,适合现场会议、课堂笔记、直播字幕。实时模式有三种排列方式:新句追加在下方、追加在上方、"追加并纠错"(会回头修正前一句的误差,但需要更强的硬件)。

处理多人对话时,打开转录查看器的"识别说话人"功能,Buzz 会自动给不同发言者打标签。每个标签都可以试听对应发言人的片段(随机抽 10 秒音频),再把自动标签改名成真人姓名;勾选"合并同一说话人的连续句子"后保存,纪要会直接按人分段。注意:Intel 版 macOS 上此功能不可用。

从手动到自动:三级进阶路线

第一级:文件夹监控。在设置里指定一个监控文件夹,之后任何新音频文件放进去,Buzz 自动开始转录,不需要人工干预。适合定期更新的播客源目录、批量课程录音这类固定工作流。

第二级:插件。自 1.4.5 版本起,Buzz 内置了一套轻量插件机制,在"帮助 → 插件"里逐个开关、拖拽调整执行顺序。自带的几个正好覆盖高频需求:

  • AI 摘要:转录完成后调用 OpenAI 兼容 API(也支持本地 Ollama)生成摘要,存进备注或旁边的文本文件
  • 跳过已转录:重导一批文件时自动识别已有结果的条目并标记为跳过,避免重复计算
  • 导出 DOCX:把转录结果直接转成 Word 文档
  • 字幕自动整形:转录一结束就按预设规则重组字幕,需要词级时间戳
  • 增强语言检测/DeepFilterNet 降噪:前面效果杠杆里提到的两个场景的自动化版本

第三级:命令行。完整 CLI 适合挂进定时任务或脚本。一条命令同时指定任务、模型与导出格式:

buzz add --task transcribe --language zh \ --model-type whispercpp --model-size small \ --srt --vtt interview.mp3

支持的后端包括 whisper、whispercpp、fasterwhisper、huggingface、openaiapi 五种,--word-timestamps可加词级时间戳,--extract-speech可在转录前提取语音,--hide-gui让任务在后台静默跑完。

两条可以照抄的工作流

工作流 A:课程视频出字幕。导入 MP4 → 选"转录"+ 手动指定语言 → 选 Small/Medium 模型并勾选词级时间戳 → 完成后打开 Resize,设定目标行宽、按标点拆分 → 导出 SRT → 拖进剪辑软件。整条链路里你只需要动两次手:导入和点运行。

工作流 B:访谈录音批量入库。把一叠访谈文件一次拖进队列(重要素材选 Large,普通素材选 Small)→ 全部跑完后逐个打开"识别说话人",把自动标签改成受访者真名并合并连续发言 → 导出 TXT 或启用 DOCX 插件直接出 Word → 文本进入你的内容分析环节。批量重导时用"跳过已转录"插件兜底,已完成的文件不会重跑。

排障速查:最容易卡住的六个点

Windows 安装时弹窗警告?正常现象,安装包未签名,选"更多信息 → 仍要运行"即可。

转录速度太慢?先确认加速方式是否匹配你的硬件:NVIDIA 独显走 CUDA,其他 GPU 或核显用 Whisper.cpp 后端走 Vulkan,Apple Silicon 有专门的优化路径。纯 CPU 环境把模型降一档(Large 换 Medium),速度差异是实打实的。

字幕没法按标点拆行?回任务设置里勾选词级时间戳,重新跑一次;没有词级时间戳时 Resize 只能按长度重组。

嘈杂录音识别乱码?勾选"提取语音",或启用 DeepFilterNet 降噪插件后再转录。

"识别说话人"不可用?检查你是不是 Intel 芯片的 Mac——该功能在这一平台上被明确排除。

结果文件放哪了?导出文件默认保存在源音频旁边,命名规则可以在首选项里自定义,支持按文件名、任务、时间等变量拼模板。

写在最后

Buzz 把"把声音变成文字"从一项要上传文件、要付费的外包服务,变成了一个装在本机、免费、可脚本化的离线能力。建议的起步动作很小:挑一段你拖了最久的那段录音,用小模型先跑一遍摸底,再决定要不要上大模型精转——跑通这一次之后,字幕、纪要、批量入库都在这条任务链上了。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询