Buzz 离线语音转文字:四步把一小时音频变成带时间轴的字幕文稿
2026/9/7 3:07:07 网站建设 项目流程

Buzz 离线语音转文字:四步把一小时音频变成带时间轴的字幕文稿

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一个跑在你自己电脑上的本地语音转文字工具,基于 OpenAI 的 Whisper 模型,把音频、视频甚至在线链接离线转成带时间轴的文字稿。装好之后,你五分钟就能拿到第一份文稿和一份 SRT 字幕,所有文件都只留在你的设备里。

为什么值得试

  • 完全离线:音频全程不出你的机器,客户访谈、会议录音放心转,不担心数据被第三方服务器存底。
  • 输入格式宽:MP3、WAV 等音频,MP4、AVI 等视频,以及在线视频链接,都能直接导入。
  • 模型家族齐全:Whisper 从 tiny 到 large 全系列都支持,在设置里下载、两下点完完成切换,不用重装软件。
  • 三端通吃:Windows、macOS、Linux 都有对应版本;你习惯命令行的话,也有 Python 包可以直接装在服务器上跑。

Buzz 安装命令行

  • Windows:从项目发布页下载安装程序,双击按提示走完;程序未签名,提示时选「More info」→「Run anyway」。
  • macOS:从发布页下载.dmg,拖进应用程序文件夹即可。
  • Linuxsudo snap install buzz安装,再执行sudo snap connect buzz:password-manager-service授权密码存储。
  • Pythonpip install buzz-captions装包,之后用python -m buzz启动界面。

首次启动时,软件会引导你下载所选模型,体积从几十 MB 到两百多 MB 不等。这是一次性投入,之后所有转写都在本地完成,不再需要联网。

第一次转录:五分钟出结果

主流程一共四步:

  1. 第一步:把文件拖进主界面,或按Ctrl + O选择;想转在线视频,直接粘贴链接。
  2. 第二步:在任务行选择任务类型(转写或翻译)和模型,语言可以自动检测,也可以手动指定。
  3. 第三步:点 Run,任务进入队列,主界面实时显示排队、处理和进度百分比;关掉窗口任务也会后台跑完。
  4. 第四步:状态变成 Completed 后,双击该行,打开转录详情,看到带时间轴的文稿。

批量处理也不费劲,一次丢几十个文件,每一行的文件、模型、任务类型和进度都清清楚楚。

模型档位速查

速度和准确率是一对矛盾,Whisper 用模型大小来调节这个天平:

模型速度准确率适合场景
tiny最快一般实时转写、快速试听
base尚可日常笔记、语音备忘
small中等良好会议纪要、访谈初稿
medium较慢很高重要内容的精转
large最慢最高字幕制作、交付级文本

结论很直接:随手记梗概用 base 就够,要出能交付的字幕就直接上 large。有 NVIDIA 显卡的话,在设置里打开 CUDA 加速,large 的速度会快上好几倍。

模型的下载和切换都在 Models 设置页完成,已安装的和可下载的列得清清楚楚,还支持填自定义下载地址,方便你用第三方优化过的 Whisper 变体。

转录编辑与字幕导出

转录详情页本身就是一个迷你字幕编辑器:

  • 转录详情页:每段文字带精确的开始、结束时间,点击任意片段就跳到对应音频位置,边播放边改文本,改动自动保存。
  • Resize(字幕调整):设定目标字幕长度,按标点拆长句,按音频里的静音间隙合并过短碎片,一键对整个文件生效。
  • 多格式导出:TXT、SRT、VTT 一键导出;转写时勾选词级时间戳,配合 Resize 能把字幕切得更贴合阅读节奏。

更多参数细节可以看编辑与调整文档。

常见场景速查

场景做法
会议纪要导入音频,选 base 或 small,直接导出 TXT
视频字幕转写时勾选词级时间戳,用 Resize 拆分后导出 SRT
外语播客转中文任务类型选 translate,指定目标语言
团队协作开文件夹监控,新音频丢进去自动开始转写
讲座会议现场接麦克风实时录音转写,用演示窗口投给观众看
服务器自动化一行buzz add命令入队,支持脚本化批量处理

命令行参数细节在官方 CLI 文档里有完整列表。

常见卡点怎么办

  • 转得太慢 → 模型档位偏高或并行任务太多 → 先换小一号模型,再开 GPU 加速。
  • 准确率不理想 → 录音噪音大 → 重录清晰版本,或换 large 重跑。
  • 任务一直排队 → 模型还没下载完 → 回 Models 设置页确认下载完成,再添加任务。
  • 内存告急 → 单个文件太长 → 分批处理。

决策参考

它适合你:长期处理采访录音、会议纪要或视频字幕,且数据不能出本地设备的人。它不适合你:只是偶尔转一小段短句,或者硬件太老、无法接受纯 CPU 转大模型的等待时间。

验证起来很简单:先拿一段 3 分钟的录音试一次,导入、选 base、看拿到的时间轴文稿是否符合预期。Buzz 的转写、翻译和字幕导出全部跑在你的电脑上,模型下载完成之后,后续使用不再依赖网络。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询