Buzz 本地离线音频转录实操:免费把录音变成文字和字幕
2026/9/10 13:32:02 网站建设 项目流程

Buzz 本地离线音频转录实操:免费把录音变成文字和字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款跑在自己电脑上的本地离线音频转录工具,底层用的是 OpenAI 的 Whisper 模型。它能把 MP3、WAV、MP4 这类音视频文件里的每句话免费语音转文字,顺手还能离线生成带时间戳的 SRT、VTT 字幕文件。全程不联网、不上传、不花钱,音频始终留在你的硬盘里。

一句话定位,三条硬理由

定位:一套完全离线、开源免费的音频转文字加字幕工作流。

  • 数据不出机器:录音从导入到导出都在本机完成,商业会议、采访素材都不经过第三方服务器。
  • 零费用可持续:代码完全开放,迭代靠社区驱动,不用按时长或订阅付费。
  • 硬件宽口径:支持 NVIDIA 显卡的 CUDA 加速、Apple Silicon 深度优化,也兼容 Vulkan;没有独显也能纯 CPU 跑,只是速度差别。

第一次使用只做这四件事

  1. 装好工具:去项目官网下载对应系统的安装包,Windows 双击走向导即可,macOS、Linux 也有各自格式。
  2. 把文件丢进来:点工具栏加号、按 Ctrl+O,或直接拖进窗口;MP3、FLAC、MP4、AVI 都能识别。
  3. 选参数运行:在任务行里选好类型、语言、模型和输出格式,点运行,文件进队列。
  4. 收结果:跑完后逐句文字和时间轴直接显示,可搜索、复制、导出。

主界面把每个文件排成一行,模型、进度、输出格式一目了然,多文件会排队并发处理。

离线语音转文字怎么调模型

转录效果好不好,主要看下面四个参数,其余都可以先用默认值。

  • 任务类型:选「转录」得到和原音频同语言的文本;选「翻译」会把非英语内容直接转成英文。跨语言素材用它。
  • 语言:知道是什么语言就手动指定,比自动检测更稳;不确定就留空让它自测。它覆盖 99 种以上语种。
  • 模型大小:从 tiny 到 large 多档。日常用 small/medium 最均衡,重要材料上 large,实时场景用 tiny/base。
  • 输出格式:TXT 是纯文字稿,SRT、VTT 是字幕文件,可多选同时产出。

模型面板里能看清哪些已经下载、哪些能一键拉取,离线环境提前把需要的规格备好。

字幕太长怎么救

把长录音转成字幕,最容易失控的就是行宽:太宽观众读不完,太碎又频繁跳行。Buzz 的 Resize 功能就是解决这个——设一个目标长度,它按标点和语义自动重新断句,把每行裁得整齐。

更细的 Merge 选项能按时间间隔合并过碎的字幕、按标点拆长句、按最大长度强制分块。适配不同平台的字幕规范,改几个数字就行。

边说边出字、多人对话分清楚

实时转录:Buzz 能直接吃麦克风输入,说话的同时屏幕就蹦出文字,还能投到一个独立的演示窗口放大展示。在线会议出纪要、课堂记笔记、直播加字幕,都靠它。

说话人识别:多人对话的录音会被自动打上发言者标签,谁说了什么分得开。会议记录、访谈整理、播客复盘,不用再对着「他说她说」猜。

结果窗口自带搜索和播放控制,配合时间戳能直接跳到对应片段核对。

让工具替你加班

  • 文件夹监控:设一个监控目录,新音频丢进去就自动开始转录,全程不用管。适合批量课程录音、定期更新的播客。
  • 插件按需开:AI 摘要、字幕优化、跳过已转录文件、增强语言检测、导出 DOCX,都在插件里,用哪个开哪个。
  • 命令行批处理:脚本党的自动化入口,适合定时任务。
buzz add --task transcribe --language zh audio.mp3 buzz add --task transcribe --srt --vtt --txt video.mp4

细节可以查官方文档,插件代码在插件目录。

五招把准确率再提一档

  1. 先定模型再谈别的:tiny/base 求快,small/medium 求均衡,large 求准。
  2. 硬件配得上模型:NVIDIA 记得开 CUDA,Apple Silicon 用优化版,纯 CPU 就小一档模型。
  3. 优化输入:录音尽量安静、音量适中;嘈杂环境开启「提取语音」选项,明显降噪。
  4. 用初始提示词:人名、地名、专业术语填进高级设置,这些词的识别率肉眼可见地涨。
  5. 批量讲策略:小模型先全量过一遍摸底,重点文件再换大模型重跑,配文件夹监控省时间。

常见疑问

必须联网吗?不用,全部在本机跑,只有主动调 OpenAI 在线 API 才需要网络。

支持多少语言?99 种以上,中英日德法主流语种全覆盖,识别和翻译都支持。

速度如何?取决于音频时长、模型大小和硬件,带 GPU 的机器通常能到实时甚至更快。

能转多长?没有硬性上限,几秒到几小时都能处理。

输出格式有哪些?TXT、SRT、VTT 三种,可同时勾选。

一句话收尾

从把录音拖进窗口那一刻起,Buzz 就把转录从昂贵、慢、有隐私风险的外包,变成免费、快速、完全可控的本地能力。现在就导入你的第一段录音,试试本地离线音频转录的手感。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询