Buzz 离线转录:5 分钟把录音变文字,隐私不出电脑
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
会议录音要转成文字,文件又不想传给第三方服务?Buzz 干的就是这件事:它把 OpenAI Whisper(一个开源语音识别模型)整个搬进你的电脑,离线完成音频转录和翻译,不用注册,不按量计费,断网也能跑。
它为什么值得你试试
文件全程不离开设备。转录由跑在本机的模型完成,音频不经过任何服务器,飞机模式也能用。内部会议、采访录音这类敏感材料,你不用先权衡风险。
没有显卡也快。后端可换:经典 Whisper、Faster Whisper(NVIDIA 显卡)、Whisper.cpp(任意显卡或纯 CPU),还有 OpenAI 云端 API。现代笔记本就能应付实时转录。
不只是转录。翻译、说话人识别、麦克风实时录音都有,还带一个投屏时看得清的大字"演示窗口"。转录查看器支持搜索、调节播放速度、循环播放片段,校对远比反复听音频高效。
为批量工作设计。命令行加文件夹监控,文件丢进目录就自动排队转录。核心逻辑在 buzz/transcriber/,界面层在 buzz/widgets/,好奇实现可以翻一翻。
| 云端转录服务 | Buzz 本地 | |
|---|---|---|
| 网络 | 要上传、必须在线 | 全程离线 |
| 费用 | 按用量计费 | 开源免费 |
| 隐私 | 文件经过第三方 | 数据留在本机 |
| 格式 | 支持有限 | 几乎全格式音视频 |
从零跑通:3 步看到文字
步骤一:安装并启动
Linux 上 Flatpak 最省事,一条命令:
flatpak install flathub io.github.chidiwilliams.BuzzWindows 和 macOS 下载安装包双击即可。习惯 PyPI 的话,两行搞定:
pip install buzz-captions python -m buzz步骤二:喂它第一个文件
主界面左上角点加号,选中音频或视频,MP3、WAV、MP4 都能收。右侧选模型,small 是稳妥起点,速度和准确度的平衡点。还可以定任务类型:transcribe 保留原文,translate 统一输出英文。点开始后任务进队列,状态列会显示实时进度,比如"In Progress 55%"。
步骤三:看结果并导出
双击列表里的文件,打开转录窗口,每段都有起止时间戳。文字可以点进去直接改,边播放边对照。文字和音频对不上时,还能手动拆分或合并片段。确认无误后导出 TXT、SRT 或 VTT,字幕直接导 SRT 就能用。
换个真实场景试试
把讲座录音变成纪要,这是最高频的用法。先导入录音,选 medium 或更大的模型,专名词出错会少一些。完成后点开转录,把听错的名字点进去改掉;音频很长就用内置搜索定位关键词,点哪段音频就跳到哪,边听边校对不打架。
给视频补字幕,流程很直白。导入视频文件转录,然后在查看器里点时间戳,微调每段的边界。背景有音乐或噪音的话,可以先开语音分离,把噪音剥掉再识别,准确率会好看不少。最后导出 SRT 或 VTT,是个拿来即用的字幕文件,直接进剪辑软件。
活动现场实时出稿,是让人意外的一环。选 Live Recording 模式,挑好麦克风,点红钮开始,文字跟着语音一段段冒出来。讲座时再开一个独立"演示窗口",字大,台下的人能看着文字逐句生长。散会时文稿已经存好,不用等。
调一调,体验更好
- 模型是最大的变量:日常用 small,重要内容上 medium,要最准上 large-v3。中英混合内容,用英语识别效果反而更好。
- 有显卡就用上:NVIDIA 卡显存 6GB 以上切 Faster Whisper,速度能快一个量级;没卡就用 Whisper.cpp,核显也能加速。
- 快捷键可自定义:设置里的 Shortcuts 页把常用操作绑上键,翻长文稿不用摸鼠标。
- 开文件夹监控:新录音丢进指定目录自动进队列,这是批处理工作流的入口。
大概率会碰到的坑
转录慢?先换小一号的模型。机器没有独显的话,把后端切到 Whisper.cpp 比干等更有效。
启动就闪退,或模型下载失败?设置里的 Models 页删掉出问题的模型重新下,大部分崩溃都是模型没下完整导致的。
麦克风选不了、报 PaErrorCode-9999?多是系统权限挡了路。Windows 去 设置 → 隐私 → 麦克风,把 Buzz 的访问放行。
偶尔"听出"音频里根本没有的词?大模型的已知小毛病,重要片段回放音频核对一下就行。
老电脑装不动?Buzz 要求 CPU 支持 AVX2,十年以上的机器跑不动,这是硬件门槛,不是设置能解决的。
想在完全断网的环境跑(比如内网机器)?先在联网机器下好模型,把整个模型目录拷到目标机器对应的缓存位置。仓库里还有个 scripts/download-models.py 脚本,能帮你一次备好离线模型缓存。
Buzz 的卖点很朴素:数据留在你手里,活由它来干。Whisper 在你电脑上安静地跑,文字、时间戳、字幕都出自本机。天天要跟录音打交道的人,跑通第一遍之后,就会明白离线转录的踏实感。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考