Vibe 语音转文字:5 分钟跑通离线语音识别,附批量转录与 GPU 加速配置
【免费下载链接】vibeTranscribe on your own!项目地址: https://gitcode.com/GitHub_Trending/vib/vibe
Vibe 是一款基于 Whisper 模型的开源语音转文字工具,装好后音频、视频都在本机转成文本,全程不上传云端,支持 100 多种语言和批量转录。
为什么选它:音频转文本,不经过任何第三方服务器
商业转录服务要把文件传到云端,按分钟计费,隐私边界模糊。Vibe 把整套离线语音识别链路放在你自己的设备上:模型本地跑、结果本地导出。它解决的具体问题是——你手里有一批不能发给任何第三方的音频,又想自己把它们变成可检索的文字。
5 分钟跑通:在三大平台安装 Vibe 语音转文字
系统要求不高:Windows 8+、macOS 13.3+、Ubuntu 22.04+ 均可。按平台走对应步骤。
Windows
- 下载最新的 .exe 安装程序。
- 双击运行安装向导。
- 按提示完成安装,首次启动会引导下载转录模型。
macOS
- 按芯片选包:Apple Silicon(M1/M2 等)下载 aarch64.dmg,Intel 芯片下载 x64.dmg。
- 双击安装,把应用拖入"应用程序"文件夹。
- ⚠️ 首次启动务必在应用上右键选择"打开",绕过系统安全校验,之后双击即可。
Linux
- 下载 .deb 安装包(Arch 用户可用 debtap 转成本地格式)。
- 终端里执行下面两条命令,一步完成安装并补齐依赖:
sudo dpkg -i vibe.deb sudo apt-get install -f- 首次启动若窗口异常,见文末"踩坑速查"设一个环境变量即可。
场景对能力:批量转录、100+ 语言、GPU 加速、Ollama 摘要
不按功能清单罗列,直接对照你手头的工作:
| 你的场景 | Vibe 的对应能力 |
|---|---|
| 一堆 .wav/.mp3 要统一处理 | 批量转录:文件拖入即跑,不用逐个启动 |
| 音频里中英混说,或出现小众语言 | 自动检测,支持 100 多种语言识别 |
| 长视频转写太慢 | GPU 加速:设置里开启即可,支持 Nvidia/AMD/Intel 架构 |
| 长访谈转完还要提炼要点 | Ollama 摘要,本地模型直接生成 |
| 产出要当字幕、打印、存档用 | 支持 SRT、VTT、TXT、HTML、PDF、JSON、DOCX 导出 |
速度翻倍:GPU 加速开关与 macOS 模型编译
GPU 加速开关
- 收益:转录从纯 CPU 切到显卡,速度显著提升。
- 代价:需要有独立显卡,Vibe 同时支持 Nvidia、AMD、Intel(Vulkan/CoreML 后端)。
- 关键操作:在设置里打开 GPU 选项,无需改任何配置文件。
macOS 模型编译提速
- 收益:2-3 倍提速。
- 代价:该模型第一次使用时会额外编译,这一步耗时较长,之后每次都是加速状态。
- 关键操作:下载与当前模型匹配的 .mlcmodelc.zip(例如 ggml-medium-encoder.mlmodelc 对应 ggml-medium-encoder.bin),从 Vibe 设置中打开模型路径,把 .mlcmodelc 文件拖到 .bin 文件旁边。
进阶集成(可选):Ollama 摘要、自定义模型链接、无头服务器
Ollama 本地摘要适用场景:转录完成后顺手产出要点,不想把文本发给外部 API。前置条件:已安装 Ollama。先拉取摘要模型:
ollama run llama3.1再在 Vibe 设置中启用"在转录前摘要"选项,完整步骤见安装文档。
自定义模型下载链接适用场景:模型托管在你自己的站点,想让用户一键下载到 Vibe。URL 格式为:
vibe://download/?url=<模型文件直链>官方模型清单和直链见模型文档。
无头服务器部署(Xvfb)适用场景:没有图形界面的 Linux 服务器上批量转写。前置条件:Ubuntu 服务器、可访问 xvfb。安装并启动虚拟显示器:
sudo apt-get install xvfb -y Xvfb :1 -screen 0 1024x768x24 & export DISPLAY=1踩坑速查
- 现象:Windows 启动报
msvc140.dll not found→根因:缺少 VC++ 运行时 →修复:安装 Visual C++ Redistributable 组件 - 现象:Linux 窗口空白或渲染异常 →根因:WebKit 合成冲突 →修复:启动前设置
export WEBKIT_DISABLE_COMPOSITING_MODE=1 - 现象:想完全离线,但启动时弹出模型下载 →根因:默认自动下载 →修复:取消下载,在设置"自定义"部分手动添加预下的模型文件
- 现象:Linux 上找不到音频文件监听功能 →根因:该平台未实现 →修复:改用 CLI 或 GUI 手动转录
一句话收尾
音频文件落进设备,Vibe 接手:批量转录、离线语音识别、GPU 加速,全在本地完成。
【免费下载链接】vibeTranscribe on your own!项目地址: https://gitcode.com/GitHub_Trending/vib/vibe
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考