Whisper.cpp 本地部署教程:从克隆到跑通第一条音频
2026/8/30 9:41:53 网站建设 项目流程

Whisper.cpp 本地部署教程:从克隆到跑通第一条音频

【免费下载链接】whisper.cppPort of OpenAI's Whisper model in C/C++项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp

Whisper.cpp 是 OpenAI Whisper 语音识别模型的 C/C++ 实现,零外部依赖,让你在任何机器上离线完成语音转文字。本文带你走完"克隆仓库 → 下载模型 → 构建 → 跑通第一条 WAV 音频"的完整流程,让你独立上手本地部署与离线语音识别。

先搞懂它是什么

它解决什么问题

你有一段会议录音、课程视频或访谈音频,想把它转成文字,又不想把音频上传到任何在线服务?Whisper.cpp 就是为此而生的:模型和推理全部跑在你自己的设备上,音频数据不出本机。

三条核心亮点

  • 纯 C/C++,无外部依赖:核心实现就在 include/whisper.h 与 src/whisper.cpp 两个文件里,克隆即可编译,不折腾依赖
  • 全平台覆盖:macOS、iOS、Android、Linux、FreeBSD、Windows(MSVC 与 MinGW)、Raspberry Pi、WebAssembly 均受支持
  • 软硬优化到位:Apple Silicon 走 Metal 与 Core ML,x86 启用 AVX 指令集,也支持 Vulkan、NVIDIA CUDA、OpenVINO、Ascend NPU 等多种加速路径

开工前检查清单

系统要求

项目要求
操作系统macOS(Intel/Arm)、Linux、Windows、FreeBSD、iOS、Android、Raspberry Pi
编译器任意 C/C++ 编译器:GCC、Clang 或 MSVC
构建工具CMake
版本控制Git
可选ffmpeg(仅当你要转码音频或下载更多示例音频时需要)

仓库地址

仓库地址见此 GitCode 镜像,克隆时直接使用(这是全文唯一需要该地址的地方)。

一步步跑通

第一步:两条命令拿到代码

克隆仓库并进入目录:

git clone https://link.gitcode.com/i/453f3824d8fda1a37548cafbf3922ea0 cd whisper.cpp

第二步:下载 ggml 格式的模型

Whisper 模型需先转换为单文件的ggml格式,仓库自带脚本一步完成。这里以 142 MiB 的base.en(仅英文、精度与体积的平衡之选)为例:

sh ./models/download-ggml-model.sh base.en

脚本会把模型保存为models/ggml-base.en.bin。各型号磁盘占用见 models/README.md:tiny 75 MiB、base 142 MiB、small 466 MiB、medium 1.5 GiB、large 2.9 GiB,内存占用约为磁盘体积的 1.5~2 倍。

第三步:编译项目

用 CMake 两步完成构建,产物输出到build/bin/

cmake -B build cmake --build build --config Release

图省事的话,make等价于上面的 CMake 流程,make base.en则一键完成"下载模型 + 编译 + 对 samples 目录所有 WAV 跑推理"的快速演示。

第四步:用自带样例音频验证

仓库自带 11 秒的samples/jfk.wav样例,运行推理工具whisper-cli

./build/bin/whisper-cli -f samples/jfk.wav

看到按时间戳分段的英文文字("And so my fellow Americans...")输出,说明本地部署与离线语音识别全部跑通。想查看全部参数,运行./build/bin/whisper-cli -h

注意:whisper-cli只处理 16-bit WAV 文件,你的音频若是 MP3/FLAC 等格式,先做转换再运行。

常用命令速查

命令作用
git clone https://link.gitcode.com/i/453f3824d8fda1a37548cafbf3922ea0克隆项目源码
sh ./models/download-ggml-model.sh base.en下载指定型号 ggml 模型(换tinysmallmediumlarge-v3等同理)
cmake -B build初始化构建目录
cmake --build build --config Release编译全部工具
make base.en一键下载模型、编译并跑完 samples 目录所有 WAV
./build/bin/whisper-cli -f samples/jfk.wav转写样例音频(-m可指定其他模型)
./build/bin/whisper-cli -h查看全部命令行参数
make -j samples下载更多示例音频并转为 16-bit WAV
ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav把任意音频转成 16-bit WAV
./build/bin/quantize models/ggml-base.en.bin models/ggml-base.en-q5_0.bin q5_0生成 Q5_0 量化模型,省内存省磁盘

卡住了怎么办

音频转不动?先转 16-bit WAV

最常见的报错原因是音频格式不符。whisper-cli只认 16-bit WAV,用ffmpeg转码后再喂给模型:

ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav

转完用-f output.wav重新运行即可。

内存不够跑不动大模型?换小一号的

按你的内存对号入座:8 GB 内存以内建议tiny/base,16 GB 可跑small,32 GB 起再考虑medium。另外带.en后缀的模型只处理英文,处理中文请使用不带.en的型号。也可以对大模型做量化压缩,命令见上文速查表。

参数和行为看不明白?回仓库文档找

完整功能说明(Core ML、CUDA、Vulkan、量化、说话人分离等)都在 README.md,模型下载与转换细节在 models/README.md,各类语言的绑定位于 bindings/ 目录。

把第一条音频跑通只是起点:换更大的模型提升精度,或搭一个 HTTP 转写服务,都是接下来的自然方向。完整文档随仓库一起提供,祝你的离线语音识别之旅顺利。

【免费下载链接】whisper.cppPort of OpenAI's Whisper model in C/C++项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询