GPT-SoVITS 快速指南:5 秒音频克隆音色,1 分钟素材完成微调
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
上传 5 秒参考音频,输入想说的文字,GPT-SoVITS 几秒内合成同音色的语音,全程不训练。4090 上推理实时因子约 0.014,一句话基本眨眼出结果;GTX 1060 就能跑。
🚀 上手:从一键安装到第一次合成
安装加首次推理,三步,大约 10 分钟:
- 拉代码:
git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS- 一键装环境。先
conda create -n GPTSoVits python=3.10建环境并激活,再执行bash install.sh --device CU128 --source HF,它会装依赖并把底模、G2PW 拼音模型(中文拼音生成模型)下到对应目录。--device可选CU126、CU128、ROCM、MPS、CPU;--source可选HF、HF-Mirror、ModelScope,后两者适合国内网络。 - 启动并合成:
python webui.py浏览器打开 9874 端口。页面顶部是数据集获取、文本处理、模型训练、推理四个页签。直接进推理页签:填参考音频的文本、上传音频文件、输入目标文字,点合成,几秒后出同音色的结果。
硬件一句话:下限 GTX 1060、8GB 内存、20GB 磁盘;推荐 RTX 3090、32GB 内存。
🎯 效果能到什么程度:零样本、微调、跨语言
三档递进,素材成本各不相同:
零样本(不训练):5 秒参考音频即可。上传文件、填好它对应的文本就能直接合成,音色贴合度受参考音频质量限制,带噪录音会把瑕疵放大。
微调:1 分钟干净录音起步。先用内置 UVR5 分离出人声(把人声从背景音乐和噪声里拆出来),切片,再跑 ASR(自动语音识别)转文本逐条校对;然后在文本处理页签一键生成 hubert、说话人向量、语义三种特征,依次训练 GPT(s1)和 SoVITS(s2)两个模型。训完回推理页签选新模型,音色稳定性提升明显。
跨语言 / 进阶:中文底稿就能让同一音色念英文、日文、韩文、粤语,不用另录外语素材。程序还带api.py/api_v2.py(默认端口 9880),可以接进自己的工程,不依赖浏览器页面。
⚠️ 避坑:高频问题一次说清
四条最常见的坑,每条按"现象—原因—对策"走:
- 合成音错字、变调 — 训练文本和音频对不上,或语言标签标错。把转写文本和音频逐条对照,改错后重训 s1。
- 结果带底噪、听感发脏 — 参考音频本身不干净。先用内置 UVR5 分离出干净人声,或换安静环境重录,别直接喂原文件。
- 训练或长文本推理时显存爆掉(OOM,显存溢出)— 切片过长一次塞太多帧。把切片时长调短,或把
is_half设为True走 fp16 混合精度。 - 启动后 9874 打不开页面 — 端口被占用或环境没装全。用
ss -lntp | grep 9874查端口是否被占,必要时在config.py里换端口;依赖缺失就重跑一次install.sh。
想深入看这里
按这个顺序读源码,从外到内:
- GPT_SoVITS/AR/:GPT 侧实现,自回归(逐个预测下一个 token)生成音素序列
- GPT_SoVITS/module/:SoVITS 声学模型结构、注意力层与 VQ 量化
- GPT_SoVITS/TTS_infer_pack/:推理主流程与多语言切换逻辑
- GPT_SoVITS/prepare_datasets/:ASR、特征提取、语义特征三步预处理脚本
- 中文文档:参数速览与训练流程说明
建议顺序:先用 5 秒人声跑零样本,听完定位音色差在哪,再把素材补到 1 分钟做一次微调,最后才去调参数——比盲目调超参快得多。模型稳定后切到 9880 端口的 API 调用,就能直接接入你的程序了。
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考