免费RVC WebUI教程:10分钟语音练一个AI歌手
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
RVC WebUI(Retrieval-based-Voice-Conversion-WebUI)是一个基于 VITS 的免费开源 AI 变声工具,能用 10 分钟语音样本训练出可唱歌的 AI 声线模型。它提供网页训练推理、实时变声和 UVR5 人声分离三类功能,基于 MIT 协议。有 4GB 显存的显卡即可运行,适合想制作 AI 翻唱、配音的普通用户,无需写代码。
初见了解:这个项目到底是什么
- 它是什么:基于 VITS 的语音转换(变声)框架,底层用检索式特征替换来防止音色泄漏。
- 能做什么:训练自己的 AI 声线、转换整首歌、麦克风实时变声、分离人声与伴奏。
- 适合谁:想做 AI 翻唱、视频配音、直播变声的内容创作者,零代码。
- 上手需要什么:4GB 以上显存的显卡、Python 3.8 以上、ffmpeg,以及 10 分钟干净人声。
- 效果参考:10 分钟数据即可得到可用模型;实时变声端到端约 170ms,ASIO 设备约 90ms。
准备清单:动手前核对一下
| 类别 | 要求 | 备注 |
|---|---|---|
| 显卡 | NVIDIA / AMD / Intel 均可 | 4GB 显存可起步,6GB 更从容 |
| Python | 3.8 以上 | 依赖需按显卡选对应清单安装 |
| ffmpeg | 必须安装 | 音频处理底层依赖 |
| 预模型 | assets 目录下的权重 | 用 tools/download_models.py 下载 |
| 人声数据 | 10 至 50 分钟,44.1kHz WAV | 底噪低、无背景音乐、无破音 |
动手实践:六步跑通第一个模型
1. 克隆仓库
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI把项目源码拉到本地,后文所有路径都相对于这个目录。
2. 安装 Python 依赖
pip install torch torchvision torchaudio pip install -r requirements.txt第一条装 PyTorch 核心,第二条装项目其余依赖(AMD 卡改用requirements-amd.txt)。
3. 下载预训练模型
python tools/download_models.py把推理和训练要用的底模放进assets/,首次启动前只需执行一次。
4. 启动 Web 界面
python infer-web.py终端打印出地址后会自动弹出浏览器,训练、推理、模型融合都在这个界面完成;Windows 用户也可直接双击go-web.bat。
5. 格式化数据并一键训练
进入"训练集格式化"选项卡:填实验名、音频文件夹路径,选采样率(32k 或 48k),点"一键训练"。看到Training is done即成功,成品模型约 60MB,落在assets/weights/。
6. 推理验证与实时变声
切到"推理"选项卡,刷新音色,选中刚训练好的模型,上传测试音频:音高算法选 RMVPE,索引比率先设 0.5,点转换即可试听。想体验实时变声,再执行:
python gui_v1.py打开麦克风实时变声界面,选输入输出设备后说话,立刻听到 AI 音色。
关键参数解读:新手只需盯这五项
| 参数 | 建议值 | 作用 |
|---|---|---|
| 总训练轮数 | 50 至 100 | 轮数太少音色不稳,音质一般的训练集超过 200 意义不大 |
| 批大小 | 4(显存小则调 1 至 2) | 决定单次处理的样本量,直接影响显存占用 |
| 索引比率 | 0.5 起步 | 抑制音色泄漏,越高越贴近训练集原始音色 |
| 音高算法 | RMVPE | 提取音高,效果最好且比 crepe_full 更快、占用更小 |
| 采样率 | 48k | 48k 音质更好,32k 更快更省显存 |
默认学习率1e-4、批大小4记录在 configs/v1/48k.json 中,新手不建议改动。
避坑问答:高频问题速查
- 显存不够(Cuda out of memory)怎么办?训练调小批大小,推理调小 configs/config.py 末尾的 x_pad、x_max 等参数。
- 训练结束后没有
.index索引文件?训练集太大可能卡住,回界面再点一次"训练索引"即可。 - 训练完推理列表里没有新音色?先点刷新音色,没有就查
logs/实验名/下的日志。 - 分享模型要发哪个文件?发
assets/weights/下 60MB 以上的 pth;logs/下的大 pth 是训练状态,不能用于推理。 - 实时变声延迟高?换 ASIO 声卡可压到约 90ms,并调小音频缓冲区。
- 报 ffmpeg error / utf8 error?多半是路径带空格、括号或中文,把文件夹挪到纯英文路径再试。
- 界面提示
Expecting value: line 1...?关闭系统的局域网或全局代理后重试。
更多问题可查 docs/cn/faq.md。
创意延展:这些玩法可以试起来
- AI 翻唱:用目标声线翻唱整首歌,先用 UVR5 分离出干声,转完再叠回伴奏。
- 视频配音:批量跑 tools/infer_batch_rvc.py,让整期节目声音风格统一。
- 直播实时变声:
python gui_v1.py打开实时界面,麦克风进、AI 声音出,适合 K 歌和聊天。 - 模型融合:在 ckpt 选项卡用 ckpt-merge 把两个声线按权重混合,得到新的中间音色。
收尾:今天就能做完的四件事
- 备一份 10 至 50 分钟的干净人声,放好路径,按上述六步完成第一次训练。
- 用一首熟悉的歌做首次推理,对比原声调整索引比率。
- 跑一次实时变声,感受 170ms 延迟下的实际体验。
- 进阶设置(显卡选择、显存优化、参数细节)参考 configs/config.py 与 docs/cn/faq.md。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考