免费RVC WebUI教程:10分钟语音练一个AI歌手
2026/9/2 9:27:19 网站建设 项目流程

免费RVC WebUI教程:10分钟语音练一个AI歌手

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

RVC WebUI(Retrieval-based-Voice-Conversion-WebUI)是一个基于 VITS 的免费开源 AI 变声工具,能用 10 分钟语音样本训练出可唱歌的 AI 声线模型。它提供网页训练推理、实时变声和 UVR5 人声分离三类功能,基于 MIT 协议。有 4GB 显存的显卡即可运行,适合想制作 AI 翻唱、配音的普通用户,无需写代码。

初见了解:这个项目到底是什么

  • 它是什么:基于 VITS 的语音转换(变声)框架,底层用检索式特征替换来防止音色泄漏。
  • 能做什么:训练自己的 AI 声线、转换整首歌、麦克风实时变声、分离人声与伴奏。
  • 适合谁:想做 AI 翻唱、视频配音、直播变声的内容创作者,零代码。
  • 上手需要什么:4GB 以上显存的显卡、Python 3.8 以上、ffmpeg,以及 10 分钟干净人声。
  • 效果参考:10 分钟数据即可得到可用模型;实时变声端到端约 170ms,ASIO 设备约 90ms。

准备清单:动手前核对一下

类别要求备注
显卡NVIDIA / AMD / Intel 均可4GB 显存可起步,6GB 更从容
Python3.8 以上依赖需按显卡选对应清单安装
ffmpeg必须安装音频处理底层依赖
预模型assets 目录下的权重用 tools/download_models.py 下载
人声数据10 至 50 分钟,44.1kHz WAV底噪低、无背景音乐、无破音

动手实践:六步跑通第一个模型

1. 克隆仓库

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

把项目源码拉到本地,后文所有路径都相对于这个目录。

2. 安装 Python 依赖

pip install torch torchvision torchaudio pip install -r requirements.txt

第一条装 PyTorch 核心,第二条装项目其余依赖(AMD 卡改用requirements-amd.txt)。

3. 下载预训练模型

python tools/download_models.py

把推理和训练要用的底模放进assets/,首次启动前只需执行一次。

4. 启动 Web 界面

python infer-web.py

终端打印出地址后会自动弹出浏览器,训练、推理、模型融合都在这个界面完成;Windows 用户也可直接双击go-web.bat

5. 格式化数据并一键训练

进入"训练集格式化"选项卡:填实验名、音频文件夹路径,选采样率(32k 或 48k),点"一键训练"。看到Training is done即成功,成品模型约 60MB,落在assets/weights/

6. 推理验证与实时变声

切到"推理"选项卡,刷新音色,选中刚训练好的模型,上传测试音频:音高算法选 RMVPE,索引比率先设 0.5,点转换即可试听。想体验实时变声,再执行:

python gui_v1.py

打开麦克风实时变声界面,选输入输出设备后说话,立刻听到 AI 音色。

关键参数解读:新手只需盯这五项

参数建议值作用
总训练轮数50 至 100轮数太少音色不稳,音质一般的训练集超过 200 意义不大
批大小4(显存小则调 1 至 2)决定单次处理的样本量,直接影响显存占用
索引比率0.5 起步抑制音色泄漏,越高越贴近训练集原始音色
音高算法RMVPE提取音高,效果最好且比 crepe_full 更快、占用更小
采样率48k48k 音质更好,32k 更快更省显存

默认学习率1e-4、批大小4记录在 configs/v1/48k.json 中,新手不建议改动。

避坑问答:高频问题速查

  • 显存不够(Cuda out of memory)怎么办?训练调小批大小,推理调小 configs/config.py 末尾的 x_pad、x_max 等参数。
  • 训练结束后没有.index索引文件?训练集太大可能卡住,回界面再点一次"训练索引"即可。
  • 训练完推理列表里没有新音色?先点刷新音色,没有就查logs/实验名/下的日志。
  • 分享模型要发哪个文件?发assets/weights/下 60MB 以上的 pth;logs/下的大 pth 是训练状态,不能用于推理。
  • 实时变声延迟高?换 ASIO 声卡可压到约 90ms,并调小音频缓冲区。
  • 报 ffmpeg error / utf8 error?多半是路径带空格、括号或中文,把文件夹挪到纯英文路径再试。
  • 界面提示Expecting value: line 1...?关闭系统的局域网或全局代理后重试。

更多问题可查 docs/cn/faq.md。

创意延展:这些玩法可以试起来

  • AI 翻唱:用目标声线翻唱整首歌,先用 UVR5 分离出干声,转完再叠回伴奏。
  • 视频配音:批量跑 tools/infer_batch_rvc.py,让整期节目声音风格统一。
  • 直播实时变声:python gui_v1.py打开实时界面,麦克风进、AI 声音出,适合 K 歌和聊天。
  • 模型融合:在 ckpt 选项卡用 ckpt-merge 把两个声线按权重混合,得到新的中间音色。

收尾:今天就能做完的四件事

  1. 备一份 10 至 50 分钟的干净人声,放好路径,按上述六步完成第一次训练。
  2. 用一首熟悉的歌做首次推理,对比原声调整索引比率。
  3. 跑一次实时变声,感受 170ms 延迟下的实际体验。
  4. 进阶设置(显卡选择、显存优化、参数细节)参考 configs/config.py 与 docs/cn/faq.md。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询