RVC WebUI 声音克隆:十分钟录音做出自己的变声器
2026/9/20 14:04:33 网站建设 项目流程

RVC WebUI 声音克隆:十分钟录音做出自己的变声器

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

老式变声器出来的声音电子味重,想调出像样的效果往往要录几个小时的素材,还未必像。RVC WebUI 声音克隆提供了另一条路:它是 MIT 协议的免费开源工具,用 10 分钟低底噪录音就能训练出一个可使用的语音转换(VC)模型,既能离线给歌曲换人声音色,也能在直播、通话里实时变声。入门级独立显卡即可跑,没有 N 卡也有 CPU 或 DirectML 的可用方案。下面按一条完整的声音克隆入门教程流程走一遍。

小数据量与低显存门槛:它比传统变声器好在哪

传统变声器的原理是移调加效果器,结果像机器人,而且根本不像目标人物。RVC 的做法是先把声音拆成内容与音色两类特征,再用检索机制把输出音色替换成训练集音色——项目名里的 Retrieval-based 指的就是这个。它用 top1 检索替换源特征,输出音色贴近训练对象,同时避免训练集音色泄漏到结果里。

对照一下以前的麻烦:

以前的麻烦RVC WebUI 的处理方式
录音几小时还未必出效果约 10 分钟低底噪录音即可完成一轮训练,数据质量决定上限
输出电子味重,不像目标人声检索式特征替换,输出音色向训练集靠拢,并抑制音色泄漏
训练、推理都要高端显卡4G 显存可完成推理,AMD/Intel 卡可走 CPU 或 DirectML 路线
实时变声依赖专用硬件端到端延迟约 170ms,搭配 ASIO 声卡可降至约 90ms(官方 README 给出的实测口径)

数据量方面,FAQ 建议 10–50 分钟;音色有特色且底噪低时,5–10 分钟也能见效。

十分钟跑通:从装依赖到听到结果

准备 Python 3.12 环境与依赖

该分支面向 Python 3.12 x64,Ubuntu 用户建议 24.04。克隆仓库并建虚拟环境:

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv .venv

激活虚拟环境后按硬件选依赖文件安装。N 卡先装对应 CUDA 版本的 Torch,再装requirments_cu118_py312.txt(RTX 50 系用 cu128 版);CPU、AMD、Intel 直接装 CPU 版:

python -m pip install -r requirments_cpu_py312.txt

完成标志:python -c "import torch"无报错,且输出的 CUDA 状态与你的硬件匹配。

下载底模到 assets 目录

仓库本身不含底模,需要按 README 的目录结构放到assets/下:hubert_base/rmvpe/是推理必需,训练还要加pretrained/pretrained_v2/。README 里给出了基于 huggingface_hub 的下载命令,照抄执行即可,也可以手工下载后按路径摆放。Windows 用户另需把 ffmpeg.exe、ffprobe.exe 放到项目根目录,Ubuntu 前面装系统依赖时已一并装好。

启动训练界面

python webui.py

浏览器会自动打开界面,默认端口 7865;无桌面的服务器加--noautoopen后手动访问。

跑一次完整流程并验证

把 10 分钟以上的目标人声录音放入训练集目录(要求底噪低)。界面上填实验名,音高提取选默认的 RMVPE——它是项目默认项,速度快、占显存少,然后一键执行数据集处理和模型训练。训练完切到推理页,选中新模型与对应索引,上传一段没参与训练的人声作为输入,生成结果。

验证标准就一条:输出听起来是“目标音色 + 原句的旋律和节奏”。控制台无报错、音色方向对了,这次训练就算成功。

场景深讲

直播实时变声:要调哪几个参数

适合谁:主播、K 歌用户,以及任何想用另一种声音通话的人。

怎么用:运行python realtime_gui.py(Windows 双击 go-realtime_gui.bat),选输入输出设备和模型即可开始说话。端到端延迟约 170ms,声卡支持 ASIO 时能压到约 90ms。

调哪里:

  • 音高提取方式:实时场景选 RMVPE,速度和准确性最稳;pm 更快但精度低一些。
  • 音调升降:想整体变高或变低,在音调参数上调,即时生效。
  • index_rate:控制输出向训练音色的贴近程度。不像目标就调高,出现浑浊感就调低;它到 1 时理论上完全消除推理源音色泄漏,但音质会更偏向训练集。

给歌曲的人声换音色:分离加转换两步走

适合谁:想做歌曲人声翻唱版、给播客或配音换音色的人。

怎么用:原曲是人声加伴奏的混合体,第一步先分离。界面内置 UVR5 人声分离,输入原曲导出纯人声;第二步把干声送进推理页转换。两步都在界面内完成,不需要手写脚本。

调哪里:分离出的干声如果带噪或带残响,先回 UVR5 页换分离模型再处理,别急着怪转换模型。批量处理多首文件时,先把一首文件的分离、推理流程调通再复制流程;命令行方式在 FAQ Q7 有说明,WebUI 消息窗也会打印对应的数据集处理和训练命令。

把训练好的音色分享给别人

适合谁:想把模型给朋友用,或换设备继续用同一个音色的人。

怎么用:注意logs/实验名/下的 pth 是实验状态快照,供复现和续训,不是拿来分享的;可分享的是assets/weights/下 60MB 以上的那个 pth,且要连同对应的 .index 文件一起打包。

验证方式:对方设备上把 pth 放入assets/weights/、index 放入assets/indices/,刷新音色列表能选中并正常推理,即打包无误。

避坑手册:四个高频问题

报 ffmpeg error 或 utf8 error

症状:加载训练集时报 ffmpeg 或 utf8 相关错误。可能原因:大概率不是 ffmpeg 本身,而是路径带空格、括号等特殊符号,或训练集路径含中文。对策:把训练集挪到纯英文且无空格的路径,项目目录本身也建议放在英文路径下。

显存溢出 CUDA out of memory

症状:训练或推理时显存不足崩溃。可能原因:显存不够;4G 以下显存基本无解,4G 是可用下限。对策:训练时缩小 batch size;推理时缩小 configs/config.py 末尾的 x_pad、x_query、x_center、x_max,程序对低显存卡也会自动切到更小配置——低显存语音转换能做的优化主要就在这两处。

输出音色不像目标

症状:训练完成,但声音介于自己和目标之间,甚至偏向底模音色。可能原因:这叫音色泄漏,当推理源或底模音质高于训练集时,输出音质被带高、音色被带偏。对策:调高 index_rate;若训练集音质好、时长足,则优先调高 total_epoch(FAQ 的口径是低质数据 20–30 足够,高质数据可到 200),模型本身就不会太依赖检索混色。

一键训练后没有索引,或界面报 Connection Error

症状:控制台显示训练完成但没生成 added 开头的索引文件;或浏览器显示 Connection Error / Expecting value。可能原因:训练集过大时索引步骤卡住;连接错误通常是控制台窗口被关了,或系统代理干扰了本地访问。对策:再点一次训练索引按钮;保持控制台窗口开着;关闭全局或局域网代理。

下一步与求助入口

跑通主线之后,值得按顺序做三件事:再收集 10 分钟数据换新实验名续训,音色会持续贴近;用 ckpt 选项卡里的 ckpt-merge 融合两个模型,换一种更稳的音色方向;最后切到实时界面,在真实对话里检验延迟和听感。

卡住时优先查仓库内置文档:docs/cn/faq.md 覆盖路径、显存、模型分享等高频问题,docs/cn/Changelog_CN.md 记录各版本改动。界面文案的多语言翻译文件在i18n/locale/下,改界面措辞可以从那里入手。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询