UVR5 人声分离完整实战教程:5 步提取纯净伴奏
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
翻唱缺伴奏、剪视频总被 BGM 里的人声干扰、混音时拿不到干声——这些卡脖子的老问题,可以用 Ultimate Vocal Remover(UVR5)解决。它是一款免费、开源的 AI 人声分离工具,图形界面操作,能把一首歌的人声和伴奏拆成两条独立音轨。下文基于仓库 v5.6.0 版本(见version.py)的真实文件与命令,带你从零跑通完整流程。
为什么"传统消人声"总差口气
你大概率在剪辑软件里试过"Center Channel Cancellation"或"消人声"开关:思路是掐掉中央声道或人声频段。结果伴奏发闷、发空,像隔着一层被子听歌。
原因在于人声和吉他泛音、键盘和声在频率上大量重叠,固定滤波器一刀切下去,误伤的永远是乐器。AI 分离走的是另一条路:模型先在海量标注音频上学会"人声在时频平面上的组合规律",再按声源而非频率切分。同样是挖掉人声,切法完全不同,这也是 UVR5 能交出接近专业分轨质量的原因。
三套算法一个界面:UVR5 内部有什么
UVR5 把三种主流分离架构整合进同一个窗口,各自对应独立的源码目录和模型仓库:
| 算法家族 | 源码位置 | 特长 | 适合素材 |
|---|---|---|---|
| MDX-Net | lib_v5/mdxnet.py | 推理快、两轨分离稳 | 流行、摇滚等常规歌曲 |
| Demucs v3/v4 | demucs/ | 支持 4 轨分轨(人声/鼓/贝斯/其他) | 编曲复杂、需要分轨的作品 |
| VR Architecture | lib_v5/vr_network/ | 模型版本多、便于精细调校 | 特定乐器去除、降噪 |
每个家族都有独立的模型目录:
- models/MDX_Net_Models/ —— MDX-Net 模型,
mdx_c_configs子目录存放各模型的 yaml 配置 - models/Demucs_Models/ —— Demucs v3、v4 模型
- models/VR_Models/ —— VR 系列模型,自带的
UVR-DeNoise-Lite.pth可先降噪再分离
推理调度集中在 separate.py,文件里的SeperateMDX、SeperateDemucs、SeperateVR等类各自负责一种架构的前后处理与设备分发,并自动检测 CUDA 与 macOS 的 MPS,有 GPU 时优先走 GPU。
3 分钟装好的最短路径
前置条件:有 Python 环境即可;处理非 WAV 文件(MP3、FLAC)需要系统装有 FFmpeg。
方式 A(省心):用官方打包的一体化安装包,Python、PyTorch、FFmpeg 全部内置,装完直接打开,无任何前置要求(Windows 版要求装在 C 盘)。
方式 B(源码运行):
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui pip install -r requirements.txt python UVR.pyrequirements.txt 已锁定 torch、librosa 0.9.2、onnxruntime、SoundFile 0.11.0、pydub 0.25.1 等关键依赖。Linux 用户还需先sudo apt install ffmpeg python3-tk(见 README.md 的 Linux 一节)。
有 NVIDIA 显卡的话,建议把 PyTorch 升级到 CUDA 版,处理速度通常快一个数量级:
pip install --upgrade torch --extra-index-url https://download.pytorch.org/whl/cu117小提示:GPU 转换的最低门槛是 RTX 1060 6GB,官方推荐 8GB 显存起;显存不够时先关掉 GPU 转换用 CPU 跑。
从一首 MP3 到干声:完整 5 步实操
以"提取一首流行歌的纯净伴奏"为例,照着点就行:
- 加载音频:点Select Input,选中 MP3 文件。进度条下方出现文件名即表示加载成功,此时波形会显示在界面中部。
- 指定输出:点Choose Output Directory选定保存目录,输出格式可选 WAV / FLAC / MP3(选 MP3 会自动按
mp3_bit_set码率压缩,见 separate.py 的save_format函数)。 - 选择算法:在CHOOSE PROCESS METHOD里选
MDX-Net,模型列表挑MDX23C-InstVoc HQ。它对应权重文件MDX23C-8KFFT-InstVoc_HQ.ckpt,是两轨"人声/伴奏"分离的主力模型。 - 设置参数:Segment Size 填 256、Overlap 填 8;有独立显卡就勾上GPU Conversion。
- 开跑:点Start Processing,等进度条走完。
结束后输出目录里出现两个文件:歌曲名_(Vocals).wav和歌曲名_(Instrumental).wav,前者是干声,后者就是你要的伴奏。
小提示:不确定参数合不合适,先勾Sample Mode只处理前 30 秒,确认效果满意再跑全长,能省大量等待时间。
模型怎么选:按歌挑模型 + 参数对照表
UVR5 的最终效果一半取决于选哪个模型。每个模型的详细参数都写在 models/MDX_Net_Models/model_data/model_data.json 里,比如primary_stem(主输出轨道)、mdx_dim_f_set(频率维度),可以直接打开看设计取向:
| 你的情况 | 建议方案 |
|---|---|
| 流行 / 摇滚,要速度 | MDX-Net 系列,MDX23C-InstVoc HQ起步 |
| 古典 / 爵士 / 编曲复杂 | 换 Demucs v4,稳定性更好,还能拆 4 轨 |
| 只想去掉某件乐器 | VR 系列专项模型,如 model_data.json 中4band_44100的 "No Piano" 版本 |
| 原音频底噪大 | 先用UVR-DeNoise-Lite.pth降噪一遍再分离 |
两个最影响结果的参数,出问题时按这个方向调:
| 现象 | 调哪个 | 怎么调 |
|---|---|---|
| 段落接缝处有"咔哒"声、拼缝感 | Overlap | 从 8 加到 16 或 24 |
| 内存吃紧、老机器卡顿 | Segment Size | 从 256 降到 128 |
| 人声残留明显 | 模型 | 换算法家族或换同家族其他模型 |
小提示:模型首次使用会联网下载。网络不顺畅时,可手动把权重文件放进
models/对应目录,程序启动时会直接加载。
GPU 加速与批量处理
设备调度逻辑在 separate.py 顶部:cuda_available = torch.cuda.is_available(),macOS 用户额外检测torch.backends.mps.is_available(),哪个可用优先用哪个。一段 5 分钟的音频,CPU 可能要十几分钟,同配置 GPU 上通常一两分钟。
文件多的时候可以写个小脚本把整个文件夹交给 UVR 排队处理:
import os, subprocess audio_folder = "你的音频目录" for f in os.listdir(audio_folder): if f.endswith((".mp3", ".wav", ".flac")): subprocess.run(["python", "UVR.py", os.path.join(audio_folder, f)])另外,UVR5 关闭时会把上次的全部设置写回 gui_data/saved_settings/,下次打开参数原样还在,不用每次重填。
常见报错速查表
| 症状 | 常见原因 | 对策 |
|---|---|---|
| CUDA out of memory | 显存不足 | 调小 Segment Size,或关掉 GPU 转换 |
| 转换非 WAV 文件时报错 | 系统没装 FFmpeg | 安装 FFmpeg(Linux:sudo apt install ffmpeg)后重试 |
| 内存分配错误 | 音频太长 / 分段太大 | 按 README.md Troubleshooting 建议,降低 Segment 或 Window 尺寸 |
| 模型下载失败或极慢 | 网络问题 | 手动下载模型放入models/对应目录 |
| 界面打不开 | 缺 tkinter 组件 | Linux 先装python3-tk(sudo apt-get -y install python3-tk) |
| 报详细错误想反馈 | — | 点 Start Processing 左侧的 Settings 按钮,再点Error Log查看完整错误信息 |
从一首你熟悉的歌开始
现在挑一首你最熟悉的歌,从Select Input加载它,先勾 Sample Mode 跑 30 秒看看 MDX23C-InstVoc HQ 的效果,满意了再跑全长。
第一次听到"干净得像官方发行版"的伴奏,你就明白这套工具值得装:它免费、开源,三种算法随你切换,几十个预训练模型持续更新——门槛从来没有这么低,剩下的交给你的耳朵挑。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考