UVR5 人声分离完整实战教程:5 步提取纯净伴奏
2026/9/6 17:26:49 网站建设 项目流程

UVR5 人声分离完整实战教程:5 步提取纯净伴奏

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

翻唱缺伴奏、剪视频总被 BGM 里的人声干扰、混音时拿不到干声——这些卡脖子的老问题,可以用 Ultimate Vocal Remover(UVR5)解决。它是一款免费、开源的 AI 人声分离工具,图形界面操作,能把一首歌的人声和伴奏拆成两条独立音轨。下文基于仓库 v5.6.0 版本(见version.py)的真实文件与命令,带你从零跑通完整流程。

为什么"传统消人声"总差口气

你大概率在剪辑软件里试过"Center Channel Cancellation"或"消人声"开关:思路是掐掉中央声道或人声频段。结果伴奏发闷、发空,像隔着一层被子听歌。

原因在于人声和吉他泛音、键盘和声在频率上大量重叠,固定滤波器一刀切下去,误伤的永远是乐器。AI 分离走的是另一条路:模型先在海量标注音频上学会"人声在时频平面上的组合规律",再按声源而非频率切分。同样是挖掉人声,切法完全不同,这也是 UVR5 能交出接近专业分轨质量的原因。

三套算法一个界面:UVR5 内部有什么

UVR5 把三种主流分离架构整合进同一个窗口,各自对应独立的源码目录和模型仓库:

算法家族源码位置特长适合素材
MDX-Netlib_v5/mdxnet.py推理快、两轨分离稳流行、摇滚等常规歌曲
Demucs v3/v4demucs/支持 4 轨分轨(人声/鼓/贝斯/其他)编曲复杂、需要分轨的作品
VR Architecturelib_v5/vr_network/模型版本多、便于精细调校特定乐器去除、降噪

每个家族都有独立的模型目录:

  • models/MDX_Net_Models/ —— MDX-Net 模型,mdx_c_configs子目录存放各模型的 yaml 配置
  • models/Demucs_Models/ —— Demucs v3、v4 模型
  • models/VR_Models/ —— VR 系列模型,自带的UVR-DeNoise-Lite.pth可先降噪再分离

推理调度集中在 separate.py,文件里的SeperateMDXSeperateDemucsSeperateVR等类各自负责一种架构的前后处理与设备分发,并自动检测 CUDA 与 macOS 的 MPS,有 GPU 时优先走 GPU。

3 分钟装好的最短路径

前置条件:有 Python 环境即可;处理非 WAV 文件(MP3、FLAC)需要系统装有 FFmpeg。

方式 A(省心):用官方打包的一体化安装包,Python、PyTorch、FFmpeg 全部内置,装完直接打开,无任何前置要求(Windows 版要求装在 C 盘)。

方式 B(源码运行)

git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui pip install -r requirements.txt python UVR.py

requirements.txt 已锁定 torch、librosa 0.9.2、onnxruntime、SoundFile 0.11.0、pydub 0.25.1 等关键依赖。Linux 用户还需先sudo apt install ffmpeg python3-tk(见 README.md 的 Linux 一节)。

有 NVIDIA 显卡的话,建议把 PyTorch 升级到 CUDA 版,处理速度通常快一个数量级:

pip install --upgrade torch --extra-index-url https://download.pytorch.org/whl/cu117

小提示:GPU 转换的最低门槛是 RTX 1060 6GB,官方推荐 8GB 显存起;显存不够时先关掉 GPU 转换用 CPU 跑。

从一首 MP3 到干声:完整 5 步实操

以"提取一首流行歌的纯净伴奏"为例,照着点就行:

  1. 加载音频:点Select Input,选中 MP3 文件。进度条下方出现文件名即表示加载成功,此时波形会显示在界面中部。
  2. 指定输出:点Choose Output Directory选定保存目录,输出格式可选 WAV / FLAC / MP3(选 MP3 会自动按mp3_bit_set码率压缩,见 separate.py 的save_format函数)。
  3. 选择算法:在CHOOSE PROCESS METHOD里选MDX-Net,模型列表挑MDX23C-InstVoc HQ。它对应权重文件MDX23C-8KFFT-InstVoc_HQ.ckpt,是两轨"人声/伴奏"分离的主力模型。
  4. 设置参数:Segment Size 填 256、Overlap 填 8;有独立显卡就勾上GPU Conversion
  5. 开跑:点Start Processing,等进度条走完。

结束后输出目录里出现两个文件:歌曲名_(Vocals).wav歌曲名_(Instrumental).wav,前者是干声,后者就是你要的伴奏。

小提示:不确定参数合不合适,先勾Sample Mode只处理前 30 秒,确认效果满意再跑全长,能省大量等待时间。

模型怎么选:按歌挑模型 + 参数对照表

UVR5 的最终效果一半取决于选哪个模型。每个模型的详细参数都写在 models/MDX_Net_Models/model_data/model_data.json 里,比如primary_stem(主输出轨道)、mdx_dim_f_set(频率维度),可以直接打开看设计取向:

你的情况建议方案
流行 / 摇滚,要速度MDX-Net 系列,MDX23C-InstVoc HQ起步
古典 / 爵士 / 编曲复杂换 Demucs v4,稳定性更好,还能拆 4 轨
只想去掉某件乐器VR 系列专项模型,如 model_data.json 中4band_44100的 "No Piano" 版本
原音频底噪大先用UVR-DeNoise-Lite.pth降噪一遍再分离

两个最影响结果的参数,出问题时按这个方向调:

现象调哪个怎么调
段落接缝处有"咔哒"声、拼缝感Overlap从 8 加到 16 或 24
内存吃紧、老机器卡顿Segment Size从 256 降到 128
人声残留明显模型换算法家族或换同家族其他模型

小提示:模型首次使用会联网下载。网络不顺畅时,可手动把权重文件放进models/对应目录,程序启动时会直接加载。

GPU 加速与批量处理

设备调度逻辑在 separate.py 顶部:cuda_available = torch.cuda.is_available(),macOS 用户额外检测torch.backends.mps.is_available(),哪个可用优先用哪个。一段 5 分钟的音频,CPU 可能要十几分钟,同配置 GPU 上通常一两分钟。

文件多的时候可以写个小脚本把整个文件夹交给 UVR 排队处理:

import os, subprocess audio_folder = "你的音频目录" for f in os.listdir(audio_folder): if f.endswith((".mp3", ".wav", ".flac")): subprocess.run(["python", "UVR.py", os.path.join(audio_folder, f)])

另外,UVR5 关闭时会把上次的全部设置写回 gui_data/saved_settings/,下次打开参数原样还在,不用每次重填。

常见报错速查表

症状常见原因对策
CUDA out of memory显存不足调小 Segment Size,或关掉 GPU 转换
转换非 WAV 文件时报错系统没装 FFmpeg安装 FFmpeg(Linux:sudo apt install ffmpeg)后重试
内存分配错误音频太长 / 分段太大按 README.md Troubleshooting 建议,降低 Segment 或 Window 尺寸
模型下载失败或极慢网络问题手动下载模型放入models/对应目录
界面打不开缺 tkinter 组件Linux 先装python3-tksudo apt-get -y install python3-tk
报详细错误想反馈点 Start Processing 左侧的 Settings 按钮,再点Error Log查看完整错误信息

从一首你熟悉的歌开始

现在挑一首你最熟悉的歌,从Select Input加载它,先勾 Sample Mode 跑 30 秒看看 MDX23C-InstVoc HQ 的效果,满意了再跑全长。

第一次听到"干净得像官方发行版"的伴奏,你就明白这套工具值得装:它免费、开源,三种算法随你切换,几十个预训练模型持续更新——门槛从来没有这么低,剩下的交给你的耳朵挑。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询