AI音频分离实战:制作保留背景和声的伴奏,从Demucs到UVR
2026/9/1 2:15:27 网站建设 项目流程

在翻唱、现场演出、排练和短视频配乐里,“带和声伴奏”是非常实用的一类音频素材。它不像纯伴奏那样把所有唱段落都拿掉,而是把主唱从人声层中去除,同时保留背景和声,这样新人声进来后,歌曲既有充分的伴奏支撑,又不会因为保留原唱而显得杂乱。以“No, Thank”这类嘻哈或 R&B 歌曲为例,如果你拿到的是合法授权的原始音频,又希望快速得到一个干净的带和声伴奏,普通音乐软件提供的“一键去人声”很难满足要求。下面这套流程可以复现,核心是拆出人声、分清主唱和背景和声,再把和声层与音乐层重新合成。

1. 先分清“纯伴奏”“去人声伴奏”“带和声伴奏”的区别

1.1 三种伴奏版本的适用场景

在动手处理之前,需要先明确你要做的到底是什么版本。不同版本的目标不同,处理方式也不同,混为一谈会导致后面反复返工。

  • 纯伴奏:不包含任何主唱和背景和声,通常由唱片公司、制作人发布,或者由制作者按原曲重新编曲。音质最稳,但很多歌曲没有官方纯伴奏。
  • 去人声伴奏:用算法将主唱从原曲中移除,常见的“消人声”工具多属于这一类。好处是快,风险是背景和声、吉他、钢琴等中频乐器会一起受损。
  • 带和声伴奏:移除主唱,但保留或重构背景和声。它适合练习翻唱、现场演出、舞台表演,也比纯伴奏更有歌曲原始氛围。

“No, Thank”这种偏人声叙事和节奏感的歌曲,如果直接一键消人声,很容易把说唱部分的中频气口、背后垫的人声切片一起消掉,最后只剩下“伴奏壳子”。所以更合理的思路是:先分离,再重组。

版本是否含主唱是否含背景和声制作难度音质损失风险
纯伴奏通常否低(多为官方或重编)
去人声伴奏视算法而定,常被破坏
带和声伴奏中高

1.2 两条主要制作路线

路线一适合已有高质量音频素材的情况:先用模型把原曲分成“人声”和“伴奏”两轨,再对人声轨做第二次分离,把“主唱”和“背景和声”拆开,最后把伴奏轨与背景和声轨合成。

路线二适合和声原声损坏严重的情况:直接把伴奏处理好,再用 MIDI 乐器或真实人声重新录一轨和声。这条路需要懂一点乐理,也需要会录音,但最终成品更可控。

后续内容以路线一为主,因为它的自动化程度高,适合大多数人第一次尝试。

1.3 为什么不能依赖一键去人声

很多一键工具使用的是“相位抵消”原理,利用人声大多集中在中央声道,把左右声道相减,从而消除中置人声。但这样做会带来三个问题:

第一,不是所有元素都固定在中置。背景和声经常会被做成较宽的声像,一键去人声会把它当成“伴奏”保留,导致主唱没了但和声还在,这反而是好事,只是不可控。

第二,中央声道里不仅有主唱,还有底鼓、贝斯、军鼓甚至一些主音乐器。相位抵消后,这些低频和中频元素也会被削弱,听起来像“纸片声”。

第三,现代歌曲大量使用压缩、混响、并行处理,人声并不是干净地存在于某一频率或某一声道里。一键消人声后,很容易出现金属感、水声、相位失真。

所以,“带和声伴奏”不是一个“消音”动作,而是一个“拆解重组”动作。真正稳定可复现的流程,需要在命令行或 DAW 中分步完成。

2. 环境准备:选对工具链,后续处理才不返工

2.1 工具清单和各自职责

下面这套工具链以开源工具为主,既能跑命令行,也能用图形界面辅助检查。

工具作用是否需要
Python 3.9+运行 AI 分离模型
Demucs将原曲分成 vocals / no_vocals
Ultimate Vocal Remover二次分离主唱和背景和声推荐
FFmpeg格式转换、采样率转换
Audacity频谱检查、波形编辑、快速试听推荐
Reaper / Cubase / Logic多轨合成、混音、导出推荐

Demucs 适合先做粗分离,UVR 适合对人声轨做细分离,两者组合比单个工具更稳定。FFmpeg 不是可选工具,因为 AI 模型对输入格式很敏感,若直接把 MP3 喂给模型,压缩痕迹会被模型放大。

2.2 安装 Demucs 和 FFmpeg

先确认 Python 版本。Windows 用户建议直接用官方 Python 安装包,并勾选“Add Python to PATH”。macOS 和 Linux 用户可以使用系统自带 Python,但更推荐先创建虚拟环境,避免依赖冲突。

python --version

然后创建虚拟环境并安装 Demucs。

python -m venv venv source venv/bin/activate python -m pip install --upgrade pip python -m pip install demucs torch torchaudio

安装完成后,检查 Demucs 是否可用。

demucs --list

如果输出包含htdemucs等模型名称,说明安装成功。FFmpeg 的安装方式因系统而异,安装后执行以下命令确认。

ffmpeg -version

只要能看到版本信息,并且输出了 libavcodec、libavformat 等编译选项,就说明 FFmpeg 可用。

2.3 输入音频文件规范

处理前把音频统一成 WAV 或 FLAC 等无损格式。如果原始素材是 MP3 甚至 128kbps 的压缩文件,优先寻找更高码率的版本。算法分离本身就会造成信息损失,如果输入已经是压缩过的,损失会叠加。

ffmpeg -i "No Thank.mp3" -ar 44100 -ac 2 -sample_fmt s16 "No Thank.wav"

这条命令把音频转换为 44.1kHz、双声道、16bit 的 WAV。中间处理阶段不建议导出 MP3,因为每一步转码都会引入新噪声。

文件属性推荐值说明
采样率44100 Hz 或 48000 Hz与原曲保持一致即可
声道2(立体声)单声道素材会损失分离效果
位深度24bit(处理)/ 16bit(交付)中间处理保留动态范围
文件名只用字母、数字、空格、短横线避免中文路径和特殊符号

这里有一个常见坑:文件名中的空格、引号、中文在命令行里容易导致路径解析错误。推荐在预处理阶段就把文件名改成No Thank.wav这种简单位置。

3. 用模型分离出主唱、伴奏和背景和声

3.1 Demucs 第一次分离

Demucs 是一个基于深度学习的音源分离模型,能把歌曲拆成多个 stem。先使用两轨模式,输出两部分:vocals.wavno_vocals.wav

demucs -n htdemucs --two-stems=vocals "No Thank.wav"

这条命令会执行如下逻辑:

  • -n htdemucs指定模型。htdemucs是常用模型,对流行音乐、嘻哈、R&B 的分离效果比较稳定。
  • --two-stems=vocals表示只要两个输出,一个叫 vocals,另一个叫 no_vocals。
  • 输出目录默认是separated/htdemucs/No Thank/

执行完以后,进入输出目录检查。

ls separated/htdemucs/"No Thank"

正常会看到vocals.wavno_vocals.wav。先不要看任何参数,直接听这两个文件。vocals.wav里应该能清楚听到主唱和背景和声,no_vocals.wav里应该保留鼓、贝斯、键盘等乐器。

3.2 第一次分离的常用参数

参数作用推荐值错误表现
-n选择模型htdemucs模型不匹配时,分离模糊
--two-stems指定分成两个 stemvocals不设置时输出四个文件,不利于后续处理
--segment设置分块长度默认即可过大时显存不足,过小时接缝明显
--overlap相邻块之间重叠长度0.25 左右过小时块之间有不连续感
--mp3直接导出 MP3不建议中间处理二次转码增加音损

如果电脑没有 NVIDIA GPU,CPU 也能跑,但会慢很多。可以先取原曲前 30 秒测试,确认参数合理后再处理完整文件。

3.3 对 vocals.wav 做“主唱 / 和声”二次分离

vocals.wav里不是只有主唱,还包含 ad-libs、背景和声、和声层。接下来用 UVR 的模型把人声层进一步分成主唱和背景和声。

UVR 是图形界面工具,操作步骤:

  1. 打开 UVR,选择Main Vocals类模型,例如UVR-MDX-NET Main
  2. 输入文件选择上一步得到的vocals.wav
  3. 输出路径选择一个新的文件夹。
  4. 设置输出 stem 为Primary(主唱)和Secondary(背景人声)。
  5. 点击 Start。

完成后会得到两个文件:一个是主唱,另一个是背景和声。背景和声轨就是后续要保留的“和声”素材。

需要说明,没有哪个模型能保证 100% 分离干净。Secondary轨里可能混有一点点主唱尾音,主唱轨里也可能夹着和声。需要对结果做一次主观试听。

3.4 用频谱检查分离结果

在 Audacity 中同时导入no_vocals.wavmain vocals.wavbacking vocals.wav,切换到频谱图视图。人声的主要能量集中在 200Hz 到 4kHz 之间,主唱会有明显的语谱条纹;背景和声如果被保留,它的能量分布会比主唱更窄、更稳定。

如果backing vocals.wav里出现非常完整的句子,说明模型把部分主唱也放到和声轨了。这时可以回到 UVR 换另一个模型,或者调整分离强度。不要手动一点一点清理,效率太低。

4. 不要急着合并,先处理和声与伴奏的平衡

4.1 伴奏轨的清理思路

no_vocals.wav通常已经比较干净,但可能会有主唱的混响尾音、房间反射声,甚至是因为模型误差残留的低语声。第一步先检查 1kHz 到 4kHz 频段,如果存在“嗡嗡”的说话式能量,可以用中频 EQ 做 2 到 3dB 的衰减。

EQ 参考: - 低频 HPF:25 Hz,去除极低频噪音 - 中频陷波:2.5 kHz,若人声残留明显 - 高频 HSF:+1 dB @ 10 kHz,恢复空气感

不建议对整条伴奏轨做大幅度 EQ。在 DAW 中先听问题频段,再决定衰减量。若伴奏轨本身质量很好,只要清理极低频即可。

4.2 和声轨的增强处理

二次分离出来的背景和声通常缺少厚度,因为它只包含“背景人声”部分,没有主唱那种中频密度。处理时可以做以下几件事:

  • 高通滤波:切除 80Hz 以下频率,避免和声轨引入无意义低频。
  • 压缩:用 2:1 到 3:1 的压缩比,补偿和声轨的动态起伏。
  • 立体声加宽:使用插件把左右声道的差异稍微扩大,但不要过量,否则新人声进来后会“打架”。
  • 混响发送:把和声轨发送到同一个混响辅助通道,让和声和伴奏处于同一空间。

注意,和声轨的主要任务是填补主唱之外的层次,不需要做得很突出。处理时经常独奏和声轨听,看它是否还有“塑料感”。

4.3 用“辅助通道”让和声融进伴奏

不要直接把和声轨和伴奏轨堆在主输出上。可以在 DAW 中建一条辅助通道,把和声轨发送到该通道,再给辅助通道加混响和压缩。

伴奏轨 -> 主输出 和声轨 -> 辅助通道 -> 压缩/混响 -> 主输出

这样做的原因是:和声不必始终控制在完全相同的音量,通过辅助通道可以统一调节平衡,遇到突发高音时也不容易爆音。

5. 在 DAW 里把和声与伴奏合成最终版本

5.1 推荐轨道结构

打开 Reaper、Cubase、Logic 或任何 DAW,创建如下轨道布局:

轨道内容是否静音用途
1Instrumental(处理后的 no_vocals.wav)主体伴奏
2Backing Vocals(二次分离后的和声)背景和声
3Main Vocals 原轨静音对齐参考
4Original 原曲静音最终对比参考

主唱参考轨和原曲轨在最终导出前静音,但它们能帮助对齐时间轴和判断成品风格。

5.2 时间轴对齐和响度匹配

Demucs 分离后的文件不会改变原曲长度,所以理论上所有音轨起点一致。但 UVR 二次分离后,某些模型的输出可能会因为重采样产生几毫秒偏移。先放大波形,把和声轨的第一个强音头与伴奏轨的对应位置对齐。

对齐后用原曲做参考,把合成结果调到与原曲相近的响度。人耳对响度变化很敏感,如果不匹配,试听时容易误判音质。

5.3 导出参数设置

合成完毕后进入导出环节。按最终用途选择格式:

参数推荐值说明
文件格式WAV 或 MP3中间交付用 WAV,网络传播可用 320kbps MP3
采样率44100 Hz 或 48000 Hz与原曲一致
位深度16bit / 24bit24bit 用于母带,交付 16bit
峰值限制-1 dBTP给播放平台留出转码余量
抖动是(从 24bit 转 16bit 时)减少量化噪声

如果只是个人练习,导出 WAV 即可。如果给现场演出或短视频平台,导出 MP3 时固定 320kbps 会比 192kbps 明显更好。

6. 常见问题排查:从现象倒推原因

6.1 故障现象和处理方案

问题现象常见原因检查方式处理方案
伴奏听起来发“闷”分离模型在高频损失偏多,或压缩格式输入用频谱看 8kHz 以上能量换无损输入,或高 shelf 提升 10kHz
伴奏里还有主唱残留主唱混响尾音被分到 no_vocals独奏伴奏轨,听句与句之间EQ 衰减中频,或用门限压掉低电平尾音
和声轨里出现完整主唱二次分离模型选择不当独奏 backing vocals 轨换 UVR 模型,重新分离
导出后低频浑浊伴奏轨和和声轨都保留了太多低频看 100Hz 以下频谱给和声轨加 80Hz 高通
整体声音“中间空”一键消人声或相位抵消留下的中频凹陷对比原曲,A/B 切换给伴奏轨加中频激励,但幅度控制在 1dB 内
时间轴对不齐UVR 重采样导致偏移放大波形看瞬态手动拖动和声轨对齐

6.2 一个常见但容易被忽略的错误:用压缩格式做中间素材

分离输出后,如果为了节省空间把 vocals.wav 转成 128kbps MP3,再拿去 UVR 分离,金属声会明显加重。模型处理的是损失后的频谱,压缩痕迹会被当成目标特征放大。整个流程中间阶段应该坚持 WAV,最终交付再转 MP3。

6.3 一个容易被误判的“人声没去干净”

有时候伴奏轨里听到的不是主唱,而是主唱的混响尾音。混响尾音通常是衰减的、模糊的,和真正主唱的音头不同。处理方式不是重新分离,而是用波形编辑器把歌曲句与句之间的尾音手动静音,或者用门限插件把低于 -40dB 的电平压住。

7. 制作流程检查清单与版权注意事项

7.1 每个阶段都应有验收标准

处理音频时,不要等到最后导出才判断好坏。每完成一步,都应该有明确检查点。

  • 分离前:输入音频是无损格式,文件命名规范,模型参数已测试。
  • Demucs 分离后:vocals.wavno_vocals.wav分离明显,没有明显互相串扰。
  • UVR 二次分离后:backing vocals.wav里没有完整主唱句子,和声清晰可辨。
  • 合成前:伴奏轨和和声轨已完成基本 EQ、压缩、混响平衡。
  • 合成后:主唱参考轨静音,人声位置不冲突,响度接近原曲。
  • 导出后:用普通耳机和手机扬声器各听一遍,避免只在高品质监听上做判断。

7.2 学习环境与发布环境的差别

个人练习时,用一台普通电脑和耳机就能完成上述流程。但如果是商业演出、伴奏带发行或公开作品,还需要额外注意:

  • 使用监听耳机或监听音箱,避免设备渲染。普通耳机容易放大低频,让你误判和声位置。
  • 导出前做响度标准化,避免平台播放时音量忽大忽小。
  • 保存工程文件和处理参数,便于后续调整。
  • 保留原始音频备份,不要用处理后的文件覆盖原文件。

7.3 版权相关提醒

处理“去人声伴奏”或“带和声伴奏”时,只应处理自己拥有版权、已获得许可或官方明确允许二次创作的音频素材。个人翻唱练习通常属于合理使用,但如果要公开发布、出售、用于商业演出,必须确认原曲权利方的授权范围。不要在公开网络传播未经授权的伴奏文件,也不要绕开版权平台限制下载原曲。

这里的核心原则是:技术流程可以复现,但使用对象必须合法。没有合法授权时,任何“高质量去人声”都不能改变侵权事实。

8. 扩展方向:从手动处理到自动化工作流

8.1 批量处理多个文件

如果手上有多个歌曲需要制作带和声伴奏,可以写一个简单脚本,对指定目录里的所有音频按同样流程处理。以下是一个可供参考的批处理思路:

for f in *.wav; do demucs -n htdemucs --two-stems=vocals "$f" done

实际使用时需要结合输出路径和文件命名。注意批量处理前先用一个文件测试,确认模型正确后再全量跑,避免浪费几个小时。

8.2 从“保留和声”升级到“重构和声”

当原始和声轨质量太差、或者分离之后仍然不干净,可以考虑重构和声。具体做法是根据原曲的和声走向,在 MIDI 键盘上录入和声旋律,然后用合成器或人声音色替代。这样做出来的带和声伴奏完全可控,但需要一定乐理基础。

8.3 用标准化录音流程替代 AI 分离

如果条件允许,更可靠的方案不是去人声,而是找原曲的制作人、乐手重新录制伴奏和和声。AI 分离适合快速原型、练习素材、低成本项目,不适合作为商业发行的首选母带来源。

制作带和声伴奏,本质上是一次“分离、判断、重组、混音”的音频拆解实验。最重要的能力不是记住命令,而是能在每一步都问一句:现在这个结果,听起来对不对?如果不对,是模型问题、参数问题,还是音源本身问题。只要建立这种排查意识,再复杂的歌曲也能一步步拆干净。建议从一首你已经拥有合法素材、节奏不那么复杂的歌曲开始,走完一遍完整流程后,再回来处理“No, Thank”或其他更复杂的人声作品。这样既不会带崩信心,也能把每一步的验收标准练扎实。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询