在翻唱、现场演出、排练和短视频配乐里,“带和声伴奏”是非常实用的一类音频素材。它不像纯伴奏那样把所有唱段落都拿掉,而是把主唱从人声层中去除,同时保留背景和声,这样新人声进来后,歌曲既有充分的伴奏支撑,又不会因为保留原唱而显得杂乱。以“No, Thank”这类嘻哈或 R&B 歌曲为例,如果你拿到的是合法授权的原始音频,又希望快速得到一个干净的带和声伴奏,普通音乐软件提供的“一键去人声”很难满足要求。下面这套流程可以复现,核心是拆出人声、分清主唱和背景和声,再把和声层与音乐层重新合成。
1. 先分清“纯伴奏”“去人声伴奏”“带和声伴奏”的区别
1.1 三种伴奏版本的适用场景
在动手处理之前,需要先明确你要做的到底是什么版本。不同版本的目标不同,处理方式也不同,混为一谈会导致后面反复返工。
- 纯伴奏:不包含任何主唱和背景和声,通常由唱片公司、制作人发布,或者由制作者按原曲重新编曲。音质最稳,但很多歌曲没有官方纯伴奏。
- 去人声伴奏:用算法将主唱从原曲中移除,常见的“消人声”工具多属于这一类。好处是快,风险是背景和声、吉他、钢琴等中频乐器会一起受损。
- 带和声伴奏:移除主唱,但保留或重构背景和声。它适合练习翻唱、现场演出、舞台表演,也比纯伴奏更有歌曲原始氛围。
“No, Thank”这种偏人声叙事和节奏感的歌曲,如果直接一键消人声,很容易把说唱部分的中频气口、背后垫的人声切片一起消掉,最后只剩下“伴奏壳子”。所以更合理的思路是:先分离,再重组。
| 版本 | 是否含主唱 | 是否含背景和声 | 制作难度 | 音质损失风险 |
|---|---|---|---|---|
| 纯伴奏 | 否 | 通常否 | 低(多为官方或重编) | 低 |
| 去人声伴奏 | 否 | 视算法而定,常被破坏 | 低 | 高 |
| 带和声伴奏 | 否 | 是 | 中高 | 中 |
1.2 两条主要制作路线
路线一适合已有高质量音频素材的情况:先用模型把原曲分成“人声”和“伴奏”两轨,再对人声轨做第二次分离,把“主唱”和“背景和声”拆开,最后把伴奏轨与背景和声轨合成。
路线二适合和声原声损坏严重的情况:直接把伴奏处理好,再用 MIDI 乐器或真实人声重新录一轨和声。这条路需要懂一点乐理,也需要会录音,但最终成品更可控。
后续内容以路线一为主,因为它的自动化程度高,适合大多数人第一次尝试。
1.3 为什么不能依赖一键去人声
很多一键工具使用的是“相位抵消”原理,利用人声大多集中在中央声道,把左右声道相减,从而消除中置人声。但这样做会带来三个问题:
第一,不是所有元素都固定在中置。背景和声经常会被做成较宽的声像,一键去人声会把它当成“伴奏”保留,导致主唱没了但和声还在,这反而是好事,只是不可控。
第二,中央声道里不仅有主唱,还有底鼓、贝斯、军鼓甚至一些主音乐器。相位抵消后,这些低频和中频元素也会被削弱,听起来像“纸片声”。
第三,现代歌曲大量使用压缩、混响、并行处理,人声并不是干净地存在于某一频率或某一声道里。一键消人声后,很容易出现金属感、水声、相位失真。
所以,“带和声伴奏”不是一个“消音”动作,而是一个“拆解重组”动作。真正稳定可复现的流程,需要在命令行或 DAW 中分步完成。
2. 环境准备:选对工具链,后续处理才不返工
2.1 工具清单和各自职责
下面这套工具链以开源工具为主,既能跑命令行,也能用图形界面辅助检查。
| 工具 | 作用 | 是否需要 |
|---|---|---|
| Python 3.9+ | 运行 AI 分离模型 | 是 |
| Demucs | 将原曲分成 vocals / no_vocals | 是 |
| Ultimate Vocal Remover | 二次分离主唱和背景和声 | 推荐 |
| FFmpeg | 格式转换、采样率转换 | 是 |
| Audacity | 频谱检查、波形编辑、快速试听 | 推荐 |
| Reaper / Cubase / Logic | 多轨合成、混音、导出 | 推荐 |
Demucs 适合先做粗分离,UVR 适合对人声轨做细分离,两者组合比单个工具更稳定。FFmpeg 不是可选工具,因为 AI 模型对输入格式很敏感,若直接把 MP3 喂给模型,压缩痕迹会被模型放大。
2.2 安装 Demucs 和 FFmpeg
先确认 Python 版本。Windows 用户建议直接用官方 Python 安装包,并勾选“Add Python to PATH”。macOS 和 Linux 用户可以使用系统自带 Python,但更推荐先创建虚拟环境,避免依赖冲突。
python --version然后创建虚拟环境并安装 Demucs。
python -m venv venv source venv/bin/activate python -m pip install --upgrade pip python -m pip install demucs torch torchaudio安装完成后,检查 Demucs 是否可用。
demucs --list如果输出包含htdemucs等模型名称,说明安装成功。FFmpeg 的安装方式因系统而异,安装后执行以下命令确认。
ffmpeg -version只要能看到版本信息,并且输出了 libavcodec、libavformat 等编译选项,就说明 FFmpeg 可用。
2.3 输入音频文件规范
处理前把音频统一成 WAV 或 FLAC 等无损格式。如果原始素材是 MP3 甚至 128kbps 的压缩文件,优先寻找更高码率的版本。算法分离本身就会造成信息损失,如果输入已经是压缩过的,损失会叠加。
ffmpeg -i "No Thank.mp3" -ar 44100 -ac 2 -sample_fmt s16 "No Thank.wav"这条命令把音频转换为 44.1kHz、双声道、16bit 的 WAV。中间处理阶段不建议导出 MP3,因为每一步转码都会引入新噪声。
| 文件属性 | 推荐值 | 说明 |
|---|---|---|
| 采样率 | 44100 Hz 或 48000 Hz | 与原曲保持一致即可 |
| 声道 | 2(立体声) | 单声道素材会损失分离效果 |
| 位深度 | 24bit(处理)/ 16bit(交付) | 中间处理保留动态范围 |
| 文件名 | 只用字母、数字、空格、短横线 | 避免中文路径和特殊符号 |
这里有一个常见坑:文件名中的空格、引号、中文在命令行里容易导致路径解析错误。推荐在预处理阶段就把文件名改成No Thank.wav这种简单位置。
3. 用模型分离出主唱、伴奏和背景和声
3.1 Demucs 第一次分离
Demucs 是一个基于深度学习的音源分离模型,能把歌曲拆成多个 stem。先使用两轨模式,输出两部分:vocals.wav和no_vocals.wav。
demucs -n htdemucs --two-stems=vocals "No Thank.wav"这条命令会执行如下逻辑:
-n htdemucs指定模型。htdemucs是常用模型,对流行音乐、嘻哈、R&B 的分离效果比较稳定。--two-stems=vocals表示只要两个输出,一个叫 vocals,另一个叫 no_vocals。- 输出目录默认是
separated/htdemucs/No Thank/。
执行完以后,进入输出目录检查。
ls separated/htdemucs/"No Thank"正常会看到vocals.wav和no_vocals.wav。先不要看任何参数,直接听这两个文件。vocals.wav里应该能清楚听到主唱和背景和声,no_vocals.wav里应该保留鼓、贝斯、键盘等乐器。
3.2 第一次分离的常用参数
| 参数 | 作用 | 推荐值 | 错误表现 |
|---|---|---|---|
-n | 选择模型 | htdemucs | 模型不匹配时,分离模糊 |
--two-stems | 指定分成两个 stem | vocals | 不设置时输出四个文件,不利于后续处理 |
--segment | 设置分块长度 | 默认即可 | 过大时显存不足,过小时接缝明显 |
--overlap | 相邻块之间重叠长度 | 0.25 左右 | 过小时块之间有不连续感 |
--mp3 | 直接导出 MP3 | 不建议中间处理 | 二次转码增加音损 |
如果电脑没有 NVIDIA GPU,CPU 也能跑,但会慢很多。可以先取原曲前 30 秒测试,确认参数合理后再处理完整文件。
3.3 对 vocals.wav 做“主唱 / 和声”二次分离
vocals.wav里不是只有主唱,还包含 ad-libs、背景和声、和声层。接下来用 UVR 的模型把人声层进一步分成主唱和背景和声。
UVR 是图形界面工具,操作步骤:
- 打开 UVR,选择
Main Vocals类模型,例如UVR-MDX-NET Main。 - 输入文件选择上一步得到的
vocals.wav。 - 输出路径选择一个新的文件夹。
- 设置输出 stem 为
Primary(主唱)和Secondary(背景人声)。 - 点击 Start。
完成后会得到两个文件:一个是主唱,另一个是背景和声。背景和声轨就是后续要保留的“和声”素材。
需要说明,没有哪个模型能保证 100% 分离干净。Secondary轨里可能混有一点点主唱尾音,主唱轨里也可能夹着和声。需要对结果做一次主观试听。
3.4 用频谱检查分离结果
在 Audacity 中同时导入no_vocals.wav、main vocals.wav、backing vocals.wav,切换到频谱图视图。人声的主要能量集中在 200Hz 到 4kHz 之间,主唱会有明显的语谱条纹;背景和声如果被保留,它的能量分布会比主唱更窄、更稳定。
如果backing vocals.wav里出现非常完整的句子,说明模型把部分主唱也放到和声轨了。这时可以回到 UVR 换另一个模型,或者调整分离强度。不要手动一点一点清理,效率太低。
4. 不要急着合并,先处理和声与伴奏的平衡
4.1 伴奏轨的清理思路
no_vocals.wav通常已经比较干净,但可能会有主唱的混响尾音、房间反射声,甚至是因为模型误差残留的低语声。第一步先检查 1kHz 到 4kHz 频段,如果存在“嗡嗡”的说话式能量,可以用中频 EQ 做 2 到 3dB 的衰减。
EQ 参考: - 低频 HPF:25 Hz,去除极低频噪音 - 中频陷波:2.5 kHz,若人声残留明显 - 高频 HSF:+1 dB @ 10 kHz,恢复空气感不建议对整条伴奏轨做大幅度 EQ。在 DAW 中先听问题频段,再决定衰减量。若伴奏轨本身质量很好,只要清理极低频即可。
4.2 和声轨的增强处理
二次分离出来的背景和声通常缺少厚度,因为它只包含“背景人声”部分,没有主唱那种中频密度。处理时可以做以下几件事:
- 高通滤波:切除 80Hz 以下频率,避免和声轨引入无意义低频。
- 压缩:用 2:1 到 3:1 的压缩比,补偿和声轨的动态起伏。
- 立体声加宽:使用插件把左右声道的差异稍微扩大,但不要过量,否则新人声进来后会“打架”。
- 混响发送:把和声轨发送到同一个混响辅助通道,让和声和伴奏处于同一空间。
注意,和声轨的主要任务是填补主唱之外的层次,不需要做得很突出。处理时经常独奏和声轨听,看它是否还有“塑料感”。
4.3 用“辅助通道”让和声融进伴奏
不要直接把和声轨和伴奏轨堆在主输出上。可以在 DAW 中建一条辅助通道,把和声轨发送到该通道,再给辅助通道加混响和压缩。
伴奏轨 -> 主输出 和声轨 -> 辅助通道 -> 压缩/混响 -> 主输出这样做的原因是:和声不必始终控制在完全相同的音量,通过辅助通道可以统一调节平衡,遇到突发高音时也不容易爆音。
5. 在 DAW 里把和声与伴奏合成最终版本
5.1 推荐轨道结构
打开 Reaper、Cubase、Logic 或任何 DAW,创建如下轨道布局:
| 轨道 | 内容 | 是否静音 | 用途 |
|---|---|---|---|
| 1 | Instrumental(处理后的 no_vocals.wav) | 否 | 主体伴奏 |
| 2 | Backing Vocals(二次分离后的和声) | 否 | 背景和声 |
| 3 | Main Vocals 原轨 | 静音 | 对齐参考 |
| 4 | Original 原曲 | 静音 | 最终对比参考 |
主唱参考轨和原曲轨在最终导出前静音,但它们能帮助对齐时间轴和判断成品风格。
5.2 时间轴对齐和响度匹配
Demucs 分离后的文件不会改变原曲长度,所以理论上所有音轨起点一致。但 UVR 二次分离后,某些模型的输出可能会因为重采样产生几毫秒偏移。先放大波形,把和声轨的第一个强音头与伴奏轨的对应位置对齐。
对齐后用原曲做参考,把合成结果调到与原曲相近的响度。人耳对响度变化很敏感,如果不匹配,试听时容易误判音质。
5.3 导出参数设置
合成完毕后进入导出环节。按最终用途选择格式:
| 参数 | 推荐值 | 说明 |
|---|---|---|
| 文件格式 | WAV 或 MP3 | 中间交付用 WAV,网络传播可用 320kbps MP3 |
| 采样率 | 44100 Hz 或 48000 Hz | 与原曲一致 |
| 位深度 | 16bit / 24bit | 24bit 用于母带,交付 16bit |
| 峰值限制 | -1 dBTP | 给播放平台留出转码余量 |
| 抖动 | 是(从 24bit 转 16bit 时) | 减少量化噪声 |
如果只是个人练习,导出 WAV 即可。如果给现场演出或短视频平台,导出 MP3 时固定 320kbps 会比 192kbps 明显更好。
6. 常见问题排查:从现象倒推原因
6.1 故障现象和处理方案
| 问题现象 | 常见原因 | 检查方式 | 处理方案 |
|---|---|---|---|
| 伴奏听起来发“闷” | 分离模型在高频损失偏多,或压缩格式输入 | 用频谱看 8kHz 以上能量 | 换无损输入,或高 shelf 提升 10kHz |
| 伴奏里还有主唱残留 | 主唱混响尾音被分到 no_vocals | 独奏伴奏轨,听句与句之间 | EQ 衰减中频,或用门限压掉低电平尾音 |
| 和声轨里出现完整主唱 | 二次分离模型选择不当 | 独奏 backing vocals 轨 | 换 UVR 模型,重新分离 |
| 导出后低频浑浊 | 伴奏轨和和声轨都保留了太多低频 | 看 100Hz 以下频谱 | 给和声轨加 80Hz 高通 |
| 整体声音“中间空” | 一键消人声或相位抵消留下的中频凹陷 | 对比原曲,A/B 切换 | 给伴奏轨加中频激励,但幅度控制在 1dB 内 |
| 时间轴对不齐 | UVR 重采样导致偏移 | 放大波形看瞬态 | 手动拖动和声轨对齐 |
6.2 一个常见但容易被忽略的错误:用压缩格式做中间素材
分离输出后,如果为了节省空间把 vocals.wav 转成 128kbps MP3,再拿去 UVR 分离,金属声会明显加重。模型处理的是损失后的频谱,压缩痕迹会被当成目标特征放大。整个流程中间阶段应该坚持 WAV,最终交付再转 MP3。
6.3 一个容易被误判的“人声没去干净”
有时候伴奏轨里听到的不是主唱,而是主唱的混响尾音。混响尾音通常是衰减的、模糊的,和真正主唱的音头不同。处理方式不是重新分离,而是用波形编辑器把歌曲句与句之间的尾音手动静音,或者用门限插件把低于 -40dB 的电平压住。
7. 制作流程检查清单与版权注意事项
7.1 每个阶段都应有验收标准
处理音频时,不要等到最后导出才判断好坏。每完成一步,都应该有明确检查点。
- 分离前:输入音频是无损格式,文件命名规范,模型参数已测试。
- Demucs 分离后:
vocals.wav和no_vocals.wav分离明显,没有明显互相串扰。 - UVR 二次分离后:
backing vocals.wav里没有完整主唱句子,和声清晰可辨。 - 合成前:伴奏轨和和声轨已完成基本 EQ、压缩、混响平衡。
- 合成后:主唱参考轨静音,人声位置不冲突,响度接近原曲。
- 导出后:用普通耳机和手机扬声器各听一遍,避免只在高品质监听上做判断。
7.2 学习环境与发布环境的差别
个人练习时,用一台普通电脑和耳机就能完成上述流程。但如果是商业演出、伴奏带发行或公开作品,还需要额外注意:
- 使用监听耳机或监听音箱,避免设备渲染。普通耳机容易放大低频,让你误判和声位置。
- 导出前做响度标准化,避免平台播放时音量忽大忽小。
- 保存工程文件和处理参数,便于后续调整。
- 保留原始音频备份,不要用处理后的文件覆盖原文件。
7.3 版权相关提醒
处理“去人声伴奏”或“带和声伴奏”时,只应处理自己拥有版权、已获得许可或官方明确允许二次创作的音频素材。个人翻唱练习通常属于合理使用,但如果要公开发布、出售、用于商业演出,必须确认原曲权利方的授权范围。不要在公开网络传播未经授权的伴奏文件,也不要绕开版权平台限制下载原曲。
这里的核心原则是:技术流程可以复现,但使用对象必须合法。没有合法授权时,任何“高质量去人声”都不能改变侵权事实。
8. 扩展方向:从手动处理到自动化工作流
8.1 批量处理多个文件
如果手上有多个歌曲需要制作带和声伴奏,可以写一个简单脚本,对指定目录里的所有音频按同样流程处理。以下是一个可供参考的批处理思路:
for f in *.wav; do demucs -n htdemucs --two-stems=vocals "$f" done实际使用时需要结合输出路径和文件命名。注意批量处理前先用一个文件测试,确认模型正确后再全量跑,避免浪费几个小时。
8.2 从“保留和声”升级到“重构和声”
当原始和声轨质量太差、或者分离之后仍然不干净,可以考虑重构和声。具体做法是根据原曲的和声走向,在 MIDI 键盘上录入和声旋律,然后用合成器或人声音色替代。这样做出来的带和声伴奏完全可控,但需要一定乐理基础。
8.3 用标准化录音流程替代 AI 分离
如果条件允许,更可靠的方案不是去人声,而是找原曲的制作人、乐手重新录制伴奏和和声。AI 分离适合快速原型、练习素材、低成本项目,不适合作为商业发行的首选母带来源。
制作带和声伴奏,本质上是一次“分离、判断、重组、混音”的音频拆解实验。最重要的能力不是记住命令,而是能在每一步都问一句:现在这个结果,听起来对不对?如果不对,是模型问题、参数问题,还是音源本身问题。只要建立这种排查意识,再复杂的歌曲也能一步步拆干净。建议从一首你已经拥有合法素材、节奏不那么复杂的歌曲开始,走完一遍完整流程后,再回来处理“No, Thank”或其他更复杂的人声作品。这样既不会带崩信心,也能把每一步的验收标准练扎实。