Audacity
打开立体声文件,全选轨道,然后 Effect → Vocal Reduction and Isolation,Action 选 Remove Vocals,导出。Audacity 3.2 把 Effect 菜单改成了子菜单,所以新版本要到 Effect → Special 里找;2.x 就直接在 Effect 菜单下。
步骤就这么多。这一页剩下的部分要讲的是没人提的那一半:这个效果实际上在做什么,以及为什么它还给你的伴奏听起来是空的。
方法一:内置效果
- 导入立体声文件。File → Import → Audio,或者直接拖进窗口。必须是立体声——单声道的情况见下文。
- 全选。
Ctrl+A(macOS 是Cmd+A)。 - 打开效果。Vocal Reduction and Isolation,在 Effect 菜单里—— 3.2 及以后在 Special 子菜单内,2.x 直接在菜单里。
- Action 选 “Remove Vocals”。同一个对话框也能反过来只留人声,那是个很好的办法:听清楚它到底减掉了什么。
- 第一遍 Strength 就留在 1.0。调高会减掉更多人声,也减掉更多其他东西。
- Low Cut for Vocals 设到 120 Hz 左右。这个频率以下不动。就是这一个控件保住了贝斯。
- High Cut for Vocals 设到 9 kHz 左右。以上不动,镲片和空气感得以保留。
- 先预听,再应用。导出用 File → Export Audio。
两个切频控件才是关键
大多数教程叫你直接拉默认值点确定。Low Cut 和 High Cut 定义的是“允许效果在哪个频带内做抵消”。把这个频带收紧到大致只包住人声的范围,是“能用的伴奏”和“干巴巴的、带相位感的一团东西”之间的差别。
处理前 —— 原始立体声母带
处理后 —— Vocal Reduction and Isolation,Remove Vocals
同一个文件、同一个窗口、同样的缩放和同样的幅度刻度——只多了一道效果。峰包络降了大约 40%。波形图告诉不了你走的是什么,只能告诉你走了很多; 但形状是线索——持续的主体没了,孤立的瞬态还站着。那些尖刺就是鼓在它居中、持续的部分被减掉之后剩下的。 下一节讲的就是:为什么那次减法里被减掉的不只有人声。
方法二:手动版,看得见原理
那个效果就是四步手工操作的封装。亲手做一遍,它的局限就一目了然了。
- 拆分立体声轨道。Tracks → Mix → Split Stereo Track。现在你有两条独立的单声道轨道。
- 把其中一条反相。选下面那条(右声道),应用 Invert,同样在 Effect 菜单里。
- 两条都摇到中间。把每条轨道的声像推子拉到正中。
- 播放。两个声道里完全相同的东西,现在相加为零。
- 渲染。Tracks → Mix → Mix and Render。
没有频带护栏,没有强度控件——就是硬减。你听到的是这个效果的原形,而且通常比方法一更难听——这正是重点。
为什么伴奏会丢掉低频
相位抵消减掉的是两个声道里完全相同的部分。它不知道什么叫人声。在常规混音里,正坐中间的不只有主唱:
| 声部 | 典型位置 | 能活下来吗? |
|---|---|---|
| 主唱 | 中央 | 不能 —— 它就是目标 |
| 底鼓 | 中央 | 不能 |
| 贝斯 | 中央,而且 120 Hz 以下往往是有意做成单声道的 | 不能 |
| 军鼓 | 中央 | 不能 |
| 吉他、键盘、和声 | 摇得很开 | 能 |
| 立体声混响尾 | 定义上就是开的 | 能 —— 包括人声自己那条 |
相位抵消瞄准的是位置,不是乐器。阴影列是立体声声场的中央; 两条虚线是唯一能收窄它的两个控件。所有紫色的部分都会被减掉。 注意主唱的最低那一截落在 Low Cut 以下,和贝斯、底鼓挤在一起——正是这段重叠, 使得把 Low Cut 提到 120 Hz 能保住低频,但也会留下一些人声的中低频。 方法二完全没有护栏,所以整条中央列都会走。
所以“把中央减掉”,减掉的是节奏与低频的骨架,人声只是其中一项。贝斯在大约 120 Hz 以下经常被刻意并成单声道,为的是在黑胶和夜店系统上播放稳定——这让它成了最稳定的牺牲品。Low Cut 守的就是这一段。
问题的另一半是混响。干的人声被抵消了,它的立体声尾巴没有。结果是一种一听就能辨认的瑕疵:一层幽灵般的人声混响,底下却没有人声,飘在伴奏上面。
什么情况下根本做不成
文件是单声道
没有可以相减的对象。Audacity 给单声道轨道画一条波形通道,给立体声画两条——这是动手之前最快的检查方式。
人声不在正中
有些制作会把主唱稍微偏离中央,或者硬摇成左右双轨。这时抵消基本留着人声不动,却悄悄把鼓删了。
人声上带立体声宽度或混响
任何让人声的左右两版产生差异的东西,都会让抵消变成不彻底。一个立体声混响、或者一次双轨叠录就足够了,而这两样在现代主唱处理上都是标配——所以下面那个 30 秒判断法,比任何参数都重要。
源文件是低码率有损格式
低码率下的联合立体声编码会改变两声道之间的关系,改到两边不再能干净地相消。从你手上质量最高的那个文件开始。
动手之前的 30 秒判断法
把原理本身当成诊断工具。做方法二的第 1 到 4 步——拆分、反相一侧、两条都摇到中间、按播放——然后听:
- 人声干净地消失了。这首歌可以用抵消做。回去用方法一正经做一遍,把贝斯保住。
- 你听到一层带混响的人声幽灵。做不成。干声被抵消了,湿的尾巴没有,没有任何参数能解决。
- 人声还清清楚楚在那儿。它不在中央。抵消是错的工具。
- 几乎所有东西都没了。这个文件实际上是单声道。
三十秒的试听,省掉一小时在 Strength 上的来回。
抵消不够用的时候该用什么
这个局限是结构性的,不是参数问题。相位抵消是减法:它只能去掉两个声道共有的东西,所以它永远无法分离一个它在几何上定位不到的人声。
AI 源分离的工作方式完全不同。一个在大量音乐上训练过的模型,学会了人声听起来是什么样,然后独立地重建每一条分轨。因为它是“识别”而不是“相减”,所以它能处理单声道文件、偏离中央的人声、和大量混响——恰好就是 Audacity 放弃的那些情况。代价是算力,而不是一个菜单项。
audiofilter.net浏览器里跑完,文件不上传,不用注册 —— 拿刚才那个文件直接试
同一个文件,过一遍分离模型
三个面板,一个文件。把最下面那条和前面 Audacity 的结果比一比: 这里的伴奏保住了被抵消版丢掉的密度,因为它不是减出来的——模型是把每一部分重建了出来。 中间那条人声,是抵消永远交不出来的另一半。
同样三条分轨,画成频谱图
这才是回答全篇一直在绕的那个问题的视图:能量到哪儿去了?波形图告诉不了你——人声和伴奏的包络很相似。这里人声是一把梳齿状的谐波, 歌手换气的地方是黑的空隙;而伴奏就是同一张图,把那把梳子取掉,其余一切都没动。 三个面板共用一套以原始混音为基准的分贝刻度,所以一处暗、另一处亮,看起来是什么意思就是什么意思。
拿刚才那个测过的文件试试
audiofilter.net 的 AI 人声消除在浏览器标签页内运行一个分离模型,交还给你一条分离出的人声和一条可以直接当伴奏用的音轨。不用注册,也不上传任何东西——处理发生在你自己的机器上,文件从不离开它。你可以自己打开网络面板看。
单曲上限两分钟,这是“在浏览器标签页里干活”的限制,不是付费墙。整首歌的话,先在 Audacity 里选中你要的那一段,用 File → Export Audio 只导出这一段,再拿去处理。