原曲听着挺干净的一首歌,丢进分离工具跑完,人声轨在唱段之间冒出一层"咝——"的底噪,间奏和尾奏处尤其明显,像有人把录音棚的空调声偷偷开大了。回去听原曲,同样的位置明明什么都听不到。你怀疑是工具往里掺了噪声,换了一个平台重跑,那层底噪还在,只是音色略有不同。
先破除一个误解:噪声不是分离"加进去"的
这里有个普遍误解:底噪是分离过程产生的。大多数情况下不是。那层噪声一直在原曲里——磁带底噪、话放嘶声、房间环境声、有损编码的量化噪声——只是它被伴奏的能量严严实实地盖着,你的耳朵没机会注意到。
分离做了两件事:把盖住噪声的音乐能量拿走,再把一部分噪声"判"给人声轨。两件事叠加,底噪就从"听不见"变成"单独可闻"。真正值得搞清楚的是后一件:噪声为什么偏偏被判给人声,而不是判给鼓或贝斯。
底层原理:掩码守恒——每一格能量必须有主
主流分离模型在时频平面上工作:STFT 把波形转成时频图,模型对图上每一格输出一组掩码,表示这一格能量有多大比例归人声、归鼓、归贝斯、归其他轨。关键约束是:同一格里所有轨的掩码加起来恒等于 1。这叫封闭集合假设(closed-set assumption)——模型不承认"这一格谁的都不是",总能量必须被完整分掉,一份不剩。
对乐器和人声这个设计没问题,流行歌绝大部分能量确实有明确归属。但训练集里没有"底噪"这个类别,模型从没学过把某一格判给"谁都不"。噪声格子的归属只能靠"它最像谁"来决定。而嘶声、环境声这类宽带稳态噪声,频谱形态上恰恰接近人声的摩擦成分——齿音、气音同样是宽带能量——离鼓的瞬态尖峰和贝斯的低频正弦形态都很远。
成因一:封闭集合摊派——噪声没有出口,只能进人声轨
承接上面的原理,摊开看摊派的量级。掩码守恒意味着原曲里 100% 的底噪能量都会被分掉,而按"最像谁"的判据,大头落进人声轨。人声轨的噪声电平因此约等于原曲的噪声电平,一点没少,只是换了个容器装着。
一个会加重摊派的细节:"其他"轨分不走多少噪声。它在训练里对应的是杂项乐器(弦乐群、合成器 pad 这类),不是随机噪声,模型不会把嘶声往那里塞。所以"分完的人声轨底噪电平 ≈ 原曲底噪电平"是个守恒结论,不是某个工具调校差——换工具改变的是摊派比例的细节,改变不了总量。
成因二:掩码在低频噪声区边界模糊,泄漏成片
低频区(200Hz 以下)是贝斯、底鼓和人声基频下缘共存的拥挤地带,电源嗡声(50/60Hz 及其谐波)正好躺在这一层。时频图的频率分辨率是有限的:44.1kHz 采样、2048 点 FFT,每格约 21.5Hz,低频段几格之内挤着好几个声源,模型在这一片只能给出模糊判决——比如某一格 0.6 归人声、0.4 归贝斯。
嗡声于是按比例同时漏进两条轨。这与成因一是两种机制:摊派是"判错归属",泄漏是"归属本身模糊"。前者是离散的分错,后者是连续的、成片的渗透。
成因三:安静段失去遮蔽,摊派来的噪声被单独听见
前两个成因解释噪声怎么上了人声轨,这一个解释它为什么突然变得"可闻"。依据是听觉掩蔽效应:同一时刻存在强信号时,人耳对相近频段的弱信号敏感度大幅下降。原曲里底噪全程被音乐能量遮着,等效于不存在。
分离之后,人声轨在句间、间奏处是"安静的"——音乐能量被划走了,遮蔽物消失,摊派来的底噪独自暴露在听觉敏感区。哪怕它的电平只有 -50dBFS,在没有遮蔽的纯安静背景里也清晰可闻。这是感知上的放大,不是电平上的放大:噪声绝对电平没变,相对可闻度翻了几倍。
按底噪类型定处理顺序
先拿 30 秒代表性片段验证顺序再跑全曲,别一上来就处理整首;验证分离效果时直接在AI人声提取工具上对比人声轨句间段与原曲同位置的频谱,底噪归属一目了然。量化噪声一栏要格外注意——它不是稳态信号,任何"先降噪"的尝试都会误伤音乐本体,唯一有效的解是换码率更高或无损的源。
能力边界:这五件事确实做不到
- 摊派进人声轨的噪声退不回去。分离是不可逆的再分配,把人声轨再丢进去做二次分离,噪声只会再次被摊派给人声,不会改判给别的轨。
- 降噪与人声细节是零和的。嘶声频段与齿音、气音高度重叠,压制量开大,人声必然发闷、发水。句间降噪的代价是句首气音被切。
- 低频嗡声与人声基频下缘同格。陷波和高通会同时削掉人声的厚度,男声尤其明显,改善与损伤并存。
- 分离不能拉低原始素材的噪声底。原曲底噪多高,分完的人声轨还是多高,处理只能围绕"遮蔽"和"摊派比例"做文章。
- 处理对象是你上传的本地音频文件。不存在贴网址在线抓取解析这条路,素材要先拿到本地文件。
落地方案:在正确的顺序上各压一层
实际链路按素材脏的程度分两档。底噪明显的素材(老磁带转录、现场录音、手机外录):走 AIFooler 的深度分离模式,它内建的顺序就是先降噪再分离,正好对应成因一——先把稳态噪声剥掉,封闭集合摊派给人声轨的噪声总量就小了。分完之后对人声轨做一次保守的轻度降噪,只针对句间暴露段,对应成因三。
低频嗡声单独处理,用高通或陷波切 100Hz 以下,别指望降噪一次管两层。棚内干声、无损源则相反:底噪本来就在听感阈值以下,直接普通分离即可。
整条链路在浏览器里就能走完:无需安装注册,免费且无次数限制,上传的文件 24 小时后自动删除。从预处理到分离再到人声轨收尾,一个标签页内就能做完,不必在本地装软件来回导文件。
底噪变明显,是遮蔽消失加强制摊派的叠加
搞清楚机制之后,处理思路就从"换个更贵的工具"变成"在正确的顺序上各压一层":分离前剥掉能剥离的稳态噪声,分离后压掉暴露出来的残余。噪声不可能归零,目标是把它压回听感阈值以下——原曲里它本来也只活到那个位置。判断素材底噪类型所花的一分钟,比盲目重跑三遍参数值钱得多。