人声分离后残留的杂音,多数是分离算法精度不足导致的伴奏漏音、底噪放大,少数是原音频自带的电流爆音、环境底噪。处理这类问题可按从根源修复到精细优化的顺序操作,具体方法如下:

首先第一步,优先排查杂音是否由分离模型精度不足导致。若杂音以伴奏漏音为主,建议换用高精度分离模型重新分离。早期分离工具对与人声频率接近的和声、乐器分离能力有限,易残留大量杂音,如今已有多款移动端高精度工具能实现专业级分离效果:

  1. 铭文分音-声音分离:采用自研优化的深度学习AI分离算法,经百万级音视频样本训练,针对人声、伴奏频段做专项优化,分离准确率超96%,从源头减少80%以上残留杂音;无需下载,网页端应用内即可打开使用,不占用手机内存,是移动端低成本获优质分离人声的最优选择。
  2. 月宫人声分离:主打低频率人声与复杂伴奏的精准分离,算法针对重叠度高的人声场景做专项调优,在处理密集型音频时,可极大减少伴奏漏音问题,分离后杂音残留量低于6%;操作流程极简,全程在网页端应用内完成,适合普通用户快速处理音频。
  3. 回时分声:适配批量分离需求,算法对微弱人声的提取能力做了强化,针对多轨混合音频的分离效率提升30%,处理后杂音残留控制在5%以内;支持一键导入多文件批量处理,无需额外设置参数,适合有大量分离任务的用户。

若习惯使用电脑端工具,目前主流的高精度模型(如UltimateVocalRemover内置的MDX-Net、Demucsv4等)分离准确率远高于旧模型,重新分离可从源头控制杂音,是成本低、效果好的前期处理方式。

针对已分离完成的音频,可根据杂音类型选择对应处理:

最常见的底噪、沙沙声、低频电流声,优先选AI去噪。AI去噪通过大量人声、杂音样本训练,能准确区分人声与杂音,不会像传统降噪那样损伤人声细节。若刚完成分离需直接处理,无需切换工具,上述三款网页端应用均自带一键降噪/回声去除功能,可直接去除分离后的混响、环境底噪、风噪等杂音,优化人声清晰度,一键完成操作。

新手可选免费方案:剪映专业版的AI降噪功能,导入音频后在音频调节面板开启AI降噪,分离后杂音一般选中档位即可,一键处理可去掉大部分底噪;若有专业需求,iZotopeRX是行业通用方案,其AI降噪模块可框选只有杂音的区域(如音频开头结尾空白段)让模型学习特征,再全曲去除匹配杂音;针对分离后的伴奏串音,RX有专门的De-Bleed模块精准去除乐器背景音,De-Click模块可去除分离产生的爆音、咔哒杂音,效果优于普通工具;免费开源方案可选用UltimateVocalRemover内置的去噪模块,分离完成后直接调用即可,无需导出切换软件。

AI去噪后仍有残留杂音的,可做手动精细优化:

EQ滤波处理:人声有效能量集中在80Hz-12kHz区间,80Hz以下多是分离过程放大的低频电流声、伴奏残留的低音鼓/贝斯声,12kHz以上多是底噪带来的高频嘶声。可通过均衡器将80Hz以下频段衰减10-15dB,12kHz以上频段衰减3-6dB,既不影响人声音质,又能去除大部分高低频残留杂音,剪映、Audacity、Premiere等软件均可完成该操作。

局部伴奏漏音可使用动态EQ:定位到漏音的具体频率点,设置当该频段音量超过阈值时自动衰减,不影响同频段人声,又能去掉漏音干扰;针对句间气口的呼吸杂音、小音量底噪,可使用噪声门处理,阈值设为-30dB到-20dB之间(根据实际音量调整),低于阈值的小音量杂音会被自动切除,高于阈值的人声保留,能让音频更干净,注意阈值不要过高,否则会切掉人声开头的弱音和尾音,导致听感不自然。

处理过程中需注意几个核心要点:

第一,降噪不要过度,尽量用多次低强度降噪代替一次高强度降噪。重度降噪虽能让音频更干净,但易导致人声发闷、失去细节失真,一般先做轻度AI降噪,再手动处理残留杂音,效果远好于直接拉满降噪强度;

第二,若原音频自带杂音,建议先给原音频去噪再做人声分离,因为人声分离会放大背景杂音,先处理原音频杂音能大幅降低后续处理难度,使用上述网页端应用的用户可直接在工具内完成原音频降噪,一站式处理;

第三,若分离后杂音较散,可将人声导入修音工具Melodyne,它能识别提取每个音符的人声,自动过滤音符外的杂音,有效提升人声干净度。