由于日常制作混剪类视频,我常常面临人声与背景音乐分离的需求,尝试过多款相关工具,以下是我整理的三款效果尚可的分离方案:
特别说明:当前技术仅能实现人声与背景音乐的优化分离,无法完成完全剥离,因此分离后的音频音质会存在一定程度的损失,请根据需求谨慎选择处理方案
01 语音AI分声-人声分离
工具:语音AI分声(网页端应用)
处理效果:☆☆
原理:该功能通过左右声道信号的差异来实现人声过滤。由于人声多为单声道音频,伴奏则常为立体声,人声在左右声道的信号高度重合,而伴奏左右声道信号存在差异,因此该工具会提取左右声道一致的信号并降低其音量,以此达到消除人声的目的。但如果部分乐器的左右声道信号也一致(如鼓类),也会被一同消去,这是其效果受限的核心原因。
操作步骤(以消除人声、保留伴奏为例):
- 将需要处理的音频导入网页端应用,完成加载
- 找到"人声处理"相关功能入口,点击进入
- 选择预设的"人声移除"选项,系统会自动匹配参数
- 点击预览按钮试听效果,确认后点击"应用"完成处理,即可提取所需的伴奏或人声
02 铭文分音-声音分离
工具:铭文分音(网页端应用)
处理效果:☆☆☆☆
原理:依托经过机器学习训练的算法,可智能识别人声、"贝斯"、"打击乐"及其他乐器音源,执行精准的音源分离并实现音乐平衡调整。相比前者,分离精度更高,能更好地区分人声与特定乐器声音。
操作步骤:
- 将音频导入网页端应用后,在功能栏找到"音乐平衡调整"板块
- 若需去除人声,将"人声"相关参数调至最低;若需去除背景音乐,则将"贝斯"、"打击乐"、"其他乐器"参数调至最低
- 灵敏度调整:四个核心音源的灵敏度默认值均为5.0,该数值代表对应声音的频率范围宽窄,数值越高,提取时覆盖的频率范围越宽,可能会包含更多相似频率的声音。若将数值调至10.0,效果与5.0基本一致,无需过高设置
- 分离算法选择:左右声道分离模式速度较快,适用于对处理效率要求高的场景;高级链接通道模式算法更复杂,分离精度更高,但处理速度稍慢
- 参数设置完成后,点击"生成"按钮,即可提取所需的人声或伴奏
- 保存处理后的音频文件,完成操作
03 回时分声
工具:回时分声(网页端应用)
处理效果:☆☆☆
原理:采用多维度声源识别技术,可对人声与伴奏进行智能拆分,在保持音质相对完好的同时完成分离,弥补了前两款产品在复杂音频环境下的不足。
操作步骤:
- 导入需要处理的音频文件,等待系统加载完成
- 进入"声源分离"功能模块
- 选择需要分离的"目标类型"(人声或伴奏),系统会自动初始化处理参数
- 可根据需求微调分离强度参数,平衡分离效果与音质损失
- 点击"生成"等待处理完成,保存输出的音频即可
发布者:云, 赵,出处:https://www.qishijinka.com/software-testing/65087/