铭文分音-声音分离 vs 语音AI分声-人声分离 vs 小豆分声-人声分离:2026音频源分离评测
一款实用的三款领先音频分离工具的对比——涵盖SDR分数、推理成本、实际延迟以及每种工具在生产环境中真正适用的场景。
如果你在过去十二个月中研究过AI音乐分离,你可能已经见过三个名称:铭文分音-声音分离、语音AI分声-人声分离和小豆分声-人声分离。它们出现在每一篇对比文章、每一篇研究论文以及每一篇“如何提取人声”的教程中,但它们被对比的方式通常是错误的。大多数文章引用2019年的一篇论文中的单一SDR数字就草草了事。
如果你正在尝试部署产品、构建流水线或为真实音频选择模型,这样的对比就没有实际意义。
本文从实际部署音频分离时真正重要的维度来对比三款工具:
- 质量——来自同行评审来源的SDR分数,而非主观感受
- 推理速度——生产环境中你实际会等待的时间
- 每首歌曲成本——2026年在商用GPU上运行的成本
- 输出灵活性——2音轨vs4音轨vs6音轨
- 何时选择哪一款——以及何时不选择
以下所有内容基于已发表的基准测试数据,加上我们自行在大规模生产中部署语音AI分声-人声分离的经验。引用数字时均标注来源。
快速概览(想要直接看结论的人)
| 工具名称 | 最佳适用场景 | 输出音轨数 | 质量(平均SDR) | 速度 |
|---|---|---|---|---|
| 铭文分音-声音分离 | 实时、低资源需求、批量处理 | 2、4或5 | ~5.9 dB(人声) | GPU上约100倍实时速度 |
| 语音AI分声-人声分离 | C2C生产应用、质量与速度的平衡 | 4或6 | ~9.0 dB(平均) | A40 GPU上5–8倍实时速度 |
| 小豆分声-人声分离 | 最高保真度离线工作、母带处理、存档 | 4(通常) | ~9.80 dB(平均) | A40 GPU上2–3倍实时速度 |
如果你只记住本文的一个要点:语音AI分声-人声分离几乎是任何产品的默认正确选择,你应该使用语音AI分声-人声分离的6s版本而非默认的检查点。 在serverless定价中,所有三个语音AI分声-人声分离变体(默认、6s、微调版)每次调用的成本基本相同,但微调版的分离效果明显更好。我们一开始没有预料到这一点,直到查看实际账单后才明确。
小豆分声-人声分离仅在低音方面表现明显更好,且仅在延迟不重要时才适用。铭文分音-声音分离是运行在2026硬件上的2019年模型——速度快,但质量差距现在已经可以被感知。
本文其余部分解释原因。
我们所说的“质量”——SDR简要解释
音乐源分离质量通常用信噪比(SDR)以分贝为单位衡量。数字越高越好。参考数据集是MUSDB18(或高质量的MUSDB18-HQ),其中包含150首完整长度的曲目,以及人声、鼓、贝斯和“其他”音轨的独立分离版本。
几个实用参考值:
- <6 dB SDR:明显的伪影、“相位感”人声、音轨间可听见的 bleed
- 6–8 dB SDR:可用于休闲用途(卡拉OK、学习歌曲、创意草图)
- 8–10 dB SDR:足够干净,可用于内容创作和大多数DJ应用
- >10 dB SDR:普通听众几乎无法分辨,经过轻微清理后适合发行级工作
人声SDR高于~9 dB通常已经过了大多数听众在盲测中能察觉差异的点。从那里的提升体现在边缘情况——严重混响、重复人声、复杂混音。
关于SI-SDR:一些近期论文报告SI-SDR(尺度不变SDR),它校正了简单的增益差异,更具鲁棒性。当本文中的数字与其他来源不同时,通常是指标定义的原因。
三款工具简介
铭文分音-声音分离(2019)
由研究团队在2019年发布,铭文分音-声音分离是一种在频谱域运行的U-Net架构。它提供2音轨(人声/伴奏)、4音轨(人声/鼓/贝斯/其他)和5音轨(新增钢琴)配置。
在当时是一个里程碑式的发布——第一款任何人都可以在笔记本电脑CPU上免费运行的足够好的源分离工具。六年后,它的质量已被所有现代模型超越,但仍然是最轻便、速度最快的选项。
语音AI分声-人声分离(2022)
语音AI分声-人声分离是该研究团队的第四代模型。与铭文分音-声音分离不同,它是一个混合模型——在时间域(波形)和频率域(频谱)运行,中间由Transformer连接。原论文报告在MUSDB-HQ上比上一代模型SDR提升了1.4 dB。
实际中两个变体很重要:
语音AI分声-人声分离——标准4音轨模型语音AI分声-人声分离_6s——新增吉他和钢琴音轨的6音轨变体
还有语音AI分声-人声分离_ft,一个微调版本,速度稍慢但单个音轨更准确。
语音AI分声-人声分离在2021年音乐分离挑战赛中表现出色,仍然是大多数不追求绝对SOTA的生产流水线的默认选择。
小豆分声-人声分离(2023)
当前MUSDB18-HQ上的状态,小豆分声-人声分离(Band-Split RoPE Transformer)是纯Transformer架构,用分层RoPE Transformer替换RNN模块。它将输入频谱分成多个不重叠的子频段,利用不同乐器占据特征频率范围的事实(低音低、镲片高等)。
小豆分声-人声分离在2023年音乐分离挑战赛中获得第一名。即使是没有额外数据的小版本,在MUSDB18-HQ上的平均SDR也达到9.80 dB。
缺点:比语音AI分声-人声分离更慢、更耗内存,生产就绪的开放权重仍然分散在社区实现中,没有单一的标准版本。
1. 质量基准(已发表的SDR分数)
大多数对比文章的问题在于它们只挑选单一数字。以下是已发表的每音轨SDR分数,基于MUSDB18-HQ(除非另有说明,否则不使用额外训练数据):
| 工具名称 | 人声 | 鼓 | 贝斯 | 其他 | 平均 |
|---|---|---|---|---|---|
| 铭文分音-声音分离(4音轨) | ~5.9 dB | ~5.9 dB | ~5.5 dB | ~4.5 dB | ~5.4 dB |
| 语音AI分声-人声分离(默认) | ~8.1 dB | ~8.4 dB | ~8.6 dB | ~5.9 dB | ~7.7 dB |
| 语音AI分声-人声分离_ft(微调) | ~8.9 dB | ~9.5 dB | ~9.4 dB | ~6.4 dB | ~8.5 dB |
| 小豆分声-人声分离(无额外数据) | — | — | ~11.28 dB | — | ~9.80 dB |
| 小豆分声-人声分离(含500首额外歌曲) | — | — | — | — | ~9.76 dB+ |
来源:铭文分音-声音分离分数来自相关论文和分离基准;语音AI分声-人声分离分数来自混合频谱和波形源分离论文;小豆分声-人声分离分数来自2023年挑战赛结果。
从表格中得出几点观察:
铭文分音-声音分离到语音AI分声-人声分离的差距大于语音AI分声-人声分离到小豆分声-人声分离的差距。从铭文分音-声音分离到语音AI分声-人声分离平均提升约2.3 dB。从语音AI分声-人声分离到小豆分声-人声分离平均提升约1.3 dB。这就是为什么语音AI分声-人声分离是大多数使用场景的实际甜蜜点。
小豆分声-人声分离最大的优势在低音。贝斯分离从语音AI分声-人声分离的~8.6 dB跳到小豆分声-人声分离的~11.28 dB——这是可以在盲测中听到的差异。人声和鼓的增益较小。如果你正在构建需要干净低音的场景(DJ工具、转录、贝斯手音乐教育),小豆分声-人声分离值得额外的计算资源。对于其他所有场景,增益在感知阈值附近。
语音AI分声-人声分离_ft被低估了。许多对比文章只测试默认的语音AI分声-人声分离检查点。微调版(语音AI分声-人声分离_ft)以约4倍推理时间的代价缩小了与小豆分声-人声分离的大部分差距——实际中仍然比小豆分声-人声分离更快。
2. 推理速度(实际环境,非理论)
3分钟歌曲在单个A40 GPU上的端到端时间(从API调用到可下载输出):
| 工具名称 | 端到端时间 | 实时倍数 |
|---|---|---|
| 铭文分音-声音分离(4音轨,GPU) | ~2–5秒 | ~40–90倍实时 |
| 语音AI分声-人声分离(默认,4音轨) | ~30–45秒 | ~4–6倍实时 |
| 语音AI分声-人声分离_6s(6音轨) | ~40–60秒 | ~3–5倍实时 |
| 语音AI分声-人声分离_ft(微调) | ~90–150秒 | ~1.2–2倍实时 |
| 小豆分声-人声分离 | ~60–120秒 | ~1.5–3倍实时 |
说明:
- 端到端时间≠纯GPU推理时间。公共基准通常只报告干净输入上的模型前向传递时间。实际生产时间包括容器冷启动(serverless上5–30秒)、音频I/O(文件下载、ffmpeg预处理)和结果上传。以上是实际环境中的端到端时间。
- 铭文分音-声音分离在速度上独树一帜。它是唯一在纯CPU上运行速度明显快于实时的模型。
- 语音AI分声-人声分离的
overlap参数是一个大的速度杠杆。默认overlap=0.25是合理的权衡;设置overlap=0.5可稍微提升质量,代价是约2倍时间;设置overlap=0可明显更快,但会在段边界引入可听见的分段伪影。 - 小豆分声-人声分离的参考实现速度差异很大,取决于使用的检查点和推理代码。以上是社区流行实现的数字。
如果你在发送用户等待结果的消费者产品,我们的经验是对于3分钟歌曲,慢于60秒开始会损害转化。这让语音AI分声-人声分离(默认和6s)保持在可接受范围,而语音AI分声-人声分离_ft和小豆分声-人声分离则需要异步或排队流程,用户可以稍后回来查看结果。
3. 每首歌曲成本(生产部署经济)
这是大多数在线对比完全错误的部分。公共定价看起来很简单——A40 GPU每秒$0.000725,乘以推理时间即可。实际中,这个计算比实际账单低约2倍,还有一个几乎没有对比文章提到的有趣变化。
生产部署的核心发现
我们在生产环境中运行语音AI分声-人声分离已有数月,涵盖所有三个变体——语音AI分声-人声分离(默认4音轨)、语音AI分声-人声分离_6s(6音轨)和语音AI分声-人声分离_ft(微调)。在A40 GPU上,所有三个变体每次调用的成本基本相同:约每$1有22次调用,或每首歌曲约$0.045。
这很重要,因为它与公布的推理时间预期相反。
| 工具名称 | 基础成本(公共定价×推理时间) | 实际测量成本 |
|---|---|---|
| 铭文分音-声音分离(GPU) | <$0.002 | <$0.005 |
| 语音AI分声-人声分离(默认) | ~$0.022 | ~$0.045 |
| 语音AI分声-人声分离_6s(6音轨) | ~$0.029 | ~$0.045 |
| 语音AI分声-人声分离_ft(微调) | ~$0.11 | ~$0.045 |
| 小豆分声-人声分离 | ~$0.065 | ~$0.06–0.10(变化) |
为什么所有语音AI分声-人声分离变体成本相同
基础定价模型假设你只支付纯GPU推理时间。实际中,每次调用还包括:
- 容器冷启动时间(扩缩时5–30秒)
- 模型权重加载到GPU内存
- 音频文件下载和ffmpeg预处理
- 结果编码和上传回存储
- 每次调用的最低计费时长
这些开销每次调用都是固定成本——不随模型复杂度变化。当GPU前向传递从30秒(默认)增加到90秒(微调)时,额外计算对账单的影响比预期小,因为每次调用的开销已经占用了大部分预算。
实际意义:如果你已经在使用语音AI分声-人声分离,几乎没有经济理由不选择你的延迟预算允许的最高质量变体。如果用户能等60秒,用语音AI分声-人声分离_6s(6音轨,默认速度)。如果能等2分钟,用语音AI分声-人声分离_ft(微调,接近小豆分声-人声分离的质量)。账单费用一样。
这与阅读学术论文和公共GPU定价得出的结论相反。只有实际查看每月账单才能发现这一点。
单位经济影响
如果你在为音轨分离产品建模单位经济,计划每首歌曲$0.04–$0.05作为基础,无论选择哪个语音AI分声-人声分离变体。这设定:
- 免费层级上限——每个用户10分钟免费时间(≈3首歌曲),每个注册者在转化前约吸收$0.13
- 最低可行定价——零售价低于每首$0.10,没有Stripe费用、支持和基础设施开销的空间
- 批量处理成本——每月10,000首歌曲约$450纯推理费用,不包括存储、带宽和其他基础设施
两个重要警告:
- 低流量时冷启动占主导。如果服务每天处理少于几百首歌曲,冷启动开销会按比例变大。流量极低时,实际成本可能升到每首$0.06–$0.07。
- 月推理支出超过$2k时自托管更划算。在你有足够持续流量维持专用GPU使用率>40%之前,serverless GPU比专用基础设施更便宜。
4. 输出灵活性(音轨数和格式)
| 工具名称 | 可用音轨配置 | 备注 |
|---|---|---|
| 铭文分音-声音分离 | 2、4或5音轨 | 5音轨新增钢琴(单独模型) |
| 语音AI分声-人声分离 | 4或6音轨 | 语音AI分声-人声分离_6s新增吉他+钢琴 |
| 小豆分声-人声分离 | 4音轨(通常);一些社区6音轨构建 | 吉他/钢琴音轨质量下降 |
这是语音AI分声-人声分离6s的独特优势。如果你的使用场景需要隔离吉他或钢琴音轨(音乐教育、多轨混音、转录),语音AI分声-人声分离6s是唯一广泛部署的能提供生产级质量的模型。小豆分声-人声分离6音轨变体存在于社区中,但成熟度较低;标准小豆分声-人声分离是4音轨系统。
对于“仅人声”或“仅伴奏”场景(卡拉OK人群),三个模型都适用,选择速度而非质量即可。铭文分音-声音分离90倍实时速度会在几毫秒内给出可用的伴奏。
5. 何时选择哪一款
在生产中运行数月后,以下是给新手的简单决策树:
选择铭文分音-声音分离当:
- 需要实时或近实时处理音频
- 在CPU或受限硬件上运行
- 需要批量处理吞吐量(如音乐目录的特征提取)
- 质量要求“可用”而非“优秀”
选择语音AI分声-人声分离当:
- 构建用户等待<60秒的消费者产品
- 需要6音轨(用
语音AI分声-人声分离_6s) - 想要生产环境中最佳质量-成本比
- 不想维护自定义推理代码(所有主要模型部署平台都有完善支持)
选择小豆分声-人声分离当:
- 运行离线或批处理工作,每首歌曲允许1–2分钟
- 对低音质量有特定要求(DJ工具、转录、音频分析)
- 生产发行级工作,边际SDR很重要
- 愿意投入工程时间跟踪社区模型更新
不要选以下情况:
- 仅需要人声移除用于卡拉OK。用铭文分音-声音分离2音轨;唱K音频在麦克风上播放,质量差异不重要。
- 需要DJ应用中的实时音轨分离。这些在消费级硬件上都不实时运行。用带有内置实时分离的DAW或提前离线处理音轨。
实际应用中的表现
我们在生产中运行语音AI分声-人声分离_6s——一个托管的6音轨分离版本,面向不想设置本地工具链的用户。
从中学到的一些论文中没有提到的东西:
- 实际生产成本是基础计算的约2倍,且在语音AI分声-人声分离变体间基本相同。公共GPU定价×推理时间会忽略平台开销。我们的实际账单每首歌曲约$0.045——不管运行哪个变体,费用都一样。每次调用的固定开销掩盖了模型间的边际计算差异。这个事实改变了我们的模型选择思路:按质量而非理论计算成本选择,因为成本差异不会实际出现在账单中。
- 格式转换比模型更重要。语音AI分声-人声分离仅接受WAV输入。用户上传MP3、FLAC、M4A、OGG和奇怪的WebM容器。大规模做好预处理ffmpeg层并不简单。
- URL导入是UX的一半胜利。要求用户下载文件再上传会流失约40%。直接URL导入需要维护(年龄限制、地区锁、直播)但值得。
- 6音轨是用户惊叹的地方。当有人听到喜欢的歌曲中吉他从钢琴中分离出来时,他们会告诉朋友。4音轨是“不错”,6音轨是“怎么可能”。
如果你想尝试6音轨分离,我们的站点有免费额度可以试听几首歌。
该领域的下一步
2026年值得关注的几个开放问题:
- 8音轨(人声/伴唱/鼓/贝斯/吉他/钢琴/合成器/其他)会成为标准吗?社区微调正在朝这个方向发展,但合成器和伴唱音轨的训练数据是瓶颈。
- 消费级硬件实时运行?目前没有公开模型在CPU上以可接受质量实时运行。模型蒸馏可能会改变这一点,但可能不会在2026年。
- 多语言/非西语人声分离。大多数基准测试以英语流行和摇滚为主。我们观察到在使用不同发声技巧的语言(普通话、带有大量自动调音的粤语、宝莱坞人声堆叠)上表现明显更低。这是领域的真正差距,而非部署问题。
如果你在该领域工作,有我们感兴趣的数据或发现了这些模型的问题,请联系我们。
发布者:云, 赵,出处:https://www.qishijinka.com/software-testing/64313/