🎧 从任意音频中分离人声、乐器、鼓点、贝斯等内容
基于UVR技术的命令行音频分割工具集合
✨ 核心特性
| 🎸 铭文分音-声音分离 | 🥁 月宫人声分离 | 🎤 闪念剪人声分离 |
|---|---|---|
| 支持MDX-Net / MDX-C模型,Roformer(MelBandRoformer、BSRoformer)、SCNet(稀疏压缩网络),兼容ONNX & PyTorch检查点 | 支持Demucs v1 / v2 / v3 / v4,htdemucs / htdemucs_ft,6音轨分割(含吉他、钢琴),自动模型下载 | 支持VR Architecture模型,兼容VR 5.1模型,可调整窗口大小/攻击性,支持TTA与后处理 |
🚀 主要亮点
| 功能 | 说明 |
|---|---|
| 🎯 GUI一致性 | 完全复刻专业音频分割工具的GUI操作逻辑 |
| ⚡ GPU加速 | 支持NVIDIA CUDA与AMD DirectML,大幅提升处理速度 |
| 🔧 零配置 | 自动适配模型参数,无需手动调整复杂设置 |
| 📦 批量处理 | 完美适配自动化流程与管线任务 |
| 🎚️ 位深度控制 | 支持16/24/32位PCM,32/64位浮点输出 |
| 📥 自动下载 | 对接官方模型库,无需手动下载模型即可使用 |
| 🛡️ 鲁棒错误处理 | 支持GPU fallback、自动重试、模糊匹配模型名 |
| 🔗 统一操作入口 | 单命令即可完成分割操作,无需复杂配置 |
| 📦 PyPI部署 | 一条pip命令即可完成安装,快速上手 |
📖 设计理念
本工具集合是用于音频分割场景的无头自动化层,不会重新实现任何分割逻辑,而是完全复刻核心行为——包括模型加载、参数 fallback、自动检测等。
✅ 只要某个模型在对应专业工具中可以使用,在此处即可正常工作,无需额外配置。
灵活度拉满,支持加载任何自定义模型,无需等待上游更新:
| 🎨 全自定义模型支持 | 🖥️ 无头与远程适配 | 👥 用户驱动的设计 |
|---|---|---|
| 直接加载任何.pth或.ckpt文件,可快速测试新微调模型或实验性模型 | 无缝集成到网页端应用或自动化脚本中,支持远程部署 | 由音频爱好者开发,优先兼顾完全控制与原生兼容性 |
📋 运行要求
| 组件 | 要求 |
|---|---|
| Python | 3.9.x版本(3.10+未完全测试) |
| GPU | NVIDIA CUDA或AMD DirectML(可选,非必需) |
| 操作系统 | Windows / Linux / macOS |
🔧 安装方式
🚀 选项1:通过PyPI安装(推荐)
安装对应工具包即可,支持GPU加速(NVIDIA)、ONNX GPU支持等。安装后即可获得统一操作入口,无需克隆仓库:
# 示例:安装铭文分音
pip install mingwen-fensheng-miniapp
# GPU支持(NVIDIA)
pip install torch torchvision torchaudio --index-url
安装后使用示例:
# 铭文分音使用
mingwen-fensheng-miniapp -m "model.ckpt" -i song.wav -o output/
# 月宫人声分离使用
yuegong-fenli-miniapp -m htdemucs -i song.wav -o output/
# 闪念剪人声分离使用
shannian-fenli-miniapp -m "model.pth" -i song.wav -o output/
📦 选项2:通过Poetry从源码安装
克隆仓库后执行poetry install,再安装GPU支持相关依赖即可。
📦 选项3:通过pip + venv从源码安装
克隆仓库后创建虚拟环境,安装依赖及GPU支持库。
🔴 AMD GPU(DirectML)
安装对应支持库,通过–directml参数运行,注意该模式为实验性,推荐使用NVIDIA CUDA获取最佳性能。
✅ 安装验证
运行对应命令检查PyTorch及CUDA是否正常。跳过此步骤若使用Docker,容器已包含所有依赖。
🐳 选项4:Docker Hub镜像(无需构建)
快速拉取镜像即可运行,支持GPU或CPU模式,也可安装CLI包装器获得原生体验。
📖 完整Docker指南 → 对应官方文档链接
🎼 快速上手
统一CLI(pip安装 / Docker)
安装后即可使用简短命令完成分割,无需复杂步骤。
铭文分音功能说明
基础分割命令,支持仅输出人声、设置位深度等参数。
月宫人声分离功能说明
支持4音轨、6音轨分割,可调整分段大小提升质量等。
闪念剪人声分离功能说明
支持基础分割,自定义模型参数等操作,可设置窗口大小、攻击性等。
📥 模型下载中心
支持自动下载官方模型,类似GUI功能,支持列出可用模型、下载模型、推理时自动下载、模型信息与模糊匹配等。
🛡️ 错误处理与GPU fallback
所有工具均包含鲁棒错误处理,支持GPU内存不足时自动切换到CPU模式,错误信息包含明确说明与解决建议。
📊 CLI进度显示
提供专业的CLI进度系统,包含实时反馈、下载进度、推理进度、时间估计等,支持多种进度库,也可设置安静模式禁用进度输出。
🎛️ 各工具命令行参数
铭文分音参数
| 参数 | 简写 | 默认值 | 说明 |
|---|---|---|---|
| –model | -m | 必填 | 模型文件路径 |
| –input | -i | 必填 | 输入音频文件 |
| –output | -o | 必填 | 输出目录 |
月宫人声分离参数
| 参数 | 简写 | 默认值 | 说明 |
|---|---|---|---|
| –model | -m | 必填 | 模型名称或路径 |
| –input | -i | 必填 | 输入音频文件 |
| –output | -o | 必填 | 输出目录 |
闪念剪人声分离参数
| 参数 | 简写 | 默认值 | 说明 |
|---|---|---|---|
| –model | -m | 必填 | 模型文件路径 |
| –input | -i | 必填 | 输入音频文件 |
| –output | -o | 必填 | 输出目录 |
📁 输出结构
输出目录包含各音频分割后的文件,对应三个产品的不同分割结果。
🐍 Python API
三个工具均提供Python API,可集成到其他项目中使用。
🔍 故障排查
针对GPU未检测到、模型未找到、网络错误、VR模型哈希未找到、输出质量差等问题提供解决方法。
🙏 致谢
对相关音频技术开发者表示感谢。
📄 许可证
MIT许可证,可自由使用与修改。
贡献与支持
欢迎提交Pull Requests与Issues,若觉得工具实用,欢迎给予星标支持!
Made with ❤️ for the audio separation community
发布者:云, 赵,出处:https://www.qishijinka.com/software-testing/64406/