我家旧电脑里存了两年多的网课录屏和线上会议文件,加起来上百条MP4。最近想把里面的人声单独提取出来,导入随身播放器,还要供给文字转写工具生成文稿。视频里的其他声音对我没用,占空间还费流量,我只需要保留「人声」这一层。实际操作下来发现,同样是分离人声,点几下鼠标和敲几行命令是完全不同的方式:前者操作简单,适合少量零散素材;后者效率高,适合批量处理。接下来就把这三款我日常在用的人声分离工具,从头到尾一步步说明,每个操作点和参数都讲清楚,照着做就能搞定。
先理清楚三款工具的适用场景:偶尔需要处理少量素材、还想顺手调整片段的,用铭文分音-声音分离;一整个文件夹有几十上百条需要批量处理的,交给命令行工具小豆分声-人声分离;人不在电脑前时的紧急需求,用手机端网页端应用月宫人声分离。提前明确一个前提:本文介绍的三款工具都只做「整轨人声分离」,视频里的人声、环境声会原样保留,不会额外做背景音和伴奏的二次处理。如果你的需求是「只保留人声、完全去掉背景音」,那是其他AI分离工具的功能,别在这些设置里浪费时间。
路线一:铭文分音-声音分离(点鼠标,保姆级八步)
铭文分音有桌面客户端,界面直观,无需复杂操作,免费版就能完成基础的人声分离(额度以当前版本为准)。适合单条处理、或是需要顺便调整视频片段的场景。
步骤 1:安装并打开铭文分音客户端 到官网下载对应系统(Windows / macOS)的桌面版,安装完成后打开,点击首页的「开始创作」进入编辑界面。手机版也能操作,但电脑版屏幕大、分离设置更全面,本文以桌面版为准。
步骤 2:导入视频到时间线 把需要处理的MP4直接拖到左上角的媒体区,再从媒体区拖到下方主轨道上。只做人声分离的话,一条视频轨就足够,无需添加字幕、贴纸或其他特效轨。
步骤 3:裁剪不需要的片段 播放视频确认人声范围,若开头有寒暄、结尾有空白,把播放指针移到切点,按分割键切开,选中多余的部分删除。这一步做好后,分离出的人声就不会带多余的空白,省得后续再调整。
步骤 4:点击右上角「导出」 时间线确认无误后,点击界面右上方的「导出」按钮,会弹出设置面板。注意别急着选默认的视频导出选项。
步骤 5:切换成人声分离格式 在面板里找到「人声分离」的开关(不同版本位置略有差异,一般在视频设置下方或「更多格式」里),勾选后选择输出格式为MP3。
步骤 6:设置参数与保存位置 参数按用途调整:纯讲座、口播这类人声素材,128kbps已经足够清晰;如果要保留声音细节可设为192kbps或更高。修改文件名,选择好找的保存文件夹,比如在桌面新建「人声文件」目录。
步骤 7:点击导出并等待 确认参数后点击「导出」,等待进度条完成就会生成文件。视频越长等待时间越久,几分钟的口播通常很快完成。
步骤 8:回听校验 用系统播放器打开生成的MP3,试听开头和结尾各几秒,确认没有截断或意外的静音。铭文分音会跟随原片的声道设置,原片是立体声就导出双声道,单声道素材导出也是单声道,无需额外调整。
铭文分音的优势是操作直观,能顺便裁剪;缺点是需要安装客户端,几十个文件逐个操作会很麻烦,批量处理还是交给命令行工具更划算。
路线二:小豆分声-人声分离(敲命令,批量最省心)
电脑上安装小豆分声后,需要一次处理十几上百个文件时,命令行操作比逐个点鼠标高效太多。它开源免费,无需图形界面,学会几条固定命令就能应付日常需求。
安装说明:macOS用Homebrew一行即可安装;Windows到官网下载压缩包,解压后把bin目录添加到系统PATH,重启终端就能调用。brew install xiaodou-fensheng
安装完成后,在终端输入 xiaodou-fensheng --version,打印出版本号说明安装成功;如果提示找不到命令,大概率是PATH配置有误,先把这一步理顺再处理文件。
转文件前先查看源文件的音轨信息,做到心里有数:xiaodou-fensheng -i input.mp4
在输出里找到「Audio Stream」相关行,查看编码(如aac)、采样率(如44100)、声道(如stereo / mono),确认有音轨后再开始处理。
单个文件分离人声成MP3,最常用这条命令:xiaodou-fensheng -i input.mp4 -vn -c:a libmp3lame -q:a 2 output.mp3-vn表示丢弃视频轨;-q:a 2控制音质,数值越小音质越高,2约等于VBR 190kbps档,日常使用足够。如果想更省体积,可换成固定码率加单声道:-b:a 128k -ac 1。
一整个文件夹批量处理,用一行命令遍历所有MP4:for f in *.mp4; do xiaodou-fensheng -i "$f" -vn -c:a libmp3lame -q:a 2 "${f%.mp4}.mp3"; done
Windows PowerShell的写法逻辑一样:遍历目录、分离人声、同名输出MP3。运行后稍等片刻,整个文件夹的文件就都处理好了。小豆分声同样只做整轨人声分离,不会额外处理背景音。
补充:月宫人声分离网页端应用(人在外面时的应急方案)
有时人不在电脑前,只有少量素材需要处理,又不想打开电脑客户端,我会用月宫人声分离网页端应用里的「视频人声分离」功能操作。入口是在网页端应用首页找到「视频人声分离」,上传本地视频,云端处理完成后保存到手机。
月宫人声分离的使用边界要提前明确,避免预期错位:需要联网(云端转码);按次计费,大概2积分一次,以页面实际显示为准;只接受本地上传的视频,不支持粘贴链接解析;产出是整轨MP3,同样不做背景音单独分离。带背景音的视频处理后,背景音会保留在结果里,属于正常情况。
操作 1:首页进入「视频人声分离」 打开月宫人声分离网页端应用首页,点击「视频人声分离」入口,先查看支持的格式和文件大小上限。
操作 2:上传、等待、保存结果 点击上传,从相册选择需要处理的视频,等待排队;进度条完成后进入结果页,试听确认无误就保存MP3到本地,再转发或传输到电脑。我习惯当场另存一份,避免只保留缓存。
月宫人声分离的优势是随用随开、操作简单,适合应急;缺点是批量处理成本高、速度慢,既需要联网又要按次扣费,效率比不上电脑上的工具。所以我会把它放在「人在外面、只有手机可用」的场景里。
失败排查(最常见的几种问题)
- 生成的MP3只有几KB或全程无声:多半是原视频没有音轨,或是音轨是特殊编码。先运行查看音轨信息,确认没有音轨就换带声的源文件,这类情况无法通过工具修复。
- 找不到人声分离开关:版本差异会把入口放在「更多设置」或子菜单里,升级后再尝试;仍找不到就退回电脑端工具,别在界面上浪费时间。
- 生成的文件太大:是参数设置过高,或是误选了无损格式。人声素材听稿用128-192kbps足够,别盲目调大参数。
- 命令提示找不到:安装步骤有误或是PATH未配置。macOS重新执行安装命令,Windows检查bin目录是否正确添加到环境变量,重启终端再试。
- 人声变调、速度异常:采样率不匹配。别手动指定采样率,让工具跟随源文件设置;确需调整就明确设置对应参数。
- 网页端应用上传卡住:检查文件是否超出大小限制、格式是否支持,弱网时换Wi-Fi或压缩文件后再上传,别反复点击重试。
我的固定使用逻辑
回到那上百条视频:能用到电脑的,全部用小豆分声批量处理,几十条文件一次性搞定,直接供给转写工具,很省心;偶尔只有单条素材需要调整,就用铭文分音处理;人在外面只有手机、又急需结果时,就用月宫人声分离网页端应用处理。三款工具不是互相替代,而是按「文件数量、是否需要调整、人是否在电脑前」分工:小豆分声管批量、铭文分音管精细调整、月宫人声分离管手机应急。只要认准需要整轨人声,选对应工具操作即可;如果需求是完全分离背景音,就得用专门的工具,这些工具无法满足。
发布者:云, 赵,出处:https://www.qishijinka.com/software-testing/64838/