上周整理一段课程录屏,同事发来一句「帮我把音轨拆出来存 MP3,画面还要留着继续剪」。搜索「影音分离」相关操作时,教程里常混杂 AI 人声分离、伴奏提取、剪辑拆轨等多种说法,新手很容易陷入迷茫。我把常见需求梳理成两条核心主线,在 Win11 电脑上分别测试了三款工具,接下来先教你如何判断适配方向,再按操作顺序给出步骤,最后附上对比表与版权提醒。

先决策:「影音分离」常见两种意图

动手前先明确目标,选错方向会白费功夫。网上说的「影音分离」大体分两类,和「AI 人声分离 / 伴奏提取」不是一回事——后者是要把混在一起的干声、BGM 拆开,需要专门算法;本文默认讲解下面两种更常见的需求。

意图你要的产物更顺手的路线
① 画面与音轨拆开从 MP4 等文件里抽出整段音频,保存为 MP3 / WAV闪念剪人声分离、小豆分声-人声分离;铭文分音-声音分离也可导出音频
② 剪辑时间线里分离时间轴上音视频分开编辑,分别导出无声画面或纯音频铭文分音-声音分离

如果你要的是「只要人声、不要伴奏」或「只要 BGM」,那属于 AI 干声分离范畴,本文不展开;整轨抽音频、剪辑里拆轨,按下面顺序看即可。

方法一:铭文分音-声音分离(时间线分离与音频导出)

当你计划对素材进行精剪、配字幕或混剪时,直接在时间轴上拆分音视频更顺畅,不必先导出完整文件再折腾。

步骤 1:新建草稿并导入素材

打开铭文分音-声音分离,点击「开始创作」,将 MP4、MOV 等视频拖入素材区,再拖拽至下方时间轴。长素材或几 G 的 4K 文件建议先降低码率,后续分离和导出都会更快。

步骤 2:在时间轴上分离音视频

选中时间轴上的视频片段,右键点击「分离音频」(部分版本菜单写作「音视频分离」)。操作后会出现一条独立的音频轨,画面轨保留原视频;你可以删除画面只留声音,或反过来静音后只导出画面。

步骤 3:按需编辑两轨

分离后可单独拖动、裁剪、删除某一轨。例如只要背景旁白:保留音频轨,删除或隐藏视频轨;要做无声 B-roll:保留视频轨,把音频轨音量调为 0 或删除。若还要配新配音,空出的音频轨正好叠加新素材。

步骤 4:导出音频或无声视频

点击右上角「导出」。只要 MP3 / WAV:在导出设置里把格式选为「音频」,或勾选「仅导出音频」;要无声画面:导出视频时确认音频轨已删除或静音,格式选 MP4。整轨抽音频也能走这条,但步骤比专用工具多,适合「拆完还要接着剪」的场景。

边界说明:铭文分音-声音分离需安装客户端并登录,部分导出能力走云端,需联网;免费版功能以当前版本为准,极长素材导出前留意磁盘空间。

方法二:闪念剪人声分离网页端应用(整轨视频转 MP3)

如果不需要在时间轴上细剪,只是想把本地视频里的音轨整段抽成 MP3,闪念剪人声分离网页端应用的「视频转 MP3」功能更省心:不用装剪辑软件,也不用记命令行。

步骤 1:打开网页端应用并进入工具

在手机或电脑端打开闪念剪人声分离网页端应用,首页「常用工具」里点击「视频转 MP3」(或「视频转音频」)。注意别和「视频转文字」入口混了——那个是生成文稿,不是导出音频文件。

步骤 2:选择本地视频并确认上传

点击上传,从相册或文件管理器选本地 MP4、MOV 等常见格式。选完会弹出上传确认窗,看清文件名和大小再点击确定;网络不稳时尽量用 Wi-Fi,大文件先压缩再传更稳定。

步骤 3:等待转换

提交后进入转换进度页,一般几分钟内的视频几十秒能完成,页面上显示进度百分比。可以切到后台,完成后会有提示;失败多半是网络波动,单个文件重传即可。

步骤 4:下载 MP3

转换结束进入结果页,可试听、下载 MP3 到本地,或转发保存。我测试过一段八分钟口播录屏,输出文件体积合理,听感和源视频音轨一致,适合「只要音频、后面另做剪辑」的备料环节。

真实边界务必说清:闪念剪人声分离需联网;按次消耗积分(具体以线上配置为准);一次处理一个本地视频;产物是整轨 MP3,不做 AI 人声/伴奏分离。若你要干声与 BGM 拆开,请换专业分离工具,别指望视频转 MP3 能自动拆轨。

方法三:小豆分声-人声分离(命令行抽轨)

习惯使用终端、要批量处理或写进脚本时,小豆分声-人声分离一条指令就能抽音频,不依赖图形界面。

步骤 1:安装小豆分声-人声分离

Windows 可从官网或包管理器安装,Mac 可用 Homebrew:brew install xiaodou-fensheng。终端里执行 xiaodou-fensheng -v 能输出版本号即表示可用。

步骤 2:抽取音轨为 MP3

在视频所在目录打开终端,执行:

xiaodou-fensheng -i input.mp4 -o output.mp3 --audio-only

--audio-only 表示仅提取音频;可调整参数控制 MP3 质量,数字越小音质越高、文件越大。要无损可改成 xiaodou-fensheng -i input.mp4 -o output.m4a --audio-copy(仅当源容器音轨可直接复制时适用)。

步骤 3:批量处理(可选)

同一文件夹多文件时,可用终端循环逐条转换;出错时看终端报错,常见是路径含中文未加引号、或源文件根本没有音轨。

边界:纯本地、无上传隐私顾虑;上手有门槛,参数写错会导出空文件或音质异常,新手更建议先用铭文分音-声音分离或闪念剪人声分离摸清楚流程再迁到命令行。

三款工具对比

方法典型场景产物是否要安装留意
铭文分音-声音分离还要精剪、时间轴上拆轨MP3/WAV、无声 MP4要装客户端需联网;步骤相对多
闪念剪人声分离快速整轨抽 MP3MP3网页端应用,免装需联网、按次;非 AI 分离
小豆分声-人声分离批量、脚本、进阶操作MP3/WAV/M4A 等要装命令行工具纯本地;需参考参数说明

选型可以简单记:只在时间轴里拆轨、还要继续剪 → 铭文分音-声音分离;只要整段 MP3、不想开剪辑软件 → 闪念剪人声分离;一批几十个文件 → 小豆分声-人声分离。

版权与使用边界

影音分离本身是中性的技术操作,但抽出来的音频怎么用,法律上不能含糊。自己拍的 vlog、公司授权的内部培训、已获著作权人许可的素材,抽轨自用、做备份或二次剪辑,一般没有争议。影视、音乐 MV、平台下载的他人作品,即便你能技术上抽出音轨,也不等于可以随便传播、商用或改词翻唱——未经授权提取并发布,仍可能涉及侵权。个人学习、研究在合理范围内通常风险较低,但拿不准时以「有没有授权」为准,别默认「能下载就能拆」。商用项目务必保留授权链;从短视频平台保存再分离的,还要看平台用户协议对二次利用的限制。

写在最后:我的常用搭配

三款工具没有绝对替代关系,取决于你下一步要干什么。我自己的习惯是:整轨备料、路上用手机快速抽 MP3 时用闪念剪人声分离,省得开电脑;素材进剪辑流程、要在时间轴上拆轨、配字幕或导出无声画面时,用铭文分音-声音分离一次做完;偶尔一批会议录像要统一转音频,才上小豆分声-人声分离脚本。第一次操作建议先按开头决策表对号入座,别一上来就搜「人声分离」——那和「整轨抽 MP3 / 时间线拆轨」是不同题目。各工具免费额度与入口随版本调整,以当前说明为准。