Ultimate Vocal Remover 人声分离工具完整指南:从安装到批量处理
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
Ultimate Vocal Remover(下文简称 UVR)是一个免费开源的人声分离工具,用图形界面把一首歌里的人声和伴奏拆开,也可以按鼓、贝斯、其他乐器做更细的拆分。它把几套不同的深度学习分离模型打包进同一个窗口,你只管选输入文件、挑一个模型、点开始处理,剩下的交给它。下面是安装、选模型、调参数、开 GPU 和排错的实操路线,全程只针对"能不能稳定出结果"这件事。
十分钟装好 UVR 并跑出第一首分离结果
官方提供了 Windows 和 macOS 的安装包,里面已经带好 Python、PyTorch 和全部依赖,不用手动配环境,解压安装后直接启动即可。Linux 没有安装包,只能从源码跑。
用源码安装(Debian/Ubuntu)只需一段命令:
sudo apt install ffmpeg python3-pip python3-tk pip3 install -r requirements.txt python3 UVR.py首次分离建议走最短路径:
- 点Select Input选一首 WAV 或 FLAC 文件(WAV 最省事)。
- 点Select Output指定输出目录。
- 处理方法保持默认的 MDX-Net,在模型列表里挑一个 MDX 模型。
- 输出格式选 WAV,点Start Processing。
- 处理完到输出目录试听人声轨和伴奏轨。
想先快速验证而不等整首跑完,可以勾Sample Mode,它默认只处理 30 秒,适合先确认模型和参数合不合适。
三种处理方法怎么选:VR、MDX-Net、Demucs
UVR 把分离模型分成三大类,选错大类,后面参数怎么调都白费。
| 处理方法 | 擅长 | 说明 |
|---|---|---|
| VR Architecture | 传统人声/伴奏二分 | 最经典的一档,速度稳 |
| MDX-Net | 人声、乐器、鼓、贝斯等细分 | 默认方法,模型种类最多 |
| Demucs | 复杂编曲的多轨拆分 | 支持 2 / 4 / 6 轨,可选 htdemucs 等 |
- 只要"人声 + 伴奏"两轨,VR 或 MDX-Net 都够,优先用 MDX-Net。
- 想拆出鼓、贝斯、其他,用 Demucs 的 4 轨或 6 轨,或在 MDX-Net 里挑对应乐器的模型。
- 模型不在本地时,去设置里的Download Center下载,文件会分别放进
models/VR_Models、models/MDX_Net_Models、models/Demucs_Models。 - 用Ensemble Mode把多个模型结果混合时,至少要先选 2 个模型,否则程序会直接报"Not Enough Models"。
效果不理想时先动 Segment 和 Overlap
大多数"分离不干净"或"内存爆掉"的问题,先别急着换模型,先看这两个旋钮。
- Segment(分段大小):MDX-Net 默认 256。值越小越吃内存,值越大越吃显存/内存,但可能更完整。官方说明里明确写了:内存分配报错,通常把 Segment 或 Window 调小就能解决。
- Overlap(重叠比例):控制相邻分段的重叠,越大衔接越顺但更慢,越小越快。MDX23 系列默认 8。
- VR 里对应的叫Window Size(320 / 512 / 1024),1024 快但偏糙,320 慢一点但更细。
我测下来,第一首跑完如果发现人声轨里有杂音,先把 Overlap 调大一档比反复换模型见效更快;如果直接崩内存,就回头把 Segment 往小调。
开 GPU 加速前,先确认显卡够不够
勾选界面上的GPU Conversion能明显提速,但前提是你的硬件达标,否则可能加载失败或更慢。
- 官方最低要求:NVIDIA RTX 1060 6GB;推荐显存 8GB 以上。
- AMD / Intel 核显:目前支持有限,Windows 上可以试 OpenCL 版本。
- Mac M 系列芯片:可用 MPS 加速,覆盖 Demucs v4 和全部 MDX-Net 模型。
- 程序会自动记住你上次的设置,关掉重开不用再配一遍。
显存不够时,与其硬开 GPU,不如关回 CPU 并把 Segment 调小,反而更稳。
批量处理和输出格式怎么设
- 一次选多个文件,或直接把文件拖进输入区,就会按顺序处理,界面里有Batch Mode选项控制批处理行为。
- 输出格式支持WAV、FLAC、MP3:要二次编辑选 WAV,要存档选 FLAC,要分享选 MP3(MP3 有 96k–320k 码率可选)。
- 想只要人声或只要伴奏,勾选对应的Vocals Only / Instrumental Only,别两边都留。
- 处理速度高度依赖硬件,这些模型本身计算量就不小,长曲加 GPU 时别期望和短视频剪辑一样快。
报错时去哪找答案
先按这几个高频原因排查,能省掉大半折腾:
- 转换非 WAV 文件报错:大概率是没装 FFmpeg。UVR 处理非 WAV 依赖 FFmpeg,先确认它装好。
- 内存分配错误:把 Segment 或 Window 调小。
- 音高/变速工具不可用:Time Stretch 和 Change Pitch 依赖 Rubber Band 库,需要单独安装。
- 看不到具体错因:点 Start Processing 左侧的设置按钮,打开Error Log看详细信息,再据此去提 issue。
- 提 issue 时把 Error Log 的内容和系统版本一起贴出来,定位会快很多。
下一步建议:先用 Sample Mode 跑一首你最熟的歌,重点盯Segment和Overlap这两个参数是否合适,GPU 是否真的加载成功;确认流程跑通后,再开 Batch Mode 批量处理,格式按用途在 WAV / FLAC / MP3 里选一个固定下来。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考