Ultimate Vocal Remover v5.6 指南:如何用 AI 人声移除从歌曲中提取人声与伴奏
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
Ultimate Vocal Remover(简称 UVR)是一款带图形界面的开源 AI 音频分离工具,它调用 MDX-Net、VR Architecture、Demucs 三类深度学习模型,把一首歌拆成人声、伴奏、鼓、贝斯等独立轨道,不需要写代码,适合想提取伴奏做人声消除、或做多轨拆分但不会用专业音频软件的用户。
典型使用场景
从翻唱录音里提取干净伴奏。选 MDX-Net 架构的人声模型,可以得到相对干净的人声轨和伴奏轨,能用于练声、伴奏跟唱。边界在于:混音复杂、人声混响重的曲目,伴奏里仍会有少量人声残留。
给播客或录音清掉背景噪声。选 VR Architecture 架构的降噪模型,专门处理底噪、环境音这类问题,效果比通用分离模型更定向。它解决不了失真或削波问题。
把歌曲拆成多轨。用 Demucs 模型一次拆出 Vocals、Drums、Bass、Other 四轨(部分模型支持 Guitar、Piano 六轨),适合做采样、翻编。鼓和贝斯的分离质量整体最好,人声轨通常不如专用人声模型纯净。
安装与环境准备
硬件方面:软件只支持 64 位系统;用 NVIDIA 显卡跑 GPU 加速最低要求 RTX 1060 6GB,推荐 8GB 以上显存,没有独显时 CPU 也能跑,只是更慢。
Windows 安装
从项目 Release 页下载 v5.6 Windows 安装程序(UVR_v5.6.0_setup.exe),按向导安装即可,包内已带 Python 和 PyTorch,无需额外装依赖。注意:必须装到 C 盘主目录,装到其他盘会导致不稳定;AMD 显卡或 Intel Arc 用户选 OpenCL 版本安装包。
macOS 安装
从 Release 页下载对应芯片的 dmg:M 系列芯片选 arm64 版本,Intel 芯片选 x86_64 版本。要求 macOS Big Sur 及以上;M1 芯片的 MPS 加速已支持 Demucs v4 和所有 MDX-Net 模型。首次启动初始化可能需要 5–10 分钟。
Linux 安装
Debian/Ubuntu 系最短路径(install_packages.sh 脚本会顺带装好系统依赖):
sudo apt update && sudo apt upgrade sudo apt install ffmpeg python3-pip python3-tk chmod +x install_packages.sh ./install_packages.sh python3 UVR.pyArch 系则用sudo pacman -S python-pip tk ffmpeg装好依赖后执行pip3 install -r requirements.txt && python3 UVR.py。注意处理非 WAV 文件依赖系统里的 FFmpeg。
提取伴奏的完整操作流程
第一步:导入音频并指定输出目录
在 "Select Input" 区域点按钮选择音频文件,或直接拖文件进窗口;在输入列表上右键可以整文件夹批量导入。然后用 "Select Output" 指定导出目录,批量处理时输出会按文件名自动归档。上方的 WAV / FLAC / MP3 单选框决定导出格式,默认 WAV(16-bit PCM),除非要压缩体积,否则保持 WAV。
第二步:选择 AI 模型架构
"Choose Process Method" 下拉框有五个选项,按需求选:
- MDX-Net:人声/伴奏分离的首选,模型列表里的 MDX23C 系列是当前分离精度最高的一档。只要人声和伴奏两轨,选它。
- VR Architecture:主打降噪、去混响,适合处理有噪声的素材;人声分离纯度不如 MDX-Net。
- Demucs:多轨拆分,一次分出 Vocals、Drums、Bass、Other。要拆鼓或贝斯选它。
- Ensemble Mode:把 2 个及以上模型结果合并,精度更高但耗时更长,新手第一轮不用开。
- Audio Tools:对齐、混音等后处理工具,不是分离模型。
首次使用时模型列表为空:点左下角扳手图标进设置,在 Download Center 下载所需模型,文件会存到 models/ 目录(MDX 模型进 models/MDX_Net_Models/,VR 进 models/VR_Models/)。
第三步:设置处理参数
参数区随架构变化,常见的是:
- Segment Size(MDX-Net):喂给模型的音频块长度,默认 256。显存紧张就调小,追求质量且显存足够就调大。
- Overlap(MDX23C):重叠量,默认 8,管边界平滑度,一般不动。
- Window Size(VR Architecture):默认 512。320 质量略好但更慢,1024 更快但质量下降。
- Aggression(VR Architecture):提取强度,默认 5,人声/伴奏都建议保持 5。
- GPU Conversion:有 NVIDIA 显卡务必勾选,速度差距明显;AMD 用 OpenCL 版本对应开关。
- Sample Mode (30s):只处理前 30 秒,用来快速试听效果,正式跑之前先勾它测一次。
第四步:运行分离
确认输入、输出、模型、参数无误后点 "Start Processing"。底部进度条和状态文本会实时显示当前文件和处理进度,批量任务按队列顺序自动跑完,中途可点停止按钮(会弹确认框)。软件关闭时会自动记住本次设置,下次打开不用重设。
第五步:查看输出结果
结果在输出目录里,文件名格式为"原文件名_模型名_轨道名.wav",例如test_MDX23C-InstVoc_HQ_vocals.wav是人声轨,..._instrumentals.wav是伴奏轨。用系统播放器对比原曲听一遍:伴奏轨重点听主歌/副歌段落有没有明显人声残留,人声轨听有没有破音或空洞感。不满意就换模型或调参数重跑。
关键参数速查
| 参数 | 作用 | 默认值 | 建议值 |
|---|---|---|---|
| Segment Size(MDX-Net) | 模型处理音频的块大小,影响内存占用与质量 | 256 | 显存 8GB+ 可试 512,内存紧张降到 128 |
| Overlap(MDX23C) | 分块重叠量,影响拼接边界平滑度 | 8 | 保持 8,边界有接缝时试 12–16 |
| Window Size(VR Arch) | 频谱分析窗口,平衡速度与质量 | 512 | 常规 512,慢机 1024 |
| Aggression(VR Arch) | 主轨道提取强度 | 5 | 保持 5,超过 5 容易糊 |
| Demucs Stem 选择 | 决定输出哪些轨道 | All Stems | 只要人声/伴奏就选 Vocals,省时 |
表内参数都从默认值起步即可,一次只改一个参数对比结果,更容易判断是哪个起了作用。
常见问题处理
现象:处理 MP3/FLAC 等文件时报错。原因:系统缺少 FFmpeg,UVR 依赖它转换非 WAV 格式。 处理:Linux 执行sudo apt install ffmpeg;Windows 把 ffmpeg.exe 放到 UVR 安装目录。
现象:内存分配错误,进程崩溃。原因:Segment 或 Window 尺寸太大,显存/内存装不下。 处理:把 Segment Size 减半重跑,显存 6GB 以下建议不超过 256。
现象:处理速度明显偏慢。原因:没走 GPU,或块尺寸过大。 处理:勾选 GPU Conversion 并确认 NVIDIA 驱动正常;仍慢则降低 Segment Size,并关掉占显卡的后台程序。
现象:伴奏里人声残留较多。原因:模型与音频风格不匹配,或分离强度不够。 处理:换 MDX23C 系列里另一个模型对比;或用 Ensemble Mode 合并两个模型结果;Demucs 的 Vocals 轨也可以做交叉验证。
现象:macOS 上点击无反应或打不开应用。原因:系统安全策略拦截未公证应用(Sonoma 的左键问题已在 v5.6 修复)。 处理:终端执行sudo xattr -rd com.apple.quarantine /Applications/Ultimate\ Vocal\ Remover.app后重试。
延伸资源
- README.md:完整安装说明、硬件要求与故障排查
- install_packages.sh 与 requirements.txt:Linux 一键安装脚本和 Python 依赖清单
- models/:三类模型(VR、MDX-Net、Demucs)的本地存放目录
- separate.py:分离推理的核心实现,想看模型如何被调用可以读这里
结语
先用默认参数勾上 Sample Mode (30s),对一首目标曲目跑 30 秒试听,确认伴奏残留是否在可接受范围,再取消采样模式跑完整版。找到一组可用设置后,在 "Select Saved Settings" 里存成预设,后续同类文件直接套用即可。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考