Ultimate Vocal Remover (UVR5) 快速上手:一首歌里把干声和伴奏分开,只需 4 步
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
想在 KTV 唱某首歌却找不到官方伴奏,或者想把一首歌里的鼓和贝斯单独切出来做 remix——播放器里那个"消人声"按钮都办不到。Ultimate Vocal Remover(UVR5)干的就是这件事:一款免费开源的 AI 人声分离工具,丢进一首歌,吐出人声与伴奏两条新音轨。
进度条走完你拿到什么:两个新文件
先说结果,再碰界面。处理完成后,输出目录会出现两个文件:
歌曲名_(Vocals).wav——分离出的干声;歌曲名_(Instrumental).wav——去掉人声的伴奏。
格式在界面上方勾选:WAV、FLAC、MP3 三选一,第一次跑用 WAV 最省心。如果只想要其中一条,可以勾上 Vocals Only 或 Instrumental Only,另一条就不再生成,时间直接省一半。
为什么它比播放器那个按钮强?因为按钮式消音是按频段切——人声占哪段,那段就被连锅端,结果伴奏发闷发空。UVR5 的模型是先学会每件乐器在时间和频率上的"声纹",再把每段声音归位——像一位记熟了原被告嗓音的法庭速记员,把各自的话记进各自的栏位。
把 UVR5 跑起来,15 分钟:官方包或源码,两条路
路线 A:官方一体化安装包。Python、PyTorch、FFmpeg 全部内置,解压即用。Windows 版要求 Win10 及以上,且要装在 C 盘;macOS 版分 M1 与 Intel 两个版本,首次启动可能花 5-10 分钟。
路线 B:源码运行。适合 Linux 用户或想自己装环境的人:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui pip install -r requirements.txt python UVR.py(Linux 下用pip3与python3代替。)MP3、FLAC 等非 WAV 格式依赖 FFmpeg,依赖版本都锁定在依赖清单里。有 NVIDIA 显卡的话,换装 CUDA 版 PyTorch,处理速度能快数倍:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117官方建议:GPU 转换最低 RTX 1060 6GB,显存 8GB 及以上更稳;纯 CPU 也能跑,只是慢一些。
给歌挑算法:三个家族各管一摊
UVR5 整合了三套算法家族,模型与源码分目录存放,按素材对号入座:
| 你的素材 | 建议算法 | 模型与源码位置 |
|---|---|---|
| 流行、摇滚,只要人声/伴奏两条 | MDX-Net,两轨快且稳 | models/MDX_Net_Models/、lib_v5/mdxnet.py |
| 编曲复杂,想单独切出鼓、贝斯、其他 | Demucs v3/v4,四轨输出 | models/Demucs_Models/、demucs/ |
| 底噪大的录音、想去回声、或只切某件乐器 | VR Arch,专项单模型 | models/VR_Models/、lib_v5/vr_network/ |
VR 系列自带降噪模型 UVR-DeNoise-Lite.pth,可以在分离前先过一遍。每个模型的设计取向(频宽、重叠、primary_stem)都记在各模型目录的 model_data.json 里,拿不准可以打开翻一翻。
4 步分离流程:从 MP3 到两条音轨
界面分三块:上方是输入输出,中间是算法与参数,下方是开始按钮。
- 载入歌曲:点 Select Input 选中文件,也可以一次选中多个文件或整个文件夹一起处理。
- 设置保存位置:点 Select Output 指定输出目录,格式勾选 WAV。
- 选算法与模型:CHOOSE PROCESS METHOD 选 MDX-Net,模型下拉里挑 MDX23C-InstVoc HQ 这类两轨模型——新手用它速度和效果最均衡。
- 开跑:有显卡勾上 GPU Conversion,点 Start Processing,等进度条走完。
首次运行会自动下载模型;网络不给力时,把模型文件手动放进 models 对应子目录即可,每个文件对应的下载地址都列在模型下载清单里。
决定接缝的两个数字:Segment Size 与 Overlap
界面中间这两个参数最值得一试:
- Segment Size:把歌切成段逐段处理,默认 256,可选 128 / 256 / 512。段越大质量越好,但吃显存;机器老、显存报不足,就降到 128,通常能流畅跑完。
- Overlap:相邻两段的衔接重叠量。试听发现"咔哒"声或段落感明显,把这个数字调大,代价是多花一点时间。
为什么必须重叠?歌曲是像贴墙纸一样一段段拼起来的,每段和下一段交叠几厘米、再做平均,接缝就看不见;完全不重叠,缝就露出来了。
VR Arch 还有两个专属旋钮:Window Size(1024 出活快,320 更慢但质量更好)、Aggressiveness(-100 到 100,常规设 5,数值越大提取越彻底)。
小贴士:想先验证效果再跑全长,勾上 Sample Mode (30s),程序只处理前 30 秒,听感满意再正式开跑,调试阶段不用干等。
避坑清单:按三个环节自查
开跑之前
- 非 WAV 文件转不动:缺 FFmpeg,先装上;
- 模型列表空、或提示模型缺失:模型没下载到位,先触发一次下载,或手动补文件。
进度条卡住或报错时
- CUDA out of memory:Segment Size 调小,或取消 GPU Conversion 交给 CPU;
- 界面点不动、打不开:更新到最新安装包,macOS Sonoma 的左键失灵问题已修复。
出结果但不满意
- 人声残留多、乐器发薄:换算法家族或换模型再跑,没有哪个模型通吃所有歌型;
- 有接缝、有咔哒声:把 Overlap 调大。
🚀 进阶:把质量再抬高一档的三个做法
- Ensemble 模式:同类模型选两个以上,各自分离一遍再取平均——像三个人独立批同一份卷子再算平均分,单个模型的偏差被摊薄。
- 4 轨 ensemble:Demucs v4 选 4-stem ensemble,会聚合多模型输出,适合编曲复杂的作品。
- 降噪预处理:底噪大的素材先用 DeNoise 模型过一遍,再做正式分离。
设置界面里还有保存设置与错误日志功能,卡住时先看一眼错误日志,多数问题能直接定位。
下一步的门槛很低:挑一首你最熟悉的歌,勾上 Sample Mode,只跑前 30 秒——听感满意,再让进度条走完全程。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考