UVR5 人声分离 5 步上手:免费 AI 提取纯净伴奏的完整实战指南
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
翻唱视频缺伴奏、剪辑被背景音乐里的人声干扰、混音拿不到干净干声——这些问题你大概率都遇到过。Ultimate Vocal Remover(UVR5)是一款免费、开源、带图形界面的 AI 人声分离工具:把一首歌丢进去,它用神经网络把"人声"和"伴奏"拆成两个独立文件,整个过程不需要任何音乐制作基础。
两种安装方式:官方包或源码起步
UVR5 基于 PyTorch 构建,官方安装包已内置 Python、PyTorch 和 FFmpeg,装完即可运行;源码方式则需要你自己准备 Python 环境。按你的系统任选一种。
方式 A(官方打包版,推荐新手):到 UVR 官方发布页下载对应系统的安装包——Windows 用UVR_v5.6.0_setup.exe,macOS 分 Intel 与 M 系列两个 dmg。注意 Windows 版必须装到 C:\ 主盘,装到其他盘会不稳定;Mac 首次启动可能需等 5-10 分钟。
方式 B(源码运行):
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui pip install -r requirements.txt python UVR.py高频坑一行解:Linux 上运行
python3 UVR.py报 "No module named tkinter",执行sudo apt install python3-tk再试;Windows 提示缺少 VC++ 运行库,装微软官方运行库即可。
第一次跑通的最小步骤
假设你有一首 MP3 流行歌,目标是拿到干净伴奏。打开主界面后,照这 5 步走:
- 加载音频:点左侧 Select Input,选中目标文件(支持拖拽进输入列表)。
- 指定输出:在 CHOOSE OUTPUT 处设置结果保存目录,输出格式选 WAV / FLAC / MP3 任一。
- 选择算法与模型:在 CHOOSE PROCESS METHOD 选 MDX-Net,模型挑 MDX23C-InstVoc HQ 这类两轨人声模型(首次运行会自动下载模型)。
- 设置参数:Segment Size 填 256,Overlap 填 8;用 NVIDIA 显卡(建议 8GB 显存以上)就勾上 GPU Conversion。
- 开始处理:点 Start Processing,等底部进度条走完。
完成后,输出目录里会多出两个文件:歌曲名_(Vocals).wav(干声)和歌曲名_(Instrumental).wav(伴奏)。
省时技巧:正式跑之前先勾上 Sample Mode,程序只处理前 30 秒。十几秒就能听到效果,参数不对立刻改,不用为整首歌反复重跑。
它为什么比老办法强
传统"消人声"是把人声集中的频段一刀切掉,结果伴奏发闷、发空——因为人声和吉他泛音、键盘和声在频率上大量重叠,固定滤波器切不干净,只会误伤乐器。UVR5 走的是另一条路:AI 模型在大量标注音频上"听懂"了音乐,学会人声与乐器在时间和频率上的组合规律,再按声源切分,而不是按频率挖洞。同样 5 分钟的歌,老办法给你一版"蒙被子"的伴奏,它给你接近专业分轨的结果。
三种算法家族已整合在同一界面,源码各就各位:
| 名称 | 源码位置 | 特长 | 适合素材 |
|---|---|---|---|
| MDX-Net | lib_v5/mdxnet.py | 推理快、两轨分离稳定 | 流行、摇滚等常规歌曲 |
| Demucs v3/v4 | demucs/ | 支持 4 轨分离(人声/鼓/贝斯/其他) | 编曲复杂、需要分轨的作品 |
| VR Architecture | lib_v5/vr_network/ | 模型多、便于精细调校 | 特定乐器去除、降噪 |
对照这张截图看:左侧负责输入输出与格式选择,中间是算法、模型与关键参数,底部是运行控制区。你前面 5 步的所有操作,都发生在中间那一栏。
按素材类型选模型与参数
跑通之后想效果更好,核心策略是"按歌选模型":
- 流行 / 摇滚:MDX-Net 系列,速度与效果最均衡,是多数歌的首选。
- 古典 / 爵士 / 编曲复杂:换 Demucs v4,4 轨模式稳定性更好。
- 只想去掉特定乐器:用 VR 系列专项模型(如 4band_44100 系列里的 No Piano 版本)。
- 录音底噪明显:先选 models/VR_Models/ 自带的 UVR-DeNoise-Lite.pth 降噪一遍,再做人声分离。
关键参数只有两个真正影响结果:
| 参数 | 推荐值 | 作用 |
|---|---|---|
| Segment Size | 128 / 256 / 512 | 分段大小。越小越省内存,越大质量越好、显存压力越大 |
| Overlap | 4-8 起步,可加至 16-32 | 分段重叠率。重叠不足会出现接缝,越高拼接越自然但耗时更长 |
两条直觉规则:听到"咔哒"声或段落感 → 把 Overlap 加到 16 或 24;老机器内存吃紧 → 把 Segment Size 降到 128。另外,各模型的详细配置(维度、FFT 参数、主分轨、是否 karaoke 模式)记录在 models/MDX_Net_Models/model_data/ 等目录的 model_data.json 里,好奇时可以直接打开看。
GPU 加速与批量处理
设备调度逻辑在 separate.py:程序启动时自动检测 NVIDIA 的 CUDA 和 macOS 的 MPS,可用时优先走 GPU——同样一段音频,CPU 要十几分钟,GPU 通常一两分钟。官方建议显存至少 8GB(最低要求 RTX 1060 6GB),显存不足就调小 Segment Size 或关掉 GPU Conversion。
手头有一整批文件时,可以把目录交给脚本循环处理(以官方仓库用法为准):
import os, subprocess folder = "你的音频目录" for f in os.listdir(folder): if f.endswith((".mp3", ".wav", ".flac")): subprocess.run(["python", "UVR.py", os.path.join(folder, f)])踩坑速查表
| 症状 | 常见原因 | 对策 |
|---|---|---|
| CUDA out of memory | 显存不足 | Segment Size 调到 128 或关闭 GPU Conversion |
| 结果有接缝、咔哒声 | Overlap 太小 | Overlap 加到 16 或 24 |
| 模型下载失败或极慢 | 网络问题 | 手动下载模型放入 models/ 对应目录 |
| 界面打不开 | 缺 tkinter 或 DLL | sudo apt install python3-tk;Windows 装 VC++ 运行库 |
| 人声残留明显 | 模型与歌型不匹配 | 换算法家族或换模型再试 |
从一首熟悉的歌开始
挑一首你最熟悉的歌,今天就用 UVR5 跑一遍 5 步流程,拿到伴奏后录一版自己的演唱。工具免费开源,社区还在持续迭代模型——第一次听到"干净得像官方发行版"的伴奏时,你会明白这点折腾值。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考