RVC WebUI UVR5 人声分离实战指南:三步拿到干净人声与伴奏
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
一句话说清 UVR5 人声伴奏分离
Retrieval-based-Voice-Conversion-WebUI(下称 RVC WebUI)内置的 UVR5 人声伴奏分离功能,能把一首歌拆成"主人声"和"非主人声"两个文件,还能顺手去掉混响、回声。适合想拆伴奏练声、做翻唱或清理录音的普通用户;读完本文你能独立完成第一次分离,并知道模型和参数该怎么挑。
环境与依赖准备
- 系统与显卡:Windows / macOS / Linux 均可;有 NVIDIA 显卡体验最好,AMD 或 Intel 核显也能跑(只是慢一些)。
- 装依赖时按显卡选清单文件:NVIDIA 用户用
requirments_cu128_py312.txt(cu118 版本按你的 PyTorch 驱动选),无独显用户用requirments_cpu_py312.txt。
先执行下面的命令拿代码并装依赖:
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI pip install -r requirments_cu128_py312.txt python webui.py验证点有两个,都确认过才算准备成功:
- 启动后浏览器自动打开,左侧能看到功能菜单,说明 WebUI 起来了。
- 进入分离选项卡后,模型下拉框里能列出 HP2_all_vocals、onnx_dereverb_By_FoxJoy 等选项——这些权重由启动脚本自动下载到
assets/uvr5_weights/目录,能列出即代表下载完成。
三步走完完整流程
第 1 步:启动程序并确认界面就绪。双击go-webui.bat(Windows)或运行python webui.py启动。 预期结果:浏览器自动打开页面,左侧功能菜单中能看到"伴奏人声分离&去混响&去回声"选项卡;如果菜单空白,看控制台(黑色窗口)的报错,最常见是代理问题,关闭系统全局代理后重启即可。
第 2 步:填入音频并执行第一次分离。点开"伴奏人声分离&去混响&去回声"选项卡,在"输入待处理音频文件夹路径"里填一个放了待处理音频的文件夹(建议直接从文件管理器地址栏整段复制粘贴);模型保持默认的 HP2_all_vocals,两个输出文件夹保持默认的 opt,导出格式选 flac 或 wav,然后点"转换"。 预期结果:等待期间"输出信息"框滚动显示处理进度;结束后打开 opt 目录,里面会出现"主人声"和"非主人声"两个子文件夹,文件名带_10后缀(即激进程度默认值)。点开主人声文件歌声清晰、非主人声文件只剩伴奏,第一次分离就跑通了。
第 3 步:一次跑一批文件。这个输入框支持两种喂法:填一个文件夹路径,文件夹里所有音频会依次处理;或直接拖多个文件进上传框;两者都填时优先读文件夹。一整张专辑或一期多集的节目,把文件放进同一个文件夹再填路径即可。 预期结果:opt 下两个子文件夹里,每个输入文件都对应一份"主人声"和一份"非主人声"输出。提示:批量时确认控制台显示 CUDA 而非 CPU(CPU 说明装成了无 GPU 的 PyTorch),并且别同时开多个分离任务,避免互相拖慢。
模型与参数选择速查
| 场景 | 推荐选择 | 代价或取舍 |
|---|---|---|
| 独唱、无和声,拆人声+伴奏 | HP2_all_vocals(默认) | 最快最稳,但和声会跟人声一起走 |
| 有和声伴唱,只要主唱本人 | HP5_only_main_vocal | 压掉和声,主人声可能略被削弱 |
| 想要更干净的伴奏 | HP3_all_vocals | 比 HP2 干净些,人声提取更激进 |
| 双声道去混响 | onnx_dereverb_By_FoxJoy(MDX-Net) | 速度偏慢,单声道混响无效 |
| 单声道去混响 | VR-DeEchoDeReverb | 耗时约为 Aggressive 的两倍 |
| 去回声/延迟,要最彻底 | VR-DeEchoAggressive | 只去回声不去混响 |
| 最干净的去混响 | 先 MDX-Net 再 VR-DeEchoAggressive 两次串联 | 跑得最慢,大文件多的话分两批 |
| "人声提取激进程度"参数 | 范围 0–20,默认 10 | 越高分离越干净,但可能损伤音质,建议每次调 2 格对比 |
常见问题处理
| 现象 | 可能原因 | 解决办法 |
|---|---|---|
| 模型下拉框是空的 | 权重没下全 | 检查assets/uvr5_weights/目录,重新运行启动脚本自动补下 |
| 点转换没反应 | 输入路径填错或含特殊符号 | 看"输出信息"框报错,从文件管理器地址栏整段复制路径 |
| 人声里残留和声 | 用了 HP2/HP3 处理带和声的歌 | 换 HP5_only_main_vocal 重跑 |
| 伴奏里人声残留明显 | 原曲人声太强或源文件压缩过度 | 换无损音质源文件,再在 HP2、HP3 之间各试一次 |
| 混响没去干净 | 模型选错 | 双声道用 onnx_dereverb_By_FoxJoy,单声道用 VR-DeEchoDeReverb,或按上表做两次串联 |
接下来可以玩什么
分离出的干净人声可以直接喂进同一界面的"转换"标签页做变声,形成"分离 → 变声"的完整工作流;项目根目录还有实时变声入口go-realtime_gui.py,UVR5 分离的实现都在 tools/uvr5/ 目录下,更多报错对照见 docs/cn/faq.md。
练习建议:找一段 30 秒左右的独唱音频放进输入文件夹,分别用 HP2_all_vocals 和 HP3_all_vocals 各跑一遍,对比两次的"主人声"文件——两次试听就够你摸清模型之间的差别,比读十篇教程都快。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考