news 2026/10/2 2:23:38

RVC WebUI UVR5 人声分离实战指南:三步拿到干净人声与伴奏

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RVC WebUI UVR5 人声分离实战指南:三步拿到干净人声与伴奏

RVC WebUI UVR5 人声分离实战指南:三步拿到干净人声与伴奏

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

一句话说清 UVR5 人声伴奏分离

Retrieval-based-Voice-Conversion-WebUI(下称 RVC WebUI)内置的 UVR5 人声伴奏分离功能,能把一首歌拆成"主人声"和"非主人声"两个文件,还能顺手去掉混响、回声。适合想拆伴奏练声、做翻唱或清理录音的普通用户;读完本文你能独立完成第一次分离,并知道模型和参数该怎么挑。

环境与依赖准备

  • 系统与显卡:Windows / macOS / Linux 均可;有 NVIDIA 显卡体验最好,AMD 或 Intel 核显也能跑(只是慢一些)。
  • 装依赖时按显卡选清单文件:NVIDIA 用户用requirments_cu128_py312.txt(cu118 版本按你的 PyTorch 驱动选),无独显用户用requirments_cpu_py312.txt。

先执行下面的命令拿代码并装依赖:

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI pip install -r requirments_cu128_py312.txt python webui.py

验证点有两个,都确认过才算准备成功:

  1. 启动后浏览器自动打开,左侧能看到功能菜单,说明 WebUI 起来了。
  2. 进入分离选项卡后,模型下拉框里能列出 HP2_all_vocals、onnx_dereverb_By_FoxJoy 等选项——这些权重由启动脚本自动下载到assets/uvr5_weights/目录,能列出即代表下载完成。

三步走完完整流程

第 1 步:启动程序并确认界面就绪。双击go-webui.bat(Windows)或运行python webui.py启动。 预期结果:浏览器自动打开页面,左侧功能菜单中能看到"伴奏人声分离&去混响&去回声"选项卡;如果菜单空白,看控制台(黑色窗口)的报错,最常见是代理问题,关闭系统全局代理后重启即可。

第 2 步:填入音频并执行第一次分离。点开"伴奏人声分离&去混响&去回声"选项卡,在"输入待处理音频文件夹路径"里填一个放了待处理音频的文件夹(建议直接从文件管理器地址栏整段复制粘贴);模型保持默认的 HP2_all_vocals,两个输出文件夹保持默认的 opt,导出格式选 flac 或 wav,然后点"转换"。 预期结果:等待期间"输出信息"框滚动显示处理进度;结束后打开 opt 目录,里面会出现"主人声"和"非主人声"两个子文件夹,文件名带_10后缀(即激进程度默认值)。点开主人声文件歌声清晰、非主人声文件只剩伴奏,第一次分离就跑通了。

第 3 步:一次跑一批文件。这个输入框支持两种喂法:填一个文件夹路径,文件夹里所有音频会依次处理;或直接拖多个文件进上传框;两者都填时优先读文件夹。一整张专辑或一期多集的节目,把文件放进同一个文件夹再填路径即可。 预期结果:opt 下两个子文件夹里,每个输入文件都对应一份"主人声"和一份"非主人声"输出。提示:批量时确认控制台显示 CUDA 而非 CPU(CPU 说明装成了无 GPU 的 PyTorch),并且别同时开多个分离任务,避免互相拖慢。

模型与参数选择速查

场景推荐选择代价或取舍
独唱、无和声,拆人声+伴奏HP2_all_vocals(默认)最快最稳,但和声会跟人声一起走
有和声伴唱,只要主唱本人HP5_only_main_vocal压掉和声,主人声可能略被削弱
想要更干净的伴奏HP3_all_vocals比 HP2 干净些,人声提取更激进
双声道去混响onnx_dereverb_By_FoxJoy(MDX-Net)速度偏慢,单声道混响无效
单声道去混响VR-DeEchoDeReverb耗时约为 Aggressive 的两倍
去回声/延迟,要最彻底VR-DeEchoAggressive只去回声不去混响
最干净的去混响先 MDX-Net 再 VR-DeEchoAggressive 两次串联跑得最慢,大文件多的话分两批
"人声提取激进程度"参数范围 0–20,默认 10越高分离越干净,但可能损伤音质,建议每次调 2 格对比

常见问题处理

现象可能原因解决办法
模型下拉框是空的权重没下全检查assets/uvr5_weights/目录,重新运行启动脚本自动补下
点转换没反应输入路径填错或含特殊符号看"输出信息"框报错,从文件管理器地址栏整段复制路径
人声里残留和声用了 HP2/HP3 处理带和声的歌换 HP5_only_main_vocal 重跑
伴奏里人声残留明显原曲人声太强或源文件压缩过度换无损音质源文件,再在 HP2、HP3 之间各试一次
混响没去干净模型选错双声道用 onnx_dereverb_By_FoxJoy,单声道用 VR-DeEchoDeReverb,或按上表做两次串联

接下来可以玩什么

分离出的干净人声可以直接喂进同一界面的"转换"标签页做变声,形成"分离 → 变声"的完整工作流;项目根目录还有实时变声入口go-realtime_gui.py,UVR5 分离的实现都在 tools/uvr5/ 目录下,更多报错对照见 docs/cn/faq.md。

练习建议:找一段 30 秒左右的独唱音频放进输入文件夹,分别用 HP2_all_vocals 和 HP3_all_vocals 各跑一遍,对比两次的"主人声"文件——两次试听就够你摸清模型之间的差别,比读十篇教程都快。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/2 2:20:24

直拍视频本地存档工作流:FFmpeg转码、字幕生成与批量API实践

这次我们来看一个很实用的本地视频存档主题&#xff1a;把「supernova 桃井爱莉 airi 位&#xff08;2026.08.15&#xff09;」这类直拍视频&#xff0c;整理成一套能转码、能截图、能生成字幕、能批量封存的本地媒体档案体系。很多人演出结束就急着保存录像&#xff0c;但下载…

作者头像 李华
网站建设 2026/10/2 2:20:09

011-0302-linux及shell-shell

Shell 概述 Shell是一个命令行解释器,它接收应用程序/用户命令,然后调用操作系统内核。 Shell还是一个功能相当强大的编程语言,易编写、易调试、灵活性强。 Linux提供的Shell解析器有 $ cat /etc/shells# /etc/shells: valid login shells/bin/sh /bin/bash /usr/bin/ba…

作者头像 李华