RVC WebUI完整指南:用10分钟音频训练语音克隆模型
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
手里有一段喜欢的声音录音,想拿它做游戏直播配音、给视频换人声、做一首自己的"AI翻唱"——RVC WebUI(Retrieval-based-Voice-Conversion-WebUI)就是为此设计的:一个把 10 分钟低底噪音频变成可用语音克隆模型的音色转换框架,附带端到端 90–170ms 延迟的实时变声器。
RVC WebUI与传统变声器的差别
传统变声器本质是变调+频谱扭曲,效果千篇一律;RVC 是训练一个"这个人的声音"的模型,输出的是具体某个人的音色。
| RVC WebUI | 传统变声器 | |
|---|---|---|
| 原理 | 训练专属音色模型做检索式特征替换 | 调整音高和频谱 |
| 数据要求 | 约10分钟干净音频 | 无 |
| 输出效果 | 可还原特定人声音色 | 机械感、卡通感 |
| 实时延迟 | 170ms,ASIO 设备约 90ms | 更低但音色不自然 |
| 硬件门槛 | 建议 4GB 以上显存 | CPU 即可 |
三个值得先知道的功能 ✨
- 一键训练流程:数据切分、F0(基频,即音高)提取、HuBERT 声纹特征提取、模型训练、索引构建,在网页界面点完即可,不需要记任何命令行。
- 检索防音色泄漏:推理时从训练集特征库检索最接近的特征去替换源音频特征,让输出音色"钉"在目标声音上,不会被你喂进去的音频带偏;强度由 index_rate 旋钮控制。
- 实时变声可用:端到端 170ms,配 ASIO(低延迟音频设备协议)输入输出可压到约 90ms,够直播对线。
从克隆到启动:让 RVC WebUI 跑起来 🚀
环境要求Python 3.12 x64,先克隆仓库进入根目录:
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI再按硬件装依赖,文件在仓库根目录,名字别拼错(作者原文就是 requirments):
| 你的硬件 | 安装方式 |
|---|---|
| CPU / AMD / Intel | 直接装requirments_cpu_py312.txt |
| NVIDIA RTX 50 系以前 | 先装 CUDA 11.8 版 Torch,再装requirments_cu118_py312.txt |
| NVIDIA RTX 50 系 | 先装 CUDA 12.8 版 Torch,再装requirments_cu128_py312.txt |
python -m pip install -r requirments_cpu_py312.txtN 卡用户把文件名换成上表对应项即可。装完需要下载底模(HuBERT 特征模型、RMVPE 音高模型、预训练权重),放到 README 规定的目录结构下:
python -m pip install --upgrade huggingface_hub hf download lj1995/VoiceConversionWebUI --revision main --include "hubert_base/*" --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main --local-dir assets/rmvpe hf download lj1995/VoiceConversionWebUI --revision main --include "pretrained/*" "pretrained_v2/*" --local-dir assets最后启动:
python webui.py浏览器会自动打开(默认端口 7865)。Windows 用户也可以跳过手动建环境,直接双击go-webui.bat启动 WebUI、go-realtime_gui.bat启动实时变声界面。
一键训练与单次推理选项卡怎么用
训练侧:把 10 分钟以上、低底噪的 WAV 音频放进一个独立文件夹,在"一键训练"选项卡填一个实验名,采样率选 40k(v1 模型)或 48k(v2),音高提取算法选rmvpe,点开始。流程会依次跑:数据切分 → F0 提取 → HuBERT 特征提取 → 模型训练 → 索引训练。完成后,能用于推理和分享的60MB+ 小模型生成在assets/weights/,对应的.index特征库在assets/indices/;logs/实验名/里的大文件是断点续训用的,别拿去分享。
推理侧:在"单次推理"选项卡选择模型、上传音频、设变调(单位半音,12 为升八度),点"转换"。要批量处理用"批量推理";想从歌曲里只留伴奏做 AI 歌手场景,用 UVR5 人声分离选项卡,对应实现在 tools/uvr5/。
index_rate与protect参数怎么调 🎚️
这两个是调效果时最先要动的旋钮,都在"单次推理"选项卡:
- index_rate(检索特征占比,0–1,默认 0.75):当底模或源音频音质高于你的训练集时,输出音质会被带高,但音色会往底模/源音频方向飘,这叫"音色泄漏"。调高它压制泄漏,代价是音质倾向训练集;调到 0 则关闭检索保护。如果你的训练集本身就高质量且时长足,把训练轮数(total_epoch)调高,模型自身就能站稳音色,index_rate 反而不重要。
- protect(默认 0.33,上限 0.5):保护清辅音和呼吸声,防止电音、撕裂这类伪影。往上拉保护更强,但会削弱索引效果,一般 0.33 起步按需微调。
- 音高算法:推理可选 pm / rmvpe / fcpe,训练只支持 pm / rmvpe。默认推荐的rmvpe是 InterSpeech 2023 的 vocal 音高算法,速度快、占用小、哑音少,新手不用换。
避坑:找不到模型、显存爆、ffmpeg 报错 ⚠️
现象:启动后提示 hubert 或 rmvpe 文件缺失。原因:底模没下载,或没放进
assets/下的规定子目录(hubert_base/、rmvpe/、pretrained/等)。解法:按上一步的hf download命令重新放置;Windows 还需把 ffmpeg.exe、ffprobe.exe 放到项目根目录(Ubuntu 用 apt 装 ffmpeg 即可)。现象:训练或推理时 CUDA out of memory。原因:显存不足,4GB 以下基本无解。解法:训练就调小 batch size;推理就缩小 configs/config.py 末尾的 x_pad、x_query 等分段参数。
现象:数据切分阶段报 ffmpeg error 或 utf8 error。原因:训练集路径带空格、括号或中文,ffmpeg 读不动,写 filelist 时编码出错。解法:把训练集挪到纯英文、无空格的路径再跑。
现象:训练完推理听不到训练集的音色。原因:没点"刷新音色",或者误用了
logs/里的断点文件。解法:先点刷新音色;仍没有就去 ckpt 选项卡做"小模型提取",确认用的是 weights 下的 60MB+ 模型。
更多帮助:FAQ与更新日志在哪查 📖
两份文档值得先翻一遍:
- docs/cn/faq.md:中文 18 问,覆盖中断/续训、中途加数据、模型分享、llvmlite.dll 报错等细节
- docs/cn/Changelog_CN.md:版本变更,升级前看一眼
下一步很具体:打开 FAQ 过一遍,准备 10 分钟干净音频放进一个文件夹,跑一次一键训练——转换完第一首测试音频,你就能听出自己的第一个克隆音色了。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考