news 2026/9/20 11:32:09

RVC WebUI完整指南:用10分钟音频训练语音克隆模型

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RVC WebUI完整指南:用10分钟音频训练语音克隆模型

RVC WebUI完整指南:用10分钟音频训练语音克隆模型

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

手里有一段喜欢的声音录音,想拿它做游戏直播配音、给视频换人声、做一首自己的"AI翻唱"——RVC WebUI(Retrieval-based-Voice-Conversion-WebUI)就是为此设计的:一个把 10 分钟低底噪音频变成可用语音克隆模型的音色转换框架,附带端到端 90–170ms 延迟的实时变声器。

RVC WebUI与传统变声器的差别

传统变声器本质是变调+频谱扭曲,效果千篇一律;RVC 是训练一个"这个人的声音"的模型,输出的是具体某个人的音色。

RVC WebUI传统变声器
原理训练专属音色模型做检索式特征替换调整音高和频谱
数据要求约10分钟干净音频
输出效果可还原特定人声音色机械感、卡通感
实时延迟170ms,ASIO 设备约 90ms更低但音色不自然
硬件门槛建议 4GB 以上显存CPU 即可

三个值得先知道的功能 ✨

  • 一键训练流程:数据切分、F0(基频,即音高)提取、HuBERT 声纹特征提取、模型训练、索引构建,在网页界面点完即可,不需要记任何命令行。
  • 检索防音色泄漏:推理时从训练集特征库检索最接近的特征去替换源音频特征,让输出音色"钉"在目标声音上,不会被你喂进去的音频带偏;强度由 index_rate 旋钮控制。
  • 实时变声可用:端到端 170ms,配 ASIO(低延迟音频设备协议)输入输出可压到约 90ms,够直播对线。

从克隆到启动:让 RVC WebUI 跑起来 🚀

环境要求Python 3.12 x64,先克隆仓库进入根目录:

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI

再按硬件装依赖,文件在仓库根目录,名字别拼错(作者原文就是 requirments):

你的硬件安装方式
CPU / AMD / Intel直接装requirments_cpu_py312.txt
NVIDIA RTX 50 系以前先装 CUDA 11.8 版 Torch,再装requirments_cu118_py312.txt
NVIDIA RTX 50 系先装 CUDA 12.8 版 Torch,再装requirments_cu128_py312.txt
python -m pip install -r requirments_cpu_py312.txt

N 卡用户把文件名换成上表对应项即可。装完需要下载底模(HuBERT 特征模型、RMVPE 音高模型、预训练权重),放到 README 规定的目录结构下:

python -m pip install --upgrade huggingface_hub hf download lj1995/VoiceConversionWebUI --revision main --include "hubert_base/*" --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main --local-dir assets/rmvpe hf download lj1995/VoiceConversionWebUI --revision main --include "pretrained/*" "pretrained_v2/*" --local-dir assets

最后启动:

python webui.py

浏览器会自动打开(默认端口 7865)。Windows 用户也可以跳过手动建环境,直接双击go-webui.bat启动 WebUI、go-realtime_gui.bat启动实时变声界面。

一键训练与单次推理选项卡怎么用

训练侧:把 10 分钟以上、低底噪的 WAV 音频放进一个独立文件夹,在"一键训练"选项卡填一个实验名,采样率选 40k(v1 模型)或 48k(v2),音高提取算法选rmvpe,点开始。流程会依次跑:数据切分 → F0 提取 → HuBERT 特征提取 → 模型训练 → 索引训练。完成后,能用于推理和分享的60MB+ 小模型生成在assets/weights/,对应的.index特征库在assets/indices/logs/实验名/里的大文件是断点续训用的,别拿去分享。

推理侧:在"单次推理"选项卡选择模型、上传音频、设变调(单位半音,12 为升八度),点"转换"。要批量处理用"批量推理";想从歌曲里只留伴奏做 AI 歌手场景,用 UVR5 人声分离选项卡,对应实现在 tools/uvr5/。

index_rate与protect参数怎么调 🎚️

这两个是调效果时最先要动的旋钮,都在"单次推理"选项卡:

  • index_rate(检索特征占比,0–1,默认 0.75):当底模或源音频音质高于你的训练集时,输出音质会被带高,但音色会往底模/源音频方向飘,这叫"音色泄漏"。调高它压制泄漏,代价是音质倾向训练集;调到 0 则关闭检索保护。如果你的训练集本身就高质量且时长足,把训练轮数(total_epoch)调高,模型自身就能站稳音色,index_rate 反而不重要。
  • protect(默认 0.33,上限 0.5):保护清辅音和呼吸声,防止电音、撕裂这类伪影。往上拉保护更强,但会削弱索引效果,一般 0.33 起步按需微调。
  • 音高算法:推理可选 pm / rmvpe / fcpe,训练只支持 pm / rmvpe。默认推荐的rmvpe是 InterSpeech 2023 的 vocal 音高算法,速度快、占用小、哑音少,新手不用换。

避坑:找不到模型、显存爆、ffmpeg 报错 ⚠️

  • 现象:启动后提示 hubert 或 rmvpe 文件缺失。原因:底模没下载,或没放进assets/下的规定子目录(hubert_base/rmvpe/pretrained/等)。解法:按上一步的hf download命令重新放置;Windows 还需把 ffmpeg.exe、ffprobe.exe 放到项目根目录(Ubuntu 用 apt 装 ffmpeg 即可)。

  • 现象:训练或推理时 CUDA out of memory。原因:显存不足,4GB 以下基本无解。解法:训练就调小 batch size;推理就缩小 configs/config.py 末尾的 x_pad、x_query 等分段参数。

  • 现象:数据切分阶段报 ffmpeg error 或 utf8 error。原因:训练集路径带空格、括号或中文,ffmpeg 读不动,写 filelist 时编码出错。解法:把训练集挪到纯英文、无空格的路径再跑。

  • 现象:训练完推理听不到训练集的音色。原因:没点"刷新音色",或者误用了logs/里的断点文件。解法:先点刷新音色;仍没有就去 ckpt 选项卡做"小模型提取",确认用的是 weights 下的 60MB+ 模型。

更多帮助:FAQ与更新日志在哪查 📖

两份文档值得先翻一遍:

  • docs/cn/faq.md:中文 18 问,覆盖中断/续训、中途加数据、模型分享、llvmlite.dll 报错等细节
  • docs/cn/Changelog_CN.md:版本变更,升级前看一眼

下一步很具体:打开 FAQ 过一遍,准备 10 分钟干净音频放进一个文件夹,跑一次一键训练——转换完第一首测试音频,你就能听出自己的第一个克隆音色了。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/20 11:31:59

grep替代工具大盘点:rg、tgrep、rawgrep、zg怎么选?

我最早开始真正研究 grep 的替代工具&#xff0c;是某次在几个 GB 的仓库里跑grep -rn等结果等到咖啡都凉了的时候。那个仓库有几十个目录、上万份代码文件、海量日志和静态资源&#xff0c;一条简单的文本匹配居然要扫十几秒。换用rg&#xff08;ripgrep&#xff09;之后&…

作者头像 李华
网站建设 2026/9/20 11:31:16

JavaWeb商品管理系统实战:Servlet+JSP三层架构与部署全流程解析

简介&#xff1a;面向JavaWeb初学者及毕业设计学生&#xff0c;这套商品管理系统提供了从用户登录到后台管理的完整闭环。系统涵盖用户注册登录与角色权限区分&#xff0c;管理员可维护商品信息、商品分类、库存数量及订单状态&#xff0c;用户端支持购物车下单&#xff0c;后台…

作者头像 李华
网站建设 2026/9/20 11:30:53

CLI驱动的Git Diff代码评审工作流设计

1. 项目概述&#xff1a;这不是一个“工具”&#xff0c;而是一套可落地的代码评审工作流设计 “open-code-review”这个名字乍看像某个开源项目仓库名&#xff0c;但结合当前搜索热词——code review、CLI、LLM Agent、git diffs——它实际指向一个正在快速成型的新型工程实践…

作者头像 李华
网站建设 2026/9/20 11:30:38

如何让你的 Chrome 老 Flash 页面在 Ruffle 扩展中流畅运行

如何让你的 Chrome 老 Flash 页面在 Ruffle 扩展中流畅运行 【免费下载链接】ruffle A Flash Player emulator written in Rust 项目地址: https://gitcode.com/GitHub_Trending/ru/ruffle 打开老页面&#xff0c;本该有动画的位置只有一块灰白&#xff0c;写着"请…

作者头像 李华
网站建设 2026/9/20 11:28:21

WSL下配置Codex CLI:彻底解决unable to locate运行时组件错误

先说个我自己的经历&#xff1a;在 Windows 终端里codex --version敲下去&#xff0c;版本号正常弹出来&#xff0c;但一打开 VS Code 想调用 Codex CLI&#xff0c;直接给我甩一句unable to locate the codex cli binary or required runtime components。当时我还以为是安装路…

作者头像 李华