news 2026/9/20 23:08:02

RVC 变声器:10 分钟录音,跑通一个可换声色的语音模型

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RVC 变声器:10 分钟录音,跑通一个可换声色的语音模型

RVC 变声器:10 分钟录音,跑通一个可换声色的语音模型

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

RVC 变声器是什么,适合谁

RVC 变声器是一个开源的语音转换工具:你给一段目标人声录音,它训出一个音色模型,之后任何音频进去都换成那个音色输出。输入是 10 到 50 分钟的 WAV 人声录音。输出是一个约 60MB 的 .pth 模型文件和转换后的音频。适合给视频配音、给游戏换声、做翻唱的内容创作者和爱好者。手里连一段干净录音都没有的,不适合先上这条路。

跑起来之前,先回答三个问题

跑 RVC 之前,把 RVC 显存要求、录音量、环境依赖这三件事先对一遍,后面才不会卡住。

我的显卡够吗

4GB 显存能跑。

配置最低要求推荐说明
显存4GB6GB 以上4GB 以下(3GB、2GB)官方 FAQ 建议放弃
显卡类型NVIDIA 或 A 卡/CPUNVIDIAA 卡 Windows 走 DirectML,Linux 走 CPU
内存8GB16GB切分和音高提取吃 CPU 多进程,内存紧就把 CPU 进程数调低
Python3.12 x643.12 x64本分支只认 3.12

需要准备多少录音

10 分钟起步,50 分钟封顶。

  • 官方建议总时长 10~50 分钟
  • 底噪低、音色有辨识度,5~10 分钟也行
  • 单条片段 30 秒到 2 分钟
  • 语速、语调、情绪要有变化
  • 统一转成 WAV,采样率会自动重采样

需要装哪些东西

三样:Python 3.12 环境、ffmpeg、预训练模型文件。

sudo apt install ffmpeg python -m venv .venv source .venv/bin/activate pip install -r requirments_cpu_py312.txt

三样都齐了,下面开始跑。

最小路径:从 10 分钟录音到一条转换出的音频

RVC 变声器最小路径一共 5 步,全部在项目根目录执行。

第 1 步:拉代码装依赖

拉代码,按你的硬件装依赖。

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv .venv source .venv/bin/activate pip install -r requirments_cpu_py312.txt

NVIDIA 卡先装 CUDA 11.8 版 torch,再把最后一行换成pip install -r requirments_cu118_py312.txt,RTX 50 系用 cu128,两阶段装法参考 README.md。Windows 激活虚拟环境用.venv\Scripts\activate

看到python -c "import torch"正常打印版本号即成功。

第 2 步:下载预训练模型

底模缺了,训练和推理都起不来。

pip install -U huggingface_hub hf download lj1995/VoiceConversionWebUI --revision main --include "hubert_base/*" --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main --local-dir assets/rmvpe hf download lj1995/VoiceConversionWebUI --revision main --include "pretrained/*" "pretrained_v2/*" --local-dir assets

看到 assets/hubert_base/、assets/rmvpe/rmvpe.pt、assets/pretrained_v2/f0G40k.pth 都在即成功。

第 3 步:启动 WebUI

一条命令,浏览器自动打开。

python webui.py

无桌面的服务器加--noautoopen;Windows 也可以直接双击 go-webui.bat 走整合包。

看到浏览器出现 RVC WebUI 页面、默认端口 7865 即成功。

第 4 步:一键训练

在"训练"页填好参数,点一键训练。

  • 填实验名(如 my-voice)和训练文件夹路径
  • 目标采样率 48k、版本 v2、模型带音高指导
  • 音高提取算法 rmvpe、总轮数 20、其余用默认

接着自动跑数据切分、F0 与 HuBERT 特征提取、模型训练、索引训练四段,日志写在 logs/my-voice/ 下。

看到 assets/weights/ 出现 my-voice.pth、logs/my-voice/ 出现 added_ 开头的 .index 即成功。没有索引就再按一次"训练特征索引"。

第 5 步:推理验证

在"模型推理"页选模型,转换一段音频。

点"刷新音色列表",推理音色里选实验名,上传一段音频,变调填 0,点"转换"。

看到输出音频能播放、音色和训练集对得上即成功。

效果不满意?调这几个旋钮

默认参数能出结果,但 RVC 变声器的效果取决于以下几个变量。

参数默认值怎么调调了会怎样
总轮数 total_epoch20底噪大数据 20~30,干净长数据 200噪数据训太多轮会把噪音学进去,干净数据训太少没收敛
保存频率 save_every_epoch5调小,多留检查点检查点多才能逐个试听,挑最早达标的,避免过拟合
batch_size约显存 GB 数的一半OOM 就往下调,最低 1调小稳定、调大提速,1 还 OOM 说明显存低于 4GB
检索特征占比 index rate0.750~1 之间拉调高锚定训练集音色,调低音质上限更高但可能音色泄露
保护值 protect0.33有电音就调低保护清辅音和呼吸声,调低保护力度更大
  • 如果出现输出有电音、撕裂声,大概率是清辅音没保护好,把 protect 从 0.33 调到 0.2 试试
  • 如果出现输出音色往输入音频或底模靠(音色泄露),大概率是 index rate 太低,把它调到 1 试试
  • 如果训练报 out of memory,大概率是 batch size 太大,逐个往下调;调到 1 还报,就是显存低于 4GB,只能换卡

从单条到批量和实时变声

RVC 变声器跑通单条之后,剩下三个场景都直接可触发。

批量转换一个文件夹

"模型推理"页下有"批量推理"选项卡。填输入音频文件夹路径和输出文件夹(默认 opt),选模型和导出格式,点转换。

限制:批量推理 index rate 默认是 1,和单次推理的 0.75 不同,同一段音频两个入口结果会有差异。

说话实时变声

Windows 双击 go-realtime_gui.bat,其他平台跑python realtime_gui.py。界面里选模型和索引、选音频输入输出设备即可开始。

限制:端到端延迟 170ms,换 ASIO 设备能压到 90ms,但依赖声卡驱动支持,普通 USB 声卡别指望这个数。

翻唱:先分离再转换

用"伴奏人声分离&去混响&去回声"选项卡的 UVR5 模型,把混音拆成人声和伴奏,人声再进推理页转换。

限制:要先下载 uvr5_weights,分离质量取决于混音本身。

  • □ 把一段不在训练集里的新录音扔进去,输出音色应该和那个人对得上
  • □ 把变调设为 +12,输出应该比输入高一个八度
  • □ 同一模型带索引和不带索引各推一次,带索引的音色相似度应该更稳

三个都过了,流程就通了。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/20 23:07:56

rrvideo 使用指南:将 rrweb 会话录制(JSON)转换为视频(WebM)

前端可观测性开发工具 【免费下载链接】rrweb record and replay the web 项目地址&#xff1a; https://gitcode.com/gh_mirrors/rr/rrweb 点击查看 免费下载 rrvideo 是 rrweb 生态中一个轻量的命令行工具&#xff0c;用于把 rrweb 录制得到的会话数据&#xff08;JSON 格式…

作者头像 李华
网站建设 2026/9/20 23:05:58

Upsonic 快速上手:用 Python 构建自主 AI 智能体的完整指南

Upsonic 快速上手&#xff1a;用 Python 构建自主 AI 智能体的完整指南 【免费下载链接】gpt-computer-assistant Build autonomous AI agents in Python. 项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-computer-assistant 每天早上花 40 分钟拼一份市场简报&…

作者头像 李华
网站建设 2026/9/20 23:04:25

RPCS3 补丁管理器完整指南:5 步安装并启用 PS3 游戏补丁

RPCS3 补丁管理器完整指南&#xff1a;5 步安装并启用 PS3 游戏补丁 【免费下载链接】rpcs3 PlayStation 3 emulator and debugger 项目地址: https://gitcode.com/GitHub_Trending/rp/rpcs3 昨晚我用 RPCS3&#xff08;PS3 模拟器&#xff09;跑起一款老游戏&#xff0…

作者头像 李华