RVC部署完整指南:从安装到出声的两条路径
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
把10分钟的人声数据变成可用的AI音色模型,或让麦克风以170ms的延迟实时变声——这是Retrieval-based-Voice-Conversion-WebUI(下文简称RVC)能做的两件事。这篇RVC部署指南覆盖Windows、Linux与macOS,走完后你会在浏览器里打开训练推理界面,或在桌面端接上麦克风直接听到变声后的自己。
为什么是它
- 训练门槛高→ 常规做法要大量数据和好显卡,RVC用10分钟低底噪语音就能出不错的效果,中端显卡也跑得动。
- 分离人声要靠别的软件→ 内置UVR5模型,在界面里选个预设就能把人声和伴奏拆开。
- 变声后声音发闷、音高乱跳→ 音高提取用的是RMVPE算法(Interspeech 2023),效果显著更好,且比crepe_full更省资源。
- 基于特征的变声会"漏"原音色→ RVC用top1检索把源特征替换成训练集特征,从机制上杜绝泄漏。
- A卡、I卡用户常被排除在外→ 提供AMD(DirectML/ROCm)与Intel(IPEX)加速支持。
开始之前
| 前置条件 | 要求 | 说明 |
|---|---|---|
| 操作系统 | Windows / Linux / macOS | Windows体验最省事,有现成整合包 |
| Python | 3.8及以上 | macOS的run.sh会自动处理3.8环境 |
| 显卡 | N卡优先,A卡/I卡可用 | 非N卡用户要换对应的依赖清单 |
| ffmpeg | 已安装 | 负责音频读写;Windows需将ffmpeg.exe、ffprobe.exe放在根目录 |
| 预模型 | hubert、rmvpe、pretrained系列.pth等 | 用tools/download_models.py一键下载 |
| 磁盘 | 数GB空闲 | 预模型、训练日志与推理产物都要落盘 |
两条上手路径
Windows整合包:一键启动步骤
- 下载
RVC-beta.7z整合包并解压,包内已配好Python运行时与模型文件。 - 双击
go-web.bat,等待终端打印启动信息(该脚本等价于以7897端口运行infer-web.py)。 - 浏览器打开
127.0.0.1:7897。
✨你应该看到:训练推理网页正常打开,左侧有"人声分离""训练""推理"等标签页;若终端直接报错或提示文件找不到,多半是解压目录含中文或空格,换个纯英文路径重试。
Linux / macOS手动搭建:最快配置方法
第1步:拿到代码
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI第2步:安装依赖
- macOS走捷径:
sh ./run.sh会自动创建3.8虚拟环境、按requirements.txt装依赖、下载全部预模型,最后直接启动界面,一条命令完成。 - Linux / Windows:先装PyTorch(选择与本机驱动匹配的CUDA版本,RTX 30系建议指定cu117源),再按显卡类型安装对应依赖清单:
- N卡:
pip install -r requirements.txt - A卡(DirectML,Windows):requirements-dml.txt
- A卡(ROCm,Linux):requirements-amd.txt,个别显卡需设置
HSA_OVERRIDE_GFX_VERSION环境变量 - I卡(IPEX,Linux):requirements-ipex.txt,并先执行
source /opt/intel/oneapi/setvars.sh
- N卡:
第3步:下载预模型
python tools/download_models.py脚本会拉取hubert_base.pt、rmvpe.pt、vocals.onnx,以及pretrained与pretrained_v2两套底模和UVR5权重,对应仓库里的assets目录。
第4步:装ffmpeg
Ubuntu/Debian用apt install ffmpeg,macOS用brew install ffmpeg,Windows把ffmpeg.exe和ffprobe.exe放进根目录即可。
第5步:启动
python infer-web.py✨你应该看到:终端打印出Web地址,浏览器打开7897端口即出现完整界面。如果启动时报assets/... not found,回到第3步补下预模型。
两个使用场景
训练推理模式:批量产出音色模型
启动方式为python infer-web.py(Windows双击go-web.bat)。典型流程是在界面里依次完成人声分离、切片、训练、推理:先拿一段目标人声素材,训出一个音色模型,再把任意干声批量转成这个音色。训练完可分享的是weights文件夹里60MB以上的.pth文件,而不是logs里的大文件。适合做AI歌手、配音替换这类离线批处理任务。
实时变声模式:麦克风直接出效果
启动方式为Windows双击go-realtime-gui.bat,其他系统运行python gui_v1.py。官方实测端到端延迟170ms,换用ASIO输入输出设备可压到90ms(依赖硬件驱动支持)。适合直播、语音通话、游戏连麦这类要求"边说边变"的场景。
卡住了怎么办
音频读取报错:ffmpeg路径问题
- 现象:指定音频后读不出来,或报乱码错误
- 最可能原因:文件路径含空格、括号等符号
- 解决方式:把音频移到纯英文、无空格的目录再试
训练时CUDA out of memory
- 现象:训练中途显存爆掉
- 最可能原因:batch size偏大
- 解决方式:调小batch size;若卡在推理检索阶段,缩小configs/config.py末尾的x_pad、x_query、x_center、x_max四个参数
依赖安装中途失败
- 现象:pip安装报llvmlite冲突或版本错误
- 最可能原因:Python版本不在支持区间
- 解决方式:改用3.7–3.10(Poetry路径)或3.8(pip/run.sh路径)重装环境
N卡30系启动报CUDA错误
- 现象:torch能导入,运行时却提示CUDA版本不匹配
- 最可能原因:PyTorch wheel的CUDA版本与驱动不一致
- 解决方式:卸载后指定cu117源重装torch、torchvision、torchaudio三个包
实时变声延迟高、有卡顿
- 现象:实时模式下回音明显滞后
- 最可能原因:使用了普通声卡设备
- 解决方式:Windows换ASIO设备,或调小界面中的音频块参数
⚠️ 以上都没覆盖到你的情况时,先翻一下中文FAQ,大部分环境疑难都有现成答案。
继续深入
- docs/cn/faq.md:中文常见问题集,环境报错和训练调优的第一站。
- docs/cn/Changelog_CN.md:更新日志,升级或换整合包版本前先看这里。
- configs/config.py:全局参数文件,推理检索相关参数集中在文件末尾。
- tools/infer/:批量推理与索引训练的独立脚本,适合不想打开网页、只想跑命令的场景。
下一步建议:先拿自己录的一段1分钟干声走一遍"分离→训练→推理"完整流程,确认链路通了,再扩展到完整数据集。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考