news 2026/9/1 20:51:20

RVC部署完整指南:从安装到出声的两条路径

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RVC部署完整指南:从安装到出声的两条路径

RVC部署完整指南:从安装到出声的两条路径

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

把10分钟的人声数据变成可用的AI音色模型,或让麦克风以170ms的延迟实时变声——这是Retrieval-based-Voice-Conversion-WebUI(下文简称RVC)能做的两件事。这篇RVC部署指南覆盖Windows、Linux与macOS,走完后你会在浏览器里打开训练推理界面,或在桌面端接上麦克风直接听到变声后的自己。

为什么是它

  • 训练门槛高→ 常规做法要大量数据和好显卡,RVC用10分钟低底噪语音就能出不错的效果,中端显卡也跑得动。
  • 分离人声要靠别的软件→ 内置UVR5模型,在界面里选个预设就能把人声和伴奏拆开。
  • 变声后声音发闷、音高乱跳→ 音高提取用的是RMVPE算法(Interspeech 2023),效果显著更好,且比crepe_full更省资源。
  • 基于特征的变声会"漏"原音色→ RVC用top1检索把源特征替换成训练集特征,从机制上杜绝泄漏。
  • A卡、I卡用户常被排除在外→ 提供AMD(DirectML/ROCm)与Intel(IPEX)加速支持。

开始之前

前置条件要求说明
操作系统Windows / Linux / macOSWindows体验最省事,有现成整合包
Python3.8及以上macOS的run.sh会自动处理3.8环境
显卡N卡优先,A卡/I卡可用非N卡用户要换对应的依赖清单
ffmpeg已安装负责音频读写;Windows需将ffmpeg.exe、ffprobe.exe放在根目录
预模型hubert、rmvpe、pretrained系列.pth等用tools/download_models.py一键下载
磁盘数GB空闲预模型、训练日志与推理产物都要落盘

两条上手路径

Windows整合包:一键启动步骤

  1. 下载RVC-beta.7z整合包并解压,包内已配好Python运行时与模型文件。
  2. 双击go-web.bat,等待终端打印启动信息(该脚本等价于以7897端口运行infer-web.py)。
  3. 浏览器打开127.0.0.1:7897

你应该看到:训练推理网页正常打开,左侧有"人声分离""训练""推理"等标签页;若终端直接报错或提示文件找不到,多半是解压目录含中文或空格,换个纯英文路径重试。

Linux / macOS手动搭建:最快配置方法

第1步:拿到代码

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

第2步:安装依赖

  • macOS走捷径:sh ./run.sh会自动创建3.8虚拟环境、按requirements.txt装依赖、下载全部预模型,最后直接启动界面,一条命令完成。
  • Linux / Windows:先装PyTorch(选择与本机驱动匹配的CUDA版本,RTX 30系建议指定cu117源),再按显卡类型安装对应依赖清单:
    • N卡:pip install -r requirements.txt
    • A卡(DirectML,Windows):requirements-dml.txt
    • A卡(ROCm,Linux):requirements-amd.txt,个别显卡需设置HSA_OVERRIDE_GFX_VERSION环境变量
    • I卡(IPEX,Linux):requirements-ipex.txt,并先执行source /opt/intel/oneapi/setvars.sh

第3步:下载预模型

python tools/download_models.py

脚本会拉取hubert_base.pt、rmvpe.pt、vocals.onnx,以及pretrained与pretrained_v2两套底模和UVR5权重,对应仓库里的assets目录。

第4步:装ffmpeg

Ubuntu/Debian用apt install ffmpeg,macOS用brew install ffmpeg,Windows把ffmpeg.exe和ffprobe.exe放进根目录即可。

第5步:启动

python infer-web.py

你应该看到:终端打印出Web地址,浏览器打开7897端口即出现完整界面。如果启动时报assets/... not found,回到第3步补下预模型。

两个使用场景

训练推理模式:批量产出音色模型

启动方式为python infer-web.py(Windows双击go-web.bat)。典型流程是在界面里依次完成人声分离、切片、训练、推理:先拿一段目标人声素材,训出一个音色模型,再把任意干声批量转成这个音色。训练完可分享的是weights文件夹里60MB以上的.pth文件,而不是logs里的大文件。适合做AI歌手、配音替换这类离线批处理任务。

实时变声模式:麦克风直接出效果

启动方式为Windows双击go-realtime-gui.bat,其他系统运行python gui_v1.py。官方实测端到端延迟170ms,换用ASIO输入输出设备可压到90ms(依赖硬件驱动支持)。适合直播、语音通话、游戏连麦这类要求"边说边变"的场景。

卡住了怎么办

音频读取报错:ffmpeg路径问题

  • 现象:指定音频后读不出来,或报乱码错误
  • 最可能原因:文件路径含空格、括号等符号
  • 解决方式:把音频移到纯英文、无空格的目录再试

训练时CUDA out of memory

  • 现象:训练中途显存爆掉
  • 最可能原因:batch size偏大
  • 解决方式:调小batch size;若卡在推理检索阶段,缩小configs/config.py末尾的x_pad、x_query、x_center、x_max四个参数

依赖安装中途失败

  • 现象:pip安装报llvmlite冲突或版本错误
  • 最可能原因:Python版本不在支持区间
  • 解决方式:改用3.7–3.10(Poetry路径)或3.8(pip/run.sh路径)重装环境

N卡30系启动报CUDA错误

  • 现象:torch能导入,运行时却提示CUDA版本不匹配
  • 最可能原因:PyTorch wheel的CUDA版本与驱动不一致
  • 解决方式:卸载后指定cu117源重装torch、torchvision、torchaudio三个包

实时变声延迟高、有卡顿

  • 现象:实时模式下回音明显滞后
  • 最可能原因:使用了普通声卡设备
  • 解决方式:Windows换ASIO设备,或调小界面中的音频块参数

⚠️ 以上都没覆盖到你的情况时,先翻一下中文FAQ,大部分环境疑难都有现成答案。

继续深入

  • docs/cn/faq.md:中文常见问题集,环境报错和训练调优的第一站。
  • docs/cn/Changelog_CN.md:更新日志,升级或换整合包版本前先看这里。
  • configs/config.py:全局参数文件,推理检索相关参数集中在文件末尾。
  • tools/infer/:批量推理与索引训练的独立脚本,适合不想打开网页、只想跑命令的场景。

下一步建议:先拿自己录的一段1分钟干声走一遍"分离→训练→推理"完整流程,确认链路通了,再扩展到完整数据集。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/1 20:45:38

AI辅助开发:用HTML5 Canvas构建坦克大战关卡编辑器

“AI 写不了完整项目”这句话&#xff0c;我最近有了一点新看法。前阵子我想做一个坦克大战的关卡编辑器&#xff0c;不是那种简单画几个方块的小 Demo&#xff0c;而是一个能绘制地图、摆放坦克、配置敌人波次、导出 JSON、再让游戏运行时直接加载的可视化工具。本来以为要写两…

作者头像 李华
网站建设 2026/9/1 20:45:05

乒乓球编排软件实战经验:从赛程生成到临场调度全解析

简介&#xff1a;乒乓球比赛编排工具&#xff0c;专为赛事组织者与裁判设计&#xff0c;支持单循环、双循环、淘汰赛及混合赛等多种赛制&#xff0c;可自动完成分组、抽签、积分计算与对阵图表更新&#xff0c;帮助快速生成公平赛程。绿色免安装、可直接运行&#xff0c;适合校…

作者头像 李华
网站建设 2026/9/1 20:44:57

狸窝全能视频转换器免安装版:轻量便携的格式转换利器

简介&#xff1a;狸窝全能视频转换器4.2.0.2免安装版是一款面向个人用户与视频爱好者的影音处理工具&#xff0c;无需安装即可启动使用。软件覆盖多种常见视频格式互转&#xff0c;兼容MP4、AVI、MKV、FLV等格式&#xff0c;并支持高清与3D视频转换&#xff0c;同时内置iPhone、…

作者头像 李华
网站建设 2026/9/1 20:44:32

OpenClaw + Ollama 开发者分享文档

OpenClaw Ollama 开发者分享文档 文档结构 章节内容1分享定位与时长2AI Agent 概念、组成、风险3OpenClaw 架构与适用场景4安装、初始化、配置、模型、记忆、基础使用5OpenClaw vs Cursor&#xff08;边界与选型&#xff0c;全文只在此处展开&#xff09;6OpenClaw 差异化场…

作者头像 李华
网站建设 2026/9/1 20:41:23

萨博隐身超音速无人战斗机概念:系统架构与关键技术全解析

萨博公布隐身超音速无人战斗机概念&#xff1a;从系统架构到关键技术全解析最近萨博&#xff08;Saab&#xff09;公开了新一代隐身超音速无人战斗机概念&#xff0c;一下子把大家的目光拉回到“无人作战飞机到底能做到什么程度”这个话题上。对于做嵌入式、飞控算法、仿真测试…

作者头像 李华