GPT-SoVITS 少样本声音克隆版本选型指南:v1/v2/v3/v4/v2Pro 六版本一文讲清
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
GPT-SoVITS 是一个用 1 分钟人声就能克隆专属音色的少样本 TTS(语音合成)项目,但它先后推出了 v1、v2、v3、v4、v2Pro、v2ProPlus 六个版本,GPT-SoVITS 版本选型成了新手最常卡住的一步。这篇指南先把结论摆在你面前,再解释每一代为什么长这样,帮你一次选对。
先说结论:按场景对号入座
| 你的场景 | 直接选 | 一句话理由 |
|---|---|---|
| 低配机器、刚接触声音克隆 | v2 | 显存门槛最低,教程和共享模型最多 |
| 只在乎音质上限 | v4 | 原生 48kHz 输出,且修掉了 v3 的金属音 |
| 训练集是手机录音、带底噪 | v2 或 v2Pro | 低质量语料上表现反而更好,v3/v4 不行 |
| 直播、实时 TTS 等低延迟需求 | v2ProPlus | 4090 上实测 RTF 约 0.014,还支持流式推理 |
如果你不想细看下文,记住这一句:没有特殊情况,选 v2ProPlus。
三个技术代际,各讲三件事
轻量入门代:v1 与 v2 合并看
- 相对上一代的关键变化:v2 把预训练语料从约 2k 小时扩到 5k 小时,新增韩语和粤语(v1 只有中、英、日),重写了文本前端,中英混读和多音字更准,对低质量参考音频也更宽容。
- 适合谁:显存紧张的老显卡、想先跑通"1 分钟克隆声音"流程的人。v2 的社区生态最成熟,绝大多数第三方教程基于它。
- 代价:输出 32kHz 音频,音质上限不如 v3/v4;v1 已停止投入新特性,只是 v2 的前身。
音质优先代:v3 与 v4 合并看
- 相对上一代的关键变化:v3 是架构级升级——少样本甚至零样本的音色相似度明显提升,GPT 重复、漏字更少,并新增了 LoRA 训练(微调显存约 8GB,全量微调约 14GB,开梯度检查点可压到约 12GB)。v4 则是对 v3 的定向修复:解决非整数倍上采样导致的金属音,并把原生输出从 24kHz 提到 48kHz,作者自己把 v4 定义为 v3 的直接替代。
- 适合谁:显卡 ≥12GB、追求相似度与情感表达的人。
- 代价:两点。一是显存门槛高于 v2 一代;二是训练集平均音质较低时效果不佳,且合成音色更偏向参考音频本身,而不是整个训练集的风格。v3 的 24kHz 原生输出部分人会觉得偏闷,项目内置了 24k→48k 音频超分(见 tools/audio_sr.py)来缓解,但 v4 直接根治。
性能新代:v2Pro 与 v2ProPlus 合并看
- 相对上一代的关键变化:音质超过 v4,硬件成本和推理速度回到 v2 水平。v2ProPlus 的 RTF(推理耗时/音频时长)实测:4060Ti 约 0.028、4090 约 0.014,合成 1400 词(约 4 分钟)只需 3.36 秒。
- 适合谁:直播、实时 TTS、对延迟敏感的场景;它也保留了 v1/v2 同族的特性,即对平均音质一般的训练集更友好。
- 代价:比 v2 略占显存;音色风格属于 v2 家族(贴合训练集整体),如果你依赖 v3/v4 那种"贴参考音频"的效果,需要心理预期上的切换。流式推理入口在 GPT_SoVITS/stream_v2pro.py。
一张表横向对比五个版本
| 维度 | v1 | v2 | v3 | v4 | v2Pro / Plus |
|---|---|---|---|---|---|
| 语种支持 | 中/英/日 | +韩/粤 | 同 v2 | 同 v2 | 同 v2 |
| 输出采样率 | 32kHz | 32kHz | 24kHz(可超分) | 48kHz | 32kHz |
| 显存门槛 | 低 | 低 | 高(LoRA 约 8GB 起) | 高 | 中(比 v2 略高) |
| 音色跟随对象 | 训练集整体 | 训练集整体 | 偏参考音频 | 偏参考音频 | 训练集整体 |
| 低质量语料容忍度 | 尚可 | 较好 | 不推荐 | 不推荐 | 较好 |
| 预训练权重目录 | s2G488k.pth | gsv-v2final-pretrained/ | s2Gv3.pth | gsv-v4-pretrained/ | v2Pro/ |
训练入口也按代际分开:v1/v2 走 GPT_SoVITS/s2_train.py,v3/v4 走 GPT_SoVITS/s2_train_v3.py,LoRA 训练见 GPT_SoVITS/s2_train_v3_lora.py;服务端部署时 v3/v4 可用 GPT_SoVITS/export_torch_script_v3v4.py 导出 TorchScript。
避坑清单:坑点—原因—对策
v2 训的模型放到 v4 上跑不了原因:GPT/SoVITS 权重按版本分目录存放(
SoVITS_weights、_v2、_v3、_v4、_v2Pro、_v2ProPlus,映射逻辑见 config.py),互不通用。 对策:换版本就重新训练,底模预训练权重可以复用,不用重下全部资产。8GB 显存做 v3 全量训练直接爆显存原因:全量微调约需 14GB。 对策:走 LoRA 路线,官方支持 8GB 显存完成,这是 v3 系列对低显存声音克隆选型最友好的入口。
v3 听感比 v4 闷原因:v3 原生只出 24kHz,高频信息被砍掉。 对策:能升 v4 就升;短期可用项目内置的 24k→48k 超分过渡。
分不清下载的预训练权重属于哪个版本原因:文件名没有版本号前缀。 对策:对照上表最后一行,或看推理默认配置 GPT_SoVITS/TTS_infer_pack/TTS.py,推理参数模板在 GPT_SoVITS/configs/tts_infer.yaml。
默认推荐与切换提醒
默认推荐:直接上 v2ProPlus——音质超 v4、速度回到 v2 水平,除非你的训练集音质很高且显卡 ≥12GB(那选 v4),或者机器实在紧张(那选 v2)。
最后提醒一个容易翻车的点:各版本模型文件隔离存放,跨版本不通用,切换版本意味着重新训练;而 v1 需要显式启动(python webui.py v1),不带参数进入的默认是 v2 及以上版本,入口是 webui.py。各代完整演进细节可查阅官方文档 docs/cn/README.md。
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考