GPT-SoVITS 教程:1 分钟录音克隆音色,原生 48k 合成
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
GPT-SoVITS 是一款少样本 TTS 引擎:5 秒参考音频可零样本克隆音色,1 分钟录音即可微调出专属声音。v4 原生输出 48kHz 音频,v2ProPlus 在 RTX 4090 上 RTF 低至 0.014,1400 词文本仅 3.36 秒合成完,支持中、英、日、韩、粤五种语言。
三步装好环境与模型
环境门槛为 conda + Python 3.10,显卡需支持 CUDA 12.6/12.8,ROCm、MPS 与纯 CPU 也能跑。
git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device CU128 --source HF--device按硬件选 CU126/CU128/ROCM/MPS/CPU;--source选下载源,国内网络建议 ModelScope- 脚本会把预训练模型拉进 GPT_SoVITS/pretrained_models/,v4 需确认含
gsv-v4-pretrained/s2Gv4.pth与vocoder.pth - 追加
--download-uvr5可顺带下载人声分离模型
🔊 让第一条声音 5 分钟内出来
- 安装完执行
python webui.py,浏览器打开端口 9874 的 WebUI - 选择零样本模式,上传 5 秒左右的干净参考音频
- 模型下拉框选 v4,输入一段中文文本
- 点击合成,听到输出音即代表整条链路可用
拆解 48k 音质背后的三个机制
- 整数倍上采样链:GPT_SoVITS/configs/s2v2ProPlus.json 中各上采样阶段为 10、8、2、2、2,v3 的金属音正来自非整数倍上采样,该配置从根源消除;BigVGAN 直接产出 48k 音频,v3 仅 24k
- 两段式结构:GPT 模型负责语义与韵律,SoVITS 负责声学细节;预训练语料从 2k 小时扩到 5k 小时,1 分钟数据微调即明显优于零样本
- 半精度默认开启:
GPT_SoVITS/configs/tts_infer.yaml中is_half: true,新显卡下推理更快、显存更省
按需调整三个开关
- 训练集音质一般 → 模型下拉框改选 v2Pro 系列 → 音质接近 v4,硬件占用与速度等同 v2
- 显存不足 → 关闭半精度改跑 FP32 → 合成不再溢出;SM 6.1 以上新卡保留 FP16 换速度
- 无 GPU → 用
GPT_SoVITS/export_torch_script.py导出优化模型再推理 → 长文本分段合成,参考音频保持 5 秒左右
匹配三类落地场景
- 短视频/播客创作者:录 1 分钟自己的声音微调,后续口播由模型生成,48k 成品无需升采样直接交付
- 跨语言配音:中文素材训练,推理时切换日语、韩语、英语文本;WebUI 自带 UVR5 分离、自动切分、ASR 标注,一套流程攒出训练集
- 旧音频翻新:先经
tools/uvr5/分离人声、tools/cmd-denoise.py降噪,再合成替代配音,适合影视二创与配音修复
对照表格排查常见故障
| 症状 | 可能原因 | 解决方法 |
|---|---|---|
| 音色下拉框为空 | 预训练模型没放对位置 | 检查GPT_SoVITS/pretrained_models/是否含对应版本的.pth/.ckpt |
| 提示未找到显卡、退回 CPU | 驱动或 CUDA 缺失 | 装好驱动,或显式指定--device CPU |
| 合成出现金属音 | v3 权重或非整数倍上采样配置 | 换 v4 并重新下载vocoder.pth |
| v3/v4 效果不如 v2 | v3/v4 对数据质量挑剔 | 先分离降噪,或改用 v2Pro 系列 |
| Mac 训出的模型质量偏低 | 已知现象 | 改用 CPU 模式训练 |
| 显存溢出 | 显存不足 | 关闭半精度,或换更大显存的卡 |
- 先用 5 秒参考音频跑一次零样本合成,确认整条链路通了
- 录 1 分钟干净人声微调,对比相似度差异
- 升级版本前先看 docs/en/Changelog_EN.md 的更新记录
【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考