news 2026/9/7 5:37:52

GPT-SoVITS 教程:1 分钟录音克隆音色,原生 48k 合成

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
GPT-SoVITS 教程:1 分钟录音克隆音色,原生 48k 合成

GPT-SoVITS 教程:1 分钟录音克隆音色,原生 48k 合成

【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS

GPT-SoVITS 是一款少样本 TTS 引擎:5 秒参考音频可零样本克隆音色,1 分钟录音即可微调出专属声音。v4 原生输出 48kHz 音频,v2ProPlus 在 RTX 4090 上 RTF 低至 0.014,1400 词文本仅 3.36 秒合成完,支持中、英、日、韩、粤五种语言。

三步装好环境与模型

环境门槛为 conda + Python 3.10,显卡需支持 CUDA 12.6/12.8,ROCm、MPS 与纯 CPU 也能跑。

git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device CU128 --source HF
  • --device按硬件选 CU126/CU128/ROCM/MPS/CPU;--source选下载源,国内网络建议 ModelScope
  • 脚本会把预训练模型拉进 GPT_SoVITS/pretrained_models/,v4 需确认含gsv-v4-pretrained/s2Gv4.pthvocoder.pth
  • 追加--download-uvr5可顺带下载人声分离模型

🔊 让第一条声音 5 分钟内出来

  1. 安装完执行python webui.py,浏览器打开端口 9874 的 WebUI
  2. 选择零样本模式,上传 5 秒左右的干净参考音频
  3. 模型下拉框选 v4,输入一段中文文本
  4. 点击合成,听到输出音即代表整条链路可用

拆解 48k 音质背后的三个机制

  • 整数倍上采样链:GPT_SoVITS/configs/s2v2ProPlus.json 中各上采样阶段为 10、8、2、2、2,v3 的金属音正来自非整数倍上采样,该配置从根源消除;BigVGAN 直接产出 48k 音频,v3 仅 24k
  • 两段式结构:GPT 模型负责语义与韵律,SoVITS 负责声学细节;预训练语料从 2k 小时扩到 5k 小时,1 分钟数据微调即明显优于零样本
  • 半精度默认开启GPT_SoVITS/configs/tts_infer.yamlis_half: true,新显卡下推理更快、显存更省

按需调整三个开关

  • 训练集音质一般 → 模型下拉框改选 v2Pro 系列 → 音质接近 v4,硬件占用与速度等同 v2
  • 显存不足 → 关闭半精度改跑 FP32 → 合成不再溢出;SM 6.1 以上新卡保留 FP16 换速度
  • 无 GPU → 用GPT_SoVITS/export_torch_script.py导出优化模型再推理 → 长文本分段合成,参考音频保持 5 秒左右

匹配三类落地场景

  • 短视频/播客创作者:录 1 分钟自己的声音微调,后续口播由模型生成,48k 成品无需升采样直接交付
  • 跨语言配音:中文素材训练,推理时切换日语、韩语、英语文本;WebUI 自带 UVR5 分离、自动切分、ASR 标注,一套流程攒出训练集
  • 旧音频翻新:先经tools/uvr5/分离人声、tools/cmd-denoise.py降噪,再合成替代配音,适合影视二创与配音修复

对照表格排查常见故障

症状可能原因解决方法
音色下拉框为空预训练模型没放对位置检查GPT_SoVITS/pretrained_models/是否含对应版本的.pth/.ckpt
提示未找到显卡、退回 CPU驱动或 CUDA 缺失装好驱动,或显式指定--device CPU
合成出现金属音v3 权重或非整数倍上采样配置换 v4 并重新下载vocoder.pth
v3/v4 效果不如 v2v3/v4 对数据质量挑剔先分离降噪,或改用 v2Pro 系列
Mac 训出的模型质量偏低已知现象改用 CPU 模式训练
显存溢出显存不足关闭半精度,或换更大显存的卡
  1. 先用 5 秒参考音频跑一次零样本合成,确认整条链路通了
  2. 录 1 分钟干净人声微调,对比相似度差异
  3. 升级版本前先看 docs/en/Changelog_EN.md 的更新记录

【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 5:37:44

智能汽车芯片选型实战:从技术、量产到口碑的三维判断框架

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 5:37:37

北京市环路矢量面数据:构建、质检与空间分析实战

简介:一套覆盖北京二环至六环的环路矢量面数据,基于2020年全国道路数据进行提取、拓扑检查与规整后生成,坐标系统一为WGS_1984_UTM_Zone_51N。该数据面向GIS制图、城市规划、道路可达性分析、行政区划展示等应用场景,二环至六环各…

作者头像 李华
网站建设 2026/9/7 5:36:35

迷你小模型崛起:从GitHub热榜到本地部署的实践指南

每天刷一遍 GitHub Trending 已经成为我这几年雷打不动的固定动作,今天的榜单给我一种很久没有过的兴奋感——霸榜的不是动辄几百 B 参数的“巨无霸”,而是一大批“迷你小模型”。这里的“迷你”并不是说能力缩水到只能当玩具,而是指那些能在…

作者头像 李华
网站建设 2026/9/7 5:36:19

Kinodynamic RRT*:融合动力学约束的机器人运动规划算法解析

简介:这份 Kinodynamic RRT* 算法的 MATLAB 实现,面向机器人路径规划研究者和爱好者,解决在几何与动力学约束下搜索可行最优路径的问题。资源将 RRT* 的渐进最优性与动力学模型相结合,覆盖状态空间表示、距离函数设计、随机采样、…

作者头像 李华
网站建设 2026/9/7 5:35:56

腾讯云上构建生产级Agent:AI Skills与工程化落地全攻略

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华