一句话简介:VoxCPM2 是 OpenBMB 开发的开源 AI 语音合成项目,GitHub 收获 34000+ Star,采用 Apache 2.0 协议,可商用。无需分词器,输入文字直接生成 48kHz 录音棚品质语音,覆盖 30 种语言与 9 种中文方言,集成声音克隆、情感控制、实时流式推理能力。本文介绍 VoxCPM2 的功能、原理、安装与使用方法。
一、VoxCPM2 是什么
VoxCPM2整合包 https://pan.quark.cn/s/84bfd922a424
是 OpenBMB 开发的开源 AI 语音合成(TTS)项目,截至目前 GitHub 收获34000+ Star,采用Apache 2.0 协议,完全免费且支持商用。
传统 TTS 流程依赖分词器(tokenizer)把文本切成音素或字符再逐段合成,常出现断句生硬、韵律机械的问题。VoxCPM2 跳过这一步,直接从原始文本生成语音,更好保留语流与情感起伏,输出48kHz 采样率,达到录音棚品质。
它的「造音」方式同样关键:用自然语言描述声音特征(如「年轻女性,温柔甜美」「中年男性,低沉沉稳」),即可合成一个全新的、不存在的声音,无需参考音频。这与必须克隆已有音频的方案有本质区别。
一句话理解:VoxCPM2 = 高品质 TTS + 自然语言造音 + 声音克隆 + 多语言方言,开箱即用的语音合成引擎。
二、核心能力
- 无需分词器:文字直出语音,断句与韵律自然,避免传统 TTS 的机械感
- 48kHz 高品质:录音棚级采样率,可直接用于视频配音、有声书、播客
- 自然语言造音:文字描述声音特征即可生成全新音色,无需参考音频
- 声音克隆:仅需少量参考音频,复刻目标说话人的音色与说话习惯
- 多语言合成:支持 30 种语言,跨语言切换自然
- 方言识别:自动识别输入文本中的方言,含粤语、四川话等 9 种中文方言
- 情感控制:通过描述或标签控制语气与情绪,实现喜怒哀乐等表达
- 实时流式推理:边生成边播放,长文本无需等待全部合成,适合对话与直播场景
三、与同类开源 TTS 对比
| 项目 | 开源协议 | 声音克隆 | 参考音频要求 | 多语言 | 中文方言 | 情感控制 | 流式推理 |
|---|---|---|---|---|---|---|---|
| VoxCPM2 | Apache 2.0 | 支持 | 造音无需 | 30 种 | 9 种 | 支持 | 支持 |
| GPT-SoVITS | MIT | 强 | 必需 | 多语言 | 部分 | 弱 | 支持 |
| ChatTTS | AGPL | 不支持 | 不需要 | 中英 | 否 | 强 | 支持 |
| CosyVoice | Apache 2.0 | 支持 | 必需 | 多语言 | 部分 | 支持 | 支持 |
选型参考:需要「不依赖参考音频、用文字直接造音」且要覆盖中文方言的,选 VoxCPM2;纯做声音克隆复刻,GPT-SoVITS 生态更成熟;做对话式口语化 TTS,ChatTTS 表现突出。
四、安装与使用
4.1 运行环境
- 显卡:建议 NVIDIA GPU,显存 6GB 以上(CPU 亦可运行,速度较慢)
- 系统:Windows 10 / 11 64 位
- 磁盘:预留约 12 GB 解压空间
4.2 安装步骤
- 获取本文提供的整合包(链接见文末「资源说明」)
- 解压到任意目录,路径不要带中文与空格
- 双击
start.bat启动脚本 - 等待 10–30 秒,浏览器自动打开 WebUI
- 在界面输入文本、选择或描述声音、点击合成,即可生成并保存语音
4.3 进阶用法
- 声音克隆:在「声音克隆」标签页上传 3–10 秒参考音频,等待特征提取完成,即可用该音色合成任意文本
- 自然语言造音:在声音描述框输入「年轻女性,温柔甜美」等描述,无需上传音频
- 方言合成:直接输入方言文本(如粤语、四川话),模型自动识别并合成对应方言
- 流式推理:长文本场景开启流式模式,边生成边播放
五、资源说明
本文附 Windows 便携版整合包,把模型权重、运行时与图形界面打包为一体,解压即可运行,无需单独配置 Python 与 CUDA 环境。
| 项目 | 信息 |
|---|---|
| 资源名称 | VoxCPM2 整合包(Windows 便携版) |
| 链接 | https://pan.quark.cn/s/84bfd922a424 |
| 文件大小 | 约 6 GB(含模型权重与运行时) |
| 更新日期 | 2026-08 |
| 解压密码 | 无 |
| 适用系统 | Windows 10 / 11 64 位 |
网盘资源需先转存至个人网盘再下载,速度更快;首次启动若被杀毒软件拦截,加入白名单即可。
六、常见问题
Q1:VoxCPM2 收费吗?能商用吗?完全免费,Apache 2.0 协议明确允许商用,无需额外授权。
Q2:没有 NVIDIA 显卡能用吗?可以。整合包支持 CPU 推理,但速度较慢,生成一句语音可能需数十秒。建议使用 6GB 显存以上的 NVIDIA 显卡。
Q3:声音克隆需要多长的参考音频?建议 3–10 秒清晰人声。过长不会明显提升效果,过短可能丢失音色特征。
Q4:和 GPT-SoVITS 选哪个?GPT-SoVITS 强在声音克隆的相似度与生态成熟度;VoxCPM2 强在无需参考音频的自然语言造音、48kHz 高品质与中文方言覆盖。要做全新音色配音选 VoxCPM2,要高度复刻某个具体人的声音选 GPT-SoVITS。
Q5:支持粤语、四川话吗?支持。VoxCPM2 覆盖 9 种中文方言,包括粤语、四川话等,输入对应方言文本即可自动识别合成。
Q6:整合包和源码手动部署有什么区别?整合包把模型权重、Python 运行时、CUDA 依赖、WebUI 全部打包,解压即用,不污染系统环境,适合无技术背景用户与离线部署。手动部署适合需要二次开发的研究者。
Q7:生成的语音能用于商业视频或有声书吗?可以。Apache 2.0 协议允许商用。若使用声音克隆功能,需确保被克隆声音的合法授权。
Q8:链接打不开或失效怎么办?先确认已登录网盘账号;若链接失效,评论区留言会及时更新地址。
七、相关链接
- GitHub 仓库:https://github.com/OpenBMB/VoxCPM
- 整合包:https://pan.quark.cn/s/84bfd922a424
声明
本文为技术评测与使用解析,所涉开源项目遵循其原始 Apache 2.0 协议,支持商用;整合包由作者整理,仅供学习交流。本内容来自平台创作者,仅提供信息存储空间服务。