MoneyPrinterTurbo语音合成指南:如何选出让AI短视频听起来像真人配音的声音
【免费下载链接】MoneyPrinterTurbo利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short videos from a topic or keyword with an automated AI workflow.项目地址: https://gitcode.com/GitHub_Trending/mo/MoneyPrinterTurbo
MoneyPrinterTurbo 是一款基于 AI 大模型的开源短视频生成工具:输入一个主题或关键词,即可自动完成写文案、配音、加字幕、配背景音乐,一键产出高清短视频。其中「语音合成(TTS)」是决定成片质感的关键环节——声音没选对,再好的画面也会显得"假"。这篇指南带你快速选出让 AI 短视频听起来像真人配音的声音,并学会调节语速、音量,让成片更自然。
💡一句话结论:中文视频首选晓晓(Xiaoxiao);新闻/财经类选晓伊(Xiaoyi)或云扬(Yunyang);纪录片/科普男声选云健(Yunjian);想要更真实的声音,配置 Azure Key 后解锁 V2 高品质声音。
MoneyPrinterTurbo 语音合成原理:两档"配音引擎"
MoneyPrinterTurbo 的配音由 app/services/voice.py 实现,内置了两档引擎:
| 引擎 | 声音数量 | 音质 | 费用 | 需要配置 |
|---|---|---|---|---|
| Edge TTS | 中文/英文/粤语/闽南语/越南语等主流音色 | 自然 | 免费 | 无需任何配置 |
| Azure v2 | 少量MultilingualNeural-V2音色 | 更接近真人 | 按量计费 | 需填 Speech Key 和 Region |
- Edge TTS(默认):开箱即用,覆盖绝大多数场景,新手直接用即可。
- Azure v2:在界面中选择带
-V2后缀的声音后,会自动出现Speech Key/Speech Region输入框;也可在配置文件 config.example.toml 的[azure]段中写入speech_key和speech_region,适合对"真人感"要求更高的用户。
中文配音音色速查表:按内容类型选声音
完整音色列表见 docs/voice-list.txt。下面这张表覆盖了 90% 的中文创作场景:
| 音色名称 | 性别 | 风格 | 推荐场景 |
|---|---|---|---|
zh-CN-XiaoxiaoNeural | 女 | 温柔自然、默认首选 | 情感故事、生活类、泛知识口播 |
zh-CN-XiaoyiNeural | 女 | 沉稳播报 | 新闻资讯、商业资讯 |
zh-CN-YunjianNeural | 男 | 低沉有磁性 | 纪录片、科技深度内容 |
zh-CN-YunxiNeural | 男 | 年轻阳光 | 科普、年轻化内容 |
zh-CN-YunxiaNeural | 男 | 童声 | 亲子、儿童故事 |
zh-CN-YunyangNeural | 男 | 专业主播 | 财经、企业宣传 |
zh-CN-liaoning-XiaobeiNeural | 女 | 东北方言 | 搞笑、剧情短视频 |
zh-CN-shaanxi-XiaoniNeural | 女 | 陕西方言 | 趣味内容、地方文化 |
小技巧:音色名称的前缀就是语言(
zh-CN普通话、en-US美音、zh-TW台语、zh-HK粤语、vi-VN越南语),想让视频说哪种语言,就选哪种前缀的音色。
WebUI 四步设置"像真人"的配音
启动 webui/Main.py 打开图形界面,在「Audio Settings(音频设置)」面板完成以下 4 步:
第 1 步:选择音色。在"语音合成"下拉框中选择音色,界面会显示"女声/男声"等友好名称,系统默认记住你上次选择的声音。
第 2 步:先试听再生成。点击「Play Voice(播放声音)」按钮,系统会立刻用你已输入的主题或文案合成一段试听音频——这是判断"像不像真人"最有效的方法,不满意就换一个音色,成本几乎为零。
第 3 步:调节语速。语速选项为 0.8x~2.0x,默认 1.0x。短视频建议:
- 生活/情感类:
1.0~1.1(从容不赶) - 知识/资讯类:
1.2~1.3(信息密度高) - 避免
1.8以上,语速过快会放大"机械感"
第 4 步:音量与背景音乐搭配。旁白音量默认 1.0,背景音乐音量默认 0.2。记住"人声为主、BGM 垫底",BGM 太大声会盖住旁白,显得廉价。
字幕与配音是"绑定"生成的
MoneyPrinterTurbo 的字幕时间轴来自语音合成时的逐词时间戳(WordBoundary),再由 app/services/subtitle.py 按标点切分成字幕条。这意味着:
- 换音色、改语速后,字幕会自动重新对齐,无需手动调整;
- 语速调得越夸张,字幕断句越容易"赶",保持 1.0~1.3 最稳;
- 想要更精准的字幕,可在配置中将
subtitle_provider从edge切换为whisper。
更多语音合成说明见官方文档:sites/docs/zh/guide/speech-synthesis.md。
进阶:用 API 调用同一套配音能力
MoneyPrinterTurbo 同时提供 REST API,视频生成接口接收同样的voice_name、voice_rate、voice_volume参数,可以把它嵌入自己的内容工作流(如批量生成矩阵账号视频):
也就是说,你在 WebUI 里试出来的"声音+语速"组合,可以直接原样写进 API 请求,实现"人工调好、机器量产"。
常见问题 FAQ
Q1:试听/合成失败或没有声音?Edge TTS 依赖外网访问,检查网络是否通畅;WebUI 有内置重试,连续失败时会用兜底文案再试一次。
Q2:选 V2 声音后合成失败?V2 声音必须正确填写 Azure 的Speech Key与Speech Region,两个值任一为空或错误都会失败。
Q3:想让声音"更真人",值不值得上 Azure v2?V2 音色的停顿和重音更接近真人主播,适合长期运营账号的固定"人设声";只是偶尔做视频,Edge TTS 的晓晓/云健已经足够自然。
Q4:声音选好了,成品里声音还是"机器味"?先检查语速是否超过 1.3,再检查 BGM 音量是否压过人声——90% 的"假"来自这两项而不是音色本身。
相关资料
- 完整音色列表:docs/voice-list.txt
- 语音合成核心源码:app/services/voice.py
- WebUI 音频设置面板:webui/Main.py
- 配置示例(含
[azure]语音 Key):config.example.toml - 官方语音合成文档:sites/docs/zh/guide/speech-synthesis.md
【免费下载链接】MoneyPrinterTurbo利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short videos from a topic or keyword with an automated AI workflow.项目地址: https://gitcode.com/GitHub_Trending/mo/MoneyPrinterTurbo
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考