做虚拟歌手翻唱或原创调校时,经常会看到歌曲信息里标注(diffsinger)。如果你还不清楚这个标记代表什么,也不明白为什么有人能把一首多人合唱做得像真人录音一样自然,那么这篇教程会比较适合你。
下面以《Split Dance feat.sakine ran 竹音パンダ(diffsinger)》这个传播场景为例,完整拆解 DiffSinger 在 OpenUTAU 工作流中的使用方式。内容包括环境准备、音素标注、多音轨合唱、渲染导出以及常见问题排查。整套流程不只适用于这一首作品,也可以复用到其他双人合唱项目里。
1. DiffSinger 是什么?
1.1 从“音源”和“引擎”两个概念说起
在 UTAU、VOCALOID 或 OpenUTAU 的生态里,有两个概念经常被混在一起:
- 音源(Voicebank / Singer)
- 合成引擎(Engine / Renderer)
音源相当于“歌手的声音素材或声音模型”,它决定了音色、语言、发音习惯和表现力。引擎则是“如何把这些声音素材变成歌声”的计算程序。
传统 UTAU 时代,音源通常是一组经过剪辑的 wav 文件,引擎在播放时把每个音节的声音片段拼接、拉伸、变调,再与伴奏混合。这种做法实现简单,但很容易出现明显的机械感和电子感。
DiffSinger 并不是一个音源,而是一套基于神经网络的歌声合成引擎。它的核心思路是用扩散模型(Diffusion Model)从噪声中逐步生成声学特征,再通过声码器转换成可听的波形。因此在发音自然度、气息连接、高音稳定性和情感表达上,都比传统拼接式合成更接近真人录音。
标题中的(diffsinger)标记,通常表示这首作品不是用 VOCALOID 编辑器或 UTAU 拼接出来的,而是以 DiffSinger 引擎作为渲染后端完成的。
1.2 DiffSinger 解决什么问题
DiffSinger 主要解决三个传统歌声合成里非常棘手的问题。
第一个问题是音色不连续。传统拼接音源在跨音区、跨咬字时容易出现音色断层,DiffSinger 生成声学特征时会对整句上下文建模,音色过渡更平滑。
第二个问题是发音抖动。拼接音源的呼吸声、辅音和元音是独立处理的,在快速歌词中容易丢音或“吞字”。DiffSinger 在生成时会参考整句音素序列和音高曲线,节奏密集的段落也能保持稳定发音。
第三个问题是表情不足。传统引擎虽然有音量、颤音、滑音等参数,但本质上还是对已有素材做后期加工。DiffSinger 可以直接生成带有气息、嘶哑感、气声等特征的声学参数,相当于在生成阶段就参与了“演唱”,而不是在播放阶段再做效果。
1.3 为什么双人合唱项目适合用来学 DiffSinger
虚拟歌手双人合唱看起来只比单人多了“一个声部”,实际难度会成倍增加。常见问题包括:两个音源音色不融合、合唱声场重叠、节奏一快就发不清字、同音高位置互相“打架”。
DiffSinger 做双人合唱有天然优势:
- 每个声部可以放在独立音轨上,单独设置音源。
- 可以根据声库特点分配主唱与和声。
- 相同文本可以复制到另一音轨再改音高,形成八度合唱或三度和声。
- 导出时可以分轨输出,方便后期在 DAW 中统一混音。
所以今天就围绕一个简化的双人合唱案例来演示:一首歌中既需要 A 音源唱主线,又需要 B 音源补和声,并用 DiffSinger 完成最终渲染。
2. 环境准备与版本说明
2.1 工具链清单
在开始之前,需要先准备好以下基础组件:
| 组件 | 作用 | 说明 |
|---|---|---|
| OpenUTAU | 工程编排与前端 | 支持多音轨、多音源、主流音素化器 |
| DiffSinger 渲染器 | 后端声学推理 | 在 OpenUTAU 内接入神经网络模型 |
| DiffSinger 声库 | 歌手声音模型 | 需要单独下载与安装 |
| 音素化器 | 将歌词转换为音素序列 | 根据声库语言选择 |
| 伴奏文件 | 歌曲背景音乐 | 用于对齐音符和判断演唱风格 |
| DAW | 后期混音 | 例如 Audacity、Cakewalk、Reaper 等 |
其中 DiffSinger 声库的文件格式通常不是传统 UTAU 的oto.ini + wav,而会包含神经网络模型文件和模型所需读取的音素表。因此安装方式和传统音源不完全一样。
如果是从别人手里拿到“既支持传统 UTAU 又支持 DiffSinger”的音源包,请优先阅读声库自带的说明文档,确认声库名称、词典、语言和推荐引擎。
开头的项目标题中出现的两个名字,可以理解为参与这首翻唱的不同“歌手”或不同“音色轨道”。在 OpenUTAU 中,每个名称对应一条独立音轨,并分别加载对应声库。
2.2 版本选择策略
关于版本,我不打算给出一个绝对固定的“推荐版本”,原因很简单:DiffSinger 生态更新较快,声库作者未必会立刻兼容最新版引擎。
建议遵循以下原则:
- 先看声库作者有没有明确推荐 OpenUTAU 版本。
- 优先选择当前正式渠道发布的最新稳定版本。
- 不要为了追求新功能而选择可能导致声库不兼容的预览版。
- 如果声库是英文或日文资料,还需要确认 OpenUTAU 是否正确配置了对应语言的音素化器。
在演示项目里,我会按“通用环境”来写。如果你只是学习用法,不用刻意追求某个大版本;重点是先把流程跑通,再慢慢调整细节。
3. DiffSinger 核心流程拆解
3.1 合成链路里每一步都在做什么
DiffSinger 的最终产物是歌声音频,但它并不是直接从音频到音频的“翻唱工具”。它依赖一条完整的信息链:
- 歌词文本
- 音素序列
- 每个音符的时长
- 音高曲线
- 声学模型推理
- 声码器生成波形
换句话说,用户必须先告诉系统:这段旋律里有哪些字、字在哪个时间点发声、音高大概是多少。DiffSinger 再根据这些条件,生成自然歌声。
所以在项目中能看到的工作,其实主要围绕“歌词音符编辑”和“音高曲线微调”展开。DiffSinger 不是简单地把人声“修音”,而是根据你提供的音符信息重建一段演唱。
这也带来一个操作习惯上的变化:越想让 AI 歌手唱得有感情,就越要把音符边界、音高起伏、特殊演唱记号做清楚。
3.2 音素化器:歌词怎么变成声音
音素是语言中最小的发音单位。例如中文“你好”可以表示为n i h ao;英文“dance”可以粗略表示为d ae n s;日文“さき”可以表示为s a k i。
DiffSinger 引擎不能直接读“你好”这种汉字或“さき”这种假名,它需要一个前置模块把它拆成音素。音素化器(Phonemizer)就是做这件事的组件。
在 OpenUTAU 中,每个音轨都可以选择对应的音素化器。
- 中文选择基于汉语拼音或注音方案音素化器。
- 日文选择基于罗马音或假名音素化器。
- 英文选择基于英文音素化器。
- 如果是一句歌词里夹杂日文和英文,需要视声库是否支持混合语言而定。
很多 DiffSinger 声库在发布时已经绑定了词表,只支持某一种语言。这时即便你把它放进其他语言的工程,也不能正确合成。遇到加载或发音异常时,第一个要检查的就是音素器与声库语言是否匹配。
3.3 多音轨合唱中的“声部分工”
在双人合唱项目中,推荐使用两条独立音轨,而不是把两个音源放在同一条音轨上“轮流切歌”。
原因有三个:
- 两条音轨可以分别设置不同音源。
- 每条音轨都有独立的音高曲线与音量包络。
- 渲染后可以分别导出单轨干声,方便混音。
以《Split Dance feat.sakine ran 竹音パンダ》这类作品为例,结构差不多是:
- 音轨 A:主旋律声部,前段唱主歌,副歌也唱主旋律。
- 音轨 B:和声声部,副歌进入伴唱,音高比主旋律低三度或高三度。
- 如果要更丰富,还可以再加一条音轨 C 做高八度副歌铺底。
在 OpenUTAU 中操作时,只需要为每条音轨设置自己的音源即可。主旋律与和声可以使用同一个音源,也可以使用不同音色,实际操作非常灵活。
3.4 绘制音符时要注意“语义”而不是“视觉”
有过 UTAU 经验的人会习惯把单词拆成最小音节后,一个音节占一个音符。但 DiffSinger 场景下,这种处理不一定总是最优。
比如英文Split Dance,如果将每个字母都单独放一个音符,容易让系统把辅音和元音切开,最终听起来像是逐字蹦出。正确做法是尽量按“单词或音节”的长度分布音符,并把音高和时值画在正确位置,让 DiffSinger 自己去生成内部过渡。
规则归纳如下:
| 语言 | 推荐输入单位 | 说明 |
|---|---|---|
| 中文 | 汉字或带音调拼音 | 避免把声母韵母强制拆成两个独立音符 |
| 日文 | 假名或罗马音 | 多个假名可连续输入,系统按词典拆分 |
| 英文 | 完整英文单词 | 由音素化器拆成音素 |
| 混合歌词 | 按声库说明 | 不要随便切换语言标签 |
这个细节直接决定歌曲的“咬字丝滑程度”。
4. 完整实战案例:双人合唱曲《Split Dance feat.sakine ran 竹音パンダ》
下面进入实操部分。我用一个仿真的完整流程来演示:从创建空工程到最终导出人声,假设目标是渲染一首双人合唱曲。
4.1 创建项目结构
建议先在工作目录中建立清晰的文件夹结构,避免后期多音轨文件混在一起:
SplitDance_DiffSinger/ ├── audio/ # 放置伴奏与参考音频 ├── ustx/ # 存放 OpenUTAU 工程文件 ├── output/ # 放置导出的干声和工程备份 └── notes/ # 歌词与调校备注实际项目中,伴奏、参考音频和最终导出不要放在同一个平面上,否则导出几次后你会分不清哪个是旧版、哪个是新版。
4.2 导入伴奏并设置节拍
打开 OpenUTAU,新建工程。
在工程属性里填写歌曲名、节拍、速度。以常见舞曲为例,假设速度在 120 BPM 左右。把伴奏文件直接拖入工程,让伴奏轨道作为整首歌的节拍参考。
此时主旋律音轨不需要急于画音符。建议先听两遍伴奏,在纸上或 notes 文件夹里记录:
- 前奏一共多少个小节
- 主歌从第几小节开始
- 副歌最高音大概出现在哪里
- 两个演唱者分别在哪些段落出现
对于《Split Dance》这类偏舞曲、节奏感很强的作品,歌词可能非常密集。建议前几遍只做人声主干的标记,不要一步到位处理快速乐句。
4.3 划分两条音轨并设置音源
创建两个音轨:
- 音轨名:
Lead - 音轨名:
Harmony
在音轨属性中分别选择 DiffSinger 作为渲染器,再分别加载对应的声库。
如果两个声库都需要用 DiffSinger 引擎,那么在 OpenUTAU 的渲染器设置里应当能看到同一个 DiffSinger 选项,但通过音轨级别设置不同的音源,就能让两条音轨最终使用不同音色。
这里必须注意:如果你发现某个声库加载后无法正常发声,不要继续调音,先确认声库说明文件里是否写了“需要配合特定音素器”或“只支持 x 语言”。这是非常常见的第一道门槛。
4.4 输入主旋律歌词与音符
主旋律音轨先从前奏结束后的强拍开始,按小节输入句子。
比如第一句歌词的输入内容,假设是英文片段“Split Dance”:
Split Dance在 OpenUTAU 中,只要音素化器选择正确,它会尝试转换为类似下面的音素:
S P L IH T D AE N S如果你希望某一处咬字更硬或更软,可以手动在音符属性里查看转换结果。高音上遇到闭口音时,建议适当延长元音所在音符的时值,避免声音被辅音挤压。
接下来把后面段落继续补齐。输入时不需要一次性写出完美旋律,可以先用等分时值粗略排布,再通过拖动音符落点,和伴奏中的底鼓、军鼓位置对齐。
4.5 编辑和声音轨
主旋律完成第一轮对齐后,复制主旋律的所有音符到“Harmony”音轨。
在 Harmony 音轨中,把所有音符整体向上移动 3 个半音,形成三度和声。如果两个音源音色接近,也可以考虑向上移动 7 个半音形成五度,或者直接向下移动 8 度做低八度铺底。
和声音轨不一定要唱完整首歌。通常只保留副歌部分的和声,会让主旋律更清晰。具体取舍根据原曲编排决定。
4.6 调整音高曲线与音量包络
DiffSinger 虽然比传统 UTAU 聪明,但并不是“随便给音符就能唱出感情”。要让“sakine ran”与“竹音パンダ”这两个角色在演唱时听起来有互动感,需要手工调整以下内容:
第一,音高起音。
真人在唱主旋律强拍时,音高通常会在极短时间内从略低或略高处滑向目标音高。如果音符之间完全平直,听起来会像电子音。DiffSinger 项目里,可以借鉴原唱的起音习惯,在主旋律音轨的音高曲线上加入细小的滑音变化。
第二,句中强弱。
舞曲中的长音往往不是恒定的音量,而是先强后弱或先弱后强。调节音量包络时,观察句子在伴奏里的位置。如果伴奏有很明显的底鼓和贝斯律动,人声也尽量随之起伏。
第三,辅音呼吸感。
快速段落中可以通过增加少量气声感,让咬字更“松”。但具体参数取决于你使用的 OpenUTAU 和 DiffSinger 前端支持哪些表达控制。不要为了追求气声把整句都调得模糊不清。
4.7 渲染单轨与分轨导出
当两条音轨都做好音符、歌词与音高曲线后,进入渲染阶段。
在 OpenUTAU 中,可以对整条音轨执行渲染。建议按下面顺序操作:
- 先只渲染主旋律音轨。
- 试听一遍,检查咬字、跑调和节奏。
- 再只渲染和声音轨。
- 试听和声是否与人声冲突。
- 如果没问题,再把两条音轨分别导出为独立的 wav 文件。
分轨导出的好处是:即使之后只在某个段落改了 5 个音符,也不需要让另外一条音轨重新渲染,降低无用工作量。
导出后的人声干声放进output/目录,之后交给 DAW 混音。
4.8 在 DAW 中完成最终合并
把伴奏、主唱干声、和声干声导入 DAW,软音源轨道可以像普通音频轨道一样处理:
- 主唱声像放在中间。
- 和声可以稍向左右偏移,形成立体感。
- 如果两条音轨都是同一声库,建议分别加一点不同的均衡或混响,避免声音“叠在一起”。
最终成品名可以标注为:
Split Dance feat.sakine ran 竹音パンダ(diffsinger)这既说明了参与的声库角色,也向听众传递了“本曲使用 DiffSinger 渲染”的技术信息。
5. 常见问题与排查思路
DiffSinger 制作流程里,问题往往不是一次出现一个,而是连环出现。下面是几个高频问题的排查表。
| 问题现象 | 常见原因 | 解决思路 |
|---|---|---|
| 音轨完全无声 | 音轨没有选择 DiffSinger 渲染器 | 在音轨属性中切换到 DiffSinger 引擎 |
| 只发声母/韵母丢失 | 音素化器语言与声库不匹配 | 检查音素器和声库词典,重新选择对应语言方案 |
| 快速歌词吞字 | 音符过短或辅音比例被切得太散 | 适当合并同词内的短音符,延长关键元音 |
| 高音出现明显破音 | 音高超出声库舒适音区 | 将整体旋律移调,或让另一音源分担该段落 |
| 和声听起来太挤 | 主唱与和声音符完全同向 | 修改和声音符间隔或做侧链压缩 |
| 节奏总对不上伴奏 | 工程速度与小节划分错误 | 重新设置 BPM,并检查伴奏导入后的对齐方式 |
| 渲染速度突然变慢 | 音轨过长或同时渲染多个轨道 | 改为分段渲染,主唱和声分开处理 |
| 换行处出现奇怪呼吸声 | 音符之间空隙过大 | 检查音符间隙和前一音尾音,必要时缩短休止 |
排查这类问题,建议遵循一条原则:先还原最小复现步骤。
例如“高音破音”问题,不要整首歌一起试。可以只保留一个高音段落,把其他音轨静音,单独渲染这一个音符,逐个调整音高。这样能更快找到是声库本身的音域限制,还是发音前一个辅音引起的异常。
另外,声库或模型文件放在带有特殊符号的路径下时,偶发读取问题。项目路径、工程名、输出文件名尽量只使用英文字母、数字和下划线。真实项目中我见过很多因为目录里带中文引号或空格而导致的奇怪问题,重构项目目录到纯英文路径后往往自动恢复。
6. DiffSinger 工程的最佳实践
6.1 先“少唱”再“唱满”
歌曲编排非常密集时,最忌讳一开始就把所有歌词全部填充进去。建议只从前奏后的前 4 个小节开始,做一小段闭环。
这一段闭环要包含至少一次节奏变化、一个简单和声、一个高音。试听后可以快速判断以下问题:
- 声库音色在快节奏下控制力如何?
- 音素化器对副歌词的转换是否正确?
- 当前 BPM 下,主旋律与伴奏是否贴合?
只有这一小段稳定后,再复制到全曲继续调整,效率要高很多。
6.2 把“歌词版本”纳入工程管理
DiffSinger 项目很容易出现一种情况:第二段歌词改了好几版,最后第一段和第三段的歌词版本彼此不统一。
工程文件夹中的notes/目录,可以按时间存放多个歌词备注:
notes/ ├── lyrics_v1.txt ├── lyrics_v2.txt └── melody_structure.txt每次改歌词前,先复制一份旧版本。这样当发现新版不如旧版发音自然时,可以快速回退。
6.3 声库授权与音源使用边界
虚拟歌手声库通常会带有作者指定的使用条款,包括是否可以用于商业发布、是否需要标注声库名称、是否允许二次配布等。
在使用 DiffSinger 制作和分享作品前,建议:
- 确认声库允许翻唱与再创作。
- 标题中清楚标注参与声库名称。
- 如果要发布到音乐平台或进行商业使用,先获得原曲和声库双方的授权。
- 不要直接分发下载好的声库模型文件。
从工程实践经验看,技术能力可以帮你把作品做出来,但授权意识决定作品能否长期留存。
6.4 音高数据要“清爽”
在 OpenUTAU 中堆叠过多音高曲线并不一定提高表现力。过度锯齿化的音高线,会让神经网络学习到不必要的抖动,最终渲染出的歌声反而非常不干净。
正确做法是:
- 对长音,用一个平滑的弧线或稳定区域表达。
- 对上行音程,让音高在句末前稳定进入目标音。
- 对快速装饰音,不要用过多控制点去“拧”它。
你可以把音高曲线看成演唱路线图。路线图清晰,引擎才不容易跑偏。
6.5 人声与伴奏的分层
DiffSinger 渲染出的干声往往频响比较完整,但如果没有层次,完整试听时会感觉人声和伴奏“粘”在一起。
建议在混音时把“主唱、和声、伴奏”分成三组,每组配备独立的音量自动化和均衡,而不是把所有人声放在同一条总线里。
针对舞曲类作品,还可以利用侧链压缩:当底鼓出现时,伴奏或低频部分被自动压低一点点,这样人声中的节奏感会被衬托得更清楚。
7. 总结与后续学习方向
通过《Split Dance feat.sakine ran 竹音パンダ(diffsinger)》这个工程案例,我们实际覆盖了从 DiffSinger 原理解释、OpenUTAU 音轨配置、歌词与音素输入、主唱和声分离、渲染导出到 DAW 混音的完整链路。
这套流程并不只能用在某一首歌上。换成中文、英文或日语声库时,核心操作思路完全一致,只是在音素化器和歌词拆分上稍有区别。
如果你接下来想继续深入,可以从三个方向选择:
- 继续研究 OpenUTAU 的音高曲线与自动调校技巧,尝试把主唱做更细的表情。
- 研究你手头声库的训练数据来源,理解它的语言和音域极限,从而在编曲阶段就避开不适合的高音或咬字。
- 学习基础混音知识,把导出的多轨人声从“能听清”提升到“耐听”的层次。
DiffSinger 不是一键生成歌曲的“黑盒”,它的价值在于,你能像导演一样,控制歌手在每个乐句里的语气与情绪。先把一条音的流程跑通,再去扩展复杂合唱,会比直接挑战一整首完整歌曲轻松很多。
如果你正在调校类似的双人合唱作品,希望这份教程能帮你少走一些弯路。