说实话,我见过太多人玩AI音乐,开场白永远都是“来一首伤感情歌”“给我做个燃一点的BGM”,结果生成出来的东西要么编曲稀碎,要么情绪全无,跟抽盲盒似的。问题真不在模型不够强,而是你给模型的提示词写得太敷衍了。AI作曲提示词这个东西,本质上是在跟一个“完全不懂音乐、但掌握海量风格素材的外星人”沟通,你描述得越具体、越结构化,它输出的东西才越接近你脑子里的那个画面。这篇东西不聊虚的,就结合我自己的实测经验,把AI音乐提示词到底应该怎么写、怎么拆、怎么迭代,从头到尾捋一遍。
1. 先把底层逻辑搞明白:AI作曲提示词到底在“告诉”模型什么?
1.1 音乐提示词和聊天、绘画提示词的根本差异
很多人会想:聊天要提示词,画图要提示词,那音乐提示词不就是一个道理吗?一句话描述我想要什么,然后让AI自由发挥。这个想法是最大的坑。
ChatGPT这类文本模型,你给它意图它就能干活;Midjourney这类绘画模型,你给它画面元素它就能渲染。但音乐模型不一样,它生成的不是一张静态的图,也不是一段文字回复,而是一条沿着时间轴展开的音频。这意味着,你的提示词不仅要描述“结果是什么”,更要在一定程度上描述“过程怎么走”——哪里进鼓、哪里进人声、哪里该收、哪里该推,这些时间结构信息才是音乐提示词和其余提示词最核心的区别。
举一个很直白的例子。你写“一首钢琴曲”,模型确实会给你钢琴的声音,但它在时间上可能是散漫的、没有起伏的。你写“钢琴独奏,前奏只有清亮的单音,从第15秒开始加入低音和弦,副歌部分情绪推满,最后以渐弱的分解和弦结束”,模型对结构的把握就会完全不一样。音乐模型本质上是在做“概率化的声音排列”,你的提示词越能把它的生成空间限制在一个合理的范围里,它输出的可听性就越高。
1.2 音乐模型到底怎么“理解”你的提示词
目前市面上的AI音乐模型,比如Suno、Udio、Stable Audio,底层都是基于扩散模型或者自回归Transformer的变体。它们不会像人一样去逐字理解句子的文学含义,而是会把你的文本编码成语义向量,再去匹配音频特征空间。
这意味着两件事。第一,模型对“风格名词”极度敏感,对“抽象情绪词”相对迟钝。比如你写“ambient, electronic, dark pads,90 BPM”,它会知道要做什么;但你只写“神秘又空灵的感觉”,它真的会手足无措。第二,模型其实不太擅长处理“否定指令”。你跟它说“不要吉他、不要鼓、不要人声”,在它内部很可能直接把这些标签也激活了,结果反而更容易出问题。
所以写音乐提示词的第一原则就是:把抽象变成具体,把否定变成肯定,把形容词变成可指向的风格标签。你写的每一个词,都应该是在帮模型缩小选择范围,而不是在跟它聊天。
2. 写一首能用的AI音乐提示词,拆成四个部分就够了
2.1 风格锚点:把模糊感觉变成可检索的标签
风格是音乐提示词的地基。一句“我想来点高级的、咖啡馆里放的那种音乐”是没法用的,你需要把它翻译成模型能检索的风格词。
以“咖啡馆音乐”为例,你可以靠具体风格标签来锁定范围:如果是早上营业时段,可能是“Acoustic, indie folk, light percussion”;如果是下午发呆时段,可能是“Lo-fi hip hop, vinyl crackle, soft piano loop”;如果偏文艺书店,可能是“Jazz trio, double bass, brush drums”。同一句话,落点完全不同。
我在实测里发现,两到四个风格关键词的组合,效果要远好于一个宽泛的大类词。只写“electronic”出来的是大杂烩,写“synthwave, retro, 80s, analog synth”就会精准很多。一个很实用的技巧是:把所有你能想到的风格词先丢进列表,选出3到5个最贴近你想要的效果的,组合起来。这就像调香水,前调、中调、后调都得有,只喷一种味道是盖不住底气的。
2.2 结构描述:给AI一张完整行程表
音乐是一种时间艺术,它的结构就是它的骨架。你在提示词里不写结构,模型也会给你一个结构,只是这个结构大概率是“平庸的万能模板”:前奏4秒、主歌8小节、副歌8小节、间奏、再来一遍、收尾。如果你要的是短视频卡点、游戏BGM、电台节目片头这类有明确时长需求的内容,这个模板往往很不够用。
目前主流平台里,Suno对结构标签的支持做得最好,它支持用户在歌词里或者风格栏里直接写[Intro]、[Verse]、[Chorus]、[Bridge]、[Outro]这样的段落标签。我自己的习惯是会在风格描述的最后补一行结构描述,比如“structure: intro → verse → chorus → verse → chorus → bridge → final chorus → outro”,这样模型对整个走势会有一个清晰的时间地图。
结构描述还有一个好处:能打破AI生成的“流水线感”。你主动给它一个“前奏很长”“间奏加一段无伴奏人声”“结尾渐弱”之类的结构安排,它就会跳出标准模板,做出来的东西有记忆点。
2.3 乐器与音色:具体到“频段”而不是“名字”
乐器词本身很好写,钢琴、吉他、鼓、贝斯谁都会。但真正拉开差距的是音色层面的描述。同样一个钢琴音色,可以是“温暖的、踏板很深的、带着房间混响的旧钢琴”,也可以是“清脆的、颗粒感强的、接近MIDI采样的电子钢琴”。模型对音色形容词的理解虽然不如对风格词那么精准,但确实会影响采样选择。
我建议每次固定一个“主奏乐器”加两个“氛围补充声部”,不要贪多。你写“钢琴、吉他、弦乐、萨克斯、鼓、贝斯、电子合成器、人声和声”这一串下去,模型大概率会在中间打架,最后出来一锅粥。更好的做法是:明确主奏乐器是什么,氛围乐器是谁,节奏声部由什么构成,然后给节奏和情绪定个调。比如“钢琴独奏为主的ballad,背景有一层薄薄的弦乐pad,鼓只在副歌进入”,这听起来像人话,模型也确实能给出更分层的结果。
音色描述还有个小技巧:用物理空间感来描述。写“加了一点老式收音机的质感”“带一点室内现场的自然混响”“声音像是从隔壁房间传过来的”,模型对这类空间类描述的响应,很多时候比我预想的要好。
2.4 情绪和速度:抽象情绪词也得配参数
情绪词不是不能写,但它要和其他信息搭配着用。单独写“悲伤”不行,写“悲伤,小调,慢速,钢琴独奏,低音区很多”就可以。这里的关键就是这个“小调”和“慢速”——也就是调性与BPM(速度,每分钟节拍数),它们才是情绪在音乐参数层面的实际载体。
我给大家一个通用公式:情绪词 + 调性 + BPM + 主奏乐器。比如“melancholic, C minor, 70 BPM, solo piano”出来的效果就很稳。如果你想让情绪更有层次,还可以加一个变化弧度,比如“从安静克制逐渐走向宣泄,副歌开放而明亮”,这相当于给模型一个动态表情记号Arc。这招在配乐类场景里特别管用,因为配乐的本质就是跟着画面的情绪走。
有人会问BPM到底怎么选?我给一个快速参考:慢歌抒情、氛围乐大概是60-80,Citypop、流行歌大概在90-110,舞曲、电子、说唱多数在120-140,再往上就是Hardcore、Drum & Bass那一挂了。不确定的时候,宁可慢一点也不要快,慢速能掩盖很多生成瑕疵,快速会把噪声、音准问题全都放大。
3. 从粗到细:一个能直接抄的AI音乐提示词工作流
3.1 第一版提示词怎么快速搭出来
很多新手一上来就在细节里挣扎,半天憋不出一句话。我的建议是,先抛弃完美主义,用“三件套”快速搭一个能跑的初版:风格词 + 乐器词 + 结构词。别的先别管,跑一轮听听整体感觉再说。
我以“雨天咖啡馆写稿子的背景音乐”为例,给你搭一个完整的初版提示词:
风格:Lo-fi hip hop, jazzy, chill, nostalgic 乐器:Rhodes piano, soft 808 drum, vinyl crackle, bass 情绪:warm, rainy day, cozy, relaxed 速度:75 BPM, C major 结构:intro with rain ambience, verse, chorus, verse, chorus, outro fade out这套词扔到主流模型里,出来的东西大概率已经是个可用的60分作品。它有风格方向、有声部结构、有情绪曲线、有速度参数,对模型来说信息已经足够充分了。你不要一上来就追求90分,先拿到一个能听的底子,再慢慢调。
3.2 迭代技巧:先听后调,不要每次全部推翻
拿到第一版结果之后,最重要的一件事是:认真听,听两遍以上,然后记录问题。我遇到最多的三个问题是:风格不对、结构不对、音色不对,但它们的解法完全不同。风格不对,要去动风格词;结构不对,要去动结构标签;音色不对,要去动乐器和音色形容词。很多人不管三七二十一,把整个提示词全改一遍,最后根本不知道是哪一步起了作用,等于在瞎试。
我的迭代法则是:每次只改一个变量。这一轮我把“Rhodes piano”换成“grand piano”,看看音色变化;下一轮我把“75 BPM”提到“85 BPM”,看看节奏影响;再下一轮我改一下结构标签,看看层次感。这样三轮下来,你能清晰地知道模型对每个变量的敏感度,也更容易沉淀出一套属于自己的经验库。
另外,我强烈建议:同一个提示词至少换三次不同的随机种子(seed)再跑。现在很多平台没有开放seed参数,但你依然可以通过点击“重新生成”或者微调歌词字词来变相换种子。有时候同一个提示词,第三次生成才会第一次才出来的神级段落,前面两个是陪跑的,这很正常,别急着删。
3.3 提升作品“人味”的三个侧写技巧
很多AI音乐一听就很“AI”,问题往往出在太工整、太干净、太平均。要消除这种感觉,可以试试用“侧写”来暗示模型不要做得太整齐。
第一,加入环境采样描述。比如“street ambience in background”“rain drops on window”“cafe chatter, distant”“tape hiss, analog warmth”,这些小细节会给作品增加一种“真实空间感”,人的耳朵非常吃这一套,尤其是做氛围音乐和Lo-fi的时候,加上环境声之后完全不像AI做的。
第二,加入表演指示词。写“rubato, loose timing”“slightly behind the beat”“with a live human feel”“dynamic expression”,这些都是在暗示模型在节拍和力度上不要做得太机械。我实测下来,加了“loose timing”之后,钢琴的节奏会微微晃动,那种微瑕疵反而是音乐活过来的关键。
第三,加入“减法”描述。你可以写“minimal arrangement, spacious, lots of silence between notes”,让模型不要拼命铺满所有频段。留白本身就是高级感的重要来源,AI默认倾向于“塞满”,你只有明说,它才会克制。
4. 不同AI作曲平台的提示词写法差异(实测经验)
4.1 Suno:用段落标签直接控制结构
Suno是目前大众接触最多的AI音乐平台,它的提示词体系相对结构化,也很适合新手。它主要分成两块:风格描述栏和歌词栏。风格栏可以写得很自由,但我的实测经验是:用逗号分隔的短词组,效果远好于一个长句子。比如“female vocal, dream pop, ethereal, 120 BPM, E major”就比“一首充满梦幻感的女声Dream Pop歌曲,速度120”稳定得多。
歌词栏里,Suno支持[Intro]、[Verse]、[Pre-Chorus]、[Chorus]、[Bridge]、[Outro]这些标签,它们会直接影响生成结构。还有一个很实用但很多人不知道的:你可以在歌词中间写[Instrumental Break]或者[Guitar Solo],模型会真的在对应位置把编曲打开,给出一段纯乐器间奏。如果你想要的是纯音乐,可以在风格栏里写“instrumental, no vocals”,同时歌词栏留空或者只写[Intro][Verse]...的纯结构标签。
4.2 Udio:支持更长的描述性提示词,适合做精细音色
Udio对自然语言描述的理解能力比Suno更细,你可以在风格栏里写更长、更细致的句子。比如“60s French pop, baroque strings, whispery female voice, old vinyl crackle, warm tube saturation”,这套描述在Udio上的效果会明显好于Suno。如果你要的是那种有年代感、有音色层次的作品,Udio会更擅长。
Udio还有一个特点:它的标题栏也会影响生成。我没搞懂内部机制,但实测是,标题写“Rainy Day in Paris”和标题写“Neon District”生成出来的氛围真的会不同。所以我用Udio时会把标题当成一个额外的提示词来用,把它写成一个有画面感的短句。此外,Udio支持“避免”类描述,但效果有限,我建议你不要写“no guitar”“no saxophone”这种否定句,而是写“piano only, minimal arrangement”,用正面描述替代。
4.3 Stable Audio和本地部署模型:以标签序列为主
Stable Audio这类模型更多被用在音效、采样、配乐类场景,它的提示词体系更接近“标签引擎”,不需要完整句子,直接用逗号分隔的关键词序列就好。而且它对音效、材质、空间类描述非常敏感,比如“foley, footsteps on gravel”,“deep bass impact, cinematic riser”。
如果你的需求是做本地部署,纯本地模型的提示词写法和在线平台还有一点区别:本地模型通常对“词序”没那么敏感,但对“关键词是否存在”极其敏感。换句话说,你把“piano”放在最前面还是最后面影响不大,但你要确保“piano”这个词确实在描述里。这种场景下,我更推荐你用固定模板去批量生成,比如“{风格},{情绪},{乐器},{BPM},{结构}”,这样的话批量测参数会非常方便。
4.4 多平台通用的一条:写“参考风格描述”远比“参考作品名”更稳
很多人喜欢在提示词里写“in the style of某不知名乐队”“像某某电影配乐的感觉”,这很容易触发平台的内容限制或者版权顾虑,而且模型对这些具体作品名的理解其实是碎片化的,效果很不稳定。
好的做法是:把某个参考作品的“可描述特征”拆出来,写成风格标签的集合。比如你想要的是“宫崎骏动画片里那种温柔又带点幻想感的钢琴曲”,与其直接提作品名,不如写“whimsical piano, Japanese animation soundtrack feel, delicate, airy, flowing, gentle strings, G-major, and moderately slow”。这样既绕开了限制,又给模型提供了足够的信息。
5. 那些踩过的坑和容易被忽略的细节(速查表)
5.1 提示词过长会稀释注意力
我见过有朋友一个提示词写三四百字,把什么背景故事、作品理念全塞进去。实测下来,过长的提示词会稀释模型对关键词的注意力,出来的效果反而不如几十个字来得精准。AI音乐提示词不是作文,它是是“浓缩的配方”。在我看来,一段合理的提示词长度大概在2到5行,核心信息密度要足够高。如果一定要写长,也请把最重要的风格词放在最前面。
另外,不同平台有隐藏的“提示词截断”机制,超长的描述后面部分很可能根本没被处理,这也是长提示词不生效的原因之一。我现在的习惯是,先用一个最精简的版本测试方向,确认方向对了,再逐步往上加细节。
5.2 “不要”类提示词在音乐模型里经常失效
前面提过音乐模型对否定指令很不敏感。“不要鼓”“不要吉他”这种写法,经常会反向命中。我在本地测试过类似提示词,结果很奇妙:明明写了no drums,出来的鼓反而又重又密。这是模型的注意力机制在作祟,它会把“drums”这个词高亮,反而让这个乐器更容易被激活。
所以与其说“不要鼓”,不如说“钢琴独奏”,与其说“不要人声”,不如说“纯乐器,无歌词”。用正向描述去引导,比用负向描述去阻止可靠得多。如果必须压制某个声部,我会连“minimal”“sparse”“almost absent”这种程度副词一起写,让模型理解它不是完全不要,而是大幅降低存在感,这样更容易达到预期。
5.3 中文歌词和旋律不咬合的问题
做中文歌的时候,最常见的问题就是AI唱出来的中文带明显的洋腔洋调,歌词和旋律的重音对不上。这个问题的根源在于,主流音乐模型的训练语料里中文歌占比不高,模型对中文声调、韵脚和音节时长的处理普遍偏弱。
我实测下来比较有效的解法是:把歌词写成接近“白话朗读节奏”的句子,不要写过于工整、文言、押韵密集的歌词,因为AI根本处理不了复杂韵脚的排布。比如你写“霓虹灯下的影子被拉得那么长”,唱出来大概率没问题;但你写“月色浸染千山雪,风过回廊夜未央”,它就可能唱得像在念经。另外一个技巧是,在风格栏里加上“Mandopop, Chinese female vocal”,让模型提前锁定发音风格。
5.4 生成之后才是真正开始:人声与后期选择
AI音乐生成出来的音频从来不是“成品”,它只是一个半成品素材,我喜欢的定位是“灵感引擎”和“草稿箱”。生成之前,我一般会把平台里的音频质量设置拉到最高,能选44.1kHz或48kHz就不选32kHz;需要做纯音乐和循环片段的时候,记得找带“loop”能力的模型或后期自己剪。
我自己的后期流程一般是:先从头到尾听一遍,把最有价值段落的时间点记下来;然后用Phrase/段落剪辑的方式提取可用的部分;再进DAW里加一点EQ和混响,把AI音频里那种“直愣愣”的高频削掉一点,氛围感立刻上一个台阶。很多AI音乐一听就很假,不是旋律不行,而是它太“干”,给一点点空间混响就自然多了。如果做的是纯BGM,记得用工具做一个响度标准化,不然和别的音乐接在一起会显得忽大忽小。
6. 一条值得收藏的提示词快速自检清单
根据我踩过的坑,我把“AI音乐提示词”的自检要点整理成一个清单,生成之前对着它过一遍,成功率会明显提升。
第一,风格是否具体到标签级?如果你发现自己写的是“好听”“高级”“有感觉”,立刻停住,换成风格词;“大气”换成“Epic orchestral”,“轻快”换成“Upbeat pop, acoustic guitar”,“伤感”换成“Melancholic ballad, minor key”。
第二,是否有时间轴上的安排?提示词里有没有“前奏”“副歌”“间奏”“结尾”相关的结构描述?如果没有,模型就会给你一个套模板结构。
第三,是否指定了核心声部?主奏乐器、节奏声部、氛围声部分别是什么?如果这三个在脑子里都说不清,那模型大概率也会给你一锅粥。
第四,参数是否可量化?BPM、调性、时长,能写就写。写不出来的话,用“slow”“fast”“high-pitched”这种相对词也比不写好。
第五,是否包含了“给模型省事”的限定?比如“no lyrics”“instrumental”“one continuous take”这类设定,能让模型少走很多弯路。这套清单我用了很久,每次生成前问自己一遍,基本能避免80%的废稿。
我个人的感受是,AI音乐提示词这门手艺,门槛并不高,但它确实是一种需要刻意练习的“翻译能力”——把脑子里模糊的声音想象,翻成模型听得懂的语言。这个东西没有标准答案,同样的提示词在不同平台、不同版本上也会有不同的反应。但只要你掌握了“具体化、结构化、可量化”这三个核心原则,再配合“每次只改一个变量”的迭代习惯,很快你就能稳定地产出属于自己风格的AI音乐作品。这篇经验也是我拿几十首废稿换来的,记录下来给你,希望你能少走一些弯路。