简介:这份《Midjourney手册》是一套面向AI绘画初学者与设计师的完整图文教程,共1.3万字、135页,系统讲解Midjourney的注册、Discord频道接入与文本生成图像的核心操作,帮助零基础读者快速上手AI绘图工具。资源以1个docx文档交付,压缩包约23.36MB,内容按前言篇、注册篇等模块编排,涵盖AI绘图原理、行业前景、版权争议、设计师应对策略,以及账号注册、服务器创建、机器人添加等实操步骤,结构清晰便于按章节查阅。目前已有1748人学习下载,适合希望系统了解Midjourney并掌握基础出图流程的读者参考,也可作为设计从业者评估AI绘图趋势与自身技能规划的入门材料。
1. 一份 135 页的 Midjourney 手册,真正值钱的是哪几页
很多人第一次接触 Midjourney,是被一张图惊艳到,然后兴冲冲打开 Discord,敲下/imagine,结果出来的东西跟想象差了十万八千里。于是开始满世界找教程,找到一份号称 135 页、1.3 万字的完整手册,从头翻到尾,发现前面几十页在讲怎么注册账号、怎么进频道,真正想看的「为什么我写的词出不来想要的图」却只有寥寥几句。
这份手册类的资料,价值不在厚度,在于它有没有把提示词的结构讲透。Midjourney 的核心不是「你会不会用 Discord」,而是「你能不能用一段结构化的英文描述,把脑子里的画面翻译成模型能理解的参数组合」。整份手册里真正值得反复看的,大概就是提示词结构、参数表、垫图与混合、以及版本差异这几块。剩下的操作步骤,用一次就记住了。
这篇文章面向两类人:一类是刚拿到这类手册、不知道从哪看起的新手,另一类是已经能出图、但出图全靠玄学、想搞清楚参数到底怎么起作用的熟手。我会按「提示词怎么写 → 参数怎么调 → 垫图怎么用 → 坑在哪 → 怎么验证效果」这条线,把一份完整手册里该有的东西拆开讲一遍,让你不用逐页翻也能把关键部分跑通。
2. 提示词结构:从一句话到一段可复现的描述
2.1 为什么「一只猫」永远出不来你想要的猫
Midjourney 的提示词本质是一段自然语言,但它对信息的密度非常敏感。你写a cat,模型只能随机采样它训练数据里「猫」的平均印象,出来的就是一只平庸的、没有任何特征的猫。你写a fluffy orange tabby cat sleeping on a windowsill, soft morning light, shallow depth of field,模型才有足够的锚点去收敛。
一份完整手册通常会给出一个提示词骨架,我把它整理成下面这个顺序,实测比乱写稳定得多:
| 位置 | 作用 | 示例片段 |
|---|---|---|
| 主体 | 画面里是什么 | a fluffy orange tabby cat |
| 动作/状态 | 主体在干什么 | sleeping, curled up |
| 环境 | 在哪里 | on a wooden windowsill |
| 光线 | 光从哪来、什么质感 | soft morning light, backlit |
| 构图/镜头 | 视角和焦段 | close-up, 85mm, shallow depth of field |
| 风格 | 媒介或艺术家风格 | photorealistic, film grain |
| 参数 | 模型可调的开关 | --ar 3:2 --v 6 |
这个顺序不是硬性规定,但把「主体」放在最前面几乎是共识,因为模型对开头词的权重更高。很多人把风格词堆在最前面,结果主体被风格淹没,出来的图「很艺术但不知道画的是啥」,这就是权重分配的问题。
2.2 一段可以直接抄的提示词模板
下面这段是我自己常用的模板,把方括号里的内容替换掉就能用。注意它是英文的,Midjourney 对英文提示词的响应明显好于中文,中文不是不能用,但会多一层翻译损耗。
[subject with 2-3 concrete attributes], [action or state], [environment with 1-2 details], [lighting description], [shot type and lens], [style or medium reference] --ar [ratio] --v [version] --style [raw or default]举个填好的例子:
a weathered fisherman with a grey beard, mending a net, on a small wooden boat at dawn, warm low-angle sunlight, medium shot, 50mm lens, documentary photography style --ar 16:9 --v 6 --style raw逻辑说明:主体给了两个具体特征(weathered、grey beard),避免模型自由发挥;动作是 mending a net,让画面有叙事;环境、光线、镜头各给一个锚点;最后用--style raw降低模型默认的「美化倾向」,让照片感更真实。
参数说明:--ar 16:9是宽高比,横构图适合场景;--v 6指定版本,不同版本对同一提示词的理解差异很大,后面会专门讲;--style raw是 v6 引入的开关,关掉默认的强风格化。
2.3 权重、否定词和那些容易被忽略的语法
手册里如果只讲「怎么写词」不讲「怎么调权重」,那基本等于没讲。Midjourney 支持用::给不同部分分配权重,也支持用--no排除元素。
hot air balloons::2 over a mountain lake::1 at sunset --no people, buildings --ar 3:2逻辑说明:::2表示「热气球」这部分权重是「山湖」的两倍,模型会把更多注意力放在热气球上。--no people, buildings是负向提示,告诉模型不要出现人和建筑。注意--no不是万能的,它只是降低出现概率,不能保证绝对不出现。
参数说明:权重数字可以是小数,比如::0.5,但差距太大(比如::5)会让低权重部分几乎消失,一般控制在 0.5 到 3 之间比较稳。多个--no项用逗号分隔,不要写成多个--no。
3. 参数表:把出图从玄学变成可调实验
3.1 版本参数为什么是第一个要固定的变量
Midjourney 的版本迭代对出图风格影响极大。同一段提示词,v5 和 v6 出来的东西可能完全不是一个路子。v6 对提示词的理解更准、文字渲染能力更强,但默认风格化也更重。如果你在手册里看到某个参数「效果很好」,先确认它是在哪个版本下测的,否则就是刻舟求剑。
我一般会先把版本固定住,再调其他参数。做法很简单,在提示词末尾加--v 6或--v 5.2。如果你不确定用哪个,就先用当前默认版本跑三张,再换另一个版本跑三张,对比主体还原度和风格倾向。
3.2 一份能直接查的参数速查表
下面这张表是我从手册和实操里整理出来的高频参数,按使用频率排序。建议先掌握前五个,剩下的用到再查。
| 参数 | 作用 | 常用取值 | 注意点 |
|---|---|---|---|
--ar | 宽高比 | 1:1 / 3:2 / 16:9 / 9:16 | 竖构图用 9:16,别用 2:3 这种非标准值 |
--v | 模型版本 | 6 / 5.2 / 5.1 | 版本间风格差异大,测试时要固定 |
--style | 风格化程度 | raw / default | raw 更写实,default 更「好看」 |
--stylize | 风格化强度 | 0-1000 | 数值越高越艺术,越低越贴提示词 |
--chaos | 结果多样性 | 0-100 | 越高四张图差异越大,适合找灵感 |
--seed | 随机种子 | 任意整数 | 固定种子可复现同一批图 |
--no | 负向提示 | 元素列表 | 只降低概率,不保证消除 |
--tile | 无缝贴图 | 无值 | 做纹理素材时用 |
--q | 生成质量 | 0.25 / 0.5 / 1 | 越低越快越糙,一般用默认 |
3.3 stylize 和 chaos 这两个参数怎么配合用
--stylize和--chaos是最容易被误用的两个参数。很多人一上来就把 stylize 拉到 1000,结果图是「好看」了,但跟自己的提示词没啥关系了。我的经验是:先低 stylize 确认主体对不对,再逐步拉高找风格。
a lone lighthouse on a rocky cliff, stormy sea, dramatic clouds --ar 2:3 --v 6 --stylize 100 --chaos 10逻辑说明:先用--stylize 100这种偏低的值,让模型优先还原「灯塔、礁石、风暴海」这些主体元素;--chaos 10让四张图有轻微差异,方便挑构图。等主体稳定了,再把 stylize 提到 400 到 600,让画面质感更好。
参数说明:stylize 的取值范围在不同版本略有差异,v6 下大致是 0 到 1000,默认是 100。chaos 默认是 0,超过 50 之后四张图可能完全不像同一个提示词,适合头脑风暴阶段,不适合精修。
3.4 seed 参数:让「再来一张」变成可控复现
--seed是手册里经常一笔带过、但实际非常实用的参数。当你跑出一张满意的图,想在此基础上微调提示词,又不想完全换一个构图,就可以把那张图的 seed 记下来,加到新提示词里。
a cozy bookstore interior, warm lamps, rain outside the window --ar 3:2 --v 6 --seed 1234567890逻辑说明:seed 固定后,模型生成时的初始噪声就固定了,同样的提示词会得到几乎一样的图。你改一两个词,就能看出这一两个词到底带来了什么变化,而不是被随机性干扰。
参数说明:seed 是任意整数,每张图生成后可以在 Discord 的消息详情里找到它的 seed 值。注意 seed 只在同一版本、同一提示词下才稳定复现,跨版本不保证。
4. 垫图、混合与局部重绘:手册里最容易被跳过的实战章节
4.1 垫图(image prompt)到底在控制什么
垫图是把一张参考图放进提示词里,让模型参考它的构图、色彩或风格。做法是把图片链接放在提示词最前面,后面跟文字描述。很多人以为垫图是「照着画」,其实它更多是「影响采样方向」,权重给太高会几乎复制原图,给太低又没效果。
https://example.com/reference.jpg a modern chair, minimalist style, studio lighting --ar 1:1 --iw 1.5 --v 6逻辑说明:图片链接在最前,--iw控制图片权重。--iw 1.5表示图片影响偏强,适合想要接近参考图构图的情况;如果只想借一点色彩氛围,把--iw降到 0.5 左右。
参数说明:--iw的取值范围通常是 0 到 2,默认值在不同版本下不同。注意图片链接必须是可公开访问的直链,本地图片要先上传到 Discord 再取链接。
4.2 混合(blend)和垫图的区别,什么时候用哪个
/blend命令是专门用来融合 2 到 5 张图的,它不需要写提示词,直接出融合结果。适合做概念探索,比如把「森林」和「机械」两张图混在一起找灵感。但它不可控,你没法指定融合比例。
垫图则更可控,你可以用文字补充细节,用--iw调权重。我的习惯是:找灵感用 blend,做成品用垫图加文字。手册里如果只讲 blend 不讲垫图,那实战价值会打折扣。
4.3 局部重绘(Vary Region)的正确打开方式
局部重绘是选中图里的一块区域,只重新生成这一块。这个功能在手册里往往只有一句话,但实际用起来有几个关键点:选区要稍微大于你想改的物体,留一点边缘给模型过渡;重绘时提示词只写「这一块应该是什么」,不要重复整张图的描述;如果重绘结果和周围不搭,多半是光线方向没对上,在提示词里补一句光线描述。
a red vintage car --ar 3:2 --v 6假设你对车颜色不满意,选中车身区域,重绘提示词写a deep green vintage car, same lighting,而不是把整段提示词再写一遍。逻辑是:模型已经知道周围环境,你只需要告诉它「这块换成什么」。
5. 避坑与排查:那些手册不会告诉你的翻车现场
5.1 提示词越长越好?错,超过一定长度后权重会被稀释
现象:写了七八十字的详细描述,结果主体反而糊了,模型像是随机抓了几个词在画。
原因:Midjourney 对提示词长度有隐式上限,过长的描述会让每个词的权重都被摊薄,模型抓不住重点。
解决:把提示词控制在 30 到 50 个词之间,把最核心的主体和特征放前面,次要的环境和风格词能删就删。如果确实需要很多约束,用::给核心部分加权。
5.2 中文提示词出图差,不一定是模型不支持
现象:用中文写提示词,出来的图总是差一口气,细节对不上。
原因:训练数据以英文为主,中文需要先被内部转换,转换过程会丢信息。
解决:养成用英文写提示词的习惯,尤其是主体和风格词。如果英文不熟,可以先用中文想清楚,再逐词翻译,不要整句机翻,机翻经常把「氛围感」翻成模型不认识的词。
5.3 同一提示词两次结果差很多,不是模型坏了
现象:同样的提示词,昨天出的图和今天出的图完全不一样。
原因:Midjourney 默认每次生成都重新采样随机噪声,除非你固定了 seed。另外,官方偶尔会静默更新模型,同一版本号下行为也可能变化。
解决:想要复现就记下 seed 和版本号;如果发现风格突变,先检查版本参数有没有变,再考虑是不是官方更新。重要项目建议把满意的图、提示词、seed、版本一起存档。
5.4--no写了没用,人还是出现了
现象:明明写了--no people,图里还是有个人影。
原因:--no是负向提示,只降低概率,不保证消除。如果画面构图强烈暗示需要一个人(比如「热闹的街道」),模型会优先满足构图逻辑。
解决:把--no和正向描述结合,比如写an empty street, deserted,用正向词把「没人」这个状态描述出来,比单纯--no people有效。
5.5 垫图后画面几乎复制原图,失去了创作空间
现象:垫图权重给高了,出来的图跟参考图几乎一样,改提示词也没用。
原因:--iw设得太高,或者参考图本身构图太强。
解决:把--iw降到 0.5 到 1 之间,或者在提示词里明确写出你想改变的部分,比如different composition, new angle。如果还是不行,换一张构图更简单的参考图。
6. 怎么验证一份手册值不值得看,以及我自己的使用习惯
拿到任何一份 Midjourney 手册,我都会先做一件事:用同一段提示词,按手册里的参数建议跑一遍,再按我自己的默认参数跑一遍,对比。如果手册里的参数确实让出图更接近预期,那这份手册的参数章节就值得细看;如果只是把官方文档翻译了一遍,那价值就有限。
具体验证方法可以拆成三步。第一步,挑一个手册里重点推荐的参数组合,比如某个 stylize 值配某个版本,跑四张图。第二步,把参数换成默认值,同样提示词再跑四张。第三步,把两组图放在一起,看主体还原度、构图稳定性、风格一致性这三个维度。主体还原度看「是不是我要的东西」,构图稳定性看「四张图是不是一个路子」,风格一致性看「换提示词后风格是否还成立」。
下面这张表是我自己用来记录对比结果的模板,你可以直接拿去用:
| 测试项 | 手册参数组 | 默认参数组 | 结论 |
|---|---|---|---|
| 主体还原度 | 高 / 中 / 低 | 高 / 中 / 低 | 哪组更准 |
| 构图稳定性 | 四张是否一致 | 四张是否一致 | 哪组更稳 |
| 风格一致性 | 换词后是否保持 | 换词后是否保持 | 哪组更可控 |
| 出图速度 | 快 / 中 / 慢 | 快 / 中 / 慢 | 是否值得等 |
我自己的习惯是:每跑出一张满意的图,就把提示词、参数、seed、版本号记在一个文本文件里。这个习惯看起来笨,但帮我省了无数次「上次那张图怎么出的来着」的后悔药。Midjourney 的随机性太强,不记录就等于每次都在重新摸索。另外,我不再追求「一条提示词出神图」,而是把提示词当成一个可迭代的实验记录,每次只改一个变量,看它带来的变化。这样积累下来,你对参数的理解会比翻十份手册都扎实。
还有一点血泪经验:不要在手头项目急用的时候才去试新参数。新参数一定要在闲的时候跑够样本量,知道它的边界在哪,急用的时候才不会翻车。手册是地图,但路得自己走一遍才算数。希望帮到你。
本文还有配套的精品资源,点击获取