用Midjourney V6出图的人,应该都有过这种经历:好不容易磨出一张满意的图,换个构图重新生成,风格却完全跑偏,同样的关键词在不同批次里出来的效果像换了个画师。直到V6版本把风格控制单独拎出来做成一个独立参数,这个问题才算是真正被解决——这就是风格参考命令--sref。
--sref(Style Reference的缩写)是一个让生成结果模仿指定图片风格特征的参数,你不用在提示词里堆砌“赛博朋克”“油画质感”“电影感”这些模糊的描述,直接把参考图丢给模型,它就能把参考图的色彩、笔触、氛围、材质这些底层特征“借用”过来。对于需要批量出图、保持画面统一风格、或者想快速复刻某类视觉调性的场景来说,这几乎是最省力的手段。这篇文章我会完整拆解--sref的底层逻辑、参数调法、完整实操流程,以及我实测下来踩过的一些坑。适合正在用Midjourney V6做视觉素材、品牌VI、插画探索、或者单纯想提高出图效率的读者。
1. 风格参考命令的底层逻辑与适用边界
1.1 为什么需要单独的“风格参考”参数
在早期版本的Midjourney里,控制风格主要靠提示词本身的描述力。你说“温暖的夕阳,复古胶片感,颗粒明显,对比度偏低”,模型确实会往那个方向靠,但结果很不稳定,因为每个人对“复古胶片感”的理解不一样,模型对不同关键词组合的响应权重也不一样。同样的描述词,在不同时间、不同随机种子下,生成结果能差出十万八千里。
后来很多人开始用“垫图”的方式:上传一张参考图,再加上提示词,让模型参考画面风格。这种方式能做,但有一个很大的问题——模型在模仿风格的同时,很容易把参考图里的具体内容也带进来,比如画面主体、构图、甚至某些细节元素。你只想借它的调色,结果把照片里那个人物的姿势也复刻出来了,这就非常被动。
--sref的设计目标就是把这个过程单独拆出来:它只提取参考图的风格特征,不提取画面内容。这个参数背后,Midjourney内部对图像做了一次“特征分离”处理——把风格相关的特征空间(色彩分布、笔触方向、材质反馈、光影调性)与内容相关的特征空间(物体类别、空间结构、主体关系)分开编码。--sref加载的是前者的特征编码。
所以你可以拿着任何有明确视觉风格的图片——一张老电影截图、一张油画细节、一张杂志排版——放进--sref,然后完全自由地描述你想生成的主体,两者不冲突。
1.2 sref能控住哪些维度,控不住哪些
我测试了不少参考图,总结一下--sref能稳定控制的维度:
- 色彩方案:这是最明显的,冷调、暖调、低饱和、高对比,基本能精准还原。
- 材质表现:画面是胶片的颗粒感、数码的锐利感,还是油画布的纹理感,影响很大。
- 光照逻辑:参考图里的光源方向、光比关系会迁移到新图上。
- 笔触与刻线风格:尤其对插画类、手绘类参考图,线条的张力方式会被保留。
但它控不住什么?具体图案和主体造型。比如你拿一张梵高的《星空》当参考图,出来的结果会有那种旋转的笔触感、强烈的蓝黄配色,但绝不会直接生成一个一模一样的星空构图。如果你拿一张人脸做参考,--sref也不会让人物长得像,那是--cref(Character Reference)干的活。这两个参数容易混淆,后面我会展开讲。
1.3 V6版本里sref的演化和差异
--sref在V6.0刚推出时,效果其实不算太稳定。当时最大的问题是:参考图的“风格强度”波动很大,同一张参考图,可能这次生成风格很重,下次生成几乎无感。到了V6.1之后,这个参数的稳定性明显提升,对风格特征的提取更加解耦,风格迁移的“纯度”也更高——也就是说,参考图的风格被迁移到新图上的比例更大,但内容污染的比例更小。
如果你还在用旧版本或默认设置,记得在操作时把版本切到V6或更新版本,旧版本对--sref的支持很差,出来的结果很可能像简单的垫图,而不是真正的风格分离。
提示:
--sref与--stylize不要混淆。--stylize是控制模型本身对提示词的“艺术化处理程度”,取值范围0到1000,它调节的是模型在理解提示词时的自由度;而--sref是指定外部参考图的风格来源。两者可以同时使用,但作用方向完全不同。
2. sref参数体系详解与调参经验
2.1 标准语法与参数范围
使用--sref非常简单,命令结构如下:
/imagine prompt: 你的画面描述 --sref <图片URL> --sv <数值>其中--sev是Style Value的缩写(写的时候是--sv),控制风格参考的强度,官方支持的数值范围大致在0到1000之间,但我实际用下来,常用区间远小于这个跨度。
来看一组我做的对比试验。用同一张昭和画报风格参考图,提示词固定为“一位穿风衣的女士站在雨夜街头,霓虹灯倒映在水洼中”,修改--sv数值:
| sv取值 | 风格表现力 | 适用场景 |
|---|---|---|
| 0-50 | 几乎看不出参考风格,仅细微影响色彩倾向 | 微调色调,保留提示词主导权 |
| 80-200 | 风格开始显现,参考图的配色和氛围明显 | 最常用的区间,兼顾主体描述 |
| 250-450 | 风格强主导,画面纹理与光影逻辑大幅贴近参考图 | 追求明显风格化效果时使用 |
| 500+ | 画面已经完全被风格控制,提示词细节容易被淹没 | 适合抽象风格探索,不推荐商用出图 |
有一个被很多人忽略的细节:--sv不是越高越好。当数值超过500,我在实测中经常出现主体结构崩坏、画面信息密度下降的问题。原因在于,风格特征被过度放大后,模型在生成时会把更多生成权重分配给风格特征的重建,导致内容特征的表达空间被压缩。打个比方,你去模仿一个人的口音,模仿得太用力,反而会忘了该说些什么内容,效果适得其反。
2.2 多参考图混合与权重分离
--sref允许同时传入多个图片URL,中间用空格隔开,模型会综合这些参考图的风格特征。这听起来很方便,但如果不做控制,结果的风格可能会变成“四不像”。这时候就需要用到权重符号::来分离。
--sref 图片A::2 图片B::1这个写法的意思是:图片A的风格权重是2,图片B的权重是1。权重默认是1,你可以写成小数或整数。我常用的策略是,在混合两种风格时,让主参考图权重在2到3之间,辅助参考图给到0.5到1。这个比例在大多数情况下都能保住一个清晰的风格主干,同时引入辅助图的细腻特征。
举个例子,我想做一张“蒙德里安配色+铅笔手绘线条”插画,参考图选一张蒙德里安经典网格画的色卡截图,加一张铅笔速写的手绘稿,命令写:
/imagine prompt: 一只黑猫趴在几何色块组成的窗户前 --sref 色卡图URL::4 手绘稿URL::1 --sv 300色卡图权重给到4,因为我想让色彩逻辑成为绝对主导;手绘稿权重只有1,只借一点线条的力度感。生成结果里,色块分割非常明确,线条也确实带着铅笔的碳铅触感,整体效果基本符合预期。
2.3 sref与seed的组合应用
--sref还有一个值得重视的用法,就是和--seed参数组合。--seed是控制随机种子,固定种子能让同一提示词在多次生成中保持构图和元素的一致性。但很多人不知道,--seed也能让--sref的风格输出更加稳定可复现。
实际场景里,我常常用--seed固定一个种子,然后小幅调整--sv,观察风格强度的变化。这样做的优势在于:你排除掉了随机性带来的干扰,能清晰地看到风格数值本身带来的影响,方便你为同一个项目找到最优参数组合。一旦找到合适的种子和风格参数组合,后面每次生成都能在稳定的基础上微调,效率非常高。
/imagine prompt: 森林里发光的鹿 --sref 参考图URL --sv 200 --seed 10086如果这个结果构图满意但风格偏弱,就改成--sv 280重新生成,因为seed没变,主体构图还会保持类似的结构,你只需要判断风格变化是否合适。这种组合方式是我目前在多图项目中保持系列视觉统一性的核心手法。
3. sref风格控制完整实操流程
3.1 从零起步:准备参考图与提示词
先选参考图。这张图不需要是画作或者渲染图,任何有明确视觉特征的图片都可以——一张老照片、一个电影片段截图、一块大理石的纹理,只要你觉得它的风格气质是你想要的,就能丢进去。
不过我有一条核心经验:尽量选“风格特征单一且强烈”的图。如果参考图本身风格就不明确,或者混合了太多视觉元素,模型提取特征时会无所适从。比如你想做浮世绘风格,就选一幅海浪潮汐的经典浮世绘,别选那种带有复杂文字排版、多个人物、前后景杂乱的图。
提示词的写法也要注意。不要尝试在提示词里复述参考图的风格,而是聚焦在“主体内容”上。比如参考图是一张黄昏时分的沙漠摄影,你想生成一辆行驶在公路上的越野车,提示词应该重点描述车的细节、场景、镜头角度、景深等,风格交给sref,这样两个系统各司其职,出图质量最高。
3.2 实操案例:复刻老式电影画报的暖调质感
这里用一个我最近的真实项目来演示。当时需要出一组某品牌宣传图,要求整体视觉风格向老式电影画报靠拢——偏暖的黄绿色调、轻微的颗粒感、带一点复古排版的气质。
第一步,选参考图。我从一个老的电影纪录片截图里提取了一张画面:有颗粒感的暗部、偏黄的暖调、对比度偏高但高光柔和。这张截图不具有任何主体内容,就是一个纯粹的“氛围参考”,非常适合做风格参考。
第二步,写提示词。因为项目需要出一系列不同主体的人物图,每张图的提示词描述主体不同,但共用同一张sref参考图。
/imagine prompt: 一位穿西装的男人坐在复古理发店的皮质座椅上,旁边放着旧式收音机,浅景深,柔光 --sref 电影截图URL --sv 220第一次生成结果出来,整体氛围很对,暖调、颗粒感都在,但人物面部偏暗,细节有点糊。我把--sv降到150,同时微调了提示词里的“柔光”为“面部补光柔和”,第二次生成就舒服多了。这里能看出,--sv在出图质量里扮演的是“风格放量”的角色,如果风格太强导致内容处理粗糙,最简单的解法就是降低--sv,而不要急着加更多描述词。
3.3 多图混合实操与细节调整
配合品牌系列化的需求,这个项目需要三张不同主体的图,但风格必须统一。我的处理方式是:固定一个基础--sref参考图,再为每张图搭配一个独立的细节参考图。比如人物图搭配一张老式皮具的质感图,产品图搭配一张金属机械的材质图——但后者的权重控制得很低,只借一点材质细节,不干扰整体调性。
/imagine prompt: 复古机械手表特写,深色木质背景,侧光 --sref 电影截图URL::3 金属质感图URL::0.5 --sv 160 --seed 2024这里权重给到3和0.5,很清晰地指定了主从关系。出来的手表图既保持了画报暖调,表身的金属拉丝细节也会稍微明显一点。注意--sv 160这个值,在混合风格时我会比单一风格略低,因为多参考图本身就会提高风格特征的叠加浓度。
3.4 系列图风格统一:锁定团队级工作流
用--sref做系列图其实有一个隐藏红利:风格统一性一旦确定,换主体描述词就能批量产出成套图片,视觉设计团队可以把核心参数像模板一样固化下来。
我目前的工作流是这样:选好参考图后,先在单张图上调试出理想的--sv与--seed组合,然后把这个参数组记录到项目共享文档里。后面所有成员出图时,直接调用同一个sref URL和同一组参数,只改提示词里的主体内容。实测下来,这种方式的系列出图一致性非常高,比单纯靠描述词统一风格可靠得多。
注意:参考图URL不要直接粘贴本地上传后的临时链接,尽量使用图床或外部图片地址。实测中发现,某些平台的临时链接在长时间后失效,会导致sref静默失效(模型不会报错,但结果完全没有参考风格)。
4. 疑难杂症与风格参数排查记录
4.1 高频问题速查表
| 症状 | 可能原因 | 解决建议 |
|---|---|---|
| 风格完全没生效 | 参考图URL失效,或未放在正确参数位置 | 检查URL是否可访问,确认命令格式 |
| 风格太弱,色彩倾向不明显 | --sv数值过低 | 从80起步,逐步上调,每次加20-30 |
| 风格太强,主体细节崩塌 | --sv过高,或参考图风格特征过于强烈 | 降低sv到100-200区间,必要时换个参考图 |
| 多参考图混合效果混乱 | 未设权重,或两张图风格冲突过大 | 用::符号设定主次权重,避免两张强风格图混用 |
| 结果风格不稳定,同参数每次都不同 | 未固定seed | 加上--seed参数并固定取值 |
| 提示词描述与风格互相抢戏 | 提示词里写了与参考图冲突的风格词 | 删掉提示词里的风格形容词,只保留内容与光影描述 |
4.2 一个典型翻车案例的完整还原
有次我做一张“复古未来主义”风格的海报,参考图选了一张很漂亮的80年代科幻插画,提示词写的是“太空站内部,穿宇航服的人正在操作仪器”,--sv给了400。结果出来画面完全是负面的:没有太空站,没有任何设备,只有堆起来的色块和扭曲的线条。
排查的过程很典型。我先把--sv降到200,重跑一次,结果稍微好了点,但人物依然变形。再把--sv降到100,这次画面终于稳定了,但风格也几乎看不出来了——变成了一张很普通的太空站场景图。
这时我意识到问题不在--sv,而在参考图本身。那张80年代插画是手工绘制的,线条夸张、色彩浓烈、构图充满了装饰性笔触,这种强手绘特征会大面积覆盖内容特征,再配合偏高的风格数值,新图就变成了一场风格特征的狂欢。后来我换了一张带有类似审美气质但更“收敛”的参考图(同样是暖色调、同样有颗粒感,但构图和笔触简单得多),--sv回到250,效果就非常理想了。
这个案例想告诉大家一个关键逻辑:--sref的风格迁移效果,强烈依赖参考图本身的“纯度”。参考图风格越现眼,模型越不肯放过,迁移到新图上的比例就越大。想做风格柔和的产品图,就别拿一张波普风浓烈的海报当参考。
4.3 版权意识与参考图选择的边界问题
最后聊一个容易被忽略的问题:用--sref参考别人的作品有没有风险。Midjourney官方的建议是不要直接参考在世艺术家的独特风格来商用,这个约束其实落在使用者的自觉性上。我个人的操作习惯是:参考图优先用自己拍摄的照片、自己手的风格试验、公共版权图库里的老照片或经典素材。参考“风格”本身不构成侵权,但如果你拿某位当代画师的完整作品做参考图,生成的结果还在商业项目里使用,这里面的风险就需要你自己评估。
提示:如果要用实拍照片做参考风格,建议选那些调色风格明确、画面内容简单(比如风景、纹理、静物)的图。选复杂人像做参考图时,即使
--sref不会复制长相,也容易在肤色、发色、甚至面部结构上产生风格牵连,影响真实感。
4.4 个人习惯与后续扩展思路
用这个参数的次数多了,我反而越来越倾向于“少即是多”。很多初学者喜欢把--sv拉得很高,觉得风格强就是效果好,但实际上好的风格参考应该是“融入”而不是“覆盖”。
我现在做系列图时,--sv基本控制在一个比较低的范围(大约120到200之间),让参考图风格变成画面的底层气质,而不是把所有元素都刷成同一种纹理。更进阶的玩法是,结合sref和—cref一起用:先用sref锁定整体视觉风格,再用--cref锁定人物形象特征,这两个命令的组合几乎能覆盖大部分商业出图的高频需求。
这个内容后续还可以继续扩展,比如测试不同盘面比例(如--ar 2:3)对sref效果的影响,比如将sref与prompt中的光影关键词叠加后是否会出现风格偏移——这些都是值得自己去跑一遍试验的方向。我自己的感受是,--sref真正改变了出图的方式,从“描述风格”变成“借用风格”,把风格控制从玄学变成了可以稳定复用的工程变量。多跑多调,你会逐渐找到适合自己项目的那组参数组合,那时候你大概率也会跟我一样,不太想回到纯靠提示词硬磨风格的日子了。