做 AI 绘画这些年,单张图的“好看”早就不是难点,真正让人头秃的是连续画面的一致性。尤其是四格故事这种形式:第一格完美,第二格开始“换脸”,到第四格基本就是另一个人了——这种翻车我经历过太多次。所以 Image 2.5 上线双参考图功能的时候,我第一反应就是拿它来验证一个真问题:能不能用双参考图跑通连续四格故事?
实测跑完之后,结论是:能跑通,而且比我想象的稳。但整个过程不是那种“一键生成爽图”的体验,里面有几个参数逻辑和节奏控制需要自己摸。这篇文章就是把我的完整复盘写下来,包含双参考图的控制逻辑、我实际用的分镜流程、参数设置,以及三个让我返工率极高的坑和对应的排查思路。如果你也在用 Image 2.5 做多格内容、系列角色图或者短篇故事漫画,这篇应该能帮你少走不少弯路。
1. 连续四格故事为什么是块硬骨头
1.1 四格故事的画面诉求拆解
很多人觉得四格故事不就是“生成四张图再拼起来”吗?真不是。单张图只需要满足一个场景、一个氛围、一个主体;但四格故事是同一批角色、同一个世界观、同一个画风,连续推进一段叙事。它就要求几个维度同时成立:
- 角色一致性:人物的五官、发型、服装、体型在四个画面里必须对得上,不能第二格换了个发型、第三格换了件衣服。
- 环境延续性:四个画面虽然可以是不同景别、不同机位,但空间逻辑要通,不能第一格是白天街道,第二格突然变成室内。
- 叙事递进感:每一格得有“剧情推进”而不是简单复读。比如第一格人物走着,第二格发现东西,第三格紧张,第四格爆发——画面之间要有情绪和动作的连贯。
- 风格统一性:四张图拼在一起,色调、光影、笔触得像是同一个人、同一个工具、同一批次画出来的。
这四条单拎出来哪一条都不难,难的是同时满足。而传统工具链里,它们往往互相打架。
1.2 以前的方案为什么总在“第四格崩坏”
在 Image 2.5 之前,我做四格故事常用的手段无非是下面这几类,各有各的硬伤:
第一种是单参考图垫图。把第一格生成结果作为后续所有格子的参考图。问题在于误差会累积:第二格轻微走样,第三格参考的就是那个“已经走样”的第二格,到第四格基本就放飞了。这也是“第四格崩坏”的最常见来源。
第二种是靠提示词硬控。在每格描述里把角色外貌写一遍,什么“棕色卷发、蓝色眼睛、黑色皮夹克”。问题是你写得再细,模型也只能给个大概方向,而且描述越多,画面越容易被其他元素干扰。
第三种是局部重绘修补。先生成大致构图,再手动锁定区域修脸、修衣服。这个方法精度可以很高,但成本极大,一张图可能来回修十几轮,四格下来就是几十轮,叙事节奏早断了。
第四种是训练 LoRA 或者角色一致性模型。效果最好,但门槛和资源消耗也最高,为了一个小短篇去微调一个模型,大多数时候不划算。
所以双参考图这个功能出来之后,我意识到它可能正好打在这个痛点上:解决了“一个参考维度不够用”的问题。只是没想到,它的正确打开方式跟我想的不太一样。
2. 双参考图与单参考图的控制逻辑差异
2.1 单参考图管不住的两个维度
先说单参考图为什么不够用。模型的参考图机制,本质上是让生成过程“模仿”这张图的某些特征。但一张图里包含的信息太多了:人物外貌、服装、背景环境、色调、构图、光影、画风……你丢一张图进去,模型只能从中“猜测”你最在意的是哪个特征。
这就导致一个问题:当你想同时锁住“角色是谁”和“画面氛围是什么”的时候,单参考图做不到精确分工。你给一张角色站姿参考图,模型可能学走了人物的脸,也可能学走了背景的色调,甚至学走了构图的透视角度——到底学哪个,存在随机性。
我给个生活化类比:单参考图就像你只给厨师看了一张成品菜的照片,他分不清你更在意的是“这道菜”本身,还是“这个摆盘方式”。双参考图则是把“菜是什么”和“摆盘风格”分开给了两张照片,控制逻辑瞬间清晰了。
2.2 双参考图的分工逻辑:角色参考图与环境参考图分离
Image 2.5 的双参考图,简单说就是可以同时上传两张参考图,让模型在生成时同时参考。但关键问题不是“能不能传两张”,而是两张图各管什么、权重怎么安排。
我实测下来比较顺手的搭配方式有两种:
- 角色参考图 + 上一格生成结果:角色参考图负责锁定人物长相和服装细节,上一格生成结果负责延续光影、色调、画风和空间关系。这种搭配最适合“逐格推进”的连环叙事,因为我希望每一格都跟上一格是同一个世界。
- 角色参考图 + 环境概念图:角色参考图管人,环境概念图管场景风格。适合做系列插画或者角色在不同地点游历的题材,比如同一角色打卡不同城市那种。
我在实际测试里,第一种方式用得最多,因为它天然适合“连续故事”这个场景。但我必须提醒一个细节:两张参考图的功能必须严格分离,否则模型会陷入“不知道该学谁”的混乱。
2.3 起始参考参数与调整思路
具体参数上,我以手头这个版本为基础,给出一个我实测能稳定起步的配置(不同版本可能略有差异,但思路一致):
| 参考图类型 | 建议权重区间 | 作用 | 注意点 |
|---|---|---|---|
| 角色参考图 | 0.7 - 0.9 | 锁定人物外貌、服装、体型 | 权重过低容易“变脸”,过高画面会呆板 |
| 场景参考图(或上一格) | 0.4 - 0.6 | 延续色调、光影、画风 | 权重过高会限制机位和构图变化 |
| 提示词强度 | 按默认即可 | 描述当前格新增内容 | 不要重复描述参考图已有的角色外貌 |
这个区间的核心逻辑是“主次分明”:角色参考图的权重必须显著高于场景参考图。因为人脸特征一旦崩了,后面再怎么修都难受;而场景信息哪怕弱一点,只要色调和氛围接得上,人眼不会立刻察觉。
如果平台支持分别调整两张参考图的权重,一定分开调,不要图省事设成一样。双参考图的精髓就在于“分开控制”,权重拉平等于回到单参考图的老路。
3. 我用双参考图跑通四格故事的完整流程
3.1 第零步:先把故事分镜写清楚
这一步很多人会跳过去,直接开始生成,结果就是“生成一张好看一张,连不起来”。我现在的做法是,任何多格内容动手之前,先画一个分镜表。四格虽然短,但也需要明确的起承转合。
我这篇测试用的小故事很简单,四格剧情大概是:一个穿红色风衣的女性在街头收到一封信,拆开时露出惊讶表情,抬头发现对面站着一个黑衣人,随后追上去但黑衣人已经消失在街道尽头。
对应到分镜表就是这样:
| 格数 | 角色动作 | 景别/机位 | 环境 | 情绪氛围 |
|---|---|---|---|---|
| 第一格 | 在街角拆信 | 全景,侧面视角 | 傍晚街道,路灯初亮 | 疑惑、好奇 |
| 第二格 | 低头看信内容 | 特写,正上方视角 | 手中信纸与信封 | 惊讶、紧张 |
| 第三格 | 抬头看向前方 | 中景,过肩视角 | 街道远处,逆光 | 警觉、不安 |
| 第四格 | 追出去,黑衣人背影 | 全景,纵深透视 | 街道尽头,薄雾 | 紧迫、悬念 |
有了这个表,后面每一步生成都知道自己在干什么,不会跑偏。强烈建议你也这样做,哪怕只是脑子里过一遍,把关键信息写在便签上都行。
3.2 准备一张“干净”的角色参考图
角色参考图的好坏直接决定整条链路的稳定性。我踩过的坑是:直接拿网上找的图或者之前生成的一张“带背景带道具”的图当参考图,结果模型把背景、道具也当成角色的一部分学了进去,后面指定新场景的时候就会打架。
正确的做法是,先把角色参考图清理干净:
- 画面中只保留一个主要角色,不要有路人、动物、复杂道具。
- 背景尽量简洁,纯色背景最佳。如果原图有复杂背景,用裁切工具把人物主体抠出来。
- 人物的脸、发型、标志性服装必须清晰可见,不要是远景小人、不要被遮挡。
- 比例建议用半身或七分身,比纯头像多出服装信息,又不会因为全身照导致脸部像素太低。
我当时为这个故事生成的参考图描述是:“一位三十岁左右的女性,红色风衣,深棕色短发,神情冷静,半身像,纯灰色背景,柔和棚拍灯光。”生成之后挑了五官最清晰的一张,裁掉多余背景,作为整条链路的角色锚点。
3.3 逐格推进时参考图怎么搭配
准备工作做完,就进入真正的生成环节。我的策略是第一格用单参考图,后面每一格用双参考图。
第一格为什么要用单参考图?因为第一格是整个故事的“视觉基调”,它要确立角色在环境中的样子。如果第一格就用双参考图,角色参考图和环境参考图之间如果有细微冲突,会把问题直接埋进第一格,后面全都是带病作业。
第一格我输入的角色参考图加上提示词:“傍晚城市街道,路灯初亮,穿红色风衣的深棕色短发女性站在街角拆信,表情疑惑,侧面全景,电影感,冷色调。”
生成之后检查两件事:脸是不是参考图那个人?氛围是不是我要的冷调街道?只要这两点没问题,这张图就作为后续的“画面锚点”。
从第二格开始,双参考图正式入场:角色参考图 + 第一格生成结果。角色参考图保证“还是这个人”,第一格结果保证“还是在同一个世界里”。第二格提示词只写新信息:“俯拍特写,女性手中展开的信封和信纸,纸上写着文字,手指微微收紧,背景虚化,惊讶情绪。”
第三格同理,参考图改为角色参考图 + 第二格生成结果,提示词写:“过肩视角,女性猛然抬头,看向街道远处,逆光中一个黑衣人背影,警觉氛围,浅景深。”第四格继续推进:“纵深构图,女性朝街道尽头奔跑,黑衣人背影在薄雾中渐远,紧迫感。”
这样逐格推进的好处是:每一格都跟前一格有视觉延续,同时又有独立的机位和动作变化,叙事感就出来了。
3.4 拼图与后期收尾的实用细节
四格全部生成之后,还有两个收尾步骤很重要:拼图方式和文字处理。
拼图我建议用最简单的一行四列或者两行两列横版,顺序从左到右。平台里的九宫格拼图模板不一定适合四格漫画,因为间距、圆角、背景色都会影响阅读节奏。我用的是图片处理软件手动排版,四张图统一加细描边或者统一圆角,视觉上就是一个完整作品。
文字部分,我不建议直接在生成时就要求“图上带对白”,因为目前的图像模型生成文字还容易出错,而且会把画面占掉一块。我习惯的做法是:生成画面时留出空白区域(比如天空、地面、纯色墙面),后期拼图后用文字工具手动添加对白或者旁白。就连气泡也可以用简单几何图形代替,干净利落。
4. 实际测试中踩过的坑与排查链路
4.1 坑一:角色“越画越不像”,加权重也救不回来
第一次跑完第四格,我看了眼结果,差点没认出来那是开头那个红风衣女性——五官整个“融”掉了,更像是另一个人。我一开始的直觉是权重不够,直接把角色参考图权重拉到 0.9,重跑了一次,结果依然不行,只是从“完全不像”变成了“有点像但僵硬”。
后来我花了点时间逐步排查,才意识到问题不在权重,而在参考图自身的质量。第一版角色参考图我偷懒,直接用了之前一张“角色站在街边”的成图,背景里有招牌、路灯、车辆。模型在训练时把这些背景元素也当成了角色的“伴随特征”,导致后面每一格都在画面上保留了一部分“街边”的痕迹,同时又和提示词里的新环境产生冲突,角色脸部反而被这种冲突干扰,越往后越失真。
解决办法是把角色参考图重新生成一版,这次只保留纯色背景、半身像、脸部清晰,然后把背景全部裁掉。重新跑了整条链路,脸的稳定性立刻上了一个台阶。这也印证了那个原则:双参考图的前提是每张参考图本身足够“干净”。
4.2 坑二:四格像“四胞胎”,镜头感全丢了
第二个坑比较有意思。第一版四格出来,人物一致性好了,但第二、三、四格几乎都是同一个角度、同一个构图的正面视角——看起来就像同一张图反复微调,叙事感完全没了。
一开始我怀疑是模型本身不会变机位,后来才发现是参考图的锅:我把“上一格生成结果”的权重拉到了 0.6,而上一格的结果不仅是“色调和环境的锚”,还把构图透视也带了过来。模型为了“参考”,把正面视角也一并延续了。
排查思路分两步:第一步,把场景参考图的权重从 0.6 降到 0.4;第二步,在提示词里主动写明机位术语,“俯拍特写”“过肩视角”“纵深构图”。这里有个细节值得注意:提示词中的机位描述在双参考图模式下非常关键,因为参考图负责的是“世界统一”,提示词负责的是“镜头运动”,两者必须分开管。
调整之后,四格的视角终于有了明显变化:全景、特写、过肩、纵深,叙事节奏回来了。这个坑也让我明白了一个平衡点:场景参考图权重不能太高,超过 0.5 就容易把构图也锁死。
4.3 坑三:提示词里的新环境被参考图“吞掉”
第三个坑发生在第四格。我明明在提示词里写了“街道尽头,薄雾,纵深透视”,生成结果却还是第一格的街道场景,只是把人物缩小了放在中间。远处的薄雾、纵深感完全没体现。
我最初以为是模型没听懂,后来把参考图换掉了才发现:问题出在角色参考图里保留了太多背景细节。因为我的角色参考图虽然是纯色背景,但服装和人物周围还是带了一点环境光影,模型在生成“人物”的同时,把那种环境感也延续了过来,导致新的场景描述施展不开。
处理方式很直接:把场景参考图(上一格)换成第一格的裁剪版——只保留第一格的天空、街道、远处建筑这些环境部分,把人物主体裁掉。这样双参考图就变成了“角色参考图管人、环境裁剪图管场景”,两者信息完全不重叠。重跑之后,第四格的薄雾街道一下就出来了。
这也是双参考图一个容易被忽略的原则:两张参考图的信息重叠越少,控制效果越好。如果两张图都包含了“人+环境”,模型就会被两份互相矛盾的信息拉扯。
4.4 养成一个参数记录习惯
最后分享一个排查习惯:每次生成之后,把当次用的提示词、参考图、权重数值记录在表格里。不要嫌麻烦,因为出问题的时候,最快的定位方式不是“再试一次”,而是回看上一次成功和失败之间的变量差。
我当时就用了一个简单表格:
| 轮次 | 参考图组合 | 角色权重 | 场景权重 | 提示词要点 | 结果评价 |
|---|---|---|---|---|---|
| 第一版 | 角色+第一格 | 0.8 | 0.6 | 正面视角 | 人物崩,构图重复 |
| 第二版 | 干净角色+第一格 | 0.9 | 0.4 | 加机位描述 | 人物稳定,构图仍偏重复 |
| 第三版 | 干净角色+环境裁剪 | 0.85 | 0.45 | 机位+环境描述 | 稳定,通过 |
这个习惯帮我省了很多反复试错的成本。每次只改一个变量,不要同时动权重和提示词,否则最后根本不知道是谁起的作用。
5. 双参考图的边界与进阶想法
5.1 双参考图适合与不适合的场景
用完整条链路之后,我对双参考图的定位有了更清晰的认识。它最适合的场景是:同一个主角色在多个场景、多个镜头下的连续性内容——比如四格故事、连环插画、角色在不同城市游历的系列图。它解决的核心问题是“单张图的特征学偏”,让模型在生成时有了明确的“角色锚点”和“风格锚点”。
但它也有明显的边界。如果画面里同时出现多个重要角色,比如四格故事里第一格有主角,第二格又多了一个反派,第三格两人同框——双参考图就会比较吃力,因为两个参考图承载不下“两个角色的同时约束”。这种情况下我的建议是:先用双参考图分别生成“主角单人画面”和“反派单人画面”,再通过局部重绘或者合成的方式把两人放进同一格,而不是指望参考图一次性搞定。
另外,双参考图对“概念发散型创作”也不是很友好。如果你只是想“随便生成一张好看的图”,双参考图反而会限制灵感和意外惊喜,让人觉得画面太“板”。
5.2 进阶:系列化角色与跨批次复用
测试完四格故事之后,我发现双参考图还有一个非常实用的延伸用法:把角色参考图做成“项目资产”,跨批次复用。
比如我在这次测试里生成的红色风衣女性参考图,后续如果我想做这个角色的其他短篇故事,可以直接复用同一张角色参考图,配合新的环境参考图。这样做的效果是,不同批次生成的四格故事放在一起看,能明显感觉到是“同一个角色的不同篇章”——角色形象完全一致,省去了每次重新锁定形象的痛苦。
我现在的做法是,在本地建一个“角色图库”,每个角色保存三张最优参考图:正面半身、全身、侧面特写。下次用的时候直接挑最合适的那张,不用重新生成。
对于更长的故事(六格、八格、甚至连环画),我建议用“关键帧策略”:先用手里的双参考图把第 1 格、最后一格和中间的转折格先生成出来,建立故事的关键节点,然后再用“上一格结果 + 关键帧结果”反推补足中间的画面。这样比从第 1 格一路顺推更不容易在长链路里失控。
5.3 关于这套流程的个人经验总结
这次用 Image 2.5 跑通四格故事,我自己最大的收获是:参考图功能不是“传两张图进去就完事”,关键是想清楚每张图负责什么、权重怎么定、信息怎么避免重叠。
如果让我给一个最核心的建议,那就是:第一张参考图管人,第二张参考图管环境,两者信息越独立、控制越精准。有了这个认知之后,四格故事只是一个起点,连续短篇、系列插画、角色合集,都可以用同一套逻辑往下扩展。而且这套思路不挑具体工具版本,哪怕以后 Image 2.6、Image 3.0 出来,参考图的核心控制逻辑大概率还是这个方向。
最后再分享一个小技巧。如果你在某一格反复生成都达不到想要的效果,不要硬试。我一般会停下来,重新审视这一格在分镜表里的“情绪任务”——有时候不是画面不行,而是这一格的剧情动作写得不够具体。提示词里加上一个具体的动作动词(“推开”“攥紧”“转身”),比加一堆形容词管用得多。这也是我踩过好几次坑之后才慢慢悟出来的:AI 绘画要的是具体动作,不是氛围词堆砌。