很多人接触 AI 漫剧,是从一张惊艳的静帧图开始的。
我在创作者社群里见过同一个场面:有人用即梦生成一张古风角色图,评论区一片惊叹,然后就没有然后了。问原因,回答大多是“图好出,故事不好接”“人物一到下一个镜头就变脸”“配音和画面总是对不上”。
这里有一个经常被忽略的事实:单张图可以靠抽卡,一部剧不能靠运气。AI 漫剧的全流程拆开看,剧本、分镜、静帧、视频、配音、剪辑,每个环节都有对应工具。但真正拉开差距的,不是“会用工具”,而是能不能把这六个环节串成一条稳定、可控、可复用的流水线。
这篇文章我想从实操角度拆一遍这条链路。重点不是推荐哪个工具最猛,而是帮你建立一套判断标准:什么阶段该做什么,为什么这么做,以及出问题时先查哪里。
1. 先搞清楚:AI 漫剧真正难的不是单点工具,而是流程编排
1.1 为什么“教程全看了,自己还是做不出来”
很多新手第一次接触 AI 漫剧,会先找工具教程。比如即梦怎么出图、豆包怎么写提示词、剪映怎么加字幕。单独看每一步都觉得不难,可真到自己手里,问题就变成一串连锁反应:
剧本写得像小说,没有镜头感,到了即梦里不知道该怎么分成静帧;静帧生成了一张好看的脸,但下一个场景换了个角度,人物就变成了另一个人;好不容易做出一段视频,配音和字幕对不上,剪映里来回拖也卡不出节奏。
这说明一个问题:教程解决的是“单点操作”,而 AI 漫剧需要的是“流程编排”。单点操作解决的是“某个工具怎么用”,流程编排解决的问题是“多个工具之间的输入输出如何衔接”。
1.2 从“最小可交付单位”开始拆,而不是从“一部剧”开始
我见过最影响进度的想法,是新手一上来就想做一部 30 集的完整漫剧。这个目标太宏大,导致他会在剧本阶段反复修改世界观,在角色设定上纠结发型和衣服,结果一周过去了,连第一集的镜头表都没出来。
更现实的做法是,先定义自己的“最小可交付单位”。我一般建议做成“一条能连续播放 30 秒到 60 秒的竖屏短片片段”,包含:
- 至少 3 到 5 个镜头;
- 一个明确的小情节:比如“主角发现线索,起身追出去”;
- 同一角色在多个镜头里保持视觉一致;
- 有配音、字幕、简单的背景音乐和音效。
这个最小单位不需要完整故事,也不需要复杂转场,但它必须能证明一件事:你已经能把剧本、分镜、静帧、视频、配音、剪辑六段流程接起来了。能接起来,后面扩到 10 集、30 集才有意义;接不起来,素材再多也只是素材。
1.3 给流程设定质量门槛,而不是等渲染完再补救
平时做单张图,不满意可以反复抽卡。但进入 AI 漫剧流程后,每张图都要变成视频素材,每个视频素材都要进剪辑轨道。如果前面的静帧风格不稳定,后面到了剪映里再去修,基本等于重做。
所以,在开始动手前,可以先给流程设几个质量门槛:
- 剧本是否已经拆成了分镜表,而不是一段纯文字;
- 角色参考图是否固定下来了,有没有统一的角色描述;
- 静帧生成后,是否已经检查过脸部、服饰、画幅、背景风格;
- 视频生成前,是否已经确认运动幅度不会导致角色崩脸;
- 配音音色和口型是否能对上,至少要保证情绪和字幕节奏一致。
这些门槛不是“完美主义”,而是为了避免返工。AI 生成工具最大的特点就是不确定性,流程中的每个环节都要考虑如何把不确定性压到最低。越早发现问题,修复成本越低。
2. 剧本阶段:用豆包把故事加工成可执行分镜表
2.1 先把故事梗概变成“角色、场景、事件”三张表
很多人拿到豆包之后,第一句话是“帮我写一个漫剧剧本”。豆包确实能写,但如果你只给它一个开放式需求,它大概率会还给你一段小说式叙述,里面堆满了心理描写和环境描写。这类文字拿去做 AI 漫剧,基本没法用。
因为在视觉生成里,模型不认识“他很纠结”这种心理描写,它只能识别“他在桌前皱眉,手停在空中”这种画面描述。所以剧本阶段的第一步,不是让豆包直接写故事,而是先建立三张表:
- 角色表:每个角色的姓名、年龄、基本外形、服装、标志性配饰、性格关键词;
- 场景表:每场戏发生在什么地方,室内还是室外,古装还是现代,白天还是晚上,核心视觉元素是什么;
- 事件表:每个镜头里角色做什么、看到什么、说什么,下一步是什么。
这三张表做好之后,再把它们喂给豆包,让它基于这些设定去展开情节。这样生成的内容不会跑偏,而且后续做提示词时可以直接复用角色表和场景表里的字段。
2.2 让豆包输出“分镜脚本”,而不是“剧情文案”
我常用的办法是给豆包一个固定输出结构。比如在对话里写:
请基于以下角色设定和场景设定,把这一段剧情改写成分镜脚本。 每个分镜需要包含以下字段: 1. 镜头编号 2. 画面内容(主体、动作、表情、环境) 3. 景别(远景/全景/中景/近景/特写) 4. 镜头运动方式(固定/推近/拉远/横移/跟随) 5. 人物台词 6. 画面备注(视觉风格、光影氛围、情绪基调)示例输入:
角色设定:林默,23岁,男,穿深灰色长风衣,短发,左耳戴黑色耳钉,性格冷静。 场景设定:深夜城市天台,远处有霓虹灯,下着小雨。 事件:林默发现手机里多了一段录像,内容是朋友被带走,他决定追查下去。豆包生成的结果通常会更接近可执行分镜。这一步的价值在于,你已经把“画面的信息结构”规定好了,后面生成静帧时,AI 只需要根据每个镜头去填画面即可。
2.3 分镜表字段越细,后面返工越少
在实际项目里,我会把分镜表做成一个表格,字段包括:镜头号、场景、景别、画面内容、角色状态、台词、字幕、时长参考、参考图编号。这里有一个非常容易被忽略的字段:角色状态。
比如“林默走到天台边缘”和“林默发现录像后的惊讶表情”,生成出来的画面是完全不同的。如果分镜表里只写“林默在天台上”,那 AI 模型大概率会自由发挥,出来的图就会和你想象中的剧情脱节。
下面是一个最小分镜表模板示例:
| 镜头号 | 场景 | 景别 | 画面内容 | 角色状态 | 台词 | 时长参考 |
|---|---|---|---|---|---|---|
| 01 | 深夜天台 | 全景 | 林默站在天台边缘,雨丝可见 | 冷静、思考 | 无 | 3秒 |
| 02 | 深夜天台 | 近景 | 林默低头看手机,屏幕光照亮脸 | 惊讶、紧张 | “这段录像……是谁发的?” | 4秒 |
| 03 | 深夜天台 | 特写 | 手机屏幕显示监控画面 | 无 | 无 | 2秒 |
| 04 | 深夜天台 | 中景 | 林默收起手机,转身快步离开 | 坚定、果断 | “我去找他。” | 3秒 |
这个模板的好处是,每个镜头都有明确的“画面内容”和“角色状态”。拿到即梦里生成静帧时,不需要再临场发挥,只需要把这一行信息翻译成提示词。
2.4 剧本拆解时的常见问题
用豆包生成分镜时,最容易出现的三个问题是:
第一,角色动作描述太抽象。AI 模型不理解“若有所思”,你要写成“低着头,手指不停敲击桌面,眼睛看向窗外”。
第二,镜头和镜头之间的连续性缺失。比如上一个镜头角色还在白天,下一个镜头突然变成夜晚。这通常是因为分镜表里没有写时间、光线和天气。
第三,台词和画面内容不匹配。人物的台词是长句子,但镜头预计只有 3 秒,配音根本来不及说完。这个问题最好在剧本阶段就控制住:一个镜头里的台词尽量控制在 15 到 20 个字以内,长句就拆成两个镜头。
3. 静帧生成:让即梦稳定出图的四层控制
3.1 一致性不是靠“记住长相”,而是靠“固定参考”
很多人在即梦里生成角色图时,会直接把分镜表里的“画面内容”翻译成提示词,比如“一个年轻男人站在天台边缘,穿灰色风衣”。生成出来大概率是“一张好看但不认识的脸”。
这不是即梦不好用,而是提示词的稳定性不够。AI 图像生成的底层逻辑是概率采样,如果每个镜头的提示词里都少了关键约束,角色就会随机漂移。想让同一角色在多个镜头里保持稳定,常见手段有三种:
- 固定角色描述词:把角色的五官、发型、服装、配饰写成固定字段,每个镜头都复制到提示词里;
- 使用参考图功能:在即梦等工具里传一张已经确定的角色图,作为角色参考;
- 固定种子值:生成满意的图之后,记录种子值,后续构图相同或相近时复用。
这三种手段并不是互相替代的关系。只用角色描述词,生成结果仍然会有偏差;只靠参考图,可能会受角度、光照影响;固定种子值可以提高稳定性,但不能完全控制构图。实际项目里,通常是三者组合使用。
3.2 正向提示词的结构化写法
很多人搜索“即梦2.0 古装剧分镜词”,本质上是在找一组能稳定输出古风分镜的提示词。但真正的稳定性不只来自某一句“魔法词”,而是来自结构。
我一般会把正向提示词写成四个部分:
主体描述 + 动作状态 + 环境背景 + 画风设定示例:
男性角色林默,23岁,深灰色长风衣,黑色短发,左耳黑色耳钉,表情冷静, 站在高楼天台的栏杆前,低头看着手机,手机屏幕发出冷光, 深夜,城市霓虹灯背景,下着小雨,地面有积水反射灯光, 古风?不对,这里是现代都市悬疑风格,电影感实拍质感,暗色调,细节丰富。注意,上面示例里的“古风?不对,这里是现代都市悬疑风格”是提示词里的常见负向写法,但在实际使用里最好直接写成“现代都市悬疑风格,电影感实拍质感”,不要加否定词。因为很多模型对否定词的理解并不稳定,你写“不要古风”,它有可能会把“古风”当成一种元素渲染进去。
正确做法是直接描述你想要的画风,把不想要的东西留给负向提示词或反向提示词。
3.3 反推提示词和局部重绘
生成一批静帧后,不可能张张满意。如果发现某一张图的构图很好,但脸部崩了、手部畸形,或者角色衣服细节不对,可以尝试的手段有:
- 先用反推提示词生成出这张图当前的完整描述,再复制回正向提示词里做微调;
- 使用局部重绘功能,只修改脸部、手部、背景等局部区域,而不是整张重新生成;
- 保留满意的角色图,生成后续镜头时作为参考图传入,而不是重新想象角色长相。
这些操作听起来零散,但它们是保持“系列感”的重要方法。漫剧和单张插画最大的区别在于:观众会看到同一个角色反复出现,只要其中两个镜头里角色长相不一致,整个叙事就会立刻出戏。
3.4 静帧成片前的检查顺序
如果生成后的画面总是出现角色不稳定、色彩不一致、构图偏出等问题,建议按这个顺序排查:
- 先检查参考图:参考图是否正确上传,是否被误裁剪、误旋转;
- 再检查角色描述词:是否每个镜头都保持了同样的核心字段;
- 然后检查环境描述:光线、天气、时间段是否与分镜表一致;
- 最后检查参数:分辨率、画幅比例、种子值、负面提示词是否变化。
很多时候你以为是大模型抽风,其实只是上一张图的参考图没传,或者某个镜头复制提示词时漏了“浅灰色风衣”里的“浅”字。
4. 图生视频:从“一张好看的图”到“一段能用的镜头”
4.1 图生视频的输入方式,决定镜头叙事上限
有了静帧之后,接下来就是把图变成视频。市面上不少工具支持视频生成,常见输入方式有三种:文生视频、图生视频、首尾帧生成。
在漫剧流程里,我更建议大家优先使用图生视频,而不是直接文生视频。原因是文生视频的随机性更大,画面细节和角色长相很容易漂移;图生视频至少能锁定一张已经满意的画面。首尾帧生成则适合做“角色从 A 动作到 B 动作”的过渡,但参数控制相对复杂,新手阶段先不用急着上。
图生视频的核心目标,不是让画面“动得越多越好”,而是让画面“在保持角色一致的前提下动得自然”。如果输入是一张静态角色图,生成视频后角色突然转头、嘴部乱晃、身体变形,这条视频基本是用不了的。
4.2 关键参数不是“拉满”,而是“刚好”
不同版本和不同工具的参数名称会略有差异,但通常都涉及:运动幅度、生成时长、种子值、画面比例。第一次使用时不要一股脑拉满所有参数,建议先用默认值生成一条,观察运动是否自然,再逐步调整。
几个常见判断:
- 运动幅度:默认或较低值适合慢节奏镜头,比如角色抬头、风吹衣角;较高值适合动作戏,但崩脸概率也会明显上升;
- 生成时长:短片段更容易保持稳定,一个镜头 3 到 5 秒通常更容易控制;如果素材长度不够,可以在剪辑阶段用多个镜头拼接;
- 种子值:如果一条视频生成后人物崩了,可以固定种子值微调提示词或运动幅度,而不是完全重开。
这里有一个很现实的经验:与其在视频生成阶段追求长镜头,不如先积累大量 3 秒左右的短镜头。原因是剪辑的本质就是切镜头,短镜头之间的衔接可以掩盖很多 AI 生成的不稳定性。你不需要一个角色连续走 10 秒不崩脸,你只需要让他每次出现 3 秒内不崩脸,然后通过剪辑节奏让观众忽略中间的跳变。
4.3 视频生成后的验收清单
每次生成完视频,先不要急着导入剪映。可以先建立一个检查清单:
- 角色脸部是否稳定,有没有出现变形、闪烁;
- 衣物和发型的动态是否符合物理常识;
- 背景是否有突然扭曲或出现多余物体;
- 运动幅度是否符合镜头需求;
- 画面是否有明显的闪烁噪点。
一旦发现某一条视频不合格,直接标记为废片,不要试图在剪映里靠特效修补。AI 视频的不稳定是基于画面像素层面的,到了剪辑阶段很难修。
4.4 批量生成时的注意点
做漫剧需要视频素材量很大。批量生成视频时,建议先做两条测试,确认这套静帧和参数能稳定输出,再开始批量。同时,给每条视频命名时带上镜头编号和版本号,比如S01_L03_V2,方便后面排查。
批量最容易出问题的环节是参考图和种子值错乱。因为有些工具的生成队列会保留上一次输入,如果你没检查,可能用上一张图的参考图生成了下一段视频,结果角色和场景全错了。所以批量生成时,每条视频后最好都检查一次“输入图是否正确”。
5. 配音与字幕:豆包负责“会说”,剪映负责“说得像”
5.1 配音工具选型和音色一致
AI 漫剧里的角色只要有台词,就涉及配音。现在很多剪辑软件和配音工具都支持文字转语音。豆包也常被用来做文本处理和语音合成,你可以先把台词稿整理好,再用配音工具生成音频。
配音最核心的问题同样是“一致性”。如果你一个角色第一集用了 A 音色,第二集换成了 B 音色,观众会非常出戏。所以在项目一开始,就要固定每个角色的音色、语速、语调。
比较稳妥的流程是:
- 先录一段角色语音作为参考,或者从配音工具里选一个稳定的音色;
- 把同一角色的所有台词分批生成,尽量保持音色设置不变;
- 如果工具支持情绪标签,可以在悲伤、愤怒、平静等情绪之间切换,但不要随便更换基础音色;
- 生成音频后,先和分镜表里的台词逐条核对,看有没有多字、错字、重复读。
另外,AI 配音最忌讳“念稿感”。文字转语音生成的音频,如果语速均匀没有任何停顿,配合画面会非常突兀。有些配音工具支持添加停顿标记,比如用逗号、句号、省略号来控制断句。不要让豆包一次性输出一大段没有标点停顿的台词,要主动在台词稿里断好句子。
5.2 从分镜表反推配音稿
这一步很多人会做反:先把配音做出来,再回头去剪画面。其实更高效的顺序是先有分镜表,再从分镜表反推配音稿。
因为分镜表里已经写好了每个镜头的台词,你需要做的,是把这些台词按镜头顺序整理成一个“配音稿”,然后交给配音工具生成。这样做的好处是,音频长度和镜头时长能大致对得上,不至于配音 10 秒但镜头只有 4 秒。
5.3 剪映里的对轨与字幕
音频生成后,导进剪映,需要和视频逐条对齐。最基础的操作是看波形图和字幕停顿点。很多 AI 配音在长句中间会有短暂停顿,如果你的画面正好在停顿处切换,节奏就会舒服;如果画面切晚了,观众会觉得拖沓;切早了,又会觉得配音还没说完。
字幕不要手动一句一句打字,剪映通常支持识别字幕或导入字幕文件。如果你的素材命名规范,字幕文件也很容易批量生成。
这里有一个建议:字幕要作为“画面设计的一部分”来看待。字体的粗细、描边、位置,会直接影响漫剧的观感。如果是现代悬疑,可以用干净的无衬线字体;如果是古风,字体可以更有书法感。但注意,字体样式要在整部作品里保持一致,不要一个镜头换一种字体。
5.4 背景音乐和音效的优先级
很多人做完配音就急着渲染导出,忽略环境音和音乐。但 AI 漫剧如果只有干巴巴的配音,会显得非常“空”。我的优先级排序是:
- 第一层:配音台词,这是信息主体;
- 第二层:环境音,比如雨声、街道噪音、室内空调声;
- 第三层:音效,比如脚步声、关门声、手机提示音;
- 第四层:背景音乐,用于情绪渲染。
不要四个声音全部堆在一起,会让整个混音变得杂乱。剪映里音量分层要清楚:背景音乐通常是垫底,不要盖过配音;音效要有明确的节奏点;环境音只要一点点,增强临场感即可。
6. 剪辑交付:素材进剪映之前,先解决“找得到”和“排得对”
6.1 素材命名与轨道分层
开始剪辑前,先把所有视频、音频、图片素材按照集数和镜头号归好类。即使只做一条 60 秒的短片,素材也可能超过 20 个文件。如果你把它们命名为“001”“002”,一旦流程出问题,排查会很痛苦。
推荐命名规则示例:
S01E03_L01_V2.mp4 S01E03_AUDIO_L01.wav S01E03_BGM_v1.mp3 S01E03_SFX_door.mp3其中S01E03代表第一季第三集,L01代表镜头号,V2代表版本号。这样哪怕中间修改过四五版,也能一眼看出最终使用的是哪个版本。
进入剪映后,轨道分层建议固定为:视频轨、字幕轨、配音轨、音效轨、音乐轨。不要把所有素材堆在一条轨道上。后期调整时,如果没有分层,你想移动某段音乐或字幕,很容易误操作其他素材。
6.2 字幕批量统一与风格克制
剪映通常支持字幕识别,但识别出来的字幕默认样式可能并不适合你的作品。建议先调好一个字幕样式,再应用到所有字幕。
字幕样式核心看三点:字体、字号、安全边距。竖屏漫剧里,字幕不要贴到屏幕边缘,尤其是手机观看时容易被刘海区域遮挡。你可以保留一定的四周安全区域,通常上方给标题和系统 UI,下方给字幕。
视觉风格上,AI 漫剧本身画面已经足够“满”,字幕不要再加动画、描边、阴影、彩色背景。绝大多数成熟作品的字幕风格都很克制,只有关键词出现时才做强调。字幕的作用是让观众快速理解台词,而不是炫技。
6.3 渲染输出与平台适配
不同平台对视频格式、画幅、时长要求并不相同。如果你准备把作品投放到红果这类竖屏短剧平台,一定不能等到渲染完再去适配。要提前查清楚平台对竖屏比例、单集时长、字幕安全区、封面尺寸的官方要求。
渲染输出时,常见问题有两类:
一是码率设置过高或过低。过高会导致文件巨大,上传慢;过低会导致画面出现马赛克。漫剧画面通常以人物和字幕为主,一般选择平台推荐的中高码率即可。
二是输出帧率不统一。如果你生成视频时有的镜头是 24 帧,有的是 30 帧,剪辑导出时最好统一到一个帧率,否则在手机上容易出现卡顿或不流畅。
6.4 导出前的最终检查
导出前建议最后看一遍时间线,重点检查:
- 有没有静帧图没有替换干净的;
- 有没有音频波形超出正常范围的爆音;
- 有没有字幕错字、多字、字幕和配音不同步;
- 有没有镜头之间亮度、色调差异过大的问题;
- 有没有多余的黑帧或拖尾。
这一步不要省。AI 视频项目里,最难受的不是生成慢,而是生成完 30 集后,发现第一集里面有个镜头字幕写错了,但你又不记得在哪条轨道上。所以,导出前检查是最后的低成本纠错机会。
7. 从自娱自乐到可交付:一个 AI 漫剧制作者的工程化清单
7.1 单集跑通,再谈批量和接单
很多人看完教程,第一反应是想靠 AI 漫剧接单。我的看法是:先把单集跑通。
“跑通”的标准不是“我做完了”,而是“我可以让另一个人按照我的流程重复做一遍,结果不会差太多”。如果你的流程里每一步都靠手气,那一两个镜头运气好还能看,到了第 20 集,你一定会被反复抽卡和重做消耗到崩溃。
什么叫流程稳定?就是同样一个分镜表,你用同一组角色卡、参考图、提示词结构和种子控制,生成出来的静帧质量在可接受范围内。稳定性的价值,在单集里看不出区别,在批量交付时直接决定生死。
7.2 一个可复用的批量制作框架
从个人创作者角度,我建议把 AI 漫剧制作拆成六个阶段,并在每个阶段留下可复用的文件资产:
- 项目设定:角色表、场景表、画风定调、配音音色设定;
- 剧本分镜:分镜表、台词稿、配音稿;
- 视觉资产:角色参考图、场景参考图、风格参考图;
- 单镜头生成:静帧图、视频片段、种子值记录;
- 后期合成:配音、音效、背景音乐、字幕、剪辑时间线;
- 交付归档:渲染视频、项目工程、素材目录、版本记录。
每次完成一个小项目,就把这套资产目录保存下来。下一次做新剧时,不需要从零开始,可以直接复用同类风格的提示词结构、角色描述模板、分镜表格式和字幕样式。
这个框架真正的价值不是让你快,而是让项目从“靠灵感推进”变成“靠流程推进”。灵感只负责开头,流程负责把灵感变成 30 集还不崩。
7.3 接单或合作时,最容易出现的交付纠纷
如果你已经完成了几条像样的作品,开始接单或加入团队,下面这些边界越早想清楚越好:
- 版权归属:AI 生成的画面版权在不同平台规则下可能不统一,合作前要和甲方确认成品版权、素材使用范围;
- 修改次数:AI 视频最怕“先做一版,然后无限次修改”。合作前明确包几次修改,每次修改范围是什么;
- 素材授权:第三方字体、音乐、音效是否有商用授权,不要等上线后再被投诉;
- 交付格式:明确交付的是剪辑后的整片,还是需要同时交付工程文件和未合成素材。
这不是教你规避责任,而是让合作双方对结果有共同的预期。AI 视频制作仍然大量依赖人工判断和反复调试,无法像流水线印刷一样保证每次输出完全一致。所以,接单前先和对方确认清楚“可接受的质量标准”,比盲目承诺“一定能做好”更重要。
7.4 长期看,哪些能力会越来越值钱
工具会不断变化。今天你熟悉即梦,可能下个月又出了新的模型;今天你习惯用豆包整理分镜,过段时间可能又有新的 AI agent 来接管一部分流程。但有几项能力不会过时:
第一,对叙事节奏的感知。知道一个镜头应该多长、一句台词应该怎么断句、情绪该在哪里释放,这是 AI 工具替代不了的。
第二,对流程抽象的能力。能把自己做项目的过程拆解成几个环节,并为每个环节建立输入、输出和质量标准。这是从“用工具的人”到“搭流程的人”的分水岭。
第三,对风险的判断力。知道哪些环节容易崩,哪些问题必须在什么时候检查,怎么通过种子值、参考图、分镜表把不确定性降到可控范围。这种能力不是看教程能学会的,必须靠实际跑完几个项目才能积累。
如果你真要长期做 AI 漫剧,不要只盯着新出的工具和技巧,要多复盘自己做过的流程:哪一步最浪费时间,哪个环节返工率最高,什么方法能稳定减少崩图、崩脸、音画不同步。把这些经验沉淀成自己的检查清单,才是从“玩票”到“专业”的跨越。
说到底,AI 漫剧这个赛道,真正值钱的不是一张好看的图,也不是一段炫酷的视频,而是一套能反复产出合格内容的流程。这套流程,最好从今天这一条 60 秒短片开始。