最近 AI 漫剧在各大平台的热度一直没降过,尤其在短剧、动漫二创和小说推文领域,已经有不少团队开始用 AI 工具批量做内容。很多朋友看到成品觉得“这效果真不错”,但一上手就卡住:人物脸部忽变、镜头不连贯、配音对不上口型、剪出来的片子总觉得哪里怪。这个《AI漫剧零基础全套教程》项目,解决的就是从剧本、分镜、静帧、视频、配音到剪辑的完整生产链路问题,而不是只教你“点哪个按钮生成一张图”。
先说结论:这个教程适合完全没有经验的新手,也适合已经会一点 Midjourney、Stable Diffusion、剪映但没跑通完整漫剧流程的人。它的核心不是讲某一个 AI 工具的单点技巧,而是把“文字创意变成一部可发布的 AI 漫剧”要经过的所有环节标准化,包括剧本编写、分镜拆解、角色一致性保持、静帧生成、图生视频、AI 配音、字幕剪辑成片。
这篇文章我会从项目能解决什么问题开始,先给出一份核心能力速览表,再按 AI 漫剧的实际生产流程拆解每一步的操作方法、工具选择和验证方式。最后会补充设备配置建议、批量生产的工程化思路、常见问题排查,以及新手最容易踩的坑。建议先收藏再读,文章很长,但每一步都可以直接照着做。
1. 核心能力速览
| 能力项 | 说明 |
|---|---|
| 项目类型 | AI 漫剧/短剧全流程制作教程 |
| 覆盖环节 | 剧本生成、分镜设计、角色一致性、静帧生成、图生视频、AI 配音、剪辑合成 |
| 适合人群 | 零基础小白、短视频创作者、小说推文作者、短剧从业者、想找副业的内容生产者 |
| 是否需要编程 | 大部分环节不需要写代码,但懂脚本和 API 调用能显著提升效率 |
| 涉及工具 | AI 绘画工具(Stable Diffusion / WebUI / ComfyUI 等)、图生视频工具、AI 配音工具、剪辑软件 |
| 硬件需求 | 按实际使用工具而定,本地部署图像模型建议 NVIDIA 显卡,显存不确定就按测试为准 |
| 启动方式 | 非单一软件,按工具链分别启动 WebUI / ComfyUI / 各生成服务 |
| 是否支持批量任务 | 取决于所选工具,ComfyUI 和部分 API 服务支持批量生成和队列处理 |
| 是否提供 API | 不同工具不同,图像生成、语音合成类服务普遍支持 HTTP API |
| 核心目标 | 从零完成一部画面稳定、配音自然、节奏合格的 AI 漫剧作品 |
需要特别说明一点:这个项目本质上是“整套制作流程的标准化方案”,不是某个具体的开源模型。你在学习的时候,需要按它给出的方案组装自己的工具链。教程里最值钱的部分不是某一个参数,而是“人物一致性”的处理思路和“从静帧到视频再到配音剪辑”的完整 workflow。
2. 适用场景与使用边界
2.1 适合做哪些内容
AI 漫剧最成熟的落地场景是短视频平台和小说推流。常见类型包括:
- 古风仙侠、都市情感类小说推剧
- 漫画风格的短篇故事
- 童话故事、儿童绘本配音视频
- 知识科普类动画
- 品牌定制动态漫画广告
从变现角度看,个人做 AI 漫剧一般走三种路线:平台分成、私域引流转化、接单定制。教程最后能学到的是一套完整生产力,而不是单一画图能力,所以相对适合作为副业起步。
2.2 不适合做哪些内容
不适合想“一键全自动生成一部完整动画”的人。任何一个 AI 漫剧项目,都需要人工参与脚本修改、分镜选择、画面筛选、语音校对和剪辑节奏控制。当前 AI 生成内容还没有成熟到能完全脱离人工审核直接发布。
2.3 版权、肖像与合规提醒
AI 漫剧制作涉及几个必须正视的问题:
- 使用真人明星、公众人物形象或特定配音音色,必须取得授权。
- 改编小说、漫画、剧本,需要确认原作品的改编权和传播权。
- AI 生成画面的版权归属,不同平台政策不同,发布前要阅读对应平台规则。
- AI 配音克隆他人声线属于高风险操作,不要用于恶搞或商业变现。
- 涉及未成年角色的内容,严禁任何不当表达。
合规建议:自己的原创剧本 + 自己训练或选择的非特定人物形象 + 无版权风险的音乐音效,是最稳妥的组合。
3. AI 漫剧本地部署工具链与硬件准备
AI 漫剧生产不是一个软件搞定,而是多个服务组合。建议先搭好环境,再跑完整流程。
3.1 硬件配置参考
因为教程中涉及图生视频、高清修复等重计算环节,尽量使用 NVIDIA 显卡。显存建议按“实用为准”来评估:
- 4GB 显存:可以跑轻量图像生成和小分辨率图生视频,但会频繁排队,效率一般。
- 6GB 显存:入门可用,适合 SD1.5 模型、小批量生成。
- 8GB 显存:比较舒服的起点,可以尝试较多模型和中等分辨率。
- 12GB 及以上:ComfyUI 批量任务、高清修复、较长视频生成的体验会好很多。
如果电脑没有 NVIDIA 显卡,还可以使用云显卡方案,或选择在线 AI 绘画/视频网站。教程面向的核心能力是流程,不是某一个本地模型。
3.2 软件环境准备清单
建议准备以下环境和工具:
| 用途 | 推荐工具 | 说明 |
|---|---|---|
| AI 绘画 | Stable Diffusion WebUI / ComfyUI | WebUI 适合新手,ComfyUI 适合批量和工作流复用 |
| 图生视频 | 各类图生视频工具/插件 | 将静帧转成动态镜头 |
| AI 配音 | 各类 AI 语音合成工具 | 需要支持长文本和音色选择 |
| 剪辑 | 剪映 / Premiere / CapCut | 剪辑、字幕、音效、节奏控制 |
| 剧本/分镜 | 大语言模型对话工具 | 生成剧本初稿、分镜描述 |
| 辅助批处理 | Python + 图像处理脚本 | 批量重命名、批量导图、目录整理 |
3.3 安装部署参考命令
如果你选择本地部署 Stable Diffusion WebUI,以下命令是通用启动模板。实际路径需要按你的安装目录调整。
# 进入 WebUI 目录(路径按实际调整) cd /path/to/stable-diffusion-webui # 启动 WebUI(Windows 使用 webui_user.bat 或 python launch.py) python launch.py --xformers --medvram参数说明:
--xformers:开启内存优化,老显卡建议保留。--medvram:中等显存模式,显存低于 8GB 推荐。- 如果显存极少,可以改用
--lowvram。
ComfyUI 的启动方式:
cd /path/to/ComfyUI python main.py --listen 127.0.0.1 --port 8188启动后浏览器访问http://127.0.0.1:8188就能进入工作流界面。ComfyUI 的好处是所有节点可以保存为 JSON 工作流,下次直接拖进去复用,做批量任务非常方便。
4. 剧本与分镜:AI 漫剧的地基
AI 漫剧最大误区是“先画图再想剧情”。正确顺序一定是“先有剧本,再有分镜,最后才生成画面”。因为 AI 绘画很难精确控制构图,你必须在文字描述里把镜头、动作、表情写清楚,模型才知道输出什么。
4.1 用 ChatGPT/DeepSeek/通义千问等生成剧本初稿
剧本环节,可以让大语言模型辅助生成,但要注意生成内容只能当“初稿”。以下是通用提示词模板:
你是一位短视频编剧,擅长动态漫画风格故事创作。 请根据以下要求写一个适合 AI 漫剧的故事大纲: 1. 主题:都市奇幻,主角拥有时间回溯能力。 2. 时长:3分钟。 3. 节奏:开头 10 秒必须出现冲突。 4. 每段情节需要包含场景描述、角色动作、表情、情绪。 5. 最后输出格式:分场景列表。关键提示:AI 生成的剧本普遍缺少“可视化表达”,因为大模型不懂镜头语言。你需要手动把“他很生气”改成“他的拳头砸在桌上,桌面晃动,眼神下压”。这一步决定了后续绘画质量的起点。
4.2 分镜拆解方法
拿到剧本后,要拆成“分镜脚本”,每个分镜包含:
- 镜号
- 景别(远景 / 中景 / 近景 / 特写)
- 角色状态
- 背景环境
- 角色动作
- 情绪标签
- 画面文字描述(用于 AI 绘画 prompt)
分镜表建议用表格维护:
| 镜号 | 景别 | 画面描述 | 对白/旁白 | 预计时长 |
|---|---|---|---|---|
| 01 | 远景 | 城市夜晚,主角站在天台边缘 | 无 | 2s |
| 02 | 特写 | 主角眼睛发亮,看向手表 | “又来了” | 2s |
| 03 | 中景 | 手表指针倒转,周围光线扭曲 | 无 | 3s |
新手常犯的问题是把分镜写得太笼统。输出“主角走在街上”分镜,AI 会产生大量无法使用的废图。要写成“傍晚城市街道,主角穿深色风衣低头走过便利店,路灯从右上方打光,背景虚化”。
4.3 提示词描述规律
画好分镜图的关键是统一“风格描述”。在生成每一张图之前,固定使用同一个风格前缀。例如:
dynamic comic style, intricate details, cinematic lighting, 4k, masterpiece, dark urban fantasy atmosphere这套风格词要保持不变,只修改主体描述。
5. 人物一致性保持:AI 漫剧的核心难点
AI 漫剧里最影响观感的问题就是“同一个角色在这一幕长这样,下一幕变成另一个人”。人物一致性是教程里最核心的部分,下面分别介绍几种主流方案。
5.1 固定角色参考图法
先用 AI 生成一版角色全身图/半身图,把它作为这个角色的“标准设定图”。后续所有画面都基于这张参考图生成。
在 Stable Diffusion WebUI 中,可以通过 ControlNet 的 Reference 功能实现参考图引导。ControlNet 启用后,后续生成的图像会保持原角色结构。
5.2 LoRA 模型微调法
如果对角色的稳定性要求非常高,可以选用 LoRA 方式训练角色。训练集一般准备 15-30 张同一角色不同角度的图片,训练大约 1 个小时能获得一个角色 LoRA。每次生成时启用对应 LoRA,角色一致性会明显更高。但这个方法需要一定学习成本,适合长期做系列漫剧的人。
5.3 工作流保存法(ComfyUI)
使用 ComfyUI 时,可以固定加载同一个“角色基础图像”节点。每次生成新分镜时,只要换 prompt 里的动作/表情,不改参考图节点。这个办法是最稳妥的批量生产方案。
5.4 实际操作建议
- 给每个角色单独建目录,保存参考图、LoRA、工作流 JSON。
- 人物表情变化不要全依赖模型,可以在后期剪辑中通过“推近镜头+局部重绘”实现。
- 每一次批量生成后要人工筛图,不要直接全用。
6. 静帧生成:从文字到画面
6.1 文生图测试
打开已部署的 WebUI,选择底模(如二次元风格模型或写实漫画模型),输入前面准备好的分镜描述,开始生成。
推荐初始参数:
| 参数 | 建议值 |
|---|---|
| 采样器 | DPM++ 2M Karras |
| 步数 | 20-30 步 |
| 宽高 | 横屏 1280x720 或竖屏 720x1280 |
| 批次数量 | 先做 1 张测试 |
| CFG | 7 |
| 分辨率提升 | 后期用 Hires. fix |
6.2 图生图与局部重绘
当某个分镜画面整体构图好,但表情或手部崩坏时,可以使用“局部重绘”功能:发送局部画面到 inpaint 面板,用黑色涂抹要修正的区域,并在提示词中重新描述该区域。注意重绘区域不要太大,否则会改成另一风格。
6.3 静帧筛选标准
一张合格的分镜静帧应满足:
- 角色面部与参考图一致
- 透视关系自然
- 画面中有足够“动态感”(适合后面图生视频)
- 清晰度足够(否则放大后会糊)
如果连续生成 5 张都崩,优先检查:
- prompt 里是否写入了不存在的物体
- ControlNet 配置是否生效
- LoRA 权重是否过大/过小
- 底模是否适合当前风格
7. 图生视频:让静止的画面动起来
静态图完成后,需要用图生视频工具把分镜转为动态镜头,否则整个作品就只是“有声漫画”,不是漫剧。
7.1 常见图生视频工具
当前图生视频工具非常多,选择标准是:能输入单张图片 + 运动提示词 + 控制动态幅度。较常用的方案包括可灵、Runway、Pika、以及 ComfyUI 中集成的开源视频生成节点。具体选哪个取决于你的网络条件、付费预算和画质需求。
7.2 图生视频操作流程
操作步骤:
- 将筛选好的静帧上传到图生视频工具。
- 填写运动提示词,例如“镜头缓缓推近,头发随风飘动,背景灯光闪烁”。
- 设置视频时长 3 到 5 秒。
- 生成后检查动态是否自然。
- 导出 MP4 或 PNG 序列帧备用。
注意:一次生成 3-5 秒即可,不要指望一镜到底生成整段漫剧。正确做法是“每个分镜生成 3 秒动态视频”,最后在剪辑软件里拼接。这样既能保证画面质量,又方便修改某一镜的画面。
7.3 图生视频常见问题
- 人物在运动时崩脸:说明运动幅度过大,减少运动词如“转身、跳跃”,改成“呼吸感、轻微摆动”。
- 镜头运动太快:降低动态时长或减少镜头移动词。
- 背景乱飘:在提示词里加上“background static, stable camera”。
- 画面闪烁:把分镜之间相同角色图片作为参考帧。
8. 配音与剪辑:最后 20% 决定成品质感
很多 AI 漫剧观感差,不是因为画面,而是配音和剪辑脱节。语音没有情绪、字幕和画面不同步、转场过于生硬,都会让作品看起来像“PPT”。
8.1 AI 配音环节
当画面素材全部齐了,进入配音阶段。AI 配音工具选择要点是:支持长文本、支持多音字调整、支持语速/停顿控制,并且最好能导出分句音频。
操作建议:
- 先根据分镜表整理对白文本。
- 一次性输入整段对白生成,避免一句句生成导致声音不连贯。
- 试听时重点检查多音字和重音位置,比如“我长年在外打工”的“长”,AI 经常读错。
- 保留每个分镜对应一段音频文件,方便剪辑对齐。
8.2 剪辑与成片
用剪映或 Premiere 将动态视频、音效、配音、字幕合在一起。AI 漫剧剪辑节奏建议:单镜头 2-4 秒,超过 5 秒无对话会显得拖沓;情绪转折点要配合音效和快速转场。
剪辑清单:
- 每个分镜视频片段时间和配音时间对齐。
- 背景音乐音量压低到旁白音量的 30% 以下。
- 字幕要跟随配音,词意不要断行。
- 导出时选择 1080p 以上,码率不低于 8Mbps。
9. 批量生产与工程化管理
如果只想做一部短剧,单人逐张生成问题不大。但如果你想稳定更新短视频账号,靠手工一张张生成完全忙不过来。下面给出批量生产的工程化思路。
9.1 分镜素材目录管理
在本地建立固定目录结构:
project_name/ ├── 01_script/ ├── 02_storyboard/ ├── 03_character_ref/ ├── 04_stills/ ├── 05_video_clips/ ├── 06_audio/ ├── 07_edit/ └── 08_output/每次新项目直接复制这个模板,不浪费时间找素材。
9.2 ComfyUI 批量生成工作流
ComfyUI 工作流支持批量加载多张参考图和多个 prompt。建议把每个分镜的 prompt 写成 CSV,再用自定义脚本调用 API。如果不想写代码,至少学会使用 ComfyUI 的批量提示词节点。
# 批量调用 ComfyUI API 的示例结构,接口路径需按实际工作流调整 import json import requests server = "http://127.0.0.1:8188" workflow = load_workflow("workflow.json") for i, prompt in enumerate(prompt_list): workflow["prompt_text"] = prompt response = requests.post(f"{server}/prompt", json={"prompt": workflow}) print(f"Task {i}: {response.status_code}")9.3 质量抽检机制
批量生成千万别直接全量入库。建议每批次生成后按目录抽样检查 20% 图片,确认角色是否崩、画面是否清晰。若有严重问题,先修 prompt 或模型再跑下一批。
10. AI 漫剧常见问题与排查方法
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 生成的人物两张脸完全不一样 | 没有使用参考图/LoRA 权重低 | 查看 ControlNet 是否勾选 | 启用 Reference,或提高 LoRA 权重 |
| 画面模糊不清晰 | 输出分辨率太低或过度放大 | 查看原图大小与放大倍数 | 提高基础分辨率,或使用高清修复 |
| 图生视频人物崩脸 | 运动幅度过大 | 检查运动提示词 | 减少动作词,保持镜头稳定 |
| 音频和画面不同步 | 对白时长和视频时长不一致 | 在剪辑时间轴上对比 | 重分句或调整视频速度 |
| 显存不足报错 | 分辨率/批次过高 | 查看显存占用 | 降低 batch size,开启 medvram/lowvram |
| WebUI 启动后页面打不开 | 端口被占用或服务未启动 | 检查日志、端口状态 | 更换端口,或重启服务 |
| 提示词报错提示未定义 | 插件未启用或语法错误 | 查看控制台输出 | 重装插件,检查词法 |
| 批量任务卡住 | 队列堆积或参数错误 | 查看任务队列 | 中止任务,重建工作流 |
11. 最佳实践与使用建议
先小规模试跑,再大规模生成。别一上来就规划 50 个分镜,先用 5 个分镜跑通全流程,确认画风、配音、剪辑全都没问题再扩量。
建立一套自己的固定“风格模板”。只要模式不变,把每部作品的角色参考图、prompt 模板、工作流 JSON 都归档,后续新作品直接复用。
生成过程要分步保存。静帧阶段、图生视频阶段、配音阶段分别建文件夹,防止一步错后面全乱。
批量任务加日志。如果你试图用脚本批处理图像,每次执行后把成功和失败的路径写入日志文件,方便排查。
# 日志输出示例 python batch_generate.py --input ./prompts.csv --output ./stills/ --log ./logs/batch.log接口服务不要暴露到公网。如果你把 WebUI/ComfyUI 开放为 API 给别人调用,建议加 API 密钥、限流和防火墙规则,避免被刷量。
首次发布前一定要人工审片。尤其检查有没有生成错别字、敏感画面、版权音乐片段。
多尝试不同底模。画面风格是漫画感还是写实感,直接影响观众留存。不要拿着一款模型死磕到底。
12. 总结与下一步
这个教程项目最值得尝试的点,是把 AI 漫剧从“玄学生成图”变成“工业化小流程”。它真正能让你根据一套可复用的链路,从剧本一步步做到成片。不建议一开始追求复杂工具和高配置,先从最基础的五步开始:剧本 -> 分镜 -> 人物设定 -> 静帧 -> 配音剪辑,走通后你会对整套流程有明确认知。
接下来你最先要验证的两件事:一是人物一致性方案是否有效,二是图生视频的动态效果能否接受。这两个功能直接决定你的成片观感,是最值得花时间调试的环节。最容易踩的坑就是跳过“剧本和分镜”直接画图,结果后续全部推翻重来。
如果后续想进阶,可以继续研究三个方向:训练自己的角色 LoRA、搭建 ComfyUI 批量生产工作流、研究小说推文短剧的流量分发逻辑。把这些吃透了,AI 漫剧就不再是“靠工具碰运气”,而是一条可以稳定输出的内容生产方式。