最近很多做短视频和短剧的朋友都在问同一个问题:AI 真人短剧到底能不能稳定量产?试过几款工具的人基本都会遇到三座大山——角色脸不稳定、分镜脚本要来回切换工具、配音和画面合成极其耗时。一个三分钟的短剧,光是盯着一帧一帧修脸部变形,就能耗掉一整天。
LibTV 这类“AI 短剧导演台”产品之所以值得关注,不是因为它是某个更强大的新模型,而是它把 AI 短剧制作里最麻烦的“工程流程”集成到了一起。从角色设定、分镜生成、画面一致性检查到成片合成,整个链路在一个平台里完成。这篇文章会用保姆级的思路,拆解 LibTV 是怎么做 AI 真人短剧的,以及七天从零上手需要分成哪几步。文章会覆盖概念、环境准备、角色卡写法、导演台操作流程、典型分镜模板、常见坑和工程化建议,尽量做到看完就能直接动手。
读完你会得到四个明确结论:第一,LibTV 真正解决的是流程集成,不是模型训练;第二,角色一致性是 AI 短剧成败的关键,LibTV 把这件事做成了可视化操作;第三,你用不用得好的分水岭是角色卡和分镜提示词怎么写;第四,商业变现的前提是版权合规和成片质量控制,这需要一套工程化的制作规范。
1. LibTV 到底是什么:先破除三个误解
很多人第一次听到 LibTV,会把“AI 真人短剧”直接理解为“输入一句话就能生成完整视频”。这个理解不能说全错,但会带来很大的预期落差。
准确地说,LibTV 是一个偏向“导演工作台”定位的 AI 短剧创作平台。它不负责替你凭空创造故事,而是提供一套从角色形象设定、分镜生成、画面一致性校正到成片输出的流程化工具链。这个定位和“一句话生成视频”的工具差异很大:后者强调零门槛,前者强调可控、可复用、可量产。
第一个常见的误解是“LibTV 是某个大模型的名字”。从产品形态看,LibTV 更像是多个模型能力的编排平台。它的导演台里可以调用不同能力的图像/视频模型,例如面向角色生成的 General Image Pro。这些模型分工协作,共同完成一部短剧的视觉表达。
第二个误解是“AI 短剧 = 全部自动,完全不用人盯”。实际上,你用 LibTV 制作质量稳定的短剧,核心工作仍然是创意劳动:你写剧本、设计角色、拆解分镜、审看画面。LibTV 自动化的是“按分镜批量生成画面”“保持同一角色在不同镜头下的长相一致”这类重复劳动,而不是替代你做导演决策。
第三个误解是“只有专业影视团队才用得起”。从产品定位看,LibTV 更适合三类人:想批量生产短视频内容的个人创作者、没有影视团队但需要短剧素材的营销团队、以及想实验 AI 叙事的新媒体从业者。门槛不在操作,而在你能不能写清楚角色设定和分镜脚本。
这个判断意味着什么?如果你想用 LibTV 做短剧,最值得投入时间去学的不是某个按钮,而是“连续叙事的能力”。工具负责画面,你负责故事。
2. AI 真人短剧的核心难点与 LibTV 的解法
在没有专业导演台工具之前,用纯 AI 工具做真人短剧的流程拆开看是这样的:
- 角色一致性:你在 Midjourney 或 Stable Diffusion 里生成一张角色图,下一张图很可能就变成另一个人了。过去靠固定 seed 值、局部重绘、训练 Lora 来解决,工程技术要求高。
- 分镜与素材管理:每一集短剧有几十个分镜,每个分镜都要记录角色、场景、景别、动作、台词。大多数人用表格管理,效率低且容易漏。
- 画面批量生成:一个分镜要跑多次才能出一张满意的,几十个分镜就是几百次生成,手动操作极其耗时。
- 配音与合成:生成语音、对齐口型、添加字幕、剪辑成片,每个环节都是独立工具,项目文件散落四处。
LibTV 的核心思路,是把以上四个环节收敛到一个“导演台”工作空间里。它用角色库解决一致性,用分镜列表解决叙事编排,用批量生成解决效率,用统一导出解决合成问题。
这里有一个容易被忽略的产品设计逻辑:传统工具是先有画面,再拼故事;LibTV 是先有角色卡和分镜脚本,再批量生成画面。这个顺序的差异,决定了它对“剧本驱动型”创作方式的天然适配。你写清楚分镜,它就负责把分镜变成画面。
有一件事要提前说清楚:AI 视频生成仍然有随机性,LibTV 降低的是“组织生产”的复杂度,而不是把随机性降为零。这也是为什么文章后面会专门强调“分镜审看”这个步骤,它是质量控制的最后一道闸门。
3. 环境准备与基础概念:账号、Credits、素材三件套
LibTV 目前主要是网页端产品,不需要本地部署模型,也不需要高性能显卡。这使得它的上手门槛远低于本地跑 Stable Diffusion 的方案。你需要准备的有三部分:账号环境、credits 额度、以及规范化的素材库。
3.1 账号与浏览器环境
LibTV 是 Web 应用,理论上使用 Chrome、Edge 等现代浏览器即可。建议准备稳定网络环境,因为 AI 短剧生成过程中涉及大量图像/视频请求,网络波动容易导致任务失败。登录账号后,建议先检查两件事:一是当前账号的 credits 剩余量,二是可用的模型列表。这两项通常能在平台首页或资源面板中直接看到。
3.2 理解 Credits 是什么
“credits 在 AI 里指什么”是被搜索很多的问题,简单说,credits 是平台内部使用的“资源额度”,按生成次数、分辨率、模型档位和任务类型进行扣除。不同模型对 credits 的消耗系数不同,普通图像生成的单价和视频生成的单价也不在一个量级。
这意味着你在规划一部短剧时,第一步不是写剧本,而是先估算 credits 预算。建议把预算按“角色卡生成、分镜生成、视频合成”三块分开记录,避免拍到一半因为额度不足卡住。具体价格和每任务消耗以平台实际显示为准,本文不做数字推断。
3.3 素材库是很多新手忽略的环节
我建议在开始任何项目之前,先建一个结构化的素材文件夹。它不需要和多复杂的系统对接,但至少包括剧本文件、角色参考图、场景参考图、分镜脚本。这个习惯能在后期管理大量分镜时节省大量时间,也方便你随时回头调整。
ai-short-drama/ ├── 01-script/ │ ├── synopsis.md │ └── episode-01-scenes.md ├── 02-characters/ │ ├── character-01-male-lead.md │ ├── character-01-male-lead-reference.png │ ├── character-02-female-lead.md │ └── character-02-female-lead-reference.png ├── 03-scenes/ │ ├── scene-01-street.md │ └── scene-01-street-reference.png ├── 04-storyboard/ │ ├── episode-01-storyboard.csv │ └── episode-01-prompt-templates.md └── 05-output/ ├── images/ └── videos/这个目录结构解决的是“素材追溯”问题。当你需要重新生成某个镜头时,只需要翻到对应角色的角色卡,而不是在聊天记录里翻找历史提示词。
4. 从剧本到角色设定:角色卡是 LibTV 的灵魂
LibTV 里做 AI 真人短剧,最重要的环节就是角色设定。角色没设定好,后面每个镜头都会出问题。
4.1 为什么角色卡这么重要
AI 生成的角色不稳定,根源在于文本提示词描述的信息量不够。你在提示词里写“漂亮女博士”,AI 每次生成的“漂亮女博士”都不一定长一个样。角色卡的作用,是把一个角色的长相特征、服装特征、气质、常用表情、标志性道具,变成一组结构化、可复用的描述。LibTV 的角色库基于这套描述生成角色参考图,后续所有分镜生成都会参考这个基准。
一个高质量角色卡至少包含六个维度:
| 维度 | 说明 | 示例 |
|---|---|---|
| 基本身份 | 年龄、性别、职业 | 28 岁女性,生物医学博士 |
| 面部特征 | 脸型、眼睛、鼻子、嘴型 | 鹅蛋脸,柳叶眉,深邃大眼,鼻梁高挺 |
| 发型发色 | 头发长度、颜色、造型 | 黑色齐肩发,微卷,留有刘海 |
| 服装风格 | 日常和特定场景的着装 | 实验室白大褂内搭浅蓝色衬衫 |
| 标志特征 | 一眼能记住的细节 | 左耳戴银色耳钉,戴细框眼镜 |
| 气质表情 | 情绪基调、常用表情 | 清冷专注,微笑时嘴角微扬 |
这个表格可以复制到自己的文档里,作为角色卡模板。
4.2 角色卡 Prompt 模板示例
下面是一个可以直接参考的角色卡提示词模板,重点是“固定描述 + 变量描述”的组合方式。
# 角色:林清瑶 ## 固定描述(所有生成必须保留) - 28 岁女性,生物医学博士,清冷书卷气 - 鹅蛋脸,柳叶眉,深邃大眼,鼻梁高挺 - 黑色齐肩发,微卷,刘海自然分开 - 日常服装:白色实验室白大褂内搭浅蓝色衬衫 - 标志细节:左耳银色耳钉,细框眼镜 - 表情基调:专注冷静,偶尔温和微笑 ## 可变描述(按分镜需要调整) - 景别:中景 / 近景 / 特写 - 环境:实验室 / 会议室 / 走廊 - 动作:查看显微镜 / 翻看论文 / 与人交谈 - 情绪:专注 / 惊讶 / 沉思 ## 负面提示词 - 多根手指、面部变形、畸形手、文字水印、模糊、低分辨率、非对称脸这里的关键逻辑是:“固定描述”保证角色长相稳定,“可变描述”负责表现不同镜头中的动作和情绪,“负面提示词”避免常见的 AI 生成缺陷。LibTV 的角色库操作方式和这个模板的思维一致:先沉淀角色基准,再在不同分镜里叠加变化。
4.3 General Image Pro 是什么,它是 GPT-Image 吗
热搜中出现的“libtv 的 general image pro 是 gpt-image 吗”这个问题,从现有材料看,General Image Pro 应该是 LibTV 导演台中用于角色/图像生成的一类专业模型能力,而不是某个确定的公开模型名称。更稳妥的判断是:它很可能在某个底层模型之上做了面向“角色一致性”和“多图保持”的封装或工作流优化,而不是简单暴露一个通用的“gpt-image”入口。
对普通创作者来说,纠结底层是哪个模型其实意义不大。你真正需要确认的是两件事:第一,General Image Pro 生成的同一角色在不同分镜中是否足够一致;第二,它的生成速度和 credits 消耗是否适合你的项目节奏。如果在这两个维度上表现合格,底层技术叫什么并不影响你用。
5. 导演台核心操作:项目创建与基础配置
从这一步开始,我们进入 LibTV 的实际操作链路。由于不同版本界面可能有差异,以下操作路径以通用流程描述,按“创建项目、配置模型、导入角色、编排分镜”四步理解即可。
5.1 创建项目和选择工作流
登录后,先创建一个新项目。建议项目名和你的素材目录一致,例如“city-doctor-ep01”。创建项目后,进入导演台,第一件要做的事情是确认当前工作流类型。AI 真人短剧通常需要的是“角色驱动的多分镜工作流”,而不是单图生成模式。
选择工作流后,你会看到几个核心面板:角色库、分镜列表、场景设置、输出预览。这些面板是 LibTV 导演台的主要工作区域。新手容易犯的错误是一上来就点“生成”,跳过角色库配置,结果所有分镜角色长相都不一致。
5.2 导入角色和场景参考
在角色库面板中,点击新增角色,把前面写好的角色卡提示词粘贴进去,并上传一张参考图(可选)。如果你有比较满意的角色图,上传参考图可以显著提高一致性。完成后,系统会生成一个“角色模板”。同一个角色模板可以被多个分镜引用,这是短剧项目逐集复用角色的基础。
场景设置同理。每个场景对应一个环境描述,例如“雨夜城市的便利店内”。把场景描述写清楚,并上传场景参考图,能帮 AI 在生成分镜时保持环境风格统一。建议在项目启动时就把主要角色和主要场景一次性配好,而不是拍一集配一次。
5.3 模型能力选择与参数配置
在生成分镜之前,先检查模型配置。不同模型能力适合不同任务:面向角色和静帧画面的任务,可以选择类似 General Image Pro 的图像能力;生成动态视频片段时,再切换到视频生成能力。这个环节没有统一标准,按项目实际情况选择即可。
关于参数,建议新手上路先保留默认设置。只有当你明确知道某个参数的含义时,再去调整。比如“画面比例”通常会直接影响短剧在短视频平台的显示效果,如果你最终要发竖屏短剧,最好从一开始就选 9:16 而不是 16:9,否则后期裁切会损失大量构图信息。
6. 从分镜到成片:导演台完整制作流程
基础配置完成之后,真正的工作才刚开始。AI 真人短剧的分镜编排,决定了成片的叙事节奏。
6.1 分镜脚本的结构化写法
分镜脚本不是剧本对话的简单拆行,而是每一条都包含画面、台词、时长、景别、角色、动作、情绪的基本单位。建议你在进 LibTV 之前,用 Markdown 或 CSV 把分镜脚本写好,再逐条导入。下面是一个分镜脚本模板。
# 第 01 集 分镜脚本 ## 场景:实验室 - [SC-001] 近景,林清瑶抬头,扶了扶眼镜,神情专注 - 台词:这个实验数据,和上周的结果完全不一样。 - 时长:3.0s - 角色:林清瑶 - 备注:背景是显微镜和试管架 - [SC-002] 中景,林清瑶从一个白大褂口袋里拿出手机,皱眉 - 台词:又是他。 - 时长:2.5s - 角色:林清瑶 - 备注:灯光偏冷白 ## 场景:医院走廊 - [SC-003] 全景,林清瑶快步走向办公室 - 台词:(无台词) - 时长:2.0s - 角色:林清瑶 - 备注:走廊窗外是阴天这种结构化写法最大的好处是:它把“画面指令”和“剧情指令”分离了。画面指令交给 AI 生成,剧情指令留在你的掌控中。导入 LibTV 后,每条分镜会对应一个生成任务。
6.2 批量生成与逐镜审看
在导演台中,把分镜脚本导入后,你可以把多个分镜一起提交生成。批量生成会大幅提高效率,但也要承担一定风险:如果有几个分镜的角色卡描述写得不够稳定,批量模式下它会“稳定地出错”。
所以接下来的逐镜审看是黄金步骤。逐镜审看的意义不是看画面好不好看,而是核对三件事:角色是否保持同一张脸、构图是否符合分镜脚本预期、画面细节里有没有明显 AI 缺陷(多手指、错位文字、面部扭曲)。出现问题的镜头,可以直接在分镜条目上重新生成,不需要重跑整条流水线。
6.3 视频片段生成与音频合成
单张画面确认完毕后,再进入视频生成环节。AI 视频生成消耗的 credits 远高于图像生成,所以更推荐的做法是先把整集分镜的静态画面全部审完,确认无误后再统一生成视频片段。这样能避免用视频生成任务来试错。
音频方面,LibTV 的“导演台”设计会尽量把配音、播报放进同一流程,方便后来对齐口型。但由于 AI 对口型仍然存在精度限制,建议台词尽量简短紧凑,留出更宽的口型容错空间。
6.4 导出与成片整理
生成完毕的分镜片段,按顺序导出。导出后你会得到若干条视频片段,需要用剪辑工具(如剪映、Premiere)把它们按分镜顺序拼接。这条“LibTV 生成 + 剪辑工具精修”的路径,是更可控的成片方案,不建议跳过剪辑直接依赖平台全自动出片。
7. 一套完整的“三分钟 AI 短剧”用例
为了把前面讲的概念串起来,这里给一个完整的最小用例:制作一集时长约三分钟的都市悬疑 AI 真人短剧。整个用例会从剧本到成片拆成五个阶段,并对每个阶段给出可落地操作。
7.1 剧本与分镜规划
三分钟短剧大约需要 12 到 18 个分镜。建议按“起-承-转-合”四分法写剧本。例如:
- 起:女主收到一封匿名信(4 个分镜)
- 承:女主调查信的来源(5 个分镜)
- 转:女主发现寄信人就是自己身边人(4 个分镜)
- 合:女主打开最后一条线索(2 个分镜)
分镜数不用太多,三分钟短剧的重点是节奏清晰。把每个分镜控制在 5 秒左右,总共 15 个分镜就有 75 秒,再配合转场和对白,时长会比较自然。
7.2 角色卡与场景配置
复用前面的“林清瑶”角色卡,新增一个男性角色“李明轩”和两个场景卡“老城区街道”“档案室”。角色卡写法与林清瑶一致。场景卡的提示词同样采用“固定环境 + 可变光线”的结构:
# 场景:老城区街道 ## 固定描述 - 雨天傍晚,老旧居民楼,路灯昏黄 - 湿漉漉的柏油路,霓虹灯招牌 - 行人稀少,氛围压抑 ## 可变描述(按分镜调整) - 时间:傍晚 / 深夜 - 天气:小雨 / 暴雨 - 光线:路灯暖光 / 霓虹冷光场景卡的固定描述负责统一场景风格,可变描述负责适配不同分镜的情绪需求。这样设计后,同一个场景在不同分镜里才会看起来是同一个地方。
7.3 分镜生成检查清单
在导演台中导入全部 15 个分镜后,逐镜检查:
- [ ] 角色的脸型、发型是否和角色卡一致
- [ ] 服装颜色是否和角色设定匹配
- [ ] 场景里的标志元素是否统一(如霓虹灯牌、老式路灯)
- [ ] 画面构图是否符合景别要求
- [ ] 是否出现多手指、文字乱码、面部扭曲
- [ ] credits 消耗是否在预算内
7.4 剪辑合成要点
导出后,用剪辑工具按分镜顺序拼接。对白配音建议先在 LibTV 中合成分镜对应的语音片段,再在剪辑工具中对齐。字幕按台词文本统一生成,注意字体大小和剧集一致性。背景音乐可以选择纯音乐,避免干扰对白。
7.5 这个用例能说明什么
三分钟短剧虽短,却完整包含了 AI 短剧的通用流程:角色设定、场景设定、分镜批量生成、逐镜审看、视频合成、剪辑成片。跑通一次,就是七天从 0 到 1 的关键一步。后续做第二集、第三集时,你只需要复用角色卡和场景卡,把重心放在新分镜编排上,效率会明显提高。
8. 常见问题与排查方法
实操过程中,最让人挫败的不是不知道工具怎么用,而是“按照步骤做了,但画面不对”。这里整理了六个高频问题,从现象到解决方式一条条过。
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 同一角色在不同分镜中长相差异大 | 角色卡固定描述不够详细,或角色模板未正确引用 | 检查分镜条目是否关联了正确的角色模板 | 完善角色卡,固定面部特征、发型、服装,并重新生成角色参考图 |
| 角色脸部出现变形或多手指 | 负面提示词缺失,或模型生成本身不稳定 | 查看生成图像的手指、脸部细节 | 在角色卡和分镜 prompt 中加入负面提示词,多生成几张挑稳定的 |
| 分镜场景风格不统一 | 场景卡描述不完整,或不同分镜使用了不同的场景关键词 | 对比多个分镜的背景元素差异 | 用统一的场景卡,固定标志性环境元素 |
| 单次生成任务失败或超时 | 网络波动、credits 不足、请求过多 | 查看任务日志和 credits 余额 | 重试任务;高峰时段错峰生成;分批量提交而非一次性提交所有分镜 |
| credits 消耗太快 | 用视频生成任务反复试错,或高分辨率生成过多 | 查看生成记录,统计各任务消耗 | 先用图像任务确认画面,再进入视频生成;控制重试次数 |
| 成片口型对不上 | 台词过长,AI 配音与画面动作不完全对齐 | 逐句检查台词时长与画面时长 | 缩短台词,预留口型容差,或后期剪辑微调 |
这些问题的共同规律是:大部分画面质量问题都出在“角色卡不稳定”和“没有逐镜审看”上。如果你发现自己反复出同一类问题,优先检查自己的角色卡和场景卡,而不是反复重试生成。
9. 工程化建议:从个人创作到可量产
跑通一部短剧之后,下一个问题通常是:怎么才能稳定地产出?如果你只是做一次性实验,个人操作习惯就可以;如果你计划持续更新,就需要把整个流程工程化。
9.1 建立自己的提示词库
把每次成功的角色卡、场景卡、分镜模板保存下来,按类型归档。日积月累后,你会在里面沉淀出“现代都市女性角色”“古代侠客角色”“雨天街景”等可复用模板。写新剧本时,直接调用已有的高稳定模板,会比每次从零开始写提示词高效得多。
建议用命名规范区分模板类型,例如:
char-female-modern-clean.md # 现代女性角色:干净利落型 char-male-ancient-warrior.md # 古代男性角色:战士型 scene-city-rainy-night.md # 城市场景:雨夜 scene-office-tech-company.md # 办公场景:科技公司9.2 控制单集产出预算
AI 短剧成本最大的部分是 credits 消耗,而消耗最大的环节是视频生成。工程化的关键在于提前估算单集预算,严格限制“无效生成次数”。建议每集开工前建立一个表格,列出预计分镜数、每画面计划生成次数、视频任务数、总 credits 预算。生成过程中按预算执行,超出预算就停止“碰运气式重试”,回到角色卡和提示词层面找原因。
9.3 内容合规:版权、肖像权与 AI 标识
做 AI 真人短剧,安全边界比技术细节更值得关注。三点提醒:
第一,不要使用未经授权的真人肖像。哪怕只是“长得像某个明星”的提示词,也可能涉及肖像权和侵权风险。建议全部使用虚拟角色设定,从源头规避问题。
第二,AI 生成内容在多个平台有标识要求。发布时主动标注“AI 生成”或使用平台提供的内容标识功能,既是合规要求,也是对观众的诚实。
第三,剧本内容避免使用未经授权的文学作品、影视剧本改编。原创剧本是最稳妥的选择。不要尝试生成任何涉及不当内容、敏感题材或打擦边球的标题和画面,这类内容不仅在平台审核中过不了,还可能带来账号风险。
9.4 七天上手的节奏参考
按标题里“七天从小白到上手”的预期,给出一个可执行的七天节奏,不需要着急一次做完:
- 第 1 天:熟悉平台界面,确认 credits 和模型列表,跑通一次单图生成。
- 第 2 天:写一个角色的角色卡,迭代到生成 10 张图有 8 张角色一致。
- 第 3 天:设计两个场景卡,把场景风格固定下来。
- 第 4 天:写一个 15 到 18 个分镜的短剧本,导入导演台。
- 第 5 天:批量生成分镜画面,逐镜审看,重新生成问题镜头。
- 第 6 天:生成视频片段,完成剪辑和字幕合成。
- 第 7 天:复盘整个流程,记录哪些角色卡稳定、哪些场景卡需要优化。
这个节奏的核心原则是先稳定单个模块,再做完整流程。跳过模块验证直接做全片,大概率会浪费大量 credits。
9.5 给想要商业变现的人一句实话
AI 短剧的商业变现不是秘密,真正稀缺的是“稳定的量产能力”和“持续的原创内容”。LibTV 提供的是更顺手的流程工具,但观众最后记住的是一个好故事。如果你准备把 AI 短剧当作长期方向,每天留出固定时间打磨剧本和角色设定,比天天研究模型参数更有价值。
LibTV 这类的 AI 短剧工具,本质上是在把传统影视工业中的“剧组分工”简化成一个创作者能驾驭的数字化工作流。你可以不会摄影、不会布光、不会剪辑,但你得会讲故事、会设计角色、会判断画面好坏。这个能力要求并没有变低,只是换了形式——从“剧组协作能力”变成“提示词导演能力”。如果你想真的把 AI 短剧做成可持续的内容事业,不妨从今天先写出第一张角色卡开始。