1. AI短剧为什么突然人人都能做了
过去大半年里,我几乎每天都能收到同行的同一个提问:AI短剧到底怎么入局?问的人里有编剧、剪辑师、MCN运营,也有完全没接触过视频制作的普通人。大家被短视频平台上那些AI生成的古风剧、悬疑剧、搞笑漫剧吸引,但又普遍觉得门槛很高——要么以为需要会写代码,要么以为要买昂贵的显卡,要么被各种复杂的工具流吓退。
直到最近Wan3.0视频模型开放免费体验,这个局面才真正被打破。我自己上手跑了一周,最大的感受是:AI短剧制作的"天堑"已经变成了"门槛",而门槛是可以迈过去的。你不需要会写代码,不需要懂深度学习原理,甚至不需要一台高性能电脑,就能从零开始生成一条有完整剧情、镜头语言和视觉风格的短剧片段。
这篇文章我就把自己从注册账号、写脚本、生成画面、配音字幕到剪辑成片的全过程拆给你看。我不会堆概念,全部按实操来,每一步都会告诉你为什么要这么做、坑在哪里、怎么样做得更好。如果你正好想试水AI短剧,又担心自己是零基础,那这篇文章就是给你写的。
先说清楚一件重要的事:Wan3.0是什么?简单讲,它是一个视频生成大模型,你给它一句文字描述(也就是提示词),它就能生成对应的动态画面。和早期那种只能生成几秒钟模糊扭曲画面的工具相比,Wan3.0在画面稳定性、动作连贯性和风格可控性上都有了质的提升,这是它能支撑短剧这种叙事型内容的关键。换句话说,它不再只是一个"换脸玩具"或"文字转动态壁纸"的噱头,而是真的可以用来讲故事的创作工具。
我在这里先放一个结论:零基础做AI短剧,最核心的能力不是技术,而是三样东西——结构化的脚本能力、精准的提示词习惯、以及一点点剪辑耐心。技术门槛已经被工具抹平了,剩下比拼的是你的叙事能力。这个结论听起来轻巧,但接下来我会用一个完整案例告诉你它到底意味着什么。
2. 从注册到拿到第一条AI视频:免费入口全流程
很多教程一上来就教你怎么写提示词、怎么部署环境,但我觉得第一步应该更朴素:先亲自看到、摸到Wan3.0生成的视频,建立体感,再谈后面的优化。所以我先带你走一遍最省事的免费体验路径。
2.1 找到官方入口并完成注册
Wan3.0的免费体验路径主要有两个方向。第一个是网页端体验,打开通义千问的官网或者直接在搜索里找"通义万相",进入后找到视频生成功能模块。第二个是移动端,在手机应用商店下载通义千问App,App内同样集成了视频生成入口。两者用同一个账号体系,注册需要手机号,流程和注册普通App没有区别。
注册这一步有一个值得注意的细节:尽量用一个绑定了常用手机号的账号。因为后面如果要搭配剪映、即梦这些辅助工具,会涉及到多个平台的素材互相导入,固定的账号体系能减少很多来回切换的麻烦。我自己吃过这个亏,一开始用临时手机号注册,后面绑定工作流的时候多花了不少时间。
2.2 免费额度的真实使用规则
关于"免费"这两个字,我要说点实际的。Wan3.0的免费体验不是让你无限量随便生成,而是提供一定的免费额度,通常按天或者按周刷新。一开始我还不理解为什么要限制额度,直到自己完整跑了一遍流程才算明白:视频生成是非常吃计算资源的,生成一条几秒钟的视频,后台的推理计算量比生成几百张图片还要大,完全不限制反而会让服务质量变得不可控。
所以我的建议是:免费额度不要浪费在随手试玩上。最开始熟悉操作时,可以用最低画质、最短视频试试手,浪费几条无所谓;但真正开始做短剧素材时,要把额度当成"预算",每条视频都先在脚本和提示词上打磨好再生成,避免一遍遍烧额度。这样零成本完成整个短剧demo是完全可行的。
2.3 我的第一条AI视频:参数选择与心理预期
第一次进入视频生成界面,你会看到几个主要选项:画面风格、生成时长、分辨率、运动幅度,有些版本还有首帧图上传的入口。第一次尝试我建议先不要追求高分辨率,也别上来就搞复杂多镜头,就先用最简单的一句话生成一条几秒钟的视频,熟悉一下操作手感。
我当时试的第一条提示词是"清晨的古镇街道,一个撑油纸伞的女子从石桥上走过,小雨蒙蒙"——类似的句子你随便写就行,重点是先看画面效果。这里有个非常重要的心理预期管理:第一条视频大概率不会完美,可能画面有抖动、人物脸部有变形、动作不符合物理规律。这太正常了,千万别因为第一条不理想就觉得工具不行。AI视频生成是一个概率过程,同样的提示词生成两次,结果不会完全一样。你需要做的是先接纳这种"抽卡式"的特性,再慢慢学会通过优化提示词把出片率提上去。
从注册到生成第一条视频,整个过程大概十几分钟。但我建议你把第一次体验留出半小时:留一点时间多试几个提示词,感受一下什么样的描述能让模型产生什么样的画面。这一步的体感建立,比看任何教程都重要。
3. 短剧脚本先行:为什么剧本质量决定AI成片上限
很多人做AI短剧犯的第一个错误,就是跳过写脚本这个环节,直接去生成视频素材。结果生成了一条又一条精美但没有逻辑的画面,最后拼在一起发现剧情支离破碎,根本没法看。我觉得很多人把AI短剧理解反了——它首先是一部剧,然后才是用AI做的。
3.1 短剧体量与AI生成节奏的匹配
传统短剧讲究"黄金三秒",即开头几秒钟内就要抓住观众注意力,但那是针对已有画面的剪辑而言。AI短剧的创作逻辑稍有不同:因为每段生成视频只有几秒到十几秒,你需要把一个完整的"起承转合"分布到多个短视频片段上,让它们在剪辑合成后形成连续叙事。
所以我建议的短剧结构是"三段式五镜头":开头一个镜头交代环境和主角,第二个镜头引入冲突点;中间两个镜头用动作或对白推进剧情;最后一个镜头留下悬念或反转。这个结构特别适合AI视频生成的特点——镜头短、信息密度高、镜头间可以灵活切换场景。确定大结构之后,再往下细分到每一句画面描述和台词,这样生成素材时才不会乱套。
3.2 编写分镜脚本表:零基础也能用的模板
我把做AI短剧的分镜脚本整理成了一张四列的表格,每一行就是一个镜头。这四列分别是:镜号、画面描述、台词/旁白、生成参数备注。你不需要用什么高大上的编剧软件,Excel或备忘录都行。
举个例子。假设我要做一个小型古风悬疑短剧,第一集开场分镜表可以长这样:
| 镜号 | 画面描述 | 台词/旁白 | 生成参数备注 |
|---|---|---|---|
| 1 | 夜雨中的荒宅,门缝内透出微弱烛光 | 旁白:"这座宅子,十年没人敢进去。" | 画面风格:古风、阴冷 |
| 2 | 一个年轻女子撑伞站在宅子门前,犹豫不决 | (无台词) | 人物特写,面部清晰 |
| 3 | 女子推开门,门内走廊尽头站着黑影 | 女子:"谁在那里?" | 运动幅度:中 |
| 4 | 黑影回头,露出一张与女子一模一样的脸 | 诡异BGM | 惊悚氛围 |
| 5 | 画面骤黑,烛光熄灭 | 旁白:"她不知道,自己才是那个不该回来的人。" | 悬念收尾 |
用这样的表格把整集脚本逐镜头写满,你会发现后面生成视频、配音、剪辑都变得轻松了。很多人觉得写分镜是专业导演才做的事,其实普通人不追求分镜的艺术性,只追求逻辑清晰,这个模板足够用了。这也是我强烈建议零基础玩家先做表格再碰工具的原因:工具生成内容有随机性,脚本表格才是你掌控项目方向的锚点。
3.3 不同类型短剧的脚本侧重
脚本格式是通用的,但不同题材,脚本的侧重点要相应调整。
古风短剧(也是目前AI最容易出效果的赛道)最看重场景氛围描写,因为Wan3.0在古风场景、服饰纹理、自然风光上的表现力很强,你的画面描述要尽量往"画面感强的空镜"上靠;现代都市短剧则更依赖台词对白和人物情绪,提示词里要多强调表情细节;科幻题材则是AI视频的强项,场景可以放开想象,但逻辑链条要严谨,否则观众一眼看出硬伤。
我在跑古风短剧时个人感觉,给画面描述加入光线、天气、视角这些环境词,比单纯描述"女主很漂亮"要有效得多,一次又一次的实验让我意识到,AI模型对氛围词的理解远比对身份词的理解更好。这都是后话,后面讲提示词时我会专门展开。
4. Wan3.0提示词实战:把脑子里的画面翻译给AI听
脚本表格写完之后,真正的重头戏来了:把每一行的画面描述改写成Wan3.0能理解并执行的提示词。这是AI短剧制作里技术含量最高的一步,也是最容易让人卡住的一步。我不会绕弯子,直接把提示词拆成公式给你。
4.1 好的提示词是一句话讲完一个完整场景
Wan3.0对提示词的理解方式和我最初想象的不太一样。它不是逐词查找匹配库,而是从整体语义上理解你的描述,所以那种只堆形容词的做法效果很差,反而是"动作+环境+风格+镜头语言"的完整句子效果最好。
我的提示词模板是这样的:[主体动作]+[场景环境]+[天气/光线]+[镜头/视角]+[风格倾向]。组装成一句话,例如:"一个穿白色长裙的年轻女子在废墟宫殿中奔跑,周围散落着破碎的石柱,夕阳从残垣间照射进来,低角度跟拍镜头,电影质感,细节丰富"。
注意这个句子不是简单并列了五个要素,而是它们之间有逻辑关系:谁在做什么、在什么地方、光线如何、用什么角度看、整体美术风格是什么。这样写出来的提示词,生成的画面才会是"一个有故事感的镜头",而不是"一堆元素的堆砌"。
4.2 画面风格词库:见效最快的秘诀
AI视频初学者经常问的一个问题是:"我怎么让所有镜头的风格统一?"如果每一句提示词里都带上统一的风格描述,出片的一致性就会明显提升。我这里整理了一套我压箱底的风格词组合,基本覆盖了主要的短剧题材:
- 古风玄幻:古代中国建筑、水墨色调、仙气缭绕、广角构图、精致服装纹理
- 都市情感:写实现代都市、浅景深、柔和自然光、温馨色调、电影感
- 科幻未来:霓虹灯railer光线、悬浮建筑、冷色调、金属质感、高清细节
- 民国谍战:青石板街道、昏黄路灯、雨夜、褐色胶片质感、复古风
使用风格词库时有一个要点:每句提示词里的风格词不一定要完全一样,可以有微调,但核心的风格形容词要保持稳定,这样镜头间的"气质"才是统一的,观众才不会觉得一条是A剧组拍的、下一条是B剧组拍的。
4.3 图生视频:解决AI短剧人物一致性的关键
先给你打个预防针:纯文生视频在AI短剧场景里有个大弱点,那就是人物一致性很难保证。你可能第一幕生成了一张很漂亮的"太子妃"脸,到第二幕再用同样描述生成,出来的人却像换了个演员——这会让观众瞬间出戏。
解决这个问题有两个主流思路。其中一个就是利用Wan3.0的图生视频能力:你先用AI绘图工具或者Wan3.0自带的首帧图功能生成一张满意的人物形象图,固定住脸型、服装、环境配色,然后在这张图的基础上让模型生成动态视频。这样后续每个镜头的主角都是这张首帧图里的那个人,一致性就大大提高。我在做古风系列短剧时,最关键的三个镜头——女主登场、女主发现秘密、女主遭遇反转——全部用了同一张首帧图来生成,效果稳定到让我意外。
另外一个思路是提示词里加入演员特征固定词,比如"瓜子脸、柳叶眉、右眼角有泪痣、素色汉服",生成时反复沿用。这个方案效果没有首帧图稳定,但胜在灵活,适合没有绘图工具的情况。我的经验是两个结合:先用文字统一人物特征,再选一个最满意的镜头画面作为后续图生视频的锚点。
4.4 动态参数调整:让镜头语言丰富起来
提示词做到位后,Wan3.0的可选参数也值得花心思。运动幅度是个容易被忽略但影响很大的选项。做静态氛围镜头(像空镜、景物特写)时,运动幅度调小一点,画面更稳定;做动作戏(奔跑、打斗、转身、回眸)时,运动幅度要大一些,否则AI生成的动态看起来像慢放PPT。
镜头的推拉摇移可以通过提示词里的视角词实现:想表达压迫感用"仰拍",想表现排队列或整体环境用"航拍俯瞰",想强调面部情绪用"特写镜头",想在两个主体之间建立联系用"过肩镜头"。这些都是导演工作的常见词汇,但你不需要考过导演系,把它们当功能词用就行——具体哪个视角配什么情绪,多试几次就有了体感。
5. 从镜头到成片:配音、字幕、剪辑与节奏控制
AI短剧从来不是"AI生成视频"就完事了,还有配音、音乐、字幕、剪辑这些环节必须处理。总有人说用AI做短剧是"有手就行",我不同意,它的剪辑工作量和传统视频制作几乎一样。好在国内的工具链已经非常成熟,普通人手机加电脑就能搞定全流程。
5.1 配音方案对比:AI语音与真人配音怎么选
短剧需要台词和旁白。现在能用的方案很多,我自己最常用的是剪映自带的文字转语音功能。它的好处是操作极简:输入文字、选一个音色、点击生成,之后配音轨就自动出现在时间轴上了。市面上的AI配音普遍有几个档次的音色选择,也有情绪语气微调,对短剧来说基本够用。
如果你是做古风、悬疑这类强调"味道"的题材,我建议你多花点时间去挑选音色,不要随便用默认的机器声。古风剧配一个有戏曲学徒腔的音色和配一个AI新闻播报腔的音色,完全是两种观感。还有一种折中方案是真人配音——录下自己读台词的声音,然后用AI变声工具处理。这叫"声音克隆"或"声音迁移",新手不一定要上,但如果你打算做系列短剧,值得关注。
配音生成时还有一个小技巧:旁白和对白要分开处理。旁白统一用深沉、平稳的叙事音色,对白则根据角色性格选择不同音色,最好男女主、反派各有辨识度,观众才能靠声音分辨"谁在说话"。这个细节对纯AI生成的短剧尤为重要,因为画面里的角色脸可能不尽相同,但声音的辨识度能帮助观众投入剧情。
5.2 字幕生成的三种路径
AI生成的视频在字幕处理上有一点要注意:不要直接用剪映的"智能字幕",因为它主要面向有真实人声的视频,对于AI配音、特别是古风口音,识别准确率不够高。正确做法是,拿你脚本表格里的台词原文,直接粘进剪映字幕轨,手动对齐。这样做不仅准确,还能通过调整字幕出现时间实现更好的节奏控制。
如果你追求更高效率,可以用"AI字幕+手动校对":先让工具自动识别一遍,然后对照台词原文逐句修改出错的字。因为是AI配音,音色相对标准,错误率不会太高,手动校对工作量可以接受。我个人更推荐第二种方式,毕竟做短剧本身就够累了,能省一点力气是一点。
5.3 剪辑节奏的黄金规则
你辛辛苦苦生成了一条条视频素材,把它们拖进剪辑时间轴后,最重要的事情是"砍"。AI生成一条视频可能原本停了在某个没意义的画面上,你就截掉;原本有四秒的空镜,观众只需要两秒,你就切;AI生成的视频普遍节奏偏慢,你要通过剪辑把它加速到短剧该有的密度。
一个很基础的训练:看任何一部你喜欢的短剧,观察它每个镜头的停留时长。你会发现大多数镜头不会超过三秒,对白密集的地方可能一秒多就切一个画面。这个节奏放到AI短剧里同样适用。我做第一个AI短剧时,素材总时长大概有20多分钟,最后剪出来只有3分钟左右,取舍的力度非常大。有一点感触就是,如果你觉得哪里无聊,观众一定会觉得更无聊,所以大胆剪掉准没错。
6. 踩坑实录:免费体验期最容易翻车的五个问题
任何AI工具,光看教程都觉得自己会了,上手之后才会发现真正的坑都在细节里。这一章我把免费体验期间遇到的几个典型问题汇总一下,权当给大家省一些试错时间。
6.1 人物脸部变形与手指崩坏
这大概是AI视频最出名的问题了。明明提示词写的是"年轻女子特写",生成出来却给人诡异的感觉。解决的经验有三条:第一,在提示词里明确加上"五官精致、面部对称"这类正向引导;第二,首帧图先经过AI绘图工具的修复,确保基础形象过关;第三,多生成几条备选,别守着一条失败视频硬用。说真的,同样的提示词生成同一个人,总有一条脸是好的,概率游戏嘛,数量就是质量。
手指问题的本质是模型在生成细小结构时还不够稳定,规避的方法也简单:减少手部特写,多用半身和全身景别,让手部动作融入整体运动。
6.2 运动幅度过大导致的画面闪烁
用Wan3.0做视频,画面闪烁有时候是因为提示词里规定了一些不自然的快速动作,比如"疯狂摆手""快速奔跑中回头",模型处理不了高强度运动变化时会出问题。解决办法是拆解动作:先写人物开始奔跑的表情和动作,再写转身的瞬间,两个镜头分开生成,中间用剪辑衔接。这又印证了分镜表"镜头短、信息准"的价值。
6.3 免费额度不够了的三种善后
免费额度用完是最让人抓狂的事情,尤其是做到一半的时候。我的建议是,这不是死局。第一,如果项目时间紧,可以考虑开通订阅会员,这给创作者提供了更方便的创作条件;第二,换时间再来,有些平台的免费额度是每日或每夜刷新的,熬夜蹲点抢额度也是圈内常态;第三,优化技术,提升出片率,让自己的每个镜头一次成型,减少反复生成。
一个段子经常在行业群里传:"练技术的第一步,是让AI少帮你返工。"额度有限反而是好事,逼着你去认真打磨脚本和提示词。
6.4 配音与画面口型不同步
如果你做的是有对白特写的短剧,配音生成后要仔细检查口型对不上。AI生成的视频里人物开口说话的画面,其嘴型可能和你的配音完全不在一个频率上。解决方案:第一,优先用无人声镜头加旁白来叙事,旁白不需要口型同步;第二,对白镜头用背影、侧脸、远景等不展示口型的角度;第三,真需要正脸对白时,接受微小偏差,大多数观众对非发音特写嘴型并不过度敏感。
6.5 生成视频分辨率不足怎么办
免费体验版的生成分辨率可能到不了专业投放的标准,放大后会有些模糊。解决方法是剪辑阶段做一次超分处理。剪映自带清晰度增强功能,也可以用第三方AI超分工具。需要注意的是,超分不要从头到尾全片做,选人物特写或关键空镜做就行,这样做能在不消耗太多资源的前提下保住观感重点。
7. 进阶思路:从一条demo到系列短剧的完整工作流
当你用上述方法成功做出第一条AI短剧demo,后面的路就宽敞了。但我也要提醒:单条短片和系列短剧在操作上完全是两码事。系列短剧的工作流更重、更长,不过一旦跑通,你等于拥有了一条可以复用的"内容流水线"。很多AI短剧博主能保持高频率更新,靠的不是灵感,正是工作流效率。
7.1 建立自己的素材库和提示词库
做系列剧的第一步,就是把你生成过的满意画面、角色形象图、效果好的提示词、经典台词全部归类存档。以后再制作同类剧情时,你可以直接调用这些素材,不用重新从头折腾,工作效率完全不是一个量级。素材库看似是一个朴素的做法,但绝大多数业余AI创作者没有这个习惯,等他们吃亏的时候就会回来补课了。
7.2 批量生成时的"同风格工程"打卡技巧
当你确定了某部短剧的"调性"以后,坚持在一个"制作批次"里完成所有镜头的生成,你的镜头一致性会大幅提升。实际操作是做一张"风格控制卡",记录下你本剧使用的所有固定风格短语、特殊参数、首帧图连接。每次生成新镜头都看着卡片检查一遍,保证所有镜头的风格描述朝同一个方向收敛。这种工程化的习惯,对普通人来说比天赋重要得多。
7.3 发布平台的选择与叙事方式适配
做了短剧就要发布,不同平台的调性差异很大,短剧的叙事节奏和画幅也要跟着适配。主流平台通常以竖屏为主、节奏明快,适合反转剧情和卡点剪辑;而横屏平台相对更容忍慢热、重氛围的叙事。你最好在第一集分镜阶段就决定好发布平台,不要横竖屏画面来回剪,浪费生成额度,也让观众观感打折。
7.4 未来的扩展空间
Wan3.0只是工具序列中的一环。完整的AI短剧工作流还可以接入AI辅助编剧(梳理剧情逻辑)、AI绘画(生成场景设定图、角色概念图)、AI作曲(生成配乐)等模块。这些方向以后可以逐步尝试。我的建议是先把手头的"文生视频→配音→剪辑"流程跑熟,形成肌肉记忆之后再叠加其他模块,否则信息过载容易让人刚开始就放弃。
8. 最后一个建议:先做一条60秒的完整短片当练手
这篇文章看下来,有的读者可能会觉得步骤好多、有一定压力。我非常能理解。做个AI短剧确实不是一个简单的操作,它更像一门综合手艺。但任何手艺都可以通过一个"最小可行项目"来入门。
我的提议是,你千万不要一上来就规划一部长剧,先做一个预算大概几十条视频、时长60秒左右的完整短片。内容不要复杂,一个角色、一个场景、一个简单反转就好。为什么是60秒?因为它的工作量足够覆盖配音、字幕、剪辑全流程,让你把所有环节体验一遍,又不至于做到一半心灰意冷。我第一次练手做的就是这种"一人一城一个秘密"的小故事,虽然粗糙,但全流程跑完后的成就感比看一百篇教程都强。
在做这个练手项目时,心态上也别给自己太大压力。AI生成视频有随机性,翻车是常态,把它当作抽卡游戏来玩反而轻松,每次都有效果惊艳的素材、有根本没法用的素材,重要的是享受创作的过程,积累经验。等你的素材库里攒下一定量的好素材了,自然会开始琢磨更深层的叙事和风格问题,这是任何AI工具都替代不了的进步过程。