1. AI短剧的逻辑变了:从剧组到一个人的生产线

先聊个现象。短视频平台上那些情节紧凑、反转不断的短剧,以前要一个剧组、几十号人、几十万预算才能拍出来。现在你打开一个网页,敲几段描述文字,就能让AI直接把画面生成出来。这种变化不是“够用就好”的将就,而是真的把短剧制作的门槛从工业级拉到了个人级。

Wan3.0(通义万相3.0)就是这个趋势里比较有代表性的视频生成大模型。它最核心的能力是 文生视频 和 图生视频 ——你给一段文字描述,或者给一张参考图,它就能生成对应的动态画面片段。跟早两年那种只能生成几秒模糊画面的模型比,它现在能做到更长时长、更高分辨率、多镜头切换,甚至生成带声音的视频,这对于做短剧来说是质变。

这篇内容适合谁?一是短视频创作者,想用AI批量产出剧情内容的;二是编剧、分镜师,想快速把剧本“可视化”看效果的;三是纯小白,没接触过任何AI工具,但对短剧制作感兴趣的人。我会把整个流程从零讲起,包括账号注册、免费额度、提示词怎么写、参数怎么调、踩了哪些坑,以及怎么把这些片段串成一部能对外发布的短剧。

1.1 传统短剧制作的重资产困局

先给大家算一笔账,看看传统短剧为什么难做。

一部正经的竖屏短剧,哪怕是低成本的,也需要这几项硬支出:演员片酬(哪怕找素人,一天也要几百到上千)、场地租赁(公寓、办公室、餐厅,按小时算钱)、摄影设备(一台像样的微单加灯光,至少一两万)、后期团队(剪辑、调色、配音、字幕)。这还没算导演、编剧、场务这些人力成本。一个100集左右的竖屏短剧,保守估计拍摄周期15到30天,成本30万到50万起步。

这个成本结构决定了传统短剧只有在投流ROI能跑正的情况下才敢开机。创作者想试错?成本太高。想一天出三五个版本的剧情?不可能。

AI视频生成模型的出现,把成本结构彻底换了。硬件成本归零(用云端算力),拍摄成本归零(不需要实景和演员),后期成本大幅降低(AI直接生成视频画面,配音和字幕也有对应的AI工具)。剩下的核心投入是你自己的创意能力——写剧本、写提示词、做剪辑决策。

1.2 大模型把创作流程压缩成了几步

用Wan3.0这类模型做短剧,整个工作流被压缩到四步: 写剧本、拆镜头、生成画面、剪辑合成 。

传统拍摄里,剧本到成片之间隔着选角、定妆、勘景、布光、表演、NG、剪辑等一系列环节。但AI视频生成把这些环节全部抽象成了“提示词”这一个东西。你要做的只是把分镜脚本转换成模型能理解的语言,然后让模型帮你“拍”出来。

这里有一个很关键的认知转变:以前我们叫“拍”短剧,现在的准确说法是“生成”短剧。你不再需要指挥摄影师调整机位和光线,而是告诉模型“这里用低角度仰拍、侧逆光、赛博朋克色调”,模型会直接理解并渲染出来。这种抽象度的提升,本质上让创作者回归到了叙事本身——你不需要懂摄影、灯光、布景,但你必须懂故事、节奏和情绪。

这也是为什么我说零基础可以上手,但要做好心理准备:你的短板不再是“技术不会”,而是“创意够不够”——这其实是好事,创意练起来比技术快多了。

2. 上手准备:账号、工具与免费额度详解

工欲善其事,必先利其器。在使用Wan3.0之前,先把需要用到的工具和账号理清楚。做AI短剧不是只用一个大模型就完事,通常是“视频生成模型+辅助工具”的组合打法。

2.1 注册与免费体验入口

Wan3.0的体验入口在 通义APP 和 通义万相官网 上都可以找到。注册流程比较简单:用手机号或者阿里系账号登录即可,不需要额外的付费订阅才能进,通常新用户注册后会送一定额度的免费生成次数,日常也会不定期放出免费体验活动,契合“免费体验”这个卖点。

这里要提醒一个细节:免费额度通常以“积分”或“次数”计算,每次生成会消耗一定额度,不同功能消耗不同。比如文生视频消耗的额度会比图生视频高,长视频比短视频高。建议刚开始的时候先别一上来就生成最长时长,先用短片段测试提示词效果,确认画面风格对了再生成正式片段,这样最省额度。

另外一个选择是API调用,如果熟悉编程,可以通过API方式批量调用,但这个涉及到模型部署和计量计费,对新手不太友好,初期建议先用网页端把流程跑通。

2.2 辅助工具清单:文案、绘图、剪辑、配音

做一部AI短剧除了Wan3.0之外,还会用到几类辅助工具。我把它们整理成一张清单,方便大家按需准备。

工具类型 用途 推荐方案
AI文案辅助 写剧本、对白、旁白 各类大语言模型均可,比如通义千问、文心一言等
AI绘图 生成角色设定图、场景参考图 Midjourney、通义万相文生图、即梦
视频生成 核心画面生成 Wan3.0(通义万相)
视频剪辑 拼接片段、加字幕、转场 剪映、必剪、Premiere
配音 对白、旁白配音 剪映自带TTS、魔音工坊、ElevenLabs
音乐音效 背景音乐、氛围音效 剪映曲库、网易天音

这张表里,AI绘图这个环节比较关键,因为Wan3.0支持图生视频,如果你先用AI画出一张符合预期的角色或场景图,再让Wan3.0把它“动起来”,画面的可控性和一致性会高很多。后面我会专门讲这个用法。

剪辑工具方面,如果不想学复杂的专业软件,剪映就完全够用。它自带字幕识别、TTS配音和曲库,专为短视频场景优化过,学习成本很低。

2.3 第一次打开Wan3.0的界面认识

第一次打开Wan3.0的生成界面,可能会有一种“怎么这么简洁”的感觉。页面上通常就几个核心元素:输入框、功能选择(文生视频/图生视频)、参数设置(时长、分辨率、运动幅度等)、生成按钮。

不要小看这个简洁的界面,里面每个参数都影响出片效果。我建议第一次使用的人先做一次“裸跑”——不调任何参数,只输入一句简单的描述,看看模型默认输出是什么水平,再逐步调整。

这样做的好处有两个:一是快速建立对模型能力的直觉,知道它能做什么、不能做什么;二是后续调整参数时心里有底,不会因为一次效果不好就怀疑自己或者工具的稳定性。

3. 实操演示:从剧本到成片的完整流程

现在进入正题。我会用一个具体的例子,完整走一遍AI短剧的制作流程。这个例子我会选一个悬疑反转类的小短剧,因为这类内容在短视频平台上数据表现好,而且对画面要求不算太高,适合新手练手。

3.1 剧本与分镜设计(提示词工程的核心)

很多人做AI短剧最大的误区,是上来就写提示词生成画面,剧本环节完全跳过。这样做的结果就是生成了一堆零散的、没有叙事逻辑的画面,最后剪辑的时候才发现拼不成故事。

正确的顺序是: 先写一段足够短的脚本,再拆成镜头列表,最后给每个镜头写提示词。

以我要做的这部悬疑短剧为例,剧本我先压缩成一句话:一个女孩回到老宅,发现镜子里的人和自己动作不一致,最后镜子里的自己对她诡异一笑。

这个短剧本大概能撑15到20秒的时长,做AI短剧练手刚刚好。接下来拆镜头,我拆成4个:

镜号 画面内容 时长
1 女孩推开老宅木门走进来,光线昏暗 3秒
2 她走到梳妆台前,坐下,看向镜子 3秒
3 镜子里的倒影延迟半拍才动,动作不一致 5秒
4 倒影停止模仿,对女孩诡异一笑,画面黑场 4秒

拆完镜头之后,才是写提示词的环节。每个镜头的提示词,我会包含以下几个要素: 主体、环境、动作、镜头运动、光线色调、画幅比例、风格参考 。

这里直接给出我用在Wan3.0上的提示词示例(可以保存起来直接抄作业):

镜头1提示词:

一位二十多岁的年轻女孩,穿着米色风衣,推开一扇老旧的双开木门,老宅内部昏暗,微弱的顶光照亮门厅,门轴发出吱呀声,镜头缓慢推进,电影感画面,实景拍摄风格,竖屏9:16,中景为主

镜头2提示词:

女孩坐在旧式梳妆台前,柔和的侧光打在她脸上,她缓缓抬头看向面前的镜子,眼神带着一丝不安,镜头从中景切换到近景,动作自然,竖屏9:16,电影感色调

镜头3提示词:

老旧镜子里的女孩倒影,正在做一个抬手摸头发的动作,但里面的倒影比现实世界慢了半拍,产生强烈的错位感,镜面反射泛着微光,氛围诡异,镜头固定位拍摄,竖屏9:16,写实风格

镜头4提示词:

镜子里的倒影停止模仿,嘴角缓缓上扬,露出一个僵硬的笑容,眼神直直盯着镜头,随后画面快速变黑,恐怖氛围拉满,竖屏9:16,特写镜头

这套提示词的写法,有几个底层逻辑可以拆解:

  • 主体描述放在开头 。模型会对前后文的注意力有不同的权重分配,主体信息前置,它更容易抓住核心。
  • 场景和光线细节要具体 。不要只写“昏暗”,要写“微弱的顶光”“柔和的侧光”,这直接影响画面质感。
  • 镜头运动单独说明 。虽然模型不一定完全听指挥,但你写“缓慢推进”和“从近景切换到特写”,输出画面的动态感受会明显不同。
  • 画幅比例一定写 。短剧需要竖屏,不写的话模型默认可能是横屏,后续还得裁切,白白损失质量。

3.2 文生视频实操与参数设置

提示词写好了,接下来进入Wan3.0的生成界面操作。

在文生视频模式下粘贴第一个镜头的提示词,然后设置参数。这里我详细说一下每个参数的作用:

  • 时长 :单次生成时长,可按秒选择。Wan3.0支持最长生成较长时长的视频,但我建议新手从短时长开始,因为提示词和画面效果匹配需要试错,长视频单次消耗额度高,试错成本大。
  • 分辨率/画质 :可选高清或更高。短剧建议直接选高清选项,因为最终要放到短视频平台,画质太差会影响完播率。
  • 运动幅度 :这个参数控制画面的动态程度。数值越大,画面中的运动越剧烈。做人物对话场景的时候,运动幅度不要拉满,否则人脸容易变形;做动作戏的时候可以拉高一些。

我建议第一次跑的时候,全部参数用默认值,只填提示词,先看一次“标准答案”。然后根据输出效果微调提示词,再调整其他参数。

生成完成后,Wan3.0会返回一段没有声音的纯视频片段。不要急着惊艳或失望,先用剪映把4个镜头的视频都导进来,按顺序排好。剪映的操作很简单: 媒体池导入 → 拖拽到时间线 → 调整顺序和长度 。4段素材分别对应4个镜头,每段大约在3到5秒之间,我先按剧本时长粗剪一版。

3.3 图生视频与人物一致性问题的破解

在实际制作AI短剧的时候,跨镜头的人物一致性是一个绕不开的痛点。文生视频模式下,每次生成的画面都是“独立创作”的,同一个人物可能第一次生成是瓜子脸,第二次就变成圆脸了。对于剧情连贯的短剧来说,这是致命的。

破解方法有两种:

方法一:先用AI绘图生成一张角色设定图。 比如我用AI绘图工具画一张“二十多岁女孩,米色风衣,长发,中式老宅复古风格”的角色立绘,然后用Wan3.0的图生视频功能,把这张图作为第一帧输入,再加上动作描述提示词。这样模型会在参考图的基础上做运动扩展,人物长相会被约束住。

方法二:在提示词里加入固定特征描述。 比如每次都写“女主角:瓜子脸,长发,米色风衣,眼神带有忧郁气质”作为统一前缀,后接该镜头不同的动作描述。虽然这个方法一致性没有图生视频强,但配合后期剪辑,基本够用。

我的实际建议是:如果角色在短剧里戏份较多, 用方法一 ,先定角色图再生成视频;如果只是背景人物或者单一场景, 用方法二 ,省事省额度。

图生视频的参数和文生视频类似,但多了一个输入框——你需要上传参考图。上传之后点上“锁定角色”,这样每次生成都会尽量保持第一帧人物的样貌。现场操作的顺序是:上传参考图 → 输入动作提示词 → 设置时长和运动幅度 → 生成。

3.4 剪辑配音合成:让片段变成一个“作品”

4个镜头的AI视频生成完毕后,进入剪映做后期。这一步决定了你的片子是“AI素材堆砌”还是“一部完整短剧”。

我习惯的剪辑顺序是:

  1. 粗剪 :把4段视频按顺序放在时间线上,每段掐掉头尾多余的部分,让节奏符合剧本设计。
  2. 加转场 :AI生成的视频片段之间,建议用“叠化”或“闪黑”这种比较轻的转场,不要用花哨的3D转场,会破坏电影感。
  3. 配音与对白 :这部悬疑短剧没有台词,只需要加一段环境音垫底。剪映的音频素材库里有“老宅环境音”“心跳声”“阴森氛围”等音效,拖拽到时间线对应位置即可。如果台词多,可以用剪映的“文本朗读”功能,选择一位声音合适的配音员,把对白粘贴进去生成音频。
  4. BGM :短剧成败的一半在音乐。悬疑类我建议选节奏缓慢、低频较多的氛围音乐,音量控制在比环境音低一点,避免抢戏。
  5. 字幕 :AI短剧尤其要重视字幕,因为画面本身的信息密度不一定够,观众需要字幕辅助理解剧情。可以直接用剪映的“识别字幕”功能,自动生成字幕,然后调整字体、大小、位置。

最后导出的时候,参数选择1080P、30帧、竖屏。如果平台对码率有要求,选择“更高画质”导出即可。导出后保存,一部15秒的AI短剧就完成了。

整个流程走下来,熟练以后大概15到20分钟能出一部。这个速度,传统剧组想都不敢想。

4. 我用Wan3.0踩过的坑:常见问题与排查思路

用了几个月Wan3.0,从最开始生成一堆废片,到后来能稳定产出可用的短剧片段,中间踩了不少坑。我把典型问题整理成下面的排查表,帮大家少走弯路。

现象 可能原因 解决方案
生成的画面混乱,人物多余 提示词信息量过大,模型抓不住重点 精简提示词,一个镜头只聚焦一个主体,必要信息前置
人脸扭曲变形 单镜头内运动幅度过大 降低运动幅度参数,或者缩短单镜头时长
跨镜头人物长相不一致 文生视频每次独立创作 改用图生视频输入角色参考图,锁定角色
生成速度慢、排队时间长 高峰期算力紧张 错峰生成,或者先本地把提示词都写好,集中半小时批量跑
画面有AI感的“塑料味” 提示词缺少光影和材质描述 增加细节:具体光源方向、胶片颗粒感、镜头焦段等
免费额度很快用完 频繁GPT式试错 用测试模式跑小片段,确认效果后再生成正式片段

4.1 提示词写不好,画面一片混乱

这个问题在AI视频模型里非常典型。新手写提示词,容易像写作文一样,恨不得把整个故事背景都写进去。比如“一个女孩在雨夜走进一家便利店,她看起来很伤心,因为刚刚和男朋友分手了,便利店老板是一个慈祥的老人,店里灯光很暖”——这串提示词如果丢给模型,它大概率会生成一个莫名其妙的大杂烩画面。

原因在于视频模型对长文本的理解力还做不到“读小说拍电影”的程度。 一个镜头只做一件事、只描述一个主体、只说清楚动作和场景 ,生成成功率会大幅上升。

我个人的经验法则是:提示词控制在30到50个字以内,用短语而非长句,用逗号分隔各要素。之前那个老宅悬疑短剧的例子,就是按这个思路写的。

4.2 人脸崩坏是怎么发生的

人脸崩坏是视频生成模型一个“老大难”问题,本质原因是模型在生成连续帧时,对人脸的细节记忆不够稳定。尤其是镜头里人物转动头部、张嘴说话、快速运动时,局部特征容易在帧间跳变。

应对策略:

  • 运动幅度参数调低,给人脸更少的“变化空间”。
  • 单镜头内的动作尽量简单,比如“抬头看镜子”比“摇头晃脑地看镜子”稳定得多。
  • 如果已经生成了面部崩坏的片段,不要整体重做,去生成同场景第二条替代素材,然后剪辑时用“叠化”转场掩盖崩坏的起始帧。

注意:不要让AI生成任何违背公序良俗的画面内容,模型本身也有内容审核机制,做内容之前先想清楚边界。

4.3 生成速度慢、排队时间长

高峰期用Wan3.0,尤其是晚上8点到11点这个时段,排队时间可能很长。我的做法是:晚上先把第二天要用的提示词全部写好,整理到一个表格里,第二天早上或者凌晨统一跑生成。这样既避开了高峰期,也方便批量管理素材。

还有一些小技巧可以提升效率:同一段提示词可以先固定随机种子,生成后如果不满意再微调描述。固定种子能确保每次生成的基础一致,微调描述时结果会有延续性,不会完全“翻车”重来。

5. 从试玩到持续产出:内容方向的进阶建议

学会了基本操作之后,下一个问题就是:拿这个能力做什么内容?直接上短剧就是一个方向,但AI短剧的远不止“做短剧”这一个玩法。我想讲几个已经被验证过的方向,供大家参考。

5.1 热门AI短剧内容类型拆解

  • 竖屏爽文短剧 :霸总、逆袭、重生、穿越,这是短视频平台上最成熟的品类。特点是情节套路化、结构高度模板化,非常契合AI批量生成的优势。一部60集的短剧,初步用AI生成素材,选片段剪辑,和做15秒的练习片相比,工作量和传统团队比完全不在一个量级。
  • AI漫剧 :二次元风格的动态漫画。用AI绘图生成漫画风格的角色图,再通过图生视频让角色动起来。漫剧的好处是画面容错率高,因为二次元风格本身就允许夸张和变形,人脸崩坏问题不那么明显。
  • 历史/悬疑科普剧场 :把历史事件、未解谜团用剧情演绎的方式拍成短剧,画面可以做得有电影感,用旁白讲解推进叙事。这类内容的制作门槛不高,但流量天花板高。
  • 品牌定制AI短剧 :如果你有客户资源或者电商资源,帮品牌用AI短剧做广告投放,单价不低。AI生成成本低,可以快速出多版本物料做AB测试找素材方向,这在传统制作流程里没法想象。

5.2 批量生产的工业化流程

如果想持续产出AI短剧内容,建议根据自己的实际情况建立一套小流水线。

我自己的流程大致是这样:

  1. 选题 :关注平台上近期热度较高的短剧梗概,拆解其核心冲突和反转结构,总结成“一句话剧情模板”。
  2. 批量写脚本 :用AI文案工具把同一个剧情模板套进不同设定里,批量产出10个左右的短剧本。
  3. 拆镜头与写提示词 :每个短剧本拆成4到6个镜头,批量写成提示词表格。
  4. 集中生成 :在非高峰期批量跑Wan3.0,一次生成当天所需的全部画面素材。
  5. 剪辑团发 :用剪映批量剪辑、加字幕、配音,遵循平台发布节奏做分发矩阵。

这套流程跑起来之后,一个人一天产出3到5部15到30秒的AI短剧是不难的。如果愿意深耕,还可以把提示词模板、素材包沉淀下来,越做越熟练,形成自己的内容库。

5.3 商业化变现的几个方向

  • 短视频平台分成与播放量激励 :把AI短剧发布到短视频平台,赚播放量分成。
  • 星图/品牌合作 :有一定粉丝量后接品牌定制短剧。
  • 素材出售 :把你生成的AI视频片段打包上传到素材平台,供其他创作者下载使用,赚取被动收入。
  • 课程与知识付费 :如果你想做重一点,也可以把自己掌握的AI短剧方法论整理成教程或课程,服务更多想入行的人。

这条路误区也挺多:有人觉得AI短剧随便生成就能爆,实际上选题、节奏、完播率仍然是决定数据表现的关键变量;有人一上来就买一堆付费课程,反而忽略了免费工具本身已经把门槛降得很低了。我的建议是:先免费把工具用熟,做出3到5部完整的作品,再考虑要不要投入金钱和更多时间。

我在实际使用中最大的体会是:AI短剧制作最难的从来不是技术,而是到底要讲一个什么故事。工具已经免费摆在那里,Wan3.0的画质和稳定性也够用,真正的分水岭在于你能不能持续产出有钩子、有反转、能让观众看完不划走的内容。所以别纠结工具版本和参数细节,把时间和精力花在选题、剧本和剪辑节奏上,这才是性价比最高的投入方式。

最后再分享一个小技巧:做AI短剧的时候,把每个镜头的提示词、生成参数、效果评价记在一个表格里,看起来多花了几分钟,但积累一段时间之后,你手里会有一套“提示词参数库”,做下一部片子的时候直接调用,效率和成功率都会明显提升。这个习惯,我从第一天就坚持了,现在回头看,是让我做AI短剧少走弯路的关键一步。

Logo

火山引擎视频云技术社区,是面向 AI 音视频开发者的技术交流平台。这里汇聚源自抖音、豆包等亿级 DAU 产品的 RTC、直播、点播、AI 媒体处理、音视频互动技术,提供接入指南、最佳实践、性能调优、场景案例、Demo 代码、开源项目、白皮书和 API 文档。社区汇聚官方工程师与一线开发者,为 AI 视频通话、数字人、AI 视频处理等应用的开发与落地提供技术支持。

更多推荐