AI短剧这个赛道,最近一年是被讨论得最多的内容创业方向之一。一个人,不用演员、不用摄像机、不用租场地,靠AI工具批量产出可以发布的短剧内容,这个事听起来像玄学,但实操下来确实可行。我前前后后试了大概四个月,从剧本到成片完整跑通了全流程,中间踩了不少坑,也总结了一套适合单人的零成本工作流。这篇文章就把整个过程拆开来讲,从选题、写脚本、生成画面、配音到剪辑,每一步都给出可以直接照做的方案,适合刚接触AI视频、想低成本试水短剧领域的玩家参考。

1. 单人要做的第一件事,先把流程想清楚再动手

1.1 别被“短剧”两个字吓住,本质是内容生产流水线

很多人一听说“AI短剧”,第一反应是觉得要懂影视工业、懂分镜头语言、懂剪辑理论。实际上零成本单人做AI短剧,本质不是拍电影,而是搭一条内容流水线。你只需要把一部短剧拆成几个环节:故事创意、分集大纲、分镜脚本、画面素材、语音素材、后期合成。每一环都用AI工具来提效,一个人就能顶一个微型剧组。

先说清楚一件事,这条流水线生产出来的短剧,不是传统意义上演员实拍、有完整服化道的那种,而是以AI生成的图片序列配合运镜动效,再加上配音和字幕形成的剧情视频。它的信息载体仍然是“剧情+表演+对白”,只是画面的来源从摄像机变成了生成式模型。理解了这一点,你才不会在起步阶段死磕画面细节,而是把精力放在“如何让故事讲得完整、让观众愿意看完”。

1.2 单人作战,时间和成本到底怎么算

零成本指的是不花钱买付费工具,但要付出时间成本。我完整跑通一集90秒左右的AI短剧,平均耗时在6到8个小时,这还是在流程熟练之后。刚开始上手时,一集花十几个小时都很正常,因为大量时间都消耗在反复抽卡、调提示词和剪辑匹配上。

成本账大概是这样:剧本环节用对话式AI,免费额度够用;画面生成用各平台的每日免费额度,文生图和图生视频都是按张数或秒数计,一天几到几十次的免费次数可以覆盖初期测试;配音用剪辑软件自带的AI音色或者网页版配音工具,基础音色基本免费;剪辑用桌面版剪映,普通功能足够。

这套玩法的核心逻辑不是“一分钱不花”,而是“把成本和风险降到最低,用时间换经验”。等你跑通一条完整的片子,对工具的使用效率有了手感,再考虑是否需要为某个环节付费提速,那是后话。

2. 剧本和分镜,AI帮你从“想拍什么”到“怎么拍”

2.1 先定题材,再让AI帮你架结构

AI短剧的选题不是越复杂越好,反而越“套路”越好。我试过悬疑、都市情感、玄幻重生这几个大类,发布数据最好的是情绪冲突强、反转密度高的都市情感和复仇类题材。原因很简单,AI生成的画面在人物微表情和复杂动作上还是有局限,但通过台词和对白营造情绪冲突,渲染场景氛围,这些它能胜任。

定好题材后,下一步是让AI搭故事框架。给AI的提示词要够具体,不能只说“帮我写一个复仇短剧”,而是要给它约束条件:主角身份、故事发生场景、每集的时长、每集结束时的钩子。

我常用的提示词模板大概是这样的:

请帮我写一个都市情感类短剧的分集大纲,共12集,每集90秒。
主角是一个被闺蜜和未婚夫联手背叛的普通女孩,剧情重点放在她的逆袭和反击上。
要求:每集结尾必须有反转或悬念,台词口语化,场景描述要清晰,适合AI生成图片来呈现。

用这个思路,AI返回的通常不是直接能拍的剧本,而是一个相对完整的结构框架。你接下来要做的,是把它改写成“分镜脚本”,也就是一张表:每一句旁白或对白,对应什么画面,画面的景别、人物动作、环境氛围是什么。这块才是后面生成画面的直接依据。

2.2 把剧本翻译成分镜脚本,关键是“画面感”

分镜脚本是AI短剧制作里最容易被新手忽略的环节。很多人直接拿着AI写的剧本去生成图片,结果出来的画面和剧情对不上,就是因为中间少了“翻译”这一步。

举个实际例子,剧本里写“她站在落地窗前,手里握着一杯红酒,眼神很冷”。这个描述直接丢给文生图模型,能出图,但画面表现力很不可控,因为你没有告诉AI镜头是近景、中景还是全景,没有说光线方向,没有说人物着装风格。

我自己的做法是把一段剧本拆成一到三张关键画面,每张画面单独写一个文生图提示词,提示词结构统一为:主体人物描述、动作与表情、场景与道具、镜头景别、光线与氛围、画质关键词。

一位25岁的中国女性,长发,深色西装外套,站在高层公寓的全景落地窗前,右手拿着红酒杯,表情冷静中带一丝轻蔑。
镜头从她的侧后方45度拍摄,中景,偏冷色调的室内光,窗外是城市夜景,柔和散景,电影感剧照,高细节。

这样生成出来的图片,贴合剧本的比例会明显提高。这一步看起来繁琐,但直接决定后期视频画面的连贯度,值得花时间慢慢磨。

3. 画面生成的关键一步,别在文生图上偷懒

3.1 文生图不是“抽卡”,提示词决定了你用多少时间改图

文生图是整条流程里最讲究技巧的环节,同时也是新手最容易产生挫败感的地方。许多初学者刚开始时喜欢用一句话描述就让AI出图,比如“一个美女站在窗边”,出来的图要么人物崩坏,要么风格不统一,于是只能反复抽卡。

实际上好的文生图,是“结构化描述”。你需要把一张画面拆成几个维度来讲清楚:人物是谁、在做什么、什么环境、什么机位、什么光、什么风格。我前面给出的提示词模板就是这个思路。如果你用某个平台,想要更加统一的风格,还可以在每张图的提示词里重复加入同一个风格关键词,比如“电影感剧照”“高细节”“4K”,这样整部剧的画面风格会更接近。

还有一点很重要,人物一致性。AI短剧和实拍最大的不同,是AI生成的人脸在每一张图里都可能变化,同一个角色换个镜头就换了一张脸,这是最跳戏的问题。早期的解决办法是靠seed值和固定描述词,现在我更建议利用工具自带的人物参考功能。主流的AI绘图工具有些支持上传参考图锁定人物长相,在生成每条分镜时都传入同一张主角参考图,人物一致性会提升很多。

3.2 图生视频,用运镜指令让静态画面动起来

画面素材准备得差不多之后,下一步是把静态图变成动态视频片段。这一步用的工具通常是“图生视频”,上传之前生成好的图片,再给它一个简单的运镜指令,比如“镜头缓慢推进”“镜头围绕人物旋转”“人物转头微笑”。

这里有一个容易踩的坑:不要在视频生成提示词里塞入太多动作,一个片段只让画面完成一个动作就够了。“镜头缓缓推近,她慢慢抬起头,眼神凝重”,这种简明的指令,生成效果最稳。如果你要求人物既走动、又转身、还拿东西,AI视频模型基本会乱套,画面会出现扭曲和闪烁。

另外,视频生成的时长要控制好。如图生视频工具生成的时长一般是4到10秒不等,我建议初期统一生成4到6秒的小片段,配合剪辑软件的变速和转场来拼接,不要追求一条长镜头直接搞定,那样失败率很高。小片段拼接的好处是:哪段不合适就重生成哪段,不影响整条片子的进度。

4. 配音、配乐和剪辑,把素材揉成一条有剧感的片子

4.1 配音不一定要花钱买音色,情绪比音色重要

画面和声音是短剧的两条腿。很多新手把精力全放在画面上,随便用一个机器朗读声去配对白,结果片子出来非常出戏。AI配音这件事,关键不在音色多高级,而在情绪是否贴合场景。

免费方案里能用的音色很多,剪辑自带或者网页配音工具里都有不少播音男声、女声、青年音色,我个人的经验是选一个清晰的青年女声或男声,然后在语速、停顿、调门上做处理。比如表达紧张剧情时,语速稍微加快一点,句与句之间缩短停顿;沉默反转的时刻,把停顿拉长,音量压低。这些细节比换一套昂贵的音色更能提升听感。

我习惯先把所有台词排进剪辑软件的时间轴,用AI音色逐句生成,而不是一整段生成完之后再切割。逐句生成的好处是方便调整每一句的情绪和时长,后期如果画面长度对不上,还能单独替换某一句的配音,不用整段重录。

4.2 剪辑节奏、背景音乐和字幕,决定这条片子是否“能看完”

AI短剧的画面生成质量再高,如果剪辑节奏拖沓,观众两秒就划走了。短剧和普通vlog不一样,它的信息密度要非常高。前3秒必须进入主要矛盾,每一句对白都要推动剧情,画面切换要快,一个90秒的片段通常需要10到15个镜头。

剪辑时我会先铺一条音乐轨,选节奏紧凑、有强鼓点的商业背景音乐,卡着音乐的重拍切镜头。音乐是很好的节拍器,没有音乐先剪视频,很容易剪得忽快忽慢。配上音乐后,把素材粗略地铺在时间轴上,再逐段调整镜头卡点。

字幕也很重要。短剧大部分用户是无声刷视频,字幕不仅是辅助,某种程度上是主角。字幕大小要够大,位置要避开画面底部被遮挡的区域,颜色以白底黑边或黑底白字为主。我一般会写字幕时把台词顺一遍,把AI生成的书面化措辞改成口语表达,比如“我从未想过你会背叛我”改成“我真没想到你会这么对我”,短剧字幕越口语越有代入感。

5. 一条90秒AI短剧的完整实操流程,照做就能跑通

5.1 从零到成片的15步实操清单

我把整套流程拆成了15个步骤,按这个顺序做,逻辑最顺,返工率最低。

  1. 用对话式AI生成故事背景和分集大纲,确定主角人设和核心冲突。
  2. 把每一集的大纲扩展成逐句对白,标记出每句对白对应的画面内容。
  3. 用一套固定的人物描述词,配合参考图功能,生成主角的形象设定图。
  4. 每句对白拆成1到2个分镜,编写对应的文生图提示词。
  5. 批量生成分镜图片,每张图生成2到3个备选方案,方便后期替换。
  6. 筛选图片,统一检查人物长相、服装和场景风格是否一致,不一致的重新生成。
  7. 对筛选好的图片做简单修饰,比如裁掉多余部分、调整构图,再用图像增强工具补细节。
  8. 把每张关键图导入图生视频工具,输入运镜指令,生成4到6秒的视频片段。
  9. 生成完所有视频片段后,把素材导入剪辑软件,按分镜顺序铺到时间轴。
  10. 用AI音色逐句生成台词录音,注意情绪、语速和停顿。
  11. 把录音拖到对应画面下方,调整每句对白的起点,让口型和画面节奏匹配。
  12. 加入背景音乐,调整音乐音量,使其比人声低6到12分贝。
  13. 卡着音乐重拍调整镜头切换点,删掉拖沓的帧段,保证90秒内信息密度充足。
  14. 给整片加上字幕,统一字幕样式,检查错别字和口语化表达。
  15. 导出成片,检查全片有没有画面闪烁、声音断层、剧情逻辑不通等问题。

5.2 单集时间分配参考,别在“不满意的画面”上死磕

我测过自己做一集的各环节耗时,按熟练后的时间分配是这样的:剧本与分镜大约1小时,文生图与图片筛选大约2小时,图生视频大约1.5小时,配音加剪辑合成大约2小时,剩余时间用来修正和导出。

这里有个很重要的心态问题:不要试图追求每张图、每个视频片段都完美。AI生成的素材,有一个显著特点就是“十张里出一张能用的”就已经算高成功率。如果你在某一张画面上反复生成了10次还不满意,正确的做法是回到分镜脚本,想一想是不是这个镜头的描述本身就不适合AI生成,然后换一种表达方式来呈现同一个剧情信息,而不是继续和同一个提示词死磕。死磕单个画面的结果,通常就是时间浪费了,片子还没出来。

6. 常见的坑,我踩过之后总结出的避坑清单

6.1 人物一致性和连贯性,是AI短剧最突出的短板

做AI短剧的人,几乎都会遇到人物前后不是同一个人的问题。我的处理方式是“三条腿走路”:第一,把主角的形象固定成一套非常具体的描述词,每次生成都复制同一段描述词,不要随意增删;第二,利用绘图工具的人物参考功能,尽量用主角定妆照作为参考图;第三,在分镜设计上减少同一角色过多正脸特写,多用背影、侧脸、中远景来叙事,既能降低一致性穿帮概率,也能保持画面风格统一。

场景连贯性也一样,同一个场景尽量复用同一张底图,只改人物位置和动作,或者直接把新人物叠到旧背景上处理。这样做出来的片子,视觉上会直接“稳”一截。

6.2 别忽视版权和平台规则,这是长线做下去的底线

用AI做短剧,版权问题是绕不开的盘口。一方面,平台对AI生成内容的标识要求会越来越明确,发布时最好主动标注“AI生成”或使用平台给的AI标识,不然后面可能被判定为疑似AI内容而被限流。另一方面,你在生成画面时使用的文字提示词,避免直接用当代明星真人姓名或还在版权期内的IP角色;在生成配音时,选择平台明确授权的音色,不要把有明确版权的真人声音拿来训练或合成。

关于平台规则,各平台对AI短剧的播放逻辑、原创标识、重复内容判定都不同。我的经验是:发布时优先选择政策相对明确的平台,带上“AI创作”标签,在简介里写明“本文内容由AI生成”,提前规避风险。做这行的心态要放长远,不要为了短期流量去碰规则的红线,账号没了,攒的粉丝和权重都归零。

6.3 视频发布后的数据复盘,怎么做才有效

很多人发布完一集短剧后,就急着去做下一集,从来不回头看数据。我自己前期也是这样,结果做了十几条数据一直徘徊,后来才开始认真看后台数据,才发现问题所在。

核心是看“完播率”和“流失点”。每个平台的创作者后台都会显示观众在哪一秒划走,这个数据对短剧来说极其重要。如果所有人都停在同一集,说明问题多半出在剧情上,观众对悬念不感兴趣;如果每一集都在前半段划走,可能是开头铺垫太长;如果画面切得很快但流失依然严重,可能是台词和画面匹配度低,观众看不懂剧情。

复盘之后,只做一件事:总结出“这一集里观众流失时间点对应的具体画面和台词”,把这类问题记下来,在下一集刻意规避。数据复盘不是看热闹,而是把观众的选择当作唯一标准来优化下一集。

我自己从第一条到现在,最大的感受是:AI短剧的门槛不在技术,而在“用工程思维做内容”的心态。工具永远在更新,今天的操作方式下个月可能就换了,但“拆解流程、逐环节优化、用数据驱动调整”这套方法论是通用的。如果你也在做AI短剧,建议先别上来就想做一鸣惊人的爆款,先从一条90秒的完整小片跑通全流程,感受一下每个环节的耗时和难度,再决定怎么优化。等你跑完第一条,你就知道下一步该往哪个方向用力了。

Logo

火山引擎视频云技术社区,是面向 AI 音视频开发者的技术交流平台。这里汇聚源自抖音、豆包等亿级 DAU 产品的 RTC、直播、点播、AI 媒体处理、音视频互动技术,提供接入指南、最佳实践、性能调优、场景案例、Demo 代码、开源项目、白皮书和 API 文档。社区汇聚官方工程师与一线开发者,为 AI 视频通话、数字人、AI 视频处理等应用的开发与落地提供技术支持。

更多推荐