AI短剧这个赛道,最近被聊得越来越多了。我身边想入局的新人,十个里面有八个,开口闭口都在问"用哪个模型":SD用什么底模?视频生成用可灵还是即梦?要不要上ComfyUI?要不要本地部署一个开源视频模型?

每次听到这类问题,我都很想说:新人做AI短剧,第一个要选的还真不是模型,是工作流。

如果你问我工作流是什么,一句话概括:就是从你脑子里冒出一个故事点子,到手机上出现一集完整短剧,中间经过的所有环节组合起来的那条生产链条。剧本、分镜、画面、视频、配音、剪辑,每一步怎么加工、用什么工具、产出什么文件、按什么标准验收,这些都是工作流的一部分。模型只是这条流水线上负责"画面渲染"的组件之一。选错工作流,再强的大模型也救不回来。

这篇文章要聊的,就是"工作流"这件事。想入局AI短剧的新人,或者已经做过几集但总觉得效率低、前后不一致的人,都可以参考我梳理的这套流程。我不会只谈道理,会把工具选型、脚本模板、参数建议、踩坑记录都放进来,给你一条能直接上手的路。

1. 为什么我劝你先别纠结模型

1.1 "模型焦虑"是新人最容易踩的坑

很多新人,包括我自己一开始,都容易陷入一种状态:今天看到某博主说"XX模型出图效果炸裂",马上就跑去下载;明天刷到"某平台视频生成太强了",立刻开会员去试。结果一个月下来,收藏夹里躺着几十个模型链接,硬盘多了几十GB的底模,但一集完整的短剧都没做出来。

为什么会这样?因为单点工具的对比和收集,并不能替代生产的完整闭环。你要做的是"剧",不是"图"。单张图再惊艳,放进短剧里,角色前后对不上、剧情节奏稀碎、配音和画面脱节,照样没人看。模型焦虑的本质,是还没有理解AI短剧到底在拼什么,就先把注意力放在了最容易被比较、被讨论的零件上。

1.2 短剧拼的是"稳定产出的连续感"

这里要先摆正一个认知:AI短剧不是AI绘画,也不是AI视频的单镜头展示,它本质上是内容生产。短剧的观看场景是手机端,用户滑动屏幕,3秒内抓不住眼球就划走了;一集通常只有60到120秒;而且你最好连续更新。在这种模式下,真正决定成败的指标,不是单张画面有多好看,而是剧情的密度、角色的连续性、声音和画面的配合节奏。

这就像开一家小餐馆。米其林大厨能做出惊艳的一道菜,但餐厅能不能活下来,看的是后厨的动线能不能稳定出餐。模型是大厨的一部分,工作流是整个后厨的动线。你在研究"该请哪个大厨"之前,得先把出餐流程想清楚,不然客人点三桌菜,后厨就乱套了。

1.3 三个理由,让工作流必须排在模型前面

1.3.1 工作流决定一致性。 短剧不是一张海报,是一个系列。主角的脸、服装、场景,从第一集到第十集,必须让观众觉得是同一个人、同一个世界。这个一致性问题,不是换一个更强的模型就能解决的,而是靠"角色参考图→固定Seed→垫图→局部重绘→LoRA"这一整套约束链路来保证的。链路本身属于工作流设计。

1.3.2 工作流决定效率。 AI短剧是按集生产的,一个月更新十几集甚至几十集都很常见。如果你每集都临时想提示词、临时找一个能用的场景、临时调风格,那时间成本是天文数字。正确的做法是先把可复用的模板固定下来,让每一集只是在模板里换故事、换台词、换角色动作,批量生产的效率瞬间就上来了。

1.3.3 工作流决定成本。 主流的AI视频生成平台,要么按量计费,要么订阅会员,出图、跑视频都要真金白银投入。没有明确的验收标准就去生成,废片率会高得吓人。一集片子反复重生成,但最终只用上三分之一,这就是典型的流程问题。

所以我的结论很直接:新人入局AI短剧,先别问"选什么模型",先问"我准备按什么流程做片子"。流程定了,模型只是流程里的一个选项。这也是我认为"第一个要选的不是模型,是这个"的根本原因。

2. 选工作流之前,先看懂AI短剧的完整生产链路

2.1 一条完整的AI短剧生产链路长这样

AI短剧的生产链路,按我的习惯分成六个环节:

  • 选题与策划:确定题材、目标观众、核心冲突。
  • 剧本与单集结构:每集60到120秒,写出有钩子的脚本。
  • 分镜脚本:把每集的文字拆成10到15个镜头,标注景别、画面描述、台词。
  • 画面生成:用AI绘画生成角色定妆图、场景图、关键帧。
  • 视频生成:把静态图转成动态视频,或直接文生视频。
  • 配音、配乐与剪辑:对白配音、旁白、BGM、音效、字幕、卡点节奏。

这六个环节环环相扣。很多新人只把注意力放在"画面生成"和"视频生成"两个环节,觉得那才是技术核心。但短剧是叙事作品,前三个环节直接决定故事成不成立,后一个环节直接决定观众能不能看下去。只盯着中间两个环节,等于做菜只研究炒锅,不管备菜和装盘。

2.2 每个环节的核心任务、产出物与工具参考

我习惯用一张表来管理这条链路:

环节 核心任务 产出物 常用工具参考
选题与策划 定题材、定人设、定冲突 一句话故事梗概、主角设定卡 文档即可
剧本与单集结构 写出每集的钩子、冲突、反转 60到120秒的剧本 文档、AI对话工具辅助
分镜脚本 把剧本拆成镜头 分镜表 表格文档
画面生成 出角色定妆图、场景图 关键帧图片 即梦、可灵、Midjourney、SD/ComfyUI
视频生成 静态图转动态视频 视频片段 可灵、即梦、Runway、Pika
配音剪辑合成 声音、字幕、节奏合成 成片 剪映、必剪、PR等

注意,这里的工具参考不是标准答案。同一个环节有大量可替换方案,你只要理清"这个环节要解决什么问题、产出什么文件"就够了。工具会迭代,但环节不会消失。真正需要你花心思设计的,是每个环节之间的交接关系。

2.3 三个关键控制点,决定短剧成不成立

看一条链路是否靠谱,我只看三个控制点。

第一是角色一致性。观众看剧认人,主角中途换脸,用户立刻觉得"这不是同一部剧"。生成画面时必须锁定主角形象。我的做法是先在出图环节稳定一个"角色定妆图",所有镜头都用它当参考图或垫图,必要时再加LoRA做专属角色。

第二是镜头与情绪连续性。AI生成画面的随机性很强,同一个动作、同一个场景,不同镜头之间风格容易漂移。工作流里要设置"风格锁定"环节,比如固定主模型、固定提示词里的画风描述、固定画面比例,把漂移的概率压到最低。

第三是剧情节奏。短剧拼的是信息密度,剪辑时不在无信息量的镜头上久留。分镜脚本阶段就要把每个镜头的时间标注清楚,后期直接按时间轴作业。这三个控制点都落在工作流层面,而不是某个模型的能力范围内。想通这一点,你就明白为什么流程优先于模型了。

3. 新手最稳的工作流搭建方案:先平台打底,再局部上重器

3.1 平台路线与本地路线怎么选

做AI短剧,工作流大概分两条路线。

一条是纯平台路线:剧本用AI写作工具辅助,画面和视频都在即梦、可灵、Runway这类平台上完成,剪辑用剪映。优点很明显:上手快、不需要高配电脑、不用部署环境,很多情况下生成效果已经相当不错,对新手最友好。缺点也清楚:控制力弱、角色一致性不够稳定、批量生产困难、受平台功能限制。

另一条是本地工作流路线:在ComfyUI这类工具里搭一套从文生图到放大、再到图生视频的完整节点流程,模型、参数、风格全部自己控制。优点是可定制性强、一致性更好、长期成本可能更低;缺点是门槛高、吃显卡、调试过程折磨人。新人一上来就搞本地工作流,很容易在一个月内把热情烧光。

我的建议很明确:新人先用平台路线跑通一集完整短剧,用最小成本验证流程;等到确实遇到平台解决不了的瓶颈,比如角色老是变脸、画面精细度不够、单位时间产量跟不上,再针对瓶颈去补本地工具。这就像第一次学做饭,先按菜谱把家常菜做出来,再研究火候和摆盘,而不是一上来就买齐全套专业厨具。

3.2 我推荐的新手起手式:三步搭建工作流

第一步,完整跑通一集。不要追求精美,就用平台图文生视频加剪映,做出一集60秒的完整短剧。目的是验证"选题→剧本→分镜→出图→动起来→配音→剪辑"这条链路走得通。

第二步,复盘瓶颈。做完第一集后,列出最痛的点:角色稳定吗?生成废片率高不高?配音对得上嘴型吗?这些痛点就是你接下来要优化的具体环节。

第三步,针对性补强。你觉得角色一致性太差,就研究固定参考图、垫图,或者给主角做一个专属LoRA;觉得画面精细度不够,再考虑上ComfyUI精修。每补一个工具,都要围绕一个明确的痛点,不要为了工具而工具。

3.3 一套能直接抄的工具链配置参考

下面是我整理的一套"平台打底"参考选型。注意,这只是参考,具体用哪个,要根据当下的成本和各平台功能变化来调整:

环节 主选 备选 选型逻辑
剧本辅助 AI对话工具 各种写作辅助工具 用来头脑风暴、拉结构;别指望一步到位的成稿
角色定妆图 即梦/Midjourney SD WebUI 需要能稳定出多头像、全身像、同一角色不同角度
文生图/图生图 即梦/SD 可灵 画面比例要支持9:16,能垫图
图生视频 可灵/即梦 Runway、Pika 能控制运动幅度,支持参考首帧/尾帧
剪辑 剪映 PR、必剪 有字幕、配音、BGM能力,适合短剧快速产出

每次聊选型我都要多说一句:工具是会变的,今天好用的平台,明天可能就改了规则;今天不行的模型,下个月就可能更新。工作流的关键不是"非用某个具体工具",而是"每个环节该做什么、产出什么格式的文件、怎么交接给下一个环节"。把交接点定义清楚,换工具只是换一个插头。

4. 从剧本到成片:一条能直接抄的实操路径

4.1 先写一集有钩子的剧本:3秒抓人,结尾留人

AI短剧单集很短,结构比长剧更严格。我常用一个结构:前3秒抛出冲突或悬念;中间30到60秒推进一个小事件,让主角解决问题或遇到升级的麻烦;结尾留一个钩子,引导用户点开下一集。

举个例子。假设题材是"女主穿越成恶毒继母",第一集可以这样开:3秒内,女主从现代惊醒,发现自己变成了小说里的恶毒继母。她正准备按原著去欺负原女主,却突然发现墙角蹲着一个眼熟的人,是上辈子救过她的恩人。这样一来,这一集的情感推动和"认错人"的钩子一下子就有了。

这个阶段,我建议用"一句话梗概加三幕式单集结构"来管理,不要一上来就写长篇剧本。AI对话工具可以帮忙发散,但最终的钩子判断一定要自己做,因为AI生成的冲突往往太套路,缺少真正扎人的细节。

4.2 分镜脚本模板:给每个镜头分配任务

剧本定了,下一步拆镜头。一集60秒,我一般控制在10到15个镜头,每个镜头3到8秒。下面这个模板可以直接抄:

镜号 景别 画面描述 台词/字幕 时长(秒) 生成方式
1 近景 女主睁眼,惊恐环顾 我怎么会在这里? 3 图生视频
2 中景 古代房间,门外传来脚步声 (旁白)她穿越了 4 图生视频
3 全景 原女主跪在地上,继母走向她 你还敢顶嘴? 4 图生视频
4 特写 女主看到墙角男子,瞳孔一震 怎么是他? 3 图生视频
... ... ... ... ... ...

分镜表的重点,是"画面描述"必须能被AI理解。不要写"女主情绪复杂",AI画不出情绪,你要写"女主皱眉、眼眶微红、拳头握紧"这种可视觉化的动作。这一步,是后面所有提示词和画面生成的基础,值得多花时间打磨。

4.3 画面生成的提示词公式:主体、动作、环境、风格一次给全

有了分镜表,就可以写画面提示词了。我的通用公式是:主体+动作+表情+环境+风格+镜头语言+画幅参数。

以镜号1为例写一条:

示例提示词:20岁左右的年轻女性,古代贵族卧房背景,刚从睡梦中惊醒,皱眉,眼神惊恐,视线望向镜头,暖色烛光,电影质感,浅景深,国风古装剧风格,竖屏9:16。

出图时参数也要固定下来。分辨率建议用竖版两倍尺寸,例如768乘1344左右的输出后再统一处理;画幅必须是9:16;如果平台支持负向提示词,可以写上"模糊、变形、多余手指、低画质"这类信息。特别要注意的是,同一集的同场景镜头,提示词里的风格描述部分要完全一致,比如"国风古装剧风格、电影质感、暖色烛光"这几个词,不要每张都改,否则画面风格非常容易漂移。

4.4 从静态图到视频:图生视频的关键参数

静态关键帧生成后,就要让它动起来。这一步我用得最多的是图生视频,因为可控性比文生视频好。以常见平台的参数为例,新手可以参考下面这套配置:

参数项 推荐值 说明
单段时长 4到6秒 太短切不出节奏,太长AI容易崩
运动幅度 低到中等 不要直接拉满,拉满容易肢体扭曲
首帧设置 与关键参考图一致 锁定画面基础,减少随机偏移
Seed值 同一镜头固定 多次生成时画面更稳定
镜头调度 推近、拉远、轻微摇移 不要做大幅旋转和剧烈运动

很多新人会在这里犯一个操作错误:运动幅度拉太高,结果画面里人物表情狰狞、肢体扭曲。图生视频不是追求动作越大越好,在AI短剧里,"小幅度的自然表情变化加镜头切换"反而更有叙事感。你需要的不是让角色跳一段舞,而是让观众觉得这个画面是在讲故事。

4.5 配音、配乐与剪辑合成:先声音后画面

视频片段都生成好之后,剪辑环节我建议按"声音先行、画面配合"的思路来做。先录制或生成对白,把对白放到时间线上,再根据对白的长度去贴合画面。这样做的好处是:台词节奏决定了镜头长度,不会出现画面太短、反过来挤压对白的情况。

工具方面,配音可以用AI配音工具或自己录,注意语气要符合角色情绪。BGM选有节奏感的背景音乐,音量压低在合适位置。音效如脚步声、敲门声、环境音,能极大提升代入感。字幕建议做成短剧常用的字幕样式,放在画面下方安全区,字号适中,方便手机观看。

4.6 素材命名规范:别让命名毁掉你的效率

做系列剧,素材量会迅速膨胀。我吃过"素材找不到"的亏,所以强烈建议使用统一命名规范:集数_镜号_版本_内容描述。例如"ep01_shot03_v2_女主震惊.png",这样后期在素材库里一眼就能找到目标,也不会多试几个版本后分不清哪个是最终的。

这一步很多人会忽略,但恰恰是工作流里特别重要的一环。生成的素材不用特意删除,保留版本就好,命名清晰比清理更重要。

4.7 给新人的7天实操排期

如果你完全没做过,我建议花7天走通第一集:

  • 第1天:确定选题和主角设定,写出一句话故事梗概。
  • 第2天:写出第一集剧本,确认钩子。
  • 第3天:拆成12个左右的镜头,完成分镜表。
  • 第4天:生成主角定妆图和所有关键帧图片,统一风格。
  • 第5天:把关键帧转成视频片段,批量生成,筛选可用片段。
  • 第6天:配音、配乐、粗剪。
  • 第7天:精剪、加字幕、导出发布。

这7天不需要追求完美,目标是"我能独立做出一集完整短剧"。跑通这个最小闭环后,再考虑优化画质、提高效率、批量生产。

5. 常见问题与排查技巧实录

5.1 角色前后不像:先查参考图,再查模型和Seed

这是AI短剧最常遇到的问题。排查顺序我一般是这样:先确认画面生成时是否用了同一张角色参考图或垫图;再确认同一集的风格关键词是否完全一致;然后检查是否固定了Seed;最后,以上都做了还不行,就考虑给主角训练专属LoRA。

新手最容易犯的错误,是拿着"角色定妆图"当参考,又临时改了提示词里的服装描述,结果身形、服饰全变了。要记住,参考图约束的是大轮廓,细节关键词不能随意漂移。做系列剧,角色定妆图是"宪法",所有镜头都围绕它走。

5.2 视频画面崩坏、肢体别扭:运动幅度降档,重试有技巧

AI视频生成模型在动态镜头下,确实容易出现手部变形、肢体扭曲、五官乱飞。遇到这种问题,先别急着换模型,把运动幅度调低,多生成几次,从中挑选稳定的一种。如果平台支持负向提示词,把"变形、扭曲、多余手指、面部扭曲"写进去。画面里的镜头调度尽量简单,推近、拉远、轻微摇移就够了,大范围旋转和剧烈运动很容易翻车。

5.3 生成速度慢、效率低:从单张出图改成批量流水线

如果每张图都单独调参、单独生成,效率确实很低。我的做法是:先把所有分镜的画面描述整理到一个表格里,统一设定好风格关键词和参数,然后按批次生成,一次生成多张再统一挑选。视频生成阶段也一样,批量提交任务,再逐条筛选。平台有并发任务就用满,没有就按优先级排队,把人工等待时间压缩到最少。

5.4 前后集风格不统一:把"风格配方"固定成模板

如果只做单集,风格漂移问题不明显,但做系列剧就会暴露。解决办法是建立自己的"风格配方"文档,里面记录底模、风格关键词、光照基调、色彩倾向、画面比例、Seed习惯。每集开工前先读配方,生成出来的画面要跟历史集对比一遍再继续,别盲目往下做。做完一集后,再把"哪些关键词导致效果变样"记下来,持续迭代这份配方。

5.5 常见问题速查表

问题 常见原因 排查顺序 处理建议
角色前后不像 参考图不一致、关键词漂移 参考图→风格词→Seed→LoRA 统一参考图、固定风格词、必要时训练LoRA
视频崩坏/肢体扭曲 运动幅度过高、镜头过于复杂 运动幅度→镜头设计→负面提示词 降低幅度、简化调度、多次生成筛选
出图速度慢 没有批量作业 批次策略→并发任务→人工筛选 统一参数批量生成,集中筛选
前后集风格不统一 缺少风格配方 历史对比→配方文档→参数固定 建立配方文档,每集开工前校准
成片节奏拖沓 分镜没标时长、剪辑没有卡点 分镜表→声音先行→卡点剪辑 每个镜头限时、对白定节奏、BGM辅助

除了这张表,还有一个经验想分享:每完成一集,都要做一次"完成度校准"。别管外部数据怎么样,你先自己按观众视角回看一遍,发现哪里出戏,就回到对应环节去修。是剧情问题就去改剧本,是画面问题就去改工作流,不要把所有问题都归结到"模型不够好"。大部分时候,问题出在流程,不在模型。

我个人做AI短剧这大半年,踩过最大的坑,就是一开始沉迷换模型,结果片子一部没做完。后来把工作流定下来,从策划、分镜到剪辑,每个环节都有了固定动作,效率才真正上来。模型这个东西,今天你觉得这个强,下个月就有更强的,你永远追不完;但工作流一旦定下来,它天天都在替你省时间。先跑通流程,再慢慢优化画质,这是我给所有新人最实在的建议。

Logo

火山引擎视频云技术社区,是面向 AI 音视频开发者的技术交流平台。这里汇聚源自抖音、豆包等亿级 DAU 产品的 RTC、直播、点播、AI 媒体处理、音视频互动技术,提供接入指南、最佳实践、性能调优、场景案例、Demo 代码、开源项目、白皮书和 API 文档。社区汇聚官方工程师与一线开发者,为 AI 视频通话、数字人、AI 视频处理等应用的开发与落地提供技术支持。

更多推荐