做短剧的传统方法是这样的:写剧本、找演员、搭场景、拍素材、后期剪辑,五道工序,至少三个人协作,耗时至少一周。

现在用AI工具链,一个人一台电脑,几小时就能从零到成品出片。

2026年,AI视频生成已经不再是“图一乐”的玩具,而是真正进入了工业化生产阶段。从剧本到分镜再到成片,一条智能化创作流水线正在重新定义视频内容的产生方式。

一、工具链全貌:每个环节的产出是下一个环节的输入

这套流程的核心在于环环相扣——剧本输出角色设定 → 角色设定生成定妆照 → 定妆照作为参考生成分镜画面 → 分镜画面生成视频片段 → 所有片段合成一部完整的短剧。

做过AI视频的人都知道,最头疼的问题就是换镜头就换脸——同一个角色在不同分镜里长得完全不一样,观众一眼就能看出是AI生成的。下面每一步我都会重点讲解如何解决这个问题。

工具矩阵一览:

| 环节 | 推荐工具 | 说明 |
|------|---------|------|
| 剧本/分镜 | DeepSeek、ChatGPT、Kimi、豆包 | 结构化提示词生成专业剧本 |
| 角色设定/生图 | Midjourney、豆包(Seedance 2.0)、即梦AI | 锁定角色形象一致性 |
| 图生视频/视频生成 | 可灵AI(Kling)、Runway、即梦AI、PixVerse | 让画面动起来 |
| 配音 | ElevenLabs、讯飞配音、剪映TTS | 生成角色配音 |
| 剪辑包装 | 剪映专业版、Premiere | 合成最终成片 |


二、Step 1:AI写剧本和分镜(约15分钟)

做短剧的第一步是剧本。很多人让AI写剧本只会说一句“帮我写一个职场反转短剧”,出来的东西要么老套,要么没法落地。

问题出在提示词不够结构化。

用DeepSeek生成短剧剧本,提示词需要包含五个层次:

① 角色设定层:告诉AI你是谁,让它在特定专业领域内思考。

> 示例:“你是一名专业的短剧编剧,擅长职场轻喜剧和反转剧情,熟悉抖音、快手短剧的快节奏叙事风格。”

② 任务描述层:告诉AI做什么,给出故事的基本框架。

> 示例:“请为我创作一部3分钟、6集的微短剧《提案反转局》。”

③ 人设定义层(最关键!):这是决定角色一致性的第一步。角色形象必须具体到可供AI生图使用。

> 示例:“林悦——24岁职场新人,干练短发,五官清秀有灵气,日常穿搭白色衬衫+高腰西裤,关键特征戴一副银色细框眼镜。”

④ 分镜约束层:告诉AI怎么呈现,明确输出格式和细节要求。

> 输出6集的分镜脚本表,每集30秒,表头必须包含:集数、镜头序号、景别、画面详细描述、对白/旁白、时长。

⑤ 格式要求层:输出格式为Markdown表格,先输出角色设定表,再输出分镜脚本表。

实操要点:
- 人设定义一定要具体到发型、服饰、标志性特征——这些是后续生图保持角色一致性的锚点
- 画面描述不能只写“两人对话”,要写“林悦抬头望向张组长,眼神从紧张转为坚定”
- 对白尽量简短有力——短剧的黄金法则是“3秒一个钩子,10秒一个小反转”
- 单个分镜时长控制在3-6秒——这个时长范围AI生成效果最稳定


三、Step 2:AI锁定角色形象,批量生成分镜图(约30-40分钟)

剧本有了,接下来要让文字变成画面。这一步是整个AI短剧制作最关键的一环——角色形象必须锁定,否则后面每帧都不一样。

 第1步:生成角色定妆照

将DeepSeek生成的角色设定依次输入AI生图界面(推荐豆包Seedance 2.0或Midjourney),每个角色生成一张定妆照。

选图标准:
- 人物面部清晰,五官端正,没有变形
- 服饰细节完整
- 背景简洁,便于后续换场景时AI识别主体
- 光线柔和,不要过曝或过暗

第2步:批量生成分镜画面

操作要点:
1. 上传参考图:在生图界面点击“添加参考图”,上传对应角色的定妆照
2. 编写完整提示词:将DeepSeek分镜表中的画面详细描述与参考图指令结合
3. 每个镜头生成2-3张候选图,从中挑选最满意的一张
4. 按“集数_镜头序号”命名保存,方便后续剪辑时快速定位

> 💡 避坑提示:如果角色在跨镜之间出现“脸漂移”(骨相、发型、服饰轻微变化),说明图像锚点不够强。解决办法是强化参考图权重,或者在提示词中反复强调角色的标志性特征。


四、Step 3:AI视频生成——让画面动起来(约1-2小时)

有了分镜图,接下来要把静态画面变成动态视频。

工具怎么选?

2026年主流AI视频工具对比:

| 工具 | 优势 | 注意点 |
|------|------|--------|
| 可灵AI(Kling 3.0)| 画面细节丰富,电影感强;支持最长2分钟连续视频生成;复杂肢体动作和中文生活场景表现出色 | 排队时间可能超过30分钟 |
| 即梦AI(Seedance 2.0) | 无需等待,1分钟之内生成视频;支持四维多模态混合输入,具备导演思维的分镜调度能力 | 画面细节略逊于可灵 |
| Runway*| 画面精细度高,提供精准的运镜和动作控制 | 适合对画质有较高要求的进阶创作者 |

新手建议:先从即梦AI起步(每天有免费次数),熟悉流程后再尝试可灵和Runway。

图生视频操作要点

视频提示词和图像提示词写法不同:
- 图像提示词:尽量用英文逗号分隔的短语,少写中文长句
- 视频提示词:句号反而有用——它能帮模型拆分镜头、动作、场景层次


五、Step 4:AI配音与剪辑包装(约30-60分钟)

 配音推荐工具:
- ElevenLabs:音质最佳,支持多角色配音,但需付费
-剪映TTS:免费,内置多种音色,适合新手
- 讯飞配音:中文语音效果优秀

操作很简单:把剧本中的对白复制进去,选择角色音色,导出音频文件。

剪辑包装

用**剪映专业版**完成最终合成:
1. 导入所有视频片段(按分镜顺序排列)
2. 导入配音音频
3. 添加字幕(剪映支持自动字幕识别)
4. 添加转场、背景音乐、片头片尾
5. 调整节奏,导出成片

短剧剪辑黄金法则:节奏要快,3秒一个钩子,10秒一个小反转。


 

上面这套流程,是我跑了多轮之后稳定下来的方案。不需要美术基础,不需要会剪辑,不需要懂代码。

但说实话,第一次自己摸索的时候,踩了不少坑——工具不会选、角色老是变脸、提示词写不对、视频生成效果不可控……每一步都可能卡住。

如果你不想自己踩这些坑,我们在龙游有一期5天线下AI短剧特训班: 行业导师一对一带教,从剧本到成片全程辅导
 

Logo

火山引擎视频云技术社区,是面向 AI 音视频开发者的技术交流平台。这里汇聚源自抖音、豆包等亿级 DAU 产品的 RTC、直播、点播、AI 媒体处理、音视频互动技术,提供接入指南、最佳实践、性能调优、场景案例、Demo 代码、开源项目、白皮书和 API 文档。社区汇聚官方工程师与一线开发者,为 AI 视频通话、数字人、AI 视频处理等应用的开发与落地提供技术支持。

更多推荐