AI短剧制作全流程拆解:从即梦到ComfyUI的角色一致性与批量生产
AI短剧这四个字,听起来像是一行命令就能出片,但实际跑过一遍后你会发现,它是一条完整的生产链路。真正决定成败的不只是某个视频模型强不强,而是分镜脚本、角色一致性、批量任务稳定性这三件事能不能理顺。这篇文章面向想从零开始做AI短剧、AI动漫、AI动态漫或漫剧的人,尤其是刚知道即梦和ComfyUI、又不知道该从哪个工具入手的读者。最简单的入门路径是:先用即梦这类在线工具确认短剧的分镜和画面方向,再靠ComfyUI把批量生成、角色一致性和动态漫制作变成一套可重复执行的流程。
我最初也是从“随便生成一条视频”开始,结果发现生成的片段之间人物长相完全对不上。后来才意识到,做短剧和做单条视频是两套思路。下面按我实际走过的路径,把工具分工、单条跑通、ComfyUI工作流、角色一致性、动态漫制作、批量生产和常见报错排查全部拆一遍。
1. AI短剧制作不是“一键生成”,而是一条四环节流水线
1.1 短剧生产的最小流程
做一条AI短剧,看起来是输入一句话就能出来一段视频,但现实中的生产流程至少包含四个环节:文本环节、视觉环节、动态环节、后期环节。
文本环节是写脚本和分镜。很多人会忽略这个步骤,直接跑去生成画面。结果就是每条片段单独看都好看,连起来故事是碎的。AI短剧本质上是短剧,故事逻辑和镜头逻辑才是骨架,画面效果只是外壳。
视觉环节是把文字变成画面。这里可以生成单张关键帧,也可以直接生成视频。如果走ComfyUI路线,一般会先生成统一的角色图和场景图,再基于这些图去生成动态片段。这样做的原因很简单:连角色都还没固定,就去生成动态视频,结果一定乱。
动态环节把静态图变成“会动的素材”。目前主流做法是图生视频,也就是用一张或多张连续帧来生成短视频。这个环节决定动作是否自然,也是资源消耗最大的地方。如果显卡显存不够,最容易在这个环节卡住。
后期环节解决的是节奏问题。剪辑、字幕、配音、配乐、转场、音效,都在这一步完成。很多AI短剧看起来很粗糙,不是画面不行,而是没有卡点、没有音效、转场生硬。你把这层补上,成片质量会立刻上一个台阶。
这四个环节不是串行跑一次就结束,而是反复迭代的。比如生成视频后发现人物不像,要回头改视觉环节;如果分镜逻辑不顺,要回头改文本;如果节奏拖沓,要回到后期重新剪。理解这个循环,后面所有工具和参数的学习才有方向。
1.2 三种短剧形态,学习路径其实不一样
AI真人短剧,风格更接近影视实拍,常见题材是古装、都市、悬疑。它最吃角色一致性和镜头连贯性,因为观众对“人脸不统一”非常敏感。前一秒还是这张脸,下一秒换了一张,整部剧的观感立刻崩掉。
AI动漫,走的是二次元画风,对审美和画风统一要求高。它的重点在动漫模型、LoRA控制和动作流畅度。这个方向最依赖模型风格的控制能力,同一个角色要能在不同分镜里保持同样的五官和服装。
AI动态漫和AI漫剧,介于漫画和动画之间。它靠静态画面加镜头运动、局部动态来叙事。重点在静态图质量、分层作画和剪辑节奏。它比真人短剧省资源,因为不需要每一帧都是完整视频,很多镜头用静态图加镜头运动就能撑住。
这三条路共用一套底层技术:提示词组织、ComfyUI工作流、图生视频、后期剪辑。差别只是模型风格和制作标准不同。零基础入门,不用一开始就决定做哪一种。先把通用链路跑通,再根据自己喜好去选画风。
至于AI做短剧能不能赚钱,我的建议是先把制作流程跑稳再谈变现。直接拿不稳定的素材去批量发布,很难留住观众,内容质量比工具数量重要得多。
2. 工具分工:即梦适合验证画面,ComfyUI适合批量量产
2.1 先用即梦这类在线工具建立画面感
即梦是目前比较适合新手的AI创作工具,支持文本生成图片、图片生成视频。这类在线平台的好处是门槛低,浏览器打开就能用,不需要关心显卡、显存、依赖包。你只需要把分镜描述写清楚,等它出结果。
很多人提到的“即梦2.0古装剧分镜词”,本质上就是一套结构化的提示词写法。比如做古装短剧时,把年代、服装、妆发、光线、镜头、氛围逐项写明白,而不是只写一句“一个古装女子在庭院里”。描述越具体,画面越接近分镜预期。
不过在线工具也有明显边界。免费额度有限;批量生成要一次一次手动点;风格可控性不如本地工作流;当你需要连续生成100个镜头、还要保持同一个主角长相时,会上手效率低很多。所以我的定位是:入门阶段用即梦来测分镜方向、练提示词、确认审美风格;进入正式生产后,把重复性任务迁到ComfyUI。
2.2 ComfyUI本地工作流解决什么问题
ComfyUI是节点式工作流工具,简单说就是像搭积木一样,把大模型、提示词、采样器、视频生成节点、保存节点连起来。它解决短剧制作里三个刚需。
第一是批量稳定。同一套节点结构可以反复复用,换提示词、换参考图、换输出路径,就能批量出素材。第二是可控性强。可以接入ControlNet、IPAdapter、LoRA这类控制模块,把角色脸型、服装、姿势锁定住。第三是工作流可保存。一个工作流文件就是一份生产SOP,换电脑、换人操作,重新加载就能跑。
代价是门槛更高。要理解节点连接、模型下载、显存占用、插件冲突这些概念。初次打开ComfyUI界面,满屏节点确实让人发蒙。但只要按一条稳定工作流一步步跑起来,难度没有想象中那么高。
2.3 本地部署需要什么条件
我的机器不算高配,跑ComfyUI之前最担心的就是硬件。这里给一个通用参考,具体以你实际电脑为准。
| 项目 | 入门配置 | 推荐配置 |
|---|---|---|
| 显卡显存 | 8GB以上 | 16GB以上 |
| 内存 | 16GB | 32GB以上 |
| 磁盘剩余空间 | 50GB以上 | 200GB以上 |
| 操作系统 | Windows 10/11 或 Ubuntu | 同上 |
| 网络 | 下载模型需要稳定网络 | 同上 |
8GB显存可以跑Stable Diffusion 1.5系列模型、部分轻量视频模型,但分辨率要压低,视频时长要缩短。16GB以上显存会更从容,可以做更高帧率、更复杂的工作流。
还有一个常见误区:很多人只看显卡,忽略磁盘。模型文件动辄几个GB到几十GB,加上插件和中间产物,收到一半硬盘满了,再好的显卡也跑不动。开始之前先看剩余空间。
3. 先跑通单条:从分镜脚本到第一段成片
3.1 分镜脚本不能只写剧情,要写可生成画面
我见过最典型的失败案例,是脚本里只有一句话:“女主走进院子,发现男主受伤了。”这一句话丢给AI,模型可能给你生成十种完全不同的画面。因为“走进院子”是一个动作概念,而不是一个可生成的画面描述。
正确做法是把分镜表拆成镜头号、景别、画面内容、台词或字幕、时长、参考图备注。例如:
| 镜头号 | 景别 | 画面内容 | 台词/字幕 | 时长 | 备注 |
|---|---|---|---|---|---|
| S01 | 中景 | 女主推开门,走进庭院,风吹起头发 | “你回来了” | 3秒 | 角色参考图A |
| S02 | 特写 | 男主抬头,眼神从惊讶到安心 | 无 | 2秒 | 情绪连贯 |
这样写完之后,生成时才能给模型一个足够明确的输入。AI短剧的镜头之间不需要复杂的转场,同场景、同时段光线一致,观众就会觉得连贯。
3.2 写提示词的核心公式
写提示词可以套一个公式:主体 + 场景环境 + 光线氛围 + 镜头语言 + 风格限定。
示例:
古代年轻女子,穿淡青色长裙,站在庭院桃树下,
黄昏暖光,薄雾,微风,发丝轻微飘动,
中景镜头,浅景深,电影感,古装影视截图质感
这里最容易遗漏的是光线和镜头语言。光线不写,模型可能默认给你一个正面大平光,结果两个镜头的光线环境完全不搭。镜头语言不写,模型可能一直输出正面照,缺少短剧需要的紧凑感和代入感。
每一条分镜生成前,先把公式里的五项填满。不要偷懒,不要想着“AI能猜到我想什么”。它猜不到。
3.3 在即梦里完成第一段成片
操作顺序我建议这样做:
- 打开即梦,进入文生图,把分镜脚本里的画面描述复制进去,生成第一张关键帧。
- 从生成结果里挑出最接近预期的一张,选择“图生视频”。
- 在生成视频时,把镜头运动描述写清楚,比如“镜头缓慢推进”“镜头从左向右平移”。
- 等待生成,下载素材,检查人物、动作和质量问题。
对于古装短剧这类题材,即梦的古风生成效果通常不差,但分镜词要写得更细。“即梦2.0古装剧分镜词”这类热门讨论,核心价值就是把古装场景拆成了可复制的描述模板,直接套用比自己现想词稳定。
3.4 一段成片是否合格,看四个指标
- 主体一致:人物是不是同一个人,服装有没有突变。
- 动作自然:肢体有没有扭曲,走路、转头、拿东西是否正常。
- 画面闪烁:帧与帧之间有没有明显的亮度或噪点跳变。
- 剪辑适配:素材有没有头部和尾部缓冲,方便后期切入切出。
如果这四项有明显问题,不要急着堆特效。先回去调整提示词、场景描述和参数,问题通常出在源头。
4. ComfyUI基础工作流:从整合包到第一个节点图
4.1 整合包还是手动部署
ComfyUI本身是开源项目,需要Python环境、PyTorch和一堆依赖。手动部署适合有经验的人,新手很容易卡在环境配置上。
社区里常见的秋叶整合包,就是为了解决这个问题:下载后解压,运行启动脚本,通常会帮你配置好运行环境。使用整合包时有三个常见坑:
- 解压路径别带中文和空格,否则部分模型加载会报错。
- 模型不会全部内置。你需要把下载的模型放进对应目录,例如大模型放models/checkpoints,LoRA放models/loras。
- 版本更新后不要直接整体覆盖。先备份自己常用的工作流文件和自定义节点,再升级。
如果你用Ubuntu,可以手动部署。大致思路是安装Python、创建虚拟环境、拉取项目、安装依赖、下载模型。实际安装步骤以官方文档为准,这里就不贴命令了。
4.2 最基础的一个文生图工作流
ComfyUI界面由节点组成。一个最基础的文生图工作流,至少包含这些节点:
加载大模型(Load Checkpoint)
→ 正/负提示词编码(CLIP Text Encode)
→ 初始化潜空间(Empty Latent Image)
→ 采样器(KSampler)
→ 解码(VAE Decode)
→ 保存图像(Save Image)
加载大模型节点,决定使用哪个底模。提示词编码节点,把文字变成模型能理解的条件。采样器控制生成过程,里面有两个关键参数:步数和CFG。
CFG简单理解是提示词对生成结果的影响强度。数值太高,画面容易过锐甚至失真;数值太低,画面容易跑题。常见范围在3.5到8之间,具体看模型说明。
第一次跑这个工作流,不要追求复杂功能。先确认大模型能出图、采样参数正常、输出目录里有文件。再逐步加ControlNet、LoRA、视频生成节点。这样出了问题,你才知道是哪个环节导致的。
4.3 图生视频工作流怎么组织
短剧里大量素材来自图生视频,也就是给定一张角色关键帧或场景图,让模型生成一小段动态视频。在ComfyUI里,工作流大致是这个逻辑:
加载图像(Load Image)
→ 尺寸调整/编码
→ 视频模型节点
→ 帧数、步数、CFG设置
→ 视频解码与保存
这里最容易出错的是输入图像尺寸。很多视频模型对宽高有硬性要求,如果你直接把一张大尺寸图片丢进去,节点会报错。正确做法是先设定视频输出宽高,再让输入图像经过尺寸调整节点,保证输入输出一致。
4.4 常用的几个自定义节点类型
我把自己生产时经常用到的节点类型整理一下,具体插件名要以社区最新版为准:
- ControlNet系列:控制姿态、边缘、深度,适合固定人物姿势。
- IPAdapter系列:参考图信息迁移,适合做角色和风格统一。
- LoRA加载节点:注入训练好的角色风格文件。
- AnimateDiff类视频生成节点:做动态漫和短动画很常用。
- 遮罩和局部重绘类节点:修正瑕疵区域,不需要整张图重新生成。
插件安装后如果界面没变化,先重启ComfyUI。如果加载报错,多半是插件版本和ComfyUI主版本不兼容,优先检查这两个版本。
5. 角色一致性:短剧量产最容易翻车的地方
5.1 翻车现象是什么样的
AI生成单张图片,质量通常都不错。但放到短剧里,问题很快暴露:上一镜是瓜子脸,下一镜变成圆脸;上一镜穿蓝色长裙,下一镜变成白色。观众对短剧的连贯性很敏感,尤其主角。脸一旦不稳定,整部剧的观感立刻下降。
很多新手会立刻认为是模型能力不行,实际上大多数情况是工作流里没有做“角色锁定”。
5.2 最轻量的锁定方式:固定角色描述词
第一步,把角色的外貌写成一段固定的、每次都原样使用的描述文案。比如:
25岁东方女性,鹅蛋脸,柳叶眉,黑色长发扎成低马尾,
发饰为银钗,穿浅蓝色交领襦裙,气质温婉。
这段文案在每一个分镜生成时都放在提示词开头,不要随意改。它能明显降低“随机换人”的概率。
如果有人说固定描述词没效果,往往是因为描述词太短或太抽象。只写“漂亮女人”,模型当然自由发挥。要写到“换个发型都能看得出是同一个角色”的程度。
5.3 参考图、IPAdapter、LoRA分别怎么用
固定文字只是第一步。要进一步提升一致性,需要引入图像控制。
参考图是通用做法。选定一张主角脸最满意的图作为标准图,后续图生图、图生视频都基于它来生成。新生成的结果会保留参考图的很大一部分特征。IPAdapter适合做风格迁移和特征参考,操作比训练LoRA简单很多,适合项目中期需要大量保持一致性的阶段。LoRA则适合长期固定角色。如果你想做几十集短剧,同一个主角每集都出现,可以训练一个角色LoRA。缺点是要准备角色样本图和训练时间,新手可以先不碰。
我的建议是:单条测试用固定描述词加参考图;项目中期用IPAdapter;确认长期产出同一角色后,再考虑LoRA。
5.4 先锁角色,再谈动作
实际工作流里还有个顺序问题。先出角色标准图,再让角色去执行动作,不要直接让模型“边生成角色边做动作”。
先生成一张干净的站姿或半身角色图,再用图生视频或ControlNet加入动作控制,这样成功率会高很多。
场景也一样。同一个庭院、同一个房间,要有一张标准场景参考图。生成新镜头时把场景参考图带入,能减少背景穿帮。等后期才发现背景和上一镜完全不一样,重做成本很高。
6. AI动态漫与AI漫剧:静态图为主的生产路径
6.1 动态漫和漫剧到底有什么区别
还是先分清概念:
- 动态漫是把漫画风格静态图做成“会动”的效果,可能是局部动态、镜头推拉,也可能是逐帧手绘动画。
- 漫剧更接近竖屏短视频剧,用漫画风或AI生成风画面,配合字幕、配音、音效,按短剧节奏剪辑。
| 形态 | 画风 | 制作重点 | 常见输出 |
|---|---|---|---|
| AI真人短剧 | 影视实拍感 | 角色一致、镜头连贯 | 横屏或竖屏片段 |
| AI动漫 | 二次元 | 画风统一、动作流畅 | 系列动画剧集 |
| AI动态漫/漫剧 | 漫画分格加局部动态 | 静态图质量、动态幅度 | 竖屏短剧 |
做动态漫通常比做真人短剧省资源。因为不需要每一帧都是完整视频,很多镜头用静态图加镜头运动就能完成“演出”。
6.2 动态漫的一个基础流程
我这里给一条从零开始也能走通的路径:
- 先用ComfyUI批量生成角色和场景静态图。这个阶段要保证角色、场景、风格都稳定。
- 在生图工作流里加ControlNet或IPAdapter,让每张关键帧保持角色一致。
- 挑出关键帧,用图生视频节点生成人物局部小动作,比如眨眼、转头、发丝飘动。
- 背景和前景分开处理。动态漫画面里,人物是前景,背景可以保持轻微移动或不移动。
- 把动态素材导入剪辑软件,加镜头推近、拉远、平移,再加字幕和配音。
这里最重要的一点,是不要整张图大幅度抖动。动态漫的“动态感”主要靠镜头运动和局部动画,没必要让每一处都在动。动得越多,出错概率越高。
6.3 配音、字幕和音效决定成片质感
AI短剧和动态漫的画面生成完之后,很大一部分效果来自后期。声音上,可以用文本转语音生成角色对话,也可以用合成音色做旁白。字幕要单独放一层,方便批量修改。音效和背景音乐要根据情绪变化切分,短剧常用的卡点音效、环境音、氛围音乐,都能明显提升节奏感。
如果成片效果一般,先检查音画节奏,而不是重新生成画面。很多时候问题不是画面差了,而是每句台词之间没有留白,音效缺失,看起来像“画面配PPT朗读”。把音频轨道认真调一遍,观感会提升很多。
7. 批量生产与工程化:从一条素材到一整集短剧
7.1 先搭好目录和命名规则
批量生成前,先建立清晰的目录结构。我常用的结构是这样的:
workspace/
├─ episode01/
│ ├─ shots/ # 原始生成片段
│ ├─ refs/ # 角色与场景参考图
│ ├─ audio/ # 配音与音乐
│ └─ final/ # 剪辑后输出
└─ workflows/ # 保存好的ComfyUI工作流文件
文件命名要一眼能看懂,不要用截图默认名。“最终版2”这种命名方式是噩梦。推荐格式:集数_场次_镜头_版本。
ep01_scene02_shot01_v1.png
ep01_scene02_shot01_v2.png
ep01_scene03_shot01_v1.mp4
这样即使中途反复调整,也能清楚知道哪个版本在哪个目录里。
7.2 批量生成前,先跑三条样例
批量任务最忌讳一上来就全量跑。ComfyUI虽然支持排队生成,但如果提示词、尺寸、模型路径有问题,跑到第50张才发现,浪费时间和资源。
我一般会先取三个有代表性的分镜样例去跑。判断标准有两个:能不能成功生成,生成质量是否符合预期。样例通过后再扩大到全部镜头。
批量跑的时候,每隔一段时间看一次输出目录,确认文件在增长,同时观察显存占用和报错日志。不要等全部跑完再打开看结果,中间出问题能省很多时间。
如果你的任务量特别大,也可以写脚本调用ComfyUI本地接口,循环提交工作流。但脚本化有一个前提:单条工作流必须足够稳定。不然脚本只会帮你把错误流程重跑很多遍。
7.3 失败任务怎么处理
批量生成一定会有失败。不要看到日志里出现红色报错,就把所有任务重新跑一遍。先记录失败任务,单独处理。
一个可用的做法是:把失败任务的输入、提示词、报错信息复制到单独的文件夹,等当前批次结束后集中排查。如果错误类型都是显存溢出,那就降分辨率或降低并发,而不是改工作流。如果错误集中在某几张输入图上,那就是输入图本身的问题,换图即可。
7.4 低配置机器怎么降载
如果显卡显存有限,又想跑批量,可以考虑这些措施:
- 把批量数设为1,一张一张排队生成。
- 降低分辨率。短剧可以先低分辨率生成粗剪素材,最终成片时再放大。
- 关闭不用的后台程序,避免内存被占满。
- 使用半精度模式减少显存占用,但生成效果可能和全精度有细微差异。
低配置不是不能做AI短剧,而是要把预期从“快速出高清大片”调整为“先保证能稳定出素材”。素材能稳定产出了,再逐步提高参数。
8. 常见报错与排查顺序:节点、显存、模型和输入
8.1 节点报错的通用排查链路
ComfyUI里最常遇到的报错是“节点在执行过程中发生错误”,英文界面下会类似“failed to execute”。很多人看到这个就不知道从哪下手。其实报错信息里通常已经包含了节点名和错误原因,关键是别慌,按顺序排查。
- 看提示里的节点名称。ComfyUI会标注具体哪个节点出错,先确认是不是某个插件节点。
- 看错误信息的最后几行。OutOfMemory代表显存不足,FileNotFoundError代表文件路径或模型文件不存在,TypeError或ValueError代表输入类型不匹配。
- 检查节点连线。有些节点要求输入图片,你直接把文本接过去,就会类型错误。
- 检查输入图像尺寸。很多视频节点对宽高有要求,先用尺寸调整节点统一。
- 检查模型文件是否完整。下载中断、文件损坏,加载时会在报错里直接体现。
- 排除以上所有问题后,再考虑插件兼容性。禁用刚安装的插件,或者更新ComfyUI版本,看是否恢复。
8.2 显存不足怎么判断和处理
显存不足最明显的特征是:任务跑了一部分才报错,打开GPU监控能看到显存接近满载。
处理优先级是这样的:先降分辨率,再减批次数,再换轻量模型。不要一上来就调大虚拟内存,那只是缓解,不是根治。
短剧生产里,我建议把单次生成的分辨率和视频时长控制在模型支持的中低档。长视频不一定一次生成成功,可以拆成多个短视频片段,后期再拼接。
8.3 模型加载失败和路径问题
模型加载失败,很大概率不是模型坏了,而是路径不对。ComfyUI对中文路径、空格、反斜杠相对敏感。下载的模型建议放在模型目录里,文件名保持简单英文。
有些整合包要求把模型放在特定文件夹,如果你放到别的位置,加载节点里就找不到。另外,模型和插件不是越多越好。装一大堆模型,不仅占磁盘,还会让ComfyUI启动变慢。实际项目用一个底模、一个角色LoRA、必需的ControlNet模块,通常就够了。
8.4 即梦生成结果不稳定怎么办
在线工具生成结果不稳定,大部分和提示词详细程度有关。如果只写“古装女子在庭院里”,每次结果当然不同。把环境、光线、镜头、服装、妆发全部写满,输出会更接近预期。
生成不满意时,先改提示词再重试。不要把同一句提示词反复刷,那是在赌概率,浪费时间。如果角色只在某几帧有轻微变化,可以用图生图或局部重绘修正。如果变化太大,就回到上一环节,换一张更稳定的参考图再来。
8.5 什么情况下该怀疑工作流本身
当一个工作流之前能跑,最近总是报错,先回想你改了什么:换了模型?更新了插件?调整了输入尺寸?把改动还原试试。
如果是从社区下载的工作流,先检查模型路径、节点版本、插件是否齐全。很多所谓打不开的工作流,只是缺了某个节点,安装后刷新页面就能解决。这也提醒你:从网上下载工作流文件后,不要直接硬套进自己的环境,先花几分钟确认依赖和模型路径,能省掉后面一堆排错时间。
AI短剧制作的整条链路到这里基本拆完了。我最深的感受是:这个方向入门不难,但想稳定产出,必须把分镜脚本、角色一致性、批量工程化和排查能力当成基本功来练。先跑通单条,再谈批量和整集。工具更新很快,工作流也会不停变化,但“先确认输入,再跑任务,再看日志,最后调参数”这套做事顺序,什么时候都用得上。
火山引擎视频云技术社区,是面向 AI 音视频开发者的技术交流平台。这里汇聚源自抖音、豆包等亿级 DAU 产品的 RTC、直播、点播、AI 媒体处理、音视频互动技术,提供接入指南、最佳实践、性能调优、场景案例、Demo 代码、开源项目、白皮书和 API 文档。社区汇聚官方工程师与一线开发者,为 AI 视频通话、数字人、AI 视频处理等应用的开发与落地提供技术支持。
更多推荐

所有评论(0)