上一篇文章我们梳理了 2026 年开源 AI 短剧工具的全景,很多读者问:工具那么多,到底该从哪里下手?答案其实很朴素——先别急着打开软件,先看清楚一条完整的内容从「文字」变成「视频」究竟要经过哪些环节。今天我们就用一篇文章,把 AI 短剧的生产流水线完整拆开,讲清楚每一个环节做什么、用什么工具、以及它们之间如何衔接。

一、核心概念:AI 短剧的「流水线」是什么
传统影视制作是一条重资产流水线:编剧、分镜师、原画、动画、配音、剪辑、调色、字幕,每一个岗位都需要专业人才。而 AI 短剧的流水线,本质上是把这条链条上的「人」替换成「模型 + 工作流」,用自动化串起每一步。
一条典型的 AI 短剧生产流水线,可以抽象为下面这几个阶段:
- 剧本阶段:用大语言模型生成或润色剧本,拆出对白、动作、场景。
- 分镜阶段:把剧本拆成一格格镜头,确定景别、运镜、角色、台词。
- 画面阶段:用文生图 / 图生图 / 视频生成工具产出每个镜头的画面或动态片段。
- 声音阶段:AI 配音、BGM、音效的生成与合成。
- 后期阶段:剪辑、字幕、转场、调色、封面。
- 发布阶段:多平台适配、标题封面、定时发布与数据复盘。
把这条流水线画成一张图,你可以用下面的 Mermaid 描述,方便放进团队文档或自己的知识库:
flowchart LR
A[剧本] --> B[分镜脚本]
B --> C[画面生成]
C --> D[配音与音效]
D --> E[剪辑与字幕]
E --> F[发布与复盘]
理解了这条链路,你就能明白为什么工具是「组合拳」而不是「单点神器」:没有任何一个工具能从头到尾包打天下,关键是让每一步的输出格式,能顺利成为下一步的输入。
二、逐环节拆解:每一步做什么、用什么工具
2.1 剧本:大模型是编剧
剧本是整条流水线的源头,质量直接决定成片上限。现在主流做法是用 Claude、GPT、DeepSeek 等大模型生成剧本,但直接让模型「写个短剧」往往得到的是小说式的文字,不利于后续分镜。正确的做法是给出结构化约束,强制输出「场次 + 镜头 + 对白 + 动作 + 情绪」的格式。
下面是一个能直接复用的 Prompt 模板,你可以保存为 script_prompt.txt:
你是一名短剧编剧。请根据以下主题创作一集 3 分钟的竖屏短剧剧本。
主题:{主题}
要求:
1. 输出 JSON 格式,字段为 scenes(数组)。
2. 每个 scene 包含:scene_id、location、time、summary。
3. 每个 scene 内含 shots(数组),每个 shot 包含:shot_id、shot_type(景别)、camera(运镜)、action、dialogue、emotion。
4. 对白口语化,单句不超过 20 字,冲突前置,每 15 秒一个反转。
5. 只输出 JSON,不要解释。
让模型输出结构化 JSON,是为了下一步分镜和画面生成时能直接解析,避免人工二次整理。这一步的输出,是后面所有环节的「合同」。
2.2 分镜:把文字翻译成镜头语言
剧本解决「讲什么」,分镜解决「怎么拍」。对于 AI 短剧,分镜脚本通常是一张表,每一行对应一个镜头,包含:镜头编号、景别(特写/中景/全景)、运镜(推/拉/摇/移)、画面描述、台词、时长、参考风格。
你可以用一段 Python 把剧本 JSON 转成分镜表格,方便人工检查:
import json
with open("script.json", encoding="utf-8") as f:
script = json.load(f)
for scene in script["scenes"]:
for shot in scene["shots"]:
row = f'{shot["shot_id"]} | {shot["shot_type"]} | {shot["camera"]} | {shot["action"]} | {shot["dialogue"]}'
print(row)
分镜脚本的价值在于「可执行」:画面描述要具体到人物、服装、场景、光线,这样喂给 ComfyUI、MiniMax H3 或 LTX 2.3 时,生成结果才会稳定。模糊的描述(比如「一个漂亮的女人」)是 AI 生成翻车的头号原因。
2.3 画面生成:三大平台的定位差异
画面阶段是整个流水线里工具最丰富的环节。结合上一篇的工具全景,这里给出三个主力的定位建议:
- ComfyUI:适合需要强控制的画面与视频生成,通过节点式工作流实现角色一致性、关键帧控制,学习成本高但天花板也高。
- MiniMax H3:全自动导演生成平台,适合「输入剧本直接出成片」的快速路线,控制力弱但产出效率极高。
- LTX 2.3:视频生成平台,擅长图生视频、动态镜头,适合把静态分镜图「动起来」并控制时长。
三者的选择不是「三选一」,而是「按镜头分配」:关键镜头用 ComfyUI 精修,量产镜头交给 MiniMax H3 与 LTX 2.3 批量生成,最后统一剪辑。
2.4 声音与后期:让画面开口说话
画面生成后,还需要 AI 配音(TTS)、BGM 与音效。配音要保证同一角色的声线一致,音效要贴合动作节奏。后期则用剪映或开源工具做剪辑、字幕与转场。
三、实战步骤:搭一套最小可用的流水线
如果你是第一次上手,建议按下面 6 步搭建一个「最小可用」版本,先跑通再优化:
- 准备剧本:用上面的 Prompt 模板生成一集结构化剧本,保存为 JSON。
- 生成分镜表:用 Python 脚本把 JSON 转成 Markdown 表格,逐行检查画面描述是否具体。
- 产出画面:先用 LTX 2.3 或 MiniMax H3 快速生成 3~5 个镜头试跑,确认风格方向。
- 关键镜头精修:对主角特写等关键镜头,用 ComfyUI 加 ControlNet / LoRA 保证一致性。
- 配音合成:用 TTS 工具给对白配音,导出分段音频,与画面时长对齐。
- 剪辑发布:在剪映中完成剪辑、字幕、BGM,按平台规格导出竖屏成片。
为了统一管理素材,建议用固定目录结构,下面是推荐的目录约定:
duanju-project/
├── script/ # 剧本与分镜
│ ├── script.json
│ └── storyboard.md
├── images/ # 分镜静态图
├── videos/ # 生成的视频片段
├── audio/ # 配音、BGM、音效
├── edit/ # 剪辑工程与成片
└── publish/ # 发布物料(封面、标题、文案)
规范目录看似小事,却能让你在批量生产时少掉 80% 的找文件时间。
四、常见问题
Q1:为什么我生成的画面和剧本对不上?
多半是分镜描述太模糊。把「主角生气」改成「女主角身穿红色风衣,眉头紧锁,握紧拳头,背景是夜晚街道」,生成命中率会显著提升。
Q2:三个工具都要装吗?
初期不必全装。先用 MiniMax H3 或 LTX 2.3 跑通全流程,等遇到一致性、控制力的瓶颈,再引入 ComfyUI 做精修。
Q3:结构化剧本 JSON 会不会限制创作?
不会。约束的是「输出格式」而非「创意」,创意仍然来自你的主题与设定。格式越规范,自动化程度越高。
Q4:流水线能全自动吗?
可以,但建议先「半自动」:人工审核分镜与关键镜头,其余环节自动。全自动容易在一致性上翻车。
五、总结
AI 短剧的生产,本质是一条「剧本 → 分镜 → 画面 → 声音 → 后期 → 发布」的流水线。每个环节都有对应的模型与工具,关键是让输出格式标准化、让环节之间无缝衔接。今天我们把这条流水线完整拆解了一遍,并给出一套最小可用的目录结构与脚本。下一篇文章,我们会进入落地的第一步——环境准备,聊聊本地 GPU、云 GPU 与工具选型,帮你把这条流水线真正跑起来。
下期预告:第 3 天《环境准备——本地 GPU、云 GPU 与工具选型指南》,我们不见不散。















暂无评论内容