第 2/60 天
引言
在 AI 漫剧制系列第一天的开篇中,我们确立了「AI 漫剧制」的概念——用 AI 工具生成漫画分镜、角色、背景,并最终合成动态漫剧。今天,我们进入实战第一站:工具选型。
市面上可用的 AI 图像生成工具众多,但并非所有工具都适合漫画制作。漫画对角色一致性、分镜构图、多格布局、对话框留白等有特殊要求。本文将从漫画制作的角度,对 Midjourney、DALL-E 3、Stable Diffusion、ComfyUI、Leonardo.ai 等主流工具做全方位对比,帮助你找到最适合的创作管线。
核心概念
漫画制作对 AI 工具的特殊要求
| 需求 | 说明 | 重要度 |
|---|---|---|
| 角色一致性 | 同一角色在多格分镜中保持面部、服装、体型一致 | ⭐⭐⭐⭐⭐ |
| 分镜构图 | 支持宽幅、竖幅、多格布局的生成 | ⭐⭐⭐⭐ |
| 局部重绘 | 修改画面局部而不影响整体 | ⭐⭐⭐⭐⭐ |
| 文字/气泡留白 | 画面预留对话框位置 | ⭐⭐⭐ |
| 批量生成 | 快速产出大量分镜素材 | ⭐⭐⭐⭐ |
| 风格控制 | 精确控制画风(漫画、写实、水墨等) | ⭐⭐⭐⭐⭐ |
工具分类图谱
AI漫画工具生态
├── 在线闭源(开箱即用)
│ ├── Midjourney — 艺术性最强,角色一致性弱
│ ├── DALL-E 3 — 理解力最强,风格可控性弱
│ └── Leonardo.ai — 功能最全面,免费额度充足
├── 开源本地(完全可控)
│ ├── Stable Diffusion — 生态最大,需手动调优
│ ├── ComfyUI + SDXL/Flux — 节点式工作流,适合管线化
│ └── Fooocus — SD 简化版,一键出图
└── 漫画专用(垂直领域)
├── AI Comic Factory (Hugging Face) — 全自动漫画生成
└── Clip Studio Paint + AI 插件 — 专业漫画+AI辅助
实战步骤
步骤 1:Midjourney — 快速产出高质量漫画分镜
Midjourney 在 V6 版本后对漫画风格有了显著提升。使用 --style raw 参数可以减少 AI 过度美化,更接近漫画质感。
示例 Prompt:
# Midjourney 漫画分镜 Prompt 模板
/imagine prompt:
manga panel, wide shot, young hero standing on rooftop at sunset,
city skyline background, dramatic lighting,
clean line art, cel shading, comic style,
--ar 16:9 --style raw --v 6
优点: 出图质量极高,风格化能力强
缺点: 角色一致性差,每张图角色长相会变;无法局部重绘;需 Discord 操作
步骤 2:DALL-E 3 — 最强 prompt 理解与构图
DALL-E 3 对复杂分镜描述的理解力是同类最强的。你可以用自然语言描述整页漫画布局。
示例 Prompt:
# DALL-E 3 漫画页 Prompt 示例
prompt = """
A comic book page with 4 panels:
Panel 1 (top left): Close-up of a detective examining a clue,
magnifying glass in hand, expression: focused.
Panel 2 (top right): Medium shot of the suspect,
nervous look, sweat drops, hands behind back.
Panel 3 (bottom left): Wide shot of the crime scene,
police tape, night, rain.
Panel 4 (bottom right): The detective points at the suspect,
dramatic reveal, "It was you all along!" in speech bubble.
Style: American comic book, bold lines, vibrant colors,
similar to Mike Mignola.
"""
优点: 多格布局理解最好;画面构图准确;文字渲染能力强
缺点: 输出分辨率固定(1024×1024);风格一致性不如 MJ;无法局部修改
步骤 3:Stable Diffusion — 完全可控的开源方案
Stable Diffusion 配合 ControlNet 和 LoRA 可以实现漫画制作中最关键的角色一致性。
安装依赖:
# 安装 ComfyUI(推荐)或 Stable Diffusion WebUI
# 以下为 WebUI 环境准备
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
cd stable-diffusion-webui
python -m venv venv
source venv/bin/activate
pip install -r requirements.txt
# 运行
python launch.py --listen --port 7860
使用 LoRA 保持角色一致:
# 角色 LoRA 训练配置(Kohya_ss)
# config.toml 关键参数
[training]
pretrained_model: "sd_xl_base_1.0.safetensors"
train_batch_size: 1
resolution: 1024
max_train_steps: 2000
learning_rate: 1e-4
[dataset]
# 使用 15-20 张角色多角度图
image_folder: "./character_refs"
caption_extension: ".txt"
优点: 完全本地运行;ControlNet 实现精确姿势/构图控制;LoRA 实现角色一致性
缺点: 需较高 GPU 显存(8GB+);学习曲线陡峭;需要手动调参
步骤 4:ComfyUI — 节点式漫画生产管线
ComfyUI 用节点图(Node Graph)构建生成管线,特别适合漫画这种需要多步骤串联的工作流。
一个典型的漫画分镜管线包含:
{
"workflow": "ComfyUI 漫画管线节点序列",
"nodes": [
{"id": 1, "type": "LoadCheckpoint", "model": "sd_xl_base.safetensors"},
{"id": 2, "type": "CLIPTextEncode", "prompt": "positive prompt"},
{"id": 3, "type": "CLIPTextEncode", "prompt": "negative prompt"},
{"id": 4, "type": "ControlNetLoader", "cn_model": "canny"},
{"id": 5, "type": "ControlNetApply", "image": "pose_reference.png"},
{"id": 6, "type": "KSampler", "steps": 30, "cfg": 7.5},
{"id": 7, "type": "VAEDecode"},
{"id": 8, "type": "SaveImage"}
],
"edges": [
"1→6", "2→6", "3→6",
"4→5", "5→6",
"6→7", "7→8"
]
}
关键节点说明:
| 节点 | 作用 | 漫画场景用途 |
|---|---|---|
| ControlNet (Canny) | 边缘检测控制 | 保持分镜草稿构图 |
| ControlNet (OpenPose) | 姿态控制 | 指定角色姿势 |
| LoRA Stack | 加载角色 LoRA | 保持角色面部一致 |
| IP-Adapter | 图像风格参考 | 保持全篇画风统一 |
| Detailer | 面部修复 | 放大后修复面部细节 |
步骤 5:Leonardo.ai — 全功能在线平台
Leonardo.ai 提供了在线版的 SD 体验,内置了 ControlNet、图像生成、画布编辑等功能,适合不想本地部署的用户。
核心功能:
- Image Generation:基于 SDXL 的在线生成
- Canvas Editor:内嵌画布编辑,支持局部重绘
- Real-Time Generation:实时绘画,边画边生成
- Elements:社区风格的 LoRA 市场
- Batch Generation:批量生成,适合漫画素材生产
步骤 6:AI Comic Factory — 一键生成整页漫画
Hugging Face 上的 AI Comic Factory 是少数专门为漫画设计的 AI 工具。你只需描述故事,它会自动生成多格漫画页。
优点: 专为漫画设计;自动分格;自动生成对话框
缺点: 角色一致性弱;分辨率有限;风格选择较少
常见问题
Q1:如何解决角色一致性?
这是 AI 漫画制作最大的痛点。推荐方案优先级:
- Stable Diffusion + LoRA(最佳方案):训练一个角色 LoRA,在不同分镜中统一调用
- Midjourney + 垫图:用同一张角色图作为参考图(
--image参数),但效果不稳定 - DALL-E 3 + 详细描述:每次描述相同的外貌特征,但一致性最差
- ComfyUI + IP-Adapter:用参考图控制风格和角色特征
Q2:不同工具的成本对比?
| 工具 | 价格 | 单次生成成本 | 显存/GPU需求 |
|---|---|---|---|
| Midjourney | $10-60/月 | ~$0.05/张 | 无需本地 GPU |
| DALL-E 3 | 按量付费 | ~$0.04/张 | 无需本地 GPU |
| Leonardo.ai | 免费/付费 | 免费 150 代币/天 | 无需本地 GPU |
| SD WebUI | 免费开源 | 电费 | 8GB+ VRAM |
| ComfyUI | 免费开源 | 电费 | 8GB+ VRAM |
| AI Comic Factory | 免费 | 免费(有排队) | 无需本地 GPU |
Q3:我的 GPU 只有 6GB 显存,能跑 SD 吗?
可以。推荐优化方案:
# 低显存优化启动参数(SD WebUI)
python launch.py
--medvram
--opt-split-attention
--no-half-vae
--precision full
--upcast-sampling
# ComfyUI 低显存模式
# 在启动时使用 --lowvram 参数
python main.py --lowvram --force-fp16
Q4:AI 生成的漫画有版权吗?
- Midjourney:付费用户拥有商业使用权
- DALL-E 3:生成的图像归用户所有
- Stable Diffusion:开源模型,生成的图像无版权限制
- 重要提示:使用他人风格 LoRA 或特定艺术家 prompt 时,需注意版权风险
Q5:输出分辨率太低,如何放大?
# 使用 Real-ESRGAN 放大
pip install realesrgan
python -c "
from realesrgan import RealESRGANer
from basicsr.archs.rrdbnet_arch import RRDBNet
# 加载模型并放大
model = RRDBNet(num_in_ch=3, num_out_ch=3, num_feat=64, num_block=23)
upsampler = RealESRGANer(scale=4, model_path='RealESRGAN_x4plus.pth')
# 输出 4x 分辨率漫画图
"
总结
经过今天的全景对比,我们可以得出工具选型指导原则:
| 用户类型 | 推荐工具组合 | 理由 |
|---|---|---|
| 新手快速入门 | Leonardo.ai + Midjourney | 零配置,开箱即用 |
| 专业漫画创作者 | ComfyUI + SDXL + LoRA | 完全可控,管线化生产 |
| 预算有限的个人 | Stable Diffusion WebUI | 免费开源,社区资源丰富 |
| 快速原型验证 | DALL-E 3 + AI Comic Factory | 理解力强,一键出整页 |
明日的预告:第 3 天 —— 我们将深入 Stable Diffusion,从零搭建一个完整的漫画角色生成工作流,包括 LoRA 训练、ControlNet 姿势控制、以及批量分镜生成。你会看到如何用代码把角色 LoRA 串联成一个自动化的漫画素材生产线。
第 2 天完成 ✅ | 明日继续:AI 漫剧制第 3 天 —— SD 漫画角色工作流搭建















暂无评论内容