☰
AI漫剧批量分镜实战:角色库+模板化工作流全记录
2026/9/30 18:39:35 网站建设 项目流程

做AI漫剧批量分镜这件事,我一开始是真没当回事。直到接了一个需要在两周内出完全部镜头脚本的漫剧项目,单张图的生成速度完全跟不上,角色脸一换场景就崩,光修角色一致性就废了两个通宵,我才意识到:没有角色库和模板化的工作流,AI漫剧分镜根本撑不起"批量"这两个字。这篇文章把我从选题到落地的完整7天流程记录整理出来,里面包括角色库怎么搭、分镜模板怎么设计、批量生成时怎么控制质量,适合正在做AI漫剧、AI短剧分镜或者想搭建AI工作流的朋友参考,照着走能少踩不少坑。

1. 漫剧分镜为什么必须"批量+角色库"一起解决

先给没做过漫剧的朋友说下背景。漫剧和传统动画、漫画都不一样,它是按短视频的逻辑来做的:一集45到90秒,镜头切得很快,基本3到8秒就是一个分镜,一集下来少说25个分镜,多的能到60个。如果一季有30集,那分镜数量就是一千张起步。这个量级下,一张一张找参考图、手动改提示词、再一张张精修,人力根本扛不住。

而AI漫剧分镜真正的痛点还不是量,是"人的一致性"。你单张生成一个角色,哪怕描述词写得再详细,AI每次生成的五官、发型、服装细节都会漂移。脸还是那张脸,但看着就是不像同一个人。更要命的是镜头一换场景,光一换,风格跟着跑,整个漫剧的观感碎成渣。所以批量分镜的前提,一定是要把"角色"和"镜头"都变成可复用的标准化资产。

我的解决方案概括起来就两个东西:角色库和模板化。

  • 角色库:把主角、配角、路人甲的脸和造型固化下来,生成任何分镜时都能稳定调用,解决"画的是谁"的问题。
  • 模板化:把分镜的类型、景别、机位、情绪、构图拆成一套固定参数,每次只需要替换角色和文案,解决"镜头怎么拍"的问题。

这两件事合在一起,才真正把AI分镜从"抽卡式生产"变成了"装配式生产"。接下来我把每一步具体怎么落地讲清楚。

2. 角色库搭建:锁定一张脸的完整操作链

角色库不是多训练几个LoRA那么简单,它是一套"选型—出图—训练—验证"的闭环。我用的工具是Stable Diffusion WebUI加LoRA训练,如果你用的是即梦、可灵这类在线平台,逻辑也是一样的,只是训练入口不同。

2.1 先用角色设定卡把特征定死

很多人在训练角色库之前就没想清楚角色长什么样,拿几张网图就开始训练,出来的LoRA自然四不像。我的做法是先做角色设定卡,把关键特征列成表格,所有训练素材和提示词都以这张卡为准。

特征项主角设定示例
性别/年龄女,22岁
发型黑色长直发,刘海偏右
瞳色深棕色
服装白色短袖T恤+深灰工装裤
配饰银色小圆耳环
性格关键词冷静、略带疏离感

这张卡的用途有两个:一是约束AI不要自由发挥,二是约束你自己后面在提示词里写的角色描述。一旦设定卡定了,提示词里就不要动不动加"red hair""blonde"这类冲突词,否则训练再好的LoRA也会被带偏。

2.2 训练素材的采集质量远大于数量

训练LoRA最常见的翻车点是用20张正面大头照就开始训。这样出来的模型正面像,侧面一塌糊涂,全身镜头更是惨不忍睹。我的素材标准是:

  • 数量:30到50张为宜,太少了特征学不够,太多了训练时间翻倍但收益递减。
  • 角度:正面、左右侧面、四分之三侧都得有,最好包含几张背面,保证转头不崩。
  • 景别:大头照10张、半身照10张、全身照10张,避免AI只记得一张脸。
  • 光线:至少包含室内暖光、室外日光、夜晚冷光三组,不然换光就变人。
  • 表情:平静、微笑、皱眉各几张,但表情幅度别太大,否则AI会把表情当成脸的一部分。

取材完成后,我会统一裁剪到512×512附近,并做一次同尺寸预处理,避免画面比例混乱影响训练。

2.3 训练参数的实践经验

我训练用的是kohya的LoRA方案,底模方面中文漫剧风格我用的是国风或二次元底模,欧美写实风格则换对应的写实底模。参数上没有绝对唯一的标准,但我把一批跑下来相对稳定的参数表放在这里:

参数推荐值说明
分辨率512×512先低分辨率训练,出图再高清放大
训练步数1500到2000步步数太多容易过拟合,太少特征学不到位
Epoch8到10搭配步数控制,不用单独拉满
学习率1e-4左右太高容易过拟合,太低学不进去
触发词角色名拼音,如xiaoya建议用无歧义的词组,不要用常见英文名

训练完成后一定要做验证,而不是只看损失曲线。我会固定写一组提示词,分别出正面、侧面、全身、不同光线下的图,和角色设定卡做对比。如果侧面像换了一个人,说明训练素材里侧面占比太低;如果所有图都像同一个模板脸,说明学习率太高过拟合了。

2.4 多个角色进同一个镜头怎么处理

实际漫剧里经常两个角色同框对话。这里有个经验之谈:不要训练一个含两个角色的混合LoRA,也不要指望单一描述词就能控制双人。正确做法是为每个角色单独训练LoRA,然后在生成同框画面时,在提示词里同时指定两个触发词,配合负面提示词排除串脸。

例子:

Prompt: xiaoya and awei, two people talking face to face, xiaoya with white t-shirt, awei with black jacket, medium shot, cafe background, soft daylight Negative prompt: extra fingers, deformed hands, duplicate faces, so close, bad anatomy

同框图最容易出现的问题是"一张脸融合成两个人",或者一个角色忽然变成另一个角色的长相。遇到这种情况,不要反复抽卡,直接改用局部重绘,把崩掉的头部区域单独重绘,并锁定另一个角色的区域。

3. 模板化分镜:把叙事语言翻译成AI参数

角色库解决的是"谁",模板化解决的是"怎么拍"。模板化的本质,是把过去靠感觉写的提示词,拆成一套结构化、可批量填充的参数骨架。

3.1 分镜表是模板化的地基

批量分镜不是AI自动生成一切,而是"人做决策+AI做执行"。我每次开工前会先做一个分镜表,哪怕只是简陋的Excel,也比直接让AI乱写强一百倍。分镜表至少要有这些列:

镜号景别机位角色动作/状态情绪环境/背景台词/字幕备注

举个例子,一个典型的第7镜:

  • 镜号:07
  • 景别:中景
  • 机位:平视
  • 角色:小雅(主角)
  • 动作/状态:站在窗边回头
  • 情绪:悲伤
  • 环境/背景:傍晚的教室,夕阳从窗户照进来
  • 台词/字幕:"我可能不会回来了。"

这张表本身就是分镜脚本,也是后面批量生成的输入数据。模板化的第一个收获,是让你在还没生成一张图的时候,就已经完成了整个故事的镜头语言设计。

3.2 镜头模板的四大件

镜头模板我总结为四大件:角色占位符、景别描述词、动作/情绪描述词、环境统一词。其中环境统一词特别容易被人忽略。

以"07"镜为例,拆开来看:

  • 角色占位符:{character},批量填充为触发的LoRA词加服装描述。
  • 景别描述词:medium shot, waist-up framing,决定构图范围。
  • 动作/情绪描述词:turn head toward window, sad expression, quiet sorrow。
  • 环境统一词:sunset light through window, empty classroom, warm orange tone。

环境统一词的意义在于,全剧如果是在"傍晚的教室"背景下,你必须让每一张出现这个场景的分镜都包含同一组环境词,否则AI会自由发挥把教室变成仓库、把夕阳变成霓虹灯。我的习惯是把"固定场景词"单独存一个清单,任何分镜用到该场景就整段复制进去。

3.3 把分镜表变成批量生成脚本

有了分镜表和镜头模板,批量生成就顺理成章了。我实际用的是WebUI的提示词组合方式,配合脚本或者用Python读取分镜表的Excel,批量生成对应的提示词文本。大致结构长这样:

# 伪代码示意,实际工具不限 for row in storyboard_rows: prompt = f"{row['character']}, {row['shot_type']}, {row['action']}, {row['environment']}, {quality_tags}" seed = row['seed'] if row['seed'] else random_seed() negative = f"{base_negative}, {row['special_negative']}" # 调用Stable Diffusion接口生成

这里的quality_tags也是模板的一部分,统一追加高分词,比如best quality, highly detailed, clean lineart, subtle shading。批量生成不等于把提示词拼接完就撒手不管,还有一个非常关键的环节是种子管理:同一个分镜如果要做多张备选,记住每张的seed,后续重抽风或者扩展构图时,才能只改局部而不让整体完全失控。

3.4 模板库的迭代比模板本身更重要

第一次做模板时别指望一次就完美。我建议每个项目跑完都回填一次模板库:哪些景别词效果好、哪些环境词总出异常、哪些情绪描述容易被AI理解反了。比如"平静"如果直接翻译成calm,很多模型会直接给一张面无表情的死鱼脸;加一个slight gentle smile效果就完全不同。这些经验不沉淀下来,下一部漫剧还要重新踩坑。

4. 七天流程全记录:从设定稿到第一批成片

下面是我实际跑过的一条7天完整流程,目标是一部30集漫剧的其中一集,分镜数38个。整体节奏我砍掉了所有犹豫环节,每天都有明确的交付物。

4.1 Day1:剧本拆分与分镜表初稿

第1天不做任何生成,只做策划。把剧本按场拆成段落,再从段落拆到单独的镜头,填入分镜表。这一步很多人嫌慢,但恰恰是最不能省的。我的经验是:如果一集剧本需要25个分镜,那么第一天至少要排出35行分镜草稿,多出的10行为后续删减留余量。

同时这一天要确定画风方向:是日系、国风、韩漫、还是写实风。这个决定直接影响底模选型。我当时的参考观众是下沉短视频平台,最终选了国风厚涂,底模用了一个国产优秀大模型加配套LoRA。画风定完,不要随便再换,不然后面所有角色库都要重训。

4.2 Day2:角色库训练与基础验证

第二天集中精力训练主角和重要配角的LoRA。主力角色先训,配角如果有5个以上,建议先只训戏份最重的2个,其余用通用型角色词硬撑,不然一天时间根本不够。

训练步骤参考上一章参数表。跑完验证后,我会额外做一个"情绪测试":用同一个角色LoRA生成开心、愤怒、悲伤、惊讶四个表情,确认五官没有崩。这一步的目的不是看谁更美,而是确认LoRA对表情的包容度足够,否则后面表演戏码全都会变成换脸灾难。

4.3 Day3:风格基底测试与镜头模板初版

第三天是承上启下的一天。先用主角LoRA生成几张全剧标志性场景的测试图,确认画风统一。这里有个容易被忽略的事:同一个底模配上不同环境词,出来的色感有时差异巨大,昼夜场景甚至会像两部剧。

所以我建议先列出全剧出现的主要场景清单,比如教室、便利店、天桥、夜晚的街道,然后用统一的角色和"镜头模板V0.1"各生成3张测试图,肉眼检查风格漂移。如果日景和夜景色温差太多,就在环境统一词里加上consistent color grading,或者干脆用固定色调的后期滤镜来兜底。

4.4 Day4:批量生成第一批分镜

第四天开始动真格。把分镜表导入批量脚本,每个分镜按"主选outcome+备选outcome"的机制生成。我一般每个分镜出3到4张备选,而不是只出1张就进下一步。

批量生成的提示词统一从分镜表映射,角色字段替换成角色LoRA触发词,场景字段替换成环境统一词。38个分镜一轮跑下来,按每张8到15秒的生成速度,大约1到2个小时就能出完第一批。这里真正费时间的不是生成,而是筛选:从三四倍数量里挑出"构图可用、脸不崩、手不废"的图。

4.5 Day5:一致性筛选与结构修复

第五天做的是"差评"工作。把昨天挑出来的图逐张对照分镜表检查,重点关注三件事:

  1. 角色是否与设定卡一致,尤其是侧面和远景下。
  2. 场景是否有明显穿帮,比如教室窗外出现现代建筑。
  3. 人物的手、脚、道具和嘴部是否有变形。

发现问题的图,不要急着删除重跑,先用修复方案处理。如果是脸崩但构图好,就局部重绘;如果是整张歪掉,直接用同一个seed重新生成;如果只是手残,就裁剪特写重做。修复后要把"修复手法"记录下来,方便形成批量修复规则。

4.6 Day6:细化与高清化

分镜图到这一步已经能用,但直接放进成片里清晰度不够。第六天做统一的高清放大。我用的是高清放大加轻度重绘的组合,放大倍率1.5到2倍,重绘幅度控制在0.2以下,避免细节被改掉。

同时在第六天把分镜图按"镜头序列"重新命名归档,后续配音、动效、字幕都要依赖这个顺序。我的命名规则是第01集_镜07_景别_状态,这样导入剪辑软件后能一眼定位镜头。

4.7 Day7:模板复盘与素材归档

第七天不安排新任务,专门做复盘和归档。把这一集实际用到的每个角色LoRA、环境统一词、镜头模板、批量脚本、种子记录全部归档到项目文件夹。更重要的是把"无效模板"也记下来,比如哪些提示词生成效果差、哪些参数组合反复翻车,避免下个7天流程重蹈覆辙。

5. 批量生成中最容易翻车的三个环节及对策

批量流程跑起来之后,真正折磨人的不是"生成慢",而是"不知道哪里会突然翻车"。下面这三个坑我几乎每个项目都会遇到,写出来给大家避雷。

5.1 角色串脸与表情僵化

批量生成多角色场景时,经常出现角色A的脸突然长成了角色B。尤其是两个角色都用了LoRA的情况下,AI很容易把特征混在一起。我的对策是:

  • 同框时把两个触发词分开放在句首,并明确归属,比如xiaoya, awei is behind her。
  • 如果串脸只发生在脸局部,用局部重绘单独修脸。
  • 表情僵化的根源通常是训练素材里情绪样本太少,回头补一些夸张表情的素材重新训LoRA。

5.2 场景描述"记忆漂移"

同一个场景词在不同的分镜之间,AI理解的背景常常不一样。前一个镜头教室里有三排课桌,后一个镜头突然变成了空房间。这个问题的根源在于:环境统一词写得不够细,AI抓不住"同一个场景"的所有必要元素。

我的做法是把每个固定场景的关键元素做成固定后缀,比如教室场景统一用:

scene: empty classroom after school, wooden desks in rows, blackboard with math notes, sunset sunlight through windows, dust floating in light

每次用到这个场景,这段词一字不改地复制。宁可描述冗长一点,也不给AI自由发挥的空间。

5.3 批量生成后的"自选式过拟合"

还有一个很多人没意识到的坑:批量生成挑图时,人会不自觉地只挑好看的图,而忽略了分镜本身的叙事要求。比如分镜表写的是"女主在雨中低头走",备选区里有一张阳光灿烂下微笑的"美图",就走不动道了。这会直接导致整段叙事情绪断裂。

所以在Day4的筛图环节,我给自己定了一条硬规则:每个分镜的筛选必须回到分镜表,先确认"情绪、动作、环境"三项是否匹配,再考虑"美不美"。不匹配的图,再好看也一律放弃。

6. 一些失败尝试和最终保留的经验

最后把我在这个流程里尝试过、也放弃过的方案写一下。这些弯路不值当再走一遍。

第一个放弃的是"纯自动批量生成",也就是不提前做分镜表,直接让脚本按剧本自动抽图。出来的一百多张图单看还行,串在一起故事完全断掉,因为AI分不清哪些镜头是因果、哪些是情绪铺垫。分镜表的"人脑决策"功能,AI暂时替代不了。

第二个放弃的是"不用角色库,全靠提示词描述脸"。这个方案在小红书图文里能糊弄,但在漫剧这种连续叙事里根本撑不住。第3个镜头和第28个镜头的同一个人,放在一起对比,观众直接出戏。角色的稳定性只能靠模型级的角色库解决,提示词只是辅助。

第三个放弃的是"过度训练"。我曾经把一个角色LoRA训到3000步,结果任何表情下那张脸都像一个蜡像,耳环、项链这些配饰反被学成了固定面部特征。这让我深刻体会到:LoRA不是越训越像,而是要在"像"和"变"之间找到平衡。

最后保留下来最值钱的经验就三条:分镜表永远在人脑里先完成,角色库和镜头模板必须分开迭代,每一轮的seed和提示词都要归档。这三条看着不起眼,但真正决定了一个AI漫剧项目能不能持续规模产出。我的7天流程跑完后,第二集、第三集的分镜生成时间直接压缩到3天出头,而且质量还更稳定。这个系统的威力,只有在连续复用的时候才能真正体现出来。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询