AI 短剧分镜的最后一公里:shuohao-skills novel-storyboard 的段/分镜/分镜图三层结构与 H3 提示词逐字对账深度拆解
【免费下载链接】shuohao-skillsAI 短剧制作的 skill 集合:拆角色、排大纲、出场景与道具设定、写剧本、切分镜 | Agent skills for AI short-drama production — character bibles, adaptation outlines, art bibles, screenplays, storyboards. Runs in Claude Code & codex.项目地址: https://gitcode.com/gh_mirrors/sh/shuohao-skills
shuohao-skills是一套面向 AI 短剧制作的 Agent skill 集合,其中的novel-storyboard(AI 短剧分镜工具)负责整条管线的"最后一公里":把剧本里的节拍流,切成可以直接下单给视频模型的生成任务——分几段、每段切几个镜、每个镜头挂哪张关键帧、提示词里每一秒该写什么,全部结构化落盘,并用 16 道质量门逐字对账,保证分镜、秒数和提示词三者永远一致。
为什么"最后一公里"最难?
AI 短剧管线的逻辑很直白:小说原文 → 改编大纲 → 角色/场景/剧本三线收敛 → 分镜 → 批量生成。前面每一步都在做"内容决定",而分镜是第一个直接面对视频模型的层——它不再创作,只把已经定下的戏翻译成模型听得懂、且不会自己"发挥"的指令。
难就难在两点:
- 镜头是生成出来的,多切一镜成本几乎为零。传统分镜心疼镜头数,AI 分镜的唯一上限是视频模型单段生成时长(默认 15 秒);
- 文字描述和画面会漂移。改了分镜秒数忘了改提示词、台词和画面对不上、声景还是旧动作——这类"漂移"靠模型自觉根本管不住。
novel-storyboard 的答案是:结构即对账。所有时间都写在storyboard.json里,提示词里能推导的部分必须由脚本推导,validate 逐字比对,漂一个字当场拦下。
三层结构拆解:段、分镜、分镜图
整个结构只有三层,层层对应一次实际的生成动作:
| 层级 | 是什么 | 硬约束 |
|---|---|---|
| 段 segment | 一次视频生成调用 | ≤15 秒(maxSegmentSeconds),不跨场次——换景必开新段 |
| 分镜 cut | 段内的一次剪切 | 每切 2–5 秒(硬门),各自认领剧本节拍,带景别、运镜 |
| 分镜图 | 每切一张 16:9 关键帧 | 第 1 切是主分镜图钉 0.00 秒,其余子分镜图各钉自己的切点 |
三个关键设计值得新手特别注意:
- 镜头认领节拍。每个分镜声明
beats:[起,止],认领剧本某场的连续节拍,不许跨场。这让"剧本改了一处"变成可机械对账的事件:重跑 validate,失效的镜头被当场点名,而不是成片时才发现戏丢了。 - 对话正反打在一段里一次生成。问话人的近景、答话人的近景、全景,各是一个 2–5 秒分镜,每格构图由自己的分镜图控制——不靠文字赌画面。
- 段号就是素材文件名。
E01-01格式的段号直接对应E01-01.mp4、E01-01-f1.png,从分镜到成片素材,命名零翻译。
结构定义见 references/schema.md,工作流完整步骤在 SKILL.md。
H3 提示词:对齐指令是"推导"出来的,不是"写"出来的
每段配一条 MiniMax H3 视频提示词(h3Prompt),采用官方 I2VA 多图对齐结构,由四部分组成:
首行对齐指令(多张分镜图各钉在哪个秒数) integrated_multimodal_description: 每个 [Shot k] 独立一行 overall_soundscape: 环境声与动作声 non_diegetic_music: 配乐(没有就 N/A)真正的设计精髓在这两条"逐字对账"门上:
- 首行对齐指令整行由分镜结构推导。多分镜的段,每张图钉在"前面分镜秒数的累计"上——
Picture 2 aligns with the 3.00-second mark…里的 3.00 不是人写的,是分镜秒数算出来的; - 每个
[Shot k](k≥2)必须带切点时刻At 00:0X.XXX,,且严格等于累计秒数。改了一切的秒数忘改提示词?validate 当场拦截。
台词处理同样严格:认领节拍的每句台词逐字进<d>[Chinese] …</d>块,改一个标点都过不去;而声景是"动作指令"——声景里写"铜铃在撞击时炸响",视频就真会把撞击演出来,所以画面动作一改,描述、声景必须同步改。完整写法规范已内化为 references/h3-prompt.md,不依赖任何外部 skill;切镜的节奏感与常见病对照表(舞台剧病、秒数漂移、台词爆仓等)在 references/storyboard-pass.md。
想看真实样例,examples/渡口-storyboard.json 是《渡口》第 1 集完整分镜:10 段 34 切认领全部 35 拍,平均 3.5 秒一切,共 119 秒 / 目标 120 秒,每段都带完整 H3 提示词。
分镜图是"资产合成",不是凭空画
分镜图这一步最容易踩坑。novel-storyboard 的态度是:场景、角色、道具长什么样,已经由上游 novel-art / novel-characters 的设定图定死了,分镜图只负责把资产按这一格的构图摆进同一帧。因此出图时参考图是"命根子":
- 场景设定图(该段场景 + 光照状态)——必挂
- 画内每个角色的设定图——有几个挂几个
- 画面里出现的大资产(船、马车)也要挂它自己的设定图——不挂就是每帧发明一条新船
- 提示词必须写明人物此刻的位置状态(已上船 / 在舱内)——只写构图不写状态,模型会把上了船的人画回岸上
出图走 codex 内置$imagegen,一镜一次调用、绝不批量,每段一个文件夹E01-01/f1..fN.png。没有 codex 就整步跳过,只交提示词,报告显示占位"不装有"。调用契约与踩坑记录见 references/frame.md。
从校验到投产:一条命令走完
全部流程由零依赖脚本 scripts/novel-storyboard.mjs 驱动,只需 Node ≥18,不需要 npm install、不需要任何 API key:
- seed:从
script.json确定性展开每场节拍清单(每拍秒数是算出来的,不让模型重新估)当切镜底稿; - validate:16 道质量门全部代码化——节拍全覆盖、段 ≤15 秒、每切 2–5 秒、台词装得下、同框 ≤3 人、H3 对齐指令逐字对账、台词逐字进
<d>块、提示词语言一致等。有违规逐条修,改完重跑到通过; - render:输出 Markdown + 单页评审报告
storyboard-report.html,含 KPI 带、分镜节奏带(片宽 = 时长占比、颜色深浅 = 景别远近)、生成批次单、配音对齐单,双击即开、离线可用; - export:一键导出 H3 投产包——每段一个文件夹,分镜图 +
prompt.md同住,根部manifest.json带 Picture 序图清单与切点时刻表,一个段文件夹 = 一次 H3 生成的全部材料。
16 道门每一道在 scripts/selftest.mjs 里都有击穿用例(191 项断言,不调模型、不花额度、1 秒跑完),证明门真的会拦。
上手门槛与适用人群
novel-storyboard 适合已经写好剧本、准备进入视频生成阶段的 AI 短剧创作者与团队:硬前提是script.json(分镜离开剧本没有意义),上游的outline.json、cast.json、art.json按有则用——能让提示词人名检查生效、报告里显示真实人名场景名、批次单嵌入场景设定图。仓库通过 scripts/install.sh 一条命令安装,Claude Code 和 codex 都能跑;需要 clone 时地址为https://gitcode.com/gh_mirrors/sh/shuohao-skills。
一句话总结:AI 短剧分镜的最后一公里,拼的不是创意而是确定性——三层结构把"怎么拍"钉死在 JSON 里,逐字对账把提示词和秒数锁成一体,剩下的,交给视频模型生成。
【免费下载链接】shuohao-skillsAI 短剧制作的 skill 集合:拆角色、排大纲、出场景与道具设定、写剧本、切分镜 | Agent skills for AI short-drama production — character bibles, adaptation outlines, art bibles, screenplays, storyboards. Runs in Claude Code & codex.项目地址: https://gitcode.com/gh_mirrors/sh/shuohao-skills
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考