最近做短视频内容的朋友群里,越来越多人在聊“AI漫剧”:一条几分钟的剧情动画,脚本、分镜、画面、配音、剪辑全用AI完成,成本可以压得很低,更新速度却快得惊人。我自己试着跑了一轮流程后发现,工具链的核心完全可以用豆包AI来承担,尤其是配合近期讨论度很高的“豆包Skill”机制,可以把一套漫剧生产流程固化下来,让新手也能按步骤出片。这篇教程就从完整实操角度,拆解从脚本到成片的全流程,重点会放在豆包Skill运用、新海诚风格的画面提示词写法、角色一致性和剪辑避坑这几个环节。
1. 为什么推荐用豆包做AI漫剧
1.1 AI漫剧到底是什么
AI漫剧并不是一个新物种,简单说就是用AI工具辅助生产“漫画动态剧”“短剧漫画”“动态漫”等内容。它和传统动画的区别在于:传统动画需要原画师逐帧绘制,AI漫剧则主要靠文本生成分镜、图像生成画面、语音合成配台词,再把静态画面通过剪辑和少量动态效果串成一条视频。
目前常见的AI漫剧形式有三种:
| 形式 | 画面风格 | 制作难度 | 更新速度 |
|---|---|---|---|
| 静态漫剧 | 漫画分镜+字幕+配音 | 较低 | 最快 |
| 动态漫剧 | 静态画面加轻微运镜、人物口型、粒子效果 | 中等 | 较快 |
| AI动画短剧 | 连续图生视频,接近动画效果 | 较高 | 较慢 |
对零基础或者刚开始尝试的人来说,建议从第一种和第二种入手。本文的实操流程也以这两种为落点,既能快速出片,又能在后续过渡到更复杂的图生视频流程。
1.2 豆包AI在漫剧生产中的定位
豆包AI本身是综合型AI助手,覆盖文本生成、图像理解、对话、翻译等能力。做漫剧时,它最大的价值不是某一个单点功能,而是能把“创意发散—脚本撰写—分镜拆解—提示词生成—内容审校”这条创作链全部承接住。
换句话说,传统流程里你需要来回切换好几个AI工具,在豆包里可以集中完成前期创作。再加上豆包App支持语音输入和语音合成,导演口述想法、生成台词、配音试听这些动作都能在一个工具里闭环。
这并不意味着所有步骤都必须在豆包一个产品里完成。漫剧生产一定会涉及专业剪辑、画面精修、批量素材管理,但作为核心创作引擎,豆包承担的是最重脑力劳动,这也是题目所说的“一个豆包搞定”的真正含义。
1.3 本文的实操路线
本文不是只讲概念,而是按照真实生产顺序推进:
- 先把豆包Skill和提示词环境准备好。
- 用豆包写故事脚本。
- 用豆包把脚本拆成分镜表格。
- 用豆包生成每个镜头的画面提示词,重点调出新海诚风格。
- 用豆包或配套工具生成画面、配音。
- 进入剪辑合成,输出完整漫剧。
- 最后补充常见报错排查和接单前的合规建议。
这条路线可以完整照做,也可以只摘取其中某一部分用于自己的项目。
2. 开工前需要准备什么
2.1 账号与基础工具
豆包AI目前最常见的入口是网页版和手机App,使用前先准备好以下基础条件:
- 豆包AI账号,手机号注册即可。
- 电脑端优先推荐使用网页版或PC客户端,因为写长提示词、复制分镜表格时,电脑效率更高。
- 剪辑软件:剪映、必剪、PR均可,新手优先推荐剪映,原因后续会解释。
- 配音工具:优先使用豆包自带的语音合成能力,或者剪映的“文本朗读”功能。
- 素材管理文件夹:按“01_脚本”“02_分镜”“03_画面”“04_配音”“05_成片”建好目录,避免后期素材混乱。
这里不写死具体版本,因为豆包客户端迭代很快。你在搜索栏看更新日志即可。多数情况下,保持默认版本就能完成本文流程。
2.2 理解豆包Skill是什么
豆包近期引入了Skill的概念,很多用户第一次看到时容易和“智能体”混淆。为了方便理解,可以把Skill理解成“内置到对话流程里的专用工作流插件”。
默认情况下,豆包是一个通用AI,你问什么它答什么。但漫剧创作这种任务,往往需要多个步骤,比如先生成脚本、再拆分镜、再写画面描述、再检查风格参数。这时如果每一轮都手动输入一堆重复指令,效率很低。Skill的作用就是把“我接下要做漫剧,请按固定流程处理”这套规则预先定义好,豆包会按照你写好的流程自动执行。
举一个通俗例子:你请一个助理帮忙做菜,普通对话模式是你一步一步告诉他“洗菜、切菜、热锅、倒油”。Skill模式则是你给他一份完整菜谱,他会自己按顺序执行,还在每个环节主动汇报结果。
当前豆包对Skill的开放形态可能随版本调整,有的入口叫“智能体”,有的已经开放“Skill”管理,有的可能放在实验室模块内。所以下面会提供两条路:如果你界面里已经有Skill入口,可以直接创建;如果暂时没看到,也提供手动把提示词粘贴进对话的兜底办法。
2.3 Skill和Agent的区别
这轮热词里很多人同时搜“skill”“agent”“skill和agent的区别”。简单区分一下:
| 维度 | Skill | Agent |
|---|---|---|
| 本质 | 带固定步骤和输出格式的能力包 | 能自主决策、多轮调用工具的执行体 |
| 交互方式 | 你调用它,它按流程处理当前任务 | 你给它目标,它自己规划并推进 |
| 功能边界 | 相对固定 | 相对开放 |
| 适合场景 | 重复性创作流程,比如漫剧分镜 | 需要多工具联动、自动决策的复杂任务 |
做漫剧时,两者可以结合起来:用Skill固定“分镜生成模板”,再用Agent在多轮对话里自动处理角色设定、风格校准、批量提示词生成。但对零基础用户,建议先从Skill入手,因为它输出更可控,不容易跑偏。
3. 用豆包Skill搭建漫剧工作流
3.1 怎么创建一个漫剧Skill
如果你使用的豆包版本已经开放Skill创建入口,通常流程是这样的:
- 进入Skill管理页面。
- 点击“新建Skill”或“创建技能”。
- 输入Skill名称,比如“AI漫剧分镜大师”。
- 在描述里写明用途,方便后续检索。
- 把核心提示词粘贴进对应的提示词编辑区。
- 保存后,在对话框选择对应Skill再开始对话。
如果没有Skill入口,就把同样的提示词直接粘贴到豆包对话框顶部,形成“长期对话设定”,效果类似。
创建Skill时要注意一点:提示词不要只写“你是一个漫剧导演”这种假大空的设定,要写清楚输出格式、字段含义、步骤顺序、禁止事项。
3.2 一个可复用的漫剧Skill提示词
下面给出一份可以直接复制使用的漫剧Skill提示词。它的设计目标是:当你输入一段剧情概要后,豆包能自动输出“故事梗概+人物设定+分镜表格+画面提示词建议”。
你是一位资深AI漫剧导演和分镜师。你的工作内容如下: 一、接到剧情概要后,按下面的步骤处理: 第一步:提炼故事梗概。不超过150字,说明主角、目标、冲突、结局。 第二步:设计主要人物。每个角色输出: - 角色名 - 性别/年龄段 - 性格关键词 - 外貌特征 - 典型服装 - 声音风格建议 第三步:生成完整分镜表格。表格必须包含这些列: - 镜头序号 - 画面内容 - 景别(远景/全景/中景/近景/特写) - 运镜描述 - 台词 - 音效/音乐建议 - 画面提示词(英文为佳) 二、画面提示词的固定结构: [主体角色描述],[动作/表情],[环境场景],[构图/景别],[光影氛围],[画风关键词],[质量词] 三、画风约束: 当用户提到“新海诚风格”时,在画面提示词中加入以下关键词: Makoto Shinkai style, anime background art, detailed sky, volumetric light, cinematic composition, vivid color grading, bokeh, clean linework, high detail 同时加入中文说明:画面强调大景深、天空云层层次、光影氛围、通透感。 四、禁止事项: - 不要输出与分镜无关的解说。 - 不要使用水印词、logo词、真实品牌词。 - 分镜数量默认8到12个,用户要求时再增减。使用方式很简单:把这段提示词粘贴进Skill,或直接粘贴到新对话中。然后在对话里输入你的剧本创意,豆包就会按照固定结构输出。
3.3 新海诚风格画面关键词库
新海诚风格是AI漫剧里很受欢迎的一种画风,特点是光影细腻、云层表现夸张、画面通透感强、色彩明亮中带层次。为了让豆包生成稳定的新海诚风格提示词,除了上面Skill里的默认词,你还可以准备一份关键词库,在需要时手动补充。
常用英文关键词参考:
Makoto Shinkai style anime background glowing clouds dramatic sky sunset afterglow soft bokeh lens flare high-saturation color detailed weather scene beautiful composition cinematic lighting clean line art high detail anime illustration常用中文关键词参考:
新海诚风格、动画背景、云层层次丰富、光影通透、色彩浓郁、电影感构图、景深虚化、逆光、空气感、细腻笔触、高细节动画插画这些词不建议一次性全部堆进去,而是根据画面内容选择5到8个组合。比如表现天空时强调“glowing clouds”“dramatic sky”,表现室内时强调“soft bokeh”“lens flare”“cinematic lighting”。
4. 实战第一步:从剧情脚本到分镜
4.1 用豆包生成故事脚本
假设我们要做一个2分钟左右、偏治愈系的新海诚风格漫剧。直接在对话里输入需求,比如:
请帮我写一个2分钟左右的AI漫剧故事,主题是“夏日重逢”,治愈系,新海诚画风。主角是一个离开小镇多年的男生,回到故乡寻找儿时玩伴。不要对话太多,重点在画面情绪。豆包返回的内容会包含分集或短片梗概。如果你觉得故事太平淡,可以继续追问:
故事要有转折,高潮部分加入一场夏日暴雨后的彩虹场景,让观众情绪被推到高点。这里有一个重要经验:AI生成的故事容易套路化,例如开头“清晨阳光洒下”、结尾“两人相视一笑”。作为创作者,你必须建立标准,主动干预。要敢于给AI限定“不要出现什么”,比只告诉它“要什么”更容易出彩。
4.2 把脚本拆成交互式分镜
获得故事梗概后,不需要手动拆分镜头,直接在对话里调用Skill,或者粘贴以下指令:
请把上面这个“夏日重逢”故事拆成12个镜头分镜,按你预设的表格格式输出。每个镜头保持80-120字的画面提示词,台词要口语化,能配合情绪。豆包会返回一份较完整的分镜表。这里建议你要求它导出成“Markdown表格”或“CSV格式”,方便粘贴到Excel进行二次整理。例如:
把分镜表格用Markdown格式输出,我后续复制到表格软件里整理。4.3 分镜表整理标准
拿到豆包输出的分镜后,不要直接拿去生成图片,你需要先做一遍“人类导演”的校验。重点检查以下内容:
- 逻辑是否连贯,镜头切换是否跳戏。
- 情绪是否递进,高潮有没有给足持续时间。
- 角色是否稳定,每个镜头里的服装、发型、外貌描述是否一致。
- 台词是否适合配音,太长的台词要拆分或删减。
如果出现角色设定前后矛盾,直接在对话里要求豆包修正:
第5镜和第8镜的女主角服装描述不一致,请统一为“浅蓝色连衣裙,白色帆布鞋,短发”。调整完成后,把分镜表复制到Excel或飞书表格中,作为后续制片的唯一依据。
5. 实战第二步:画面生成与角色一致性
5.1 为什么同一角色在不同镜里会变样
用AI生成漫剧画面时,最容易出现的困扰是“同一个角色上一张图一个样子,下一张图又变了”。这是因为AI文生图模型不具备默认的“角色身份记忆”能力,它每次生成都是独立的。
解决思路有几种:
- 锁定角色描述词:每个镜头的画面提示词里,人物外貌和服装必须保持一致。
- 先生成角色三视图:在正式画分镜前,先生成角色设定图,再把设定图作为参考图。
- 依赖豆包的多模态理解能力:上传一张角色参考图,让豆包基于这张图生成后续画面描述。
如果你的工具支持“图生图”或“垫图”,方法2会更稳定。
5.2 每个镜头画面提示词的写法模板
在豆包里填写画面提示词时,样式如下:
一个穿浅蓝色连衣裙的短发女生站在夏日的车站前,风吹起裙角,她抬头看天空,表情带着期待和紧张。场景是小镇旧车站,站台边有绿色邮筒,远处有山和积雨云。中景,轻微仰拍,画面通透,阳光从云层间隙洒下。 Keyword: Makoto Shinkai style, anime background, dramatic sky, glowing clouds, lens flare, cinematic lighting, high detail如果豆包能直接生成画面,就把这段文字交给豆包文生图功能。如果豆包只负责文本,你需要先复制这段提示词到专门的AI绘图工具里使用,同样也能出效果。
5.3 批量生成的效率技巧
AI漫剧镜头多,如果一帧一帧手动描述会非常累。你可以让豆包一次性输出所有镜头的提示词,形成“提示词批量包”。
在对话里输入:
把上面的12个分镜全部扩展为完整画面提示词,不要遗漏,按“镜头01、镜头02”的编号输出,每个提示词独立成段。人物外观描述必须完全一致,只允许环境、景别和情绪变化。得到批量提示词后,可以复制到表格里逐行执行生成。有些工具支持批量导入,你可以直接使用。如果工具不支持批量,建议从情绪点最饱满的高潮镜头开始生成,再补齐前后镜头,这样即便有偏差,后期调整成本也较低。
6. 实战第三步:配音、动态化和剪辑
6.1 用豆包生成配音
漫剧配音有两类做法:一是真人配音,适合需要强烈情绪表现力的作品;二是AI语音合成,适合快速出片和低成本项目。如果是零基础小白,建议先用AI配音练手。
在豆包对话里,你可以这样要求:
请为以下台词生成配音脚本文案,语气要符合漫剧情绪。我用语音合成工具朗读,所以请把每句台词控制在20字以内,并标注情绪关键词。 台词:我回来了。这么多年,我还是记得那个夏天。得到文案后,再用豆包的语音功能朗读,或者复制到剪映“文本朗读”中选择合适音色。注意:不同语音合成工具的连读、停顿、重音处理不一样,生成后一定要听三遍以上,发现AI味太重就换成自然音色,或手动加上断句。
6.2 画面动态化思路
如果只把静态图配上配音,视觉张力会偏弱。想要让漫剧更像“剧”,可以给画面加动态效果,常见手段有三种:
- 轻微运镜:在剪辑软件中用关键帧让静态图缓慢放大、平移,模拟推镜头和摇镜头。
- 环境动态:给画面加雨丝、光线变化、云层流动等效果。剪映有氛围动画效果可套用。
- AI图生视频:如果你使用的豆包版本或配套工具支持图生视频,可选择部分高潮镜头生成动态片段,注意力集中到关键场景,不需要全部动态化。
不建议一开始就把所有镜头都做成图生视频,一是耗时,二是容易破坏风格统一性。先用“静态图+关键帧运镜”把全片串起来,再用视频生成工具处理一两个高潮镜头,效果会更好。
6.3 漫画感剪辑:时间线、转场与节奏
剪辑时,我最推荐新手用剪映,原因是它内置大量适合剧情片的转场、字幕样式和音乐卡点功能,不必额外找素材。
导入素材后,按照分镜表顺序排入时间线,然后统一完成以下设置:
- 每张画面默认停留3到5秒,配音长的镜头可延长。
- 转场优先选“淡入淡出”“叠化”“轻微模糊”,不要用PPT感强烈的花式转场。
- 配音轨和字幕轨对齐,字幕可以整段粘贴后在时间线上手动拆分。
- BGM音量控制在人声之下,一般在20%到35%左右,避免掩盖台词。
- 全片节奏参考“开场平缓—中段推进—高潮爆发—结尾释然”的结构,高潮部分可以加快剪辑频率。
6.4 字幕、封面和导出设置
漫剧的字幕一般分两类:对话字幕和氛围字幕。对话字幕使用简体中文字体即可,建议字号大一点,放在画面下方三分之一处。氛围字幕用于表现角色内心独白或时间地点,可以配合新海诚风格使用带一点日系感的字体,但要注意版权。
导出的参数建议如下,具体可依据平台调整:
分辨率:1920x1080 或 1080x1920 帧率:30fps 格式:MP4 码率:较高,保证画面清晰 音频:48kHz,立体声如果发布到B站、抖音横屏,选1920x1080。如果发布到抖音、快手竖屏,选1080x1920,分镜构图也需要相应调整,建议在前期生成画面时就明确用横屏还是竖屏,避免后期裁坏构图。
7. 常见问题与排查思路
| 问题现象 | 常见原因 | 解决思路 |
|---|---|---|
| 豆包输出的分镜太抽象,没法直接生成画面 | 提示词里没有景别和画面结构 | 要求豆包按“主体+动作+环境+景别+光影+画风”格式重写 |
| 同一角色每张图都不一样 | 人物描述没有锁定固定关键词 | 建立角色卡,统一外貌、服装、发型词 |
| 新海诚风格不明显 | 风格关键词数量不足或和画面内容冲突 | 增加天空、光照、云层关键词,减少复杂场景元素 |
| 生成画面有文字乱码 | 提示词里包含了品牌词或logo干扰 | 删除品牌相关词,补上“no text, no logo” |
| 配音AI味太重 | 单句太短或标点不完整 | 手动拆分长句,补充逗号和省略号以控制停顿 |
| 剪辑后画面和配音不同步 | 没有按照分镜表逐帧对齐 | 以配音轨为基准,逐镜头对齐画面和字幕 |
| 发布到竖屏平台画面被裁 | 前期没确认横竖屏方向 | 前期锁定画幅比例,必要时对画面重新构图 |
如果你在操作中遇到同类报错,建议先排查提示词,再排查工具设置,因为多数问题都出在前期描述不够结构化。
8. 给打算接单的新手的建议
8.1 版权与合规红线
标题提到“学完即可接单”,这话有一定吸引力,但作为创作者,接单前必须先弄清楚版权边界:
- 你生成的AI漫剧如果商用,要确认所用AI工具服务条款是否明确允许商用。
- 配音音色如果用他人克隆音色,必须获得本人授权,无法确定来源就不要商用。
- 音乐、音效优先使用素材库内已授权内容,不要随便下载网络音乐。
- 剧本原创性要留底,尤其是客户定制单,建议清晰约定创作与授权范围。
- 若涉及真人形象、地标、品牌,要向客户确认素材授权。
合规不是阻碍,而是保护自己。一次版权纠纷足以抵消好几单收入。
8.2 接单前先做样片测试
我的建议是:在正式接单之前,先独自完成1到2条10分钟以内的完整漫剧作品,不一定要发布,但要跑完全流程。通过样片你才能知道:
- 自己完整做一个漫剧需要多少小时。
- 哪些环节最耗时。
- 豆包Skill能不能扛住长时间连续创作。
- 剪辑和配音的熟练度有没有达标。
只有跑过完整流程,报价才靠谱,不会出现“单子接了但交不了货”的问题。
8.3 持续优化的方向
AI工具更新很快,豆包Skill也在持续演进。想在这一行有长期竞争力,不要只依赖“会按按钮”,而是要逐渐建立以下能力:
- 提示词能力:能根据画面反馈快速调整风格。
- 脚本能力:能判断故事节奏、情绪转折是否成立。
- 审美能力:能区分“AI一眼假”和“有电影感”的差别。
- 项目管理能力:能并行处理多个订单,管理素材和时间节点。
把豆包当成你的创作搭档,而不是替代你思考的机器,这样才能做出有辨识度的作品。工具的差距会越来越小,真正拉开差距的,是对故事、画面和情绪的理解。
做漫剧这件事,最大的门槛从来不是工具。只要你认真跑一遍流程,把分镜模板、角色卡、风格关键词、剪辑节奏都整理成自己的素材库,后续每一部作品都会比上一部快很多。这篇教程里的方法和提示词都可以直接拿去用,也建议你边做边调整,把它变成真正适合自己创作习惯的流程。