做历史故事类的短视频,你大概率遇到过这种尴尬:想好了一个题材,比如“草船借箭”,但写到一半卡壳,不知道那句旁白该配什么画面;或者脚本终于写完了,剪视频时才发现配音、字幕、分镜、背景音乐全部要对齐,一个片子磨到后半夜才勉强出来,第二天再一看,质感还不行。后来我把整套流程搬进了Coze工作流,输入一个主题就能直接产出一套“可以直接拿去生成视频”的物料包:故事脚本、分镜表、画面提示词、旁白配音词、配乐建议一次性全部给齐。这篇文章就把这套工作流的搭建思路、提示词细节和实测踩坑记录完整拆出来,适合短视频运营、自媒体创作者,以及所有想把AI视频生产流程化的玩家。
1. 为什么用Coze做历史故事视频:先想清楚的3件事
1.1 Coze工作流到底管哪一段
先说个容易误解的点,Coze工作流本身并不直接生成视频。它不能替代可灵、即梦、Vidu这类视频生成工具,但它能帮你把“创意到素材”这一段最难但最重复的脑力活全部自动化。
我之前试过纯手工模式:先在大模型里聊出故事大纲,再复制到另一个对话里拆分镜,再手动把每个分镜扩写成画面提示词,最后再单独写解说词。这套流程最大的问题是信息在多次复制粘贴中会变形,经常是故事写得很精彩,分镜却完全接不上情绪,画面提示词又和旁白视角对不上。拆成几个独立节点之后,故事大纲、分镜、画面提示词、旁白四者的信息可以层层传递和约束,输出格式也统一成表格或JSON,素材之间的“缝隙”就补上了。
所以这套工作流解决的是生产流程中“编排”和“一致性”的问题。它就像一个流水线上的数字中控台,指挥各个AI节点在同一套设定下工作,最后一次性交付所有中间产物。
1.2 选Coze而不是本地工具的原因
你可能会问,网上有那么多工作流工具,ComfyUI、Dify、n8n都能做类似的事,为什么我选了Coze。
坦白说,ComfyUI在专业视频生成和精调画面上确实更强,但它本地部署对显卡和动手能力都有要求,我身边不少朋友光是装节点就能折腾一晚上。Dify和n8n适合企业内部数据流转,但搭建智能体、接入插件生态时没有Coze那么顺滑。Coze最大的优势是零门槛、云端托管,打开网页就能用,团队空间还能一键分享给伙伴协作调优。而且它自带大量插件和模板,像“上传文档”“知识库”“剪映草稿”这类能力可以少写很多代码,更别说它不需要自己维护服务器,断网了也不影响已发布的工作流运行。
另外一点是成本。Coze个人版的免费额度和低门槛配置,对个人创作者来说非常友好,我后期做大量测试时没有出现预算焦虑。
1.3 这个工作流适合谁、能解决什么问题
这套工作流不是给专业影视团队用的,它更适合三类人:
第一类是短视频运营和自媒体博主,尤其是做历史科普、传统文化、人文故事类账号的,日常更新频率高,需要能稳定复用的流程。第二类是刚接触AI视频的玩家,想从一个可复制的模板开始,而不是从空白画布慢慢摸索。第三类是团队中负责内容生产的操盘手,可以用团队空间把工作流分享给组员,保证大家输出的素材风格一致。
它能解决的核心问题有三个:一是让故事结构有保障,不会写着写着跑偏;二是让分镜和画面提示词有足够的细节,拿过去就能在视频工具里用;三是让旁白和画面情绪对齐,减少后期返工。
2. 工作流整体设计:把“一条龙”拆成5个节点
2.1 整体架构与节点走向
我搭建的这个工作流叫“历史故事视频素材工厂”,整体分为五段:开始节点、故事大纲节点、分镜拆解节点、画面提示词节点、旁白配音节点。最后再加一个结束节点把结果汇总输出。
工作流的走向是这样的:开始时收集用户输入的视频主题、目标时长、风格偏好、角色描述等;然后故事大纲节点根据这些输入生成一个结构完整的故事;接着分镜拆解节点把故事按时间线切成若干分镜;随后画面提示词节点负责为每个分镜生成适合视频生成工具的详细画面描述;旁白配音节点单独生成解说词和时间轴标记;最后汇总节点把所有内容整理成结构化报告返回给用户。
这里有一个关键点:为什么不用一个大模型节点一步到位输出所有内容?我最初也这么试过,因为看起来省事,但实际输出质量极差。单一节点会为了“全面”而牺牲“深度”,故事写得像流水账,分镜又像说明文。拆成多个节点之后,每个节点只负责一个任务,可以用更精准的提示词约束它,输出质量明显提升。
2.2 每个节点到底在干什么
开始节点主要定义接收参数,我设置了四个:视频主题、总时长、画面风格、角色设定。总时长用来计算分镜数量和旁白字数,画面风格会影响后续所有画面提示词的统一性,角色设定则是为了让同一角色在不同分镜中保持视觉一致。
故事大纲节点是整个工作流最核心的节点,它会接收视频主题和总时长,输出一个带明确结构的故事。我在提示词里要求它严格按照“背景铺垫、冲突出现、危机升级、转折/解决、收尾升华”五个部分来组织内容,同时需要提供历史知识核对说明,确保内容在文化常识层面没有硬伤。
分镜拆解节点拿到故事大纲后,按时长拆成分镜,每个分镜有约8-12个镜头。它输出的内容包括景别、运镜、画面描述、情绪氛围,这些字段直接决定后续视频生成的画面质量。
画面提示词节点是工作流里最“技术流”的一环,它把分镜的表层描述转换成适合AI视频生成工具的语言,比如补充光线、材质、气候、色板、镜头运动。很多人在视频工具里生成画面时总是“不像自己想要的”,大多是因为分镜描述太抽象,缺少这些硬性细节。
旁白配音节点则负责生成解说词,我会要求它匹配画面时长的同时保持叙事节奏,并把情感强度标注出来,方便后期配音时掌握抑扬顿挫。
2.3 参数配置细节
在Coze里配置这些节点时,我总结了一些比较重要的参数经验。模型选择上,建议优先选推理能力较强的模型,因为故事大纲和分镜拆解比较考验逻辑,能力弱的小模型容易生成逻辑不连贯的内容。温度参数我默认设在0.7,既不会太随机也不会太模板化。如果发现同一主题生成的脚本结构总是一模一样,就把温度调到0.9以上。
输出格式建议统一要求JSON或Markdown表格,方便后续节点解析和人工查看。变量传递时要注意字段命名保持一致,比如故事大纲里的“角色名”必须与分镜节点里使用的“角色设定”完全对应,否则会出现信息丢失。
另外,Coze支持在节点间插入代码节点,我喜欢在处理完故事大纲后,加一个后端小逻辑清洗JSON格式,去掉多余的转义符,这样后面环节读取时就不会报错。实际使用中这能省去大量调试时间。
3. 核心提示词工程:让故事既“对味”又“有画面”
3.1 主题输入与内容安全约束
这套工作流输出的是历史故事视频素材,所以在提示词里我专门加了一条硬性内容约束:避开真实存在的敏感争议人物和近现代真实事件,优先从公版文学、成语典故、民间传说、传统文化符号中取材。比如“草船借箭”“完璧归赵”“嫦娥奔月”“丝绸之路上一段小人物传奇”这类,既有历史韵味,又远离敏感信息。这个约束不只是为了合规,从传播角度看,观众对这类题材的接受度也更高。
我还要求故事内容必须符合主流价值观,不能出现血腥、暴力、刻意煽动对立的情节。做历史故事视频最容易踩的一个坑是“硬蹭”真实人物并进行不当演绎,这种内容即使流量好也容易翻车,不值得冒这个险。
3.2 故事大纲节点的提示词模板
故事大纲节点我用了一段相对固定的提示词,你可以直接复制套用。
你是一位资深历史故事编剧,擅长把历史文化题材改编为适合短视频传播的口语化故事。 请根据用户输入的主题,生成一个完整的故事大纲。 要求: 1. 故事结构必须包含:背景铺垫、冲突出现、危机升级、转折/解决、收尾升华五个部分。 2. 故事要有人物弧光,主角要有一个明确的欲望或目标。 3. 语言风格要口语化,避免书面化和过度文绉绉。 4. 内容需符合主流价值观,优先从公版文学、成语典故、民间传说、传统文化符号中取材。 5. 避开真实敏感争议人物和近现代真实事件。 6. 输出格式为JSON,字段包括: - title:故事标题 - theme:核心主题 - summary:一句话梗概 - characters:角色列表,包含每个角色的姓名、身份、性格关键词 - plot:按五个结构部分拆解的情节列表 - knowledge_check:对故事涉及的文化背景解读,说明逸出真实历史的部分 用户输入的视频主题是:{{video_topic}} 目标视频时长:{{video_duration}} 视频风格偏好:{{video_style}}这个提示词的关键是强制输出结构化JSON。没有这个约束,模型容易写成一大段散文,后续节点就没法自动处理。有了知识核对字段,你在生成视频前可以人工快速判断这个故事是否存在常识错误。
3.3 分镜与画面提示词模板
分镜拆解节点接收故事大纲JSON,输出一个Markdown表格,每一行是一个分镜。我会要求按总时长倒推分镜数量,比如60秒视频大约拆12个分镜,每个分镜5秒左右。
画面提示词节点最核心的逻辑,是把“文学性描述”翻译成“视频生成语言”。我做了个对比,刚开始我的分镜描述是“江面上有很多船,天气很阴沉”,生成出来的画面就是一张平庸的截图。后来我要求每个分镜必须包含六个要素:景别、主体动作、环境细节、光线条件、镜头运动、画面色彩基调。同样一个场景就变成了“全景,晨雾弥漫的长江,数十艘草船以圆阵排列,旗帜潮湿微动,天光从云缝中洒下,镜头从高空缓慢推近,整体色调为冷青灰”,生成出来的画面立刻有“电影感”了。
这个节点我使用的提示词片段如下:
你是AI视频生成工具的资深提示词工程师。 请结合分镜描述,为每个分镜生成适合AI视频生成的详细画面提示词。 要求: 1. 每个提示词必须包含以下维度: - 景别:远景/全景/中景/近景/特写 - 主体动作:角色在做什么 - 环境细节:时间、天气、背景物 - 光线条件:自然光/逆光/柔光/黄昏光等 - 镜头运动:固定/推/拉/摇/移/跟 - 画面基调:整体色调、风格符号 2. 提示词控制在40-80个中文字符左右,避免太长导致视频工具识别困难。 3. 同一角色在不同分镜中必须保持外形描述一致。 4. 输出格式为JSON数组,每个元素包含分镜序号、分镜内容、画面提示词、情绪关键词、配乐建议。这里的“角色一致性”是后期制作最难解决的问题之一。我会在节点提示词里固定角色外貌前缀,比如“主角是一位身穿青布长衫的中年书生,面容清瘦,发髻整齐,腰间挂一枚玉佩”,这段描述会被拼接到每一个涉及该角色的画面提示词开头,尽量降低一致性偏差。
3.4 旁白配音节点与节奏控制
旁白配音节点我单独设定,不和其他节点合并。原因很简单,旁白的好坏直接决定观众愿不愿意看下去。如果旁白和画面脱节,或者语速和画面节奏明显不搭,再好看的画面也会被浪费。
我在这个节点提示词里加入了“时间轴意识”。每个分镜的旁白字数要和分镜时长匹配,比如一个5秒的分镜一般配18到25个汉字。这样后期只需要把解说词按时间粘贴到剪辑软件里,基本不会出现大幅度错位。
情感语气也是重点,我会要求旁白词中标注情感语气提示,比如“低沉地”“略带紧张地”“逐渐高昂”,方便配音环节控制情绪。
4. 从工作流到成片:视频生成实操与参数调整
4.1 拿到输出后怎么用
Coze工作流运行完之后,你会拿到一个完整的结构化素材包,里面包括故事大纲、分镜表、画面提示词、旁白词、配乐建议。使用顺序建议是先快速浏览一遍故事大纲和分镜表,确认叙事逻辑没有大问题,再逐条把画面提示词复制到视频生成工具中。
目前主流的AI视频生成工具,比如可灵、即梦、Vidu,都有自己的风格参数。我的习惯是在所有分镜中使用统一的风格前缀,比如“中国风水墨动画,青绿山水色调,电影级光线”,这样即使每个分镜单独生成,最终剪辑时画风也不会跳得厉害。
视频生成工具的常见参数我一般这样设置:视频比例选9:16,适合抖音、视频号这类竖屏平台;时长选5秒,方便后期拼接和控制成本;运动幅度选“中”,太大画面容易变形,太小又像PPT;如果工具有镜头控制选项,优先选择与分镜表运镜一致的预设,比如“缓慢推近”“从左向右平移”。每个分镜生成2-3个候选,选最贴近预期的一条。
4.2 配音与字幕匹配
配音这个环节,我建议先把旁白词导入配音工具(剪映直接就能做),生成一段完整的解说音频后再去匹配画面。不要一上来就按分镜一段段配,那样容易出现音色不统一、节奏断裂的问题。
拿到完整音频后,把时间轴上的音频波形标记出来,然后回到剪辑软件里把之前生成好的视频片段按顺序往上铺。每个分镜的起始点尽量对准旁白词的开头,微调一般不会超过半秒,这个工作量已经比传统剪辑少很多了。
字幕我习惯使用剪映的自动字幕功能,把识别结果出来之后手动校对一遍,特别注意历史人名、地名、生僻字。自动识别经常把“草船借箭”的“借”识别成其他同音字,这个坑我踩过好几次,后期必须人工复核。
4.3 沉浸感的关键:风格一致性与音效
所谓“沉浸式”,不只是画面清楚、配音好听就行,更需要风格一致。我做这个工作流时专门加了“风格固定器”这个设计:在开始节点接收一个风格参数,比如“中国风水墨动画”,然后把这个参数传送到分镜节点和画面提示词节点,确保每个镜头都带上统一风格词。没有这个设计,同一个故事里的画面很容易出现“上一秒是国风水墨,下一秒变成欧美写实”的割裂感。
背景音效也很重要,但要克制。我一般只在片头加环境音,比如雨声、风声、鸟鸣,在关键转折处加一段低音鼓点,其余时间留给旁白和背景音乐。配乐建议在Coze工作流的每个分镜里都会生成,但最终混音时我不会完全照搬,而是根据视频整体情绪选择一首主旋律,偶尔在两三个关键分镜处做音量渐强。
4.4 从“半自动”到“全自动”的过渡
完全一键出片在目前的工具链里还不太现实,但可以做到“半自动流水线”。我的操作方式是:Coze工作流负责生成所有素材,视频生成工具负责出画面,剪辑软件负责拼接配音和字幕。整个流程如果顺利,一条60秒的历史故事视频可以在40分钟左右完成,比纯手工写脚本、找素材、剪辑至少快了两倍以上。
如果想要进一步自动化,可以研究剪映草稿接口或者用Coze的API输出结果,再对接自动化工具生成草稿文件。这个方向需要一定编程能力,属于进阶玩法,后面我再单独写文章展开。
5. 常见问题与排坑实录:我实测踩过的几个坑
5.1 故事“撞车”和重复套路
用同样的提示词跑同一个主题,第一次和第二次出来的故事结构往往一模一样,特别是你希望做系列视频时,会发现每集套路雷同。解决方法是把温度参数调到0.9以上,并在故事大纲提示词中加入“请提供一种意想不到的情节转折”和“结局不要全圆满,允许留白”。另外,在开始节点加一个随机种子字段,同一主题可以通过填入不同种子获得不同版本。实测下来,这样处理之后故事的同质化会明显减轻。
5.2 画面提示词太长被视频工具“吞掉”
很多视频生成工具对提示词长度有上限,尤其是一些轻量级工具,超过80个中文字符后会自动截断,导致画面缺少关键元素。我一开始每个分镜试图写一段两百字的“电影级详细描述”,结果大量画面崩坏。后来我把提示词控制在一百字以内,并把核心信息前置,比如“晨雾、草船、冷青色”放在开头,修饰语放在后面。这样截断后,关键视觉元素依然能保住。
5.3 角色形象不一致、穿帮明显
同一角色在不同分镜中长得不一样,是AI视频目前最头疼的问题。我能给出的实际经验是三层防护:一是在所有分镜提示词前面拼上统一角色外貌前缀;二是在画面提示词节点中限制“不得改变角色的发型、脸部轮廓、服装颜色”;三是生成视频时尽量让每个分镜都从角色正面或侧面统一角度开始,不要突然出现大角度俯拍。即便如此,完全一致也做不到,但可以把一致性从“不能用”提升到“可接受”。
5.4 字幕和配音对不上
字幕与配音错位,通常不是因为视频生成问题,而是因为旁白词字数过多或过少。我建议在配音生成前先用Coze旁白节点输出字数统计,如果单个分镜旁白超过25个汉字,就提醒自己削减描述。真的生成后对不上时,不要逐字调整,直接选中所有字幕块,用剪辑软件的“整体偏移”功能做一次性对齐,这样能省很多时间。
5.5 内容审核与平台风控
发布历史类短视频时,内容审核是个绕不开的话题。最好的策略不是等被判违规后申诉,而是在生成阶段就做好风控。我在工作流的故事大纲节点里明确加入了“不涉及真实敏感争议人物、不虚构近现代真实事件、不渲染暴力猎奇”的要求,同时在每个分镜的情绪关键词中避免负面极端词汇。这样做不仅让内容安全,也更利于平台推荐算法,因为正面向上的内容天然更受推荐机制青睐。
6. 团队协作与扩展玩法:让工作流真正成为生产力
6.1 复制、分享和团队空间
Coze的团队空间是一个很容易被忽略但非常实用的功能。新版Coze中,进入工作台后找到左侧的“团队空间”入口,在里面可以创建项目、添加协作者、管理工作流和知识库。我做完这套历史故事工作流后,直接把可复制的链接发给了几个做短视频的朋友,他们复制到自己的空间后只需要修改开始节点的参数,就能跑出差异化的成品。
使用团队空间还有一个好处,就是知识库可以共享。如果你把常考据的历史文化资料、文物图片、古诗词文档上传到团队空间知识库,那么团队里的每个工作流都能引用这份资料,生成的故事在文化还原度上会明显高于裸模型。比如我在知识库里放了一份古代服饰图鉴,之后生成的角色服装描述就再也不是“古装白衣”这种笼统词汇了。
6.2 扩展玩法:AI漫剧、书单视频、公文处理
这套工作流的核心模式其实是“输入主题—拆解结构—生成多媒体素材”,这种模式不只能做历史故事视频,换一个提示词模板就能迁移到别的场景。我后来用类似的思路搭了AI漫剧分镜工作流,输入小说章节就能输出一整套漫画分镜提示词;也搭过一个书单视频工作流,输入书名就能生成书评文案和配图提示词。Coze的扩展生态里还有Markdown转Word、上传文档处理、简历筛选这类现成模板,稍微改一改就能和工作流串联起来。
如果你想深入,可以再研究一下工作流编码,也就是在Coze里用代码节点对输出做更精细的清洗和拼接。比如把画面提示词批量加前缀、把分镜表转换为CSV、把旁白词转成字幕文件,这些重复操作都可以用几行脚本解决。
6.3 后续还能怎么迭代
我个人的规划是把这个工作流升级成“系列化创作引擎”,也就是支持一次输入多个主题,批量生成一整季的历史故事素材包。另一个方向是接入更智能的音色定制和情感识别,让旁白不再是单一的朗读腔,而是根据剧情自动推荐不同情绪的音色。技术迭代很快,但用到的核心思维是一样的:把创作经验从“一次性灵感”变成“可复用的结构化流程”。
最后再分享一个实际感受:工作流的价值不在于省掉所有人工,而在于把重复劳动和创意决策分开。机器负责把写脚本、拆分镜、补细节这些脏活累活全干了,你只需要做两件事,选好主题,把好最后一道质量关。我建议如果你也想做历史故事类视频,先从一条最短的成片开始,只跑通“故事大纲—旁白—一个分镜”这个最小闭环,再一步步扩展成全流程。踩过一次坑之后,你对整套系统运行逻辑的理解,会比看十篇教程都管用。