今天给大家演示一个《三分钟读一本书》Coze 工作流。该工作流通过大模型驱动的分镜文案生成、图像合成、语音合成以及视频草稿自动创建等一整套流程,将一本书的内容浓缩为一个三分钟的视频,实现从文本到成片的全自动化制作。用户只需输入书名、作者和个人账号信息,即可得到包含字幕、画面、旁白和转场效果的完整视频成品。
文章目录
- 工作流介绍
- 核心模型
- Node节点
- 工作流程
- 大模型应用
- 分镜画面生成与字幕拆解
- 使用方法
- 应用场景
- 开发与应用
工作流介绍
这个工作流的核心逻辑围绕大模型文案分镜生成 + 图像生成与处理 + 音频合成 + 视频草稿合成四个部分展开。它利用大语言模型生成分镜脚本和关键词,再调用图像生成与抠图工具输出视觉元素,结合语音合成生成解说音频,最后通过代码逻辑和视频剪映插件完成音视频素材的整合,生成最终的视频草稿。整个过程体现了文本、图像、音频多模态结合的自动化生产能力。
核心模型
该工作流的核心模型是大语言模型「豆包·1.5·Pro·256k」,它负责将输入的书籍文案转化为视频分镜描述、图像提示词和字幕。模型的能力保证了分镜与原文案一致,且在画面表现和关键词抽取上具有创造性和准确性。
| 模型名称 | 说明 |
|---|---|
| 豆包·1.5·Pro·256k | 用于生成分镜画面描述、字幕文案及关键词,驱动整个视频内容创作 |
Node节点
该工作流包含多个关键节点,覆盖了从数据输入、分镜生成、图像处理到视频草稿生成的各个环节。大模型节点完成文本到分镜的转换,图像生成