【Coze】【视频】三分钟读一本书
2026/9/24 17:02:07 网站建设 项目流程

今天给大家演示一个《三分钟读一本书》Coze 工作流。该工作流通过大模型驱动的分镜文案生成、图像合成、语音合成以及视频草稿自动创建等一整套流程,将一本书的内容浓缩为一个三分钟的视频,实现从文本到成片的全自动化制作。用户只需输入书名、作者和个人账号信息,即可得到包含字幕、画面、旁白和转场效果的完整视频成品。

文章目录

  • 工作流介绍
    • 核心模型
    • Node节点
  • 工作流程
  • 大模型应用
    • 分镜画面生成与字幕拆解
  • 使用方法
  • 应用场景
  • 开发与应用

工作流介绍

这个工作流的核心逻辑围绕大模型文案分镜生成 + 图像生成与处理 + 音频合成 + 视频草稿合成四个部分展开。它利用大语言模型生成分镜脚本和关键词,再调用图像生成与抠图工具输出视觉元素,结合语音合成生成解说音频,最后通过代码逻辑和视频剪映插件完成音视频素材的整合,生成最终的视频草稿。整个过程体现了文本、图像、音频多模态结合的自动化生产能力。

核心模型

该工作流的核心模型是大语言模型「豆包·1.5·Pro·256k」,它负责将输入的书籍文案转化为视频分镜描述、图像提示词和字幕。模型的能力保证了分镜与原文案一致,且在画面表现和关键词抽取上具有创造性和准确性。

模型名称说明
豆包·1.5·Pro·256k用于生成分镜画面描述、字幕文案及关键词,驱动整个视频内容创作

Node节点

该工作流包含多个关键节点,覆盖了从数据输入、分镜生成、图像处理到视频草稿生成的各个环节。大模型节点完成文本到分镜的转换,图像生成

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询