今天给大家演示的是一个基于ComfyUI 的多控制条件融合图像生成工作流。该工作流围绕 Z-Image Turbo 体系展开,通过图像输入、自动提示词生成以及多种结构控制预处理的灵活切换,实现从“参考图像理解”到“高质量图像生成”的一体化流程。
结合效果展示可以直观看到,该工作流既能保持原始画面的结构信息,又能在风格和细节上进行较大幅度的重构,非常适合用于人物、场景或概念图的高一致性再创作。
文章目录
- 工作流介绍
- 核心模型
- Node 节点
- 工作流程
- 大模型应用
- RH_Captioner 图像语义理解与提示词生成
- 使用方法
- 应用场景
- 开发与应用
工作流介绍
这是一个以参考图像驱动 + 多 ControlNet 结构约束 + 自动提示词生成为核心思路的 ComfyUI 工作流。整体设计并非单一路径,而是通过统一的图像输入,派生出深度、姿态、边缘等多种结构信息,再由开关节点进行选择性接入,从而在同一套模型架构下实现不同控制策略的快速切换。工作流同时引入图像自动描述节点,将参考图像内容转化为中文提示词,减少手动写 Prompt 的成本,使生成结果在语义与结构层面都与原图保持高度关联。
核心模型
该工作流的核心模型体系围绕Z-Image Turbo架构展开,整体目标是实现高速采样与多结构条件统一控制。在模型组合上,UNet 负责图像扩散与细节生成,CLIP 模型不仅承担文本编码任务,还配合图像描述节点完成“图生文”的语义理解,VAE 则用于潜空间与最终图像之间的稳定编解码。通过额外加载的 Model Patch,将多种 ControlNet 结构信息整合进同一扩散模型中,使姿态、深度、边缘等条件不再是割裂使用,而是可以在同一模型上下文中灵活切换与叠加。这种模型层级的设计,使工作流在保持生成速度的同时,也具备较高的可控性与一致性。
| 模型名称 | 说明 |
|---|