今天给大家演示一个基于 Flux 文生生写真风格的 ComfyUI 自动润色工作流。该工作流融合了图像上传、文本提示、模型引导与自动修复,能够精准识别人像照片中的面部特征,结合 Lora 模型和提示语意生成系统自动进行主题风格润色。
本例采用敦煌飞天为默认主题,通过内嵌的多阶段推理与 Flux 指导模块,实现高质量的生写真图像输出,适用于写真润色、风格迁移、人像创作等多个方向。
文章目录
- 工作流介绍
- 核心模型
- Node节点
- 工作流程
- 大模型应用
- CLIPTextEncode 主写实语义编码
- DualCLIPLoader 主题理解与扩展语义加载
- ApplyPulidFlux 人脸参考语义融合大模型
- 使用方法
- 应用场景
- 开发与应用
工作流介绍
本工作流设计用于将用户上传的人像图进行智能化润色,通过 Pulid-Flux 系列模型配合 Flux 引导机制,结合面部分析与 EVA_CLIP 编码,实现面部细节的自动识别、艺术风格化重绘及输出优化。工作流结构清晰,涵盖从图像加载、模型调用、文本语义引导、面部特征提取到最终图像生成的完整流程。尤其在面部识别精度、提示词响应与生成图像质量三方面表现出色。
核心模型
工作流依赖多个关键模型完成图像生成与润色任务。其中包括主导人像绘制的 LoRA 模型、处理图像语义的 EVA_CLIP、指导生成走向的 Flux 模型、以及进行解码的 VAE 模块。它们通过模型融合与引导策略形成联动,使得工作流具备稳定性与高质量输出能力。
| 模型名称 | 说明 |
|---|---|
flux1-dev.sft | 主 U-Net 模型,提供基础生成能力,支持 fp8 推理加速 |
v4_woman_shuffle.safetensors | Lora 风格模型,控制女性人物的绘制细节与风格方向 |
pulid_flux_v0.9.1.safetensors | Pulid Flux 模型核心文件,控制风格融合与润色策略 |
ae.sft | VAE 解码器,用于将潜在图像转换为最终图像输出 |
clip_l.safetensors/t5xxl_fp8_e4m3fn.safetensors | CLIP 编码器组合,用于文本到图像语义引导 |
| EVA_CLIP | 语义图文匹配模块,用于细化提示词与图像风格契合度 |
Node节点
整个流程由多个 ComfyUI Node 节点组成,每个节点负责不同的任务处理。包括图像加载、文本提示处理、采样器选择、随机噪声生成、Flux 引导器设定、最终图像保存等。节点之间通过数据链接协同完成自动润色流程。
| 节点名称 | 说明 |
|---|---|
LoadImage | 加载本地上传的人像图像,用作基础输入 |
CLIPTextEncode | 编码提示词,实现语义驱动的风格生成 |
PulidFluxModelLoader | 加载 Pulid-Flux 模型参数 |
PulidFluxInsightFaceLoader | 分析输入人像的面部特征,用于面部精准重构 |
ApplyPulidFlux | 将 Flux 风格与面部分析结果应用到模型生成过程 |
BasicGuider | 生成引导器用于控制最终采样方向 |
RandomNoise | 生成潜变量噪声用于扩散模型初始化 |
BasicScheduler | 设定生成步数、调度器与去噪强度等参数 |
SamplerCustomAdvanced | 高级采样器节点,实现多因素图像生成控制 |
VAELoader/VAEDecode | 加载并解码图像潜变量为最终图像 |
SaveImage | 保存最终生成结果到本地目录 |
工作流程
本工作流结构严谨,整体分为图像输入、语义引导、模型处理、生成控制与输出保存五个阶段。用户上传图像后,系统自动进行面部分析,并通过文本提示词控制图像风格方向。模型融合机制将风格化权重与基础模型合并,引导器与采样器共同作用,配合调度器控制生成过程的节奏与细节,最终通过 VAE 解码并输出高质量润色图像。整体流程实现了从“用户上传 → 风格注入 → 智能生成 → 图像输出”的闭环处理。
| 流程序号 | 流程阶段 | 工作描述 | 使用节点 |
|---|---|---|---|
| 1 | 图像准备 | 加载用户上传的人像图像,获取输入图像数据 | LoadImage |
| 2 | 提示词编码 | 将用户输入的提示词转换为语义向量,用于风格引导 | CLIPTextEncode |
| 3 | 模型加载 | 加载 PulidFlux 模型、UNet 主模型、Lora 风格模型、VAE | UNETLoader, LoraLoaderModelOnly, PulidFluxModelLoader, VAELoader |
| 4 | 面部分析 | 分析图像中的面部特征,为风格重绘提供参考 | PulidFluxInsightFaceLoader |
| 5 | 风格融合 | 将提示词语义、面部特征、模型风格等融合注入主模型 | ApplyPulidFlux |
| 6 | 图像引导 | 设置 FluxGuider 引导方向,提升图像一致性 | FluxGuidance, BasicGuider |
| 7 | 随机初始化 | 生成扩散初始噪声和潜变量图像 | RandomNoise, EmptyLatentImage |
| 8 | 采样调度 | 设置步数、去噪参数和采样器方式 | BasicScheduler, KSamplerSelect |
| 9 | 图像生成 | 启动采样过程生成潜图结果 | SamplerCustomAdvanced |
| 10 | 解码输出 | 解码潜图为最终图像并保存本地 | VAEDecode, SaveImage |
大模型应用
CLIPTextEncode 主写实语义编码
该节点将用户输入的自然语言 Prompt 转成语义向量,用来控制画面的风格、光线、构图和整体真实度。它不读取图像内容,只依赖 Prompt 来决定生成方向。文本越具体,生成画面越贴合主题与光影描述。
| 节点名称 | Prompt 信息 | 说明 |
|---|---|---|
| CLIPTextEncode | Positive Prompt: red wall background, sunlight filtering through blinds, half-body portrait, silk robe slipping from shoulder, elegant Asian woman, filmic texture, contrast of light and shadow, cultural heritage, quiet contemplation, timeless beauty, cinematic realism. Negative Prompt:(未在节点中单独设置,由模型内部规则约束) | 将自然语言 Prompt 编码为写实风格语义,用于引导最终影像的光影、构图和人物气质。 |
DualCLIPLoader 主题理解与扩展语义加载
该节点加载两套 CLIP 模型权重,让系统具备更强的语言解析能力。它不生成 Prompt,但负责提供 CLIPTextEncode 所需的语言理解模型,使 Prompt 的语义更完整、更稳定。
| 节点名称 | Prompt 信息 | 说明 |
|---|---|---|
| DualCLIPLoader | 模型文件: t5xxl_fp8_e4m3fn.safetensors clip_l.safetensors 类型:flux | 为文本编码器提供高质量语言理解能力,使 Prompt 的语义转换更可靠稳定。 |
ApplyPulidFlux 人脸参考语义融合大模型
该节点负责用 PuLID-Flux 面部参考模型将上传的人脸信息与文本语义结合,使生成的面部更贴近输入照片的特征。它不生成 Prompt,但会根据图像中人物的脸部特征自动生成内部语义,使生成结果与参考脸保持一致。
| 节点名称 | Prompt 信息 | 说明 |
|---|---|---|
| ApplyPulidFlux | 内部引用信息: face_analysis → 参考脸部特征 eva_clip → 视觉语义模型 image → 原始人像输入 | 把人脸参考信息融合到模型语义,使最终成像在保持风格的前提下贴近原图脸部特征。 |
使用方法
整个工作流以“上传人脸参考 + 文生图 + Flux 光影主题渲染”的方式运行。用户上传一张正面人脸图,再填写自然语言 Prompt。系统会先加载双 CLIP 模型,对 Prompt 进行语义编码;同时识别上传人像的脸部特征,通过 PuLID-Flux 自动提取参考脸语义。
文本语义与人脸参考一起送入采样器,模型在保持人物面貌特征的同时,根据 Prompt 渲染光影、服装、背景和摄影气质。
用户替换图片或修改 Prompt 后,流程会自动重新编码并生成全新的写实影像。人脸图定义外貌结构,Prompt 决定主题审美与光线氛围。
| 注意点 | 说明 |
|---|---|
| 上传头像必须正面清晰 | 影响人脸参考模型输出质量 |
| Prompt 建议自然语言长句 | 光影、情绪、场景写得越具体效果越好 |
| 选择合适的 Lora 可强化主题风格 | 不同 Lora 会改变艺术气质 |
| 不建议使用动漫词汇 | 可能削弱写实效果 |
| 图片尺寸固定为 1024×1024 | 保证人脸检测与渲染一致性 |
| 替换图片后无需手动修改节点 | 系统会自动重新推理 |
应用场景
本工作流在文生图自动润色领域具有广泛应用价值。其强大的面部分析与风格融合能力,使其不仅适用于艺术写真、角色定制、风格迁移,还可用于商业广告、内容创作、AIGC 等多场景。用户只需上传一张正脸图并提供风格关键词,即可获得高质感、高一致性的图像结果,极大地降低了创作门槛。
| 应用场景 | 使用目标 | 典型用户 | 展示内容 | 实现效果 |
|---|---|---|---|---|
| 人像润色 | 自动提升原始图像的面部细节与质感 | 摄影后期师、内容创作者 | 高分辨率风格化写真图像 | 保留人脸特征,风格统一 |
| 艺术风格生成 | 根据提示语生成定制风格图像 | 插画师、AIGC 应用开发者 | 飞天、古风、电影感等主题图像 | 精准表达主题意图 |
| 虚拟形象定制 | 构建虚拟人物或数字人形象 | 游戏设计师、虚拟偶像开发者 | 统一风格的人物肖像 | 支持多模型融合和迭代优化 |
| 电商展示图优化 | 美化商品模特照片 | 淘宝商家、模特工作室 | 视觉统一的模特图 | 适配不同视觉风格需求 |
| 写真风格迁移 | 迁移已有照片至目标风格 | 摄影发烧友、视觉博主 | 风格一致的照片合集 | 高一致性、高保真重绘输出 |
开发与应用
更多 AIGC 与 ComfyUI工作流 相关研究学习内容请查阅:
ComfyUI使用教程、开发指导、资源下载
更多内容桌面应用开发和学习文档请查阅:
AIGC工具平台Tauri+Django环境开发,支持局域网使用
AIGC工具平台Tauri+Django常见错误与解决办法
AIGC工具平台Tauri+Django内容生产介绍和使用
AIGC工具平台Tauri+Django开源ComfyUI项目介绍和使用
AIGC工具平台Tauri+Django开源git项目介绍和使用