一、趋势
① 简单介绍
CVPR 2026 图像生成方向共收录 447 篇(约占全会议生成式视觉的一半),整体已从“能否生成”跨入“可控、高保真、可对齐、可溯源”的阶段。扩散模型仍是绝对主干(约 50% 论文提及),但骨干正从 U-Net 迁移到 DiT/Transformer,并出现流匹配(Flow Matching)、自回归(VAR)等新范式。
② 从“像不像”到“好不好、合不合意图”
奖励建模与偏好对齐(RL / DPO / GRPO)快速成为主流,生成开始“听得懂人话”——组合正确性、审美、身份一致性成为可优化目标,质量评估从分布相似度转向人类偏好。
③ 落地与扩展双线并进
采样加速 / 步蒸馏把推理压到数步,使端侧实时生成成为可能;视频 / 3D / 4D(把单图推向动态与立体的“世界模型”;同时概念擦除 / 水印 / 溯源回应版权与合规,生成进入“可被监管”的阶段。
二、方法
下面按“提及该方法的论文数”列出全局高频方法族。同一篇论文可能命中多个方法,故占比之和大于 100%。
方法族 | 论文数(占比) | 简单介绍 |
扩散模型 | 226 篇(50.6%) | 逐步去噪的生成范式,是图像生成的事实标准底座。 |
DiT/Transformer | 125 篇(28.0%) | 以 Transformer 为骨干替换 U-Net,成为新主流架构。 |
偏好对齐(RL/DPO/GRPO) | 123 篇(27.5%) | 用奖励/人类偏好把生成对齐到“好且合意图”。 |
采样加速 | 98 篇(21.9%) | 少步采样、步蒸馏、缓存等手段,直接压低推理成本。 |
视频/动态 | 92 篇(20.6%) | 把单图扩展到时间维,生成连贯视频或动态场景。 |
图像编辑 | 89 篇(19.9%) | 基于指令或参考图修改已有图像的生产力任务。 |
数据集/基准 | 86 篇(19.2%) | 新训练数据与评测基准,决定能力上限与可复现进步。 |
布局/条件控制 | 63 篇(14.1%) | 用布局/位姿/草图/深度等空间条件精确控制构图。 |
架构/合并/剪枝 | 62 篇(13.9%) | 新骨干、模型合并/剪枝/调制等决定性价比的根基。 |
压缩/超分/复原 | 56 篇(12.5%) | 用生成式方法做超分、压缩、去噪与复原。 |
个性化/身份 | 53 篇(11.9%) | 学习并复现特定主体或风格,实现定制生成。 |
多模态 | 47 篇(10.5%) | 跨文本/图像/音频统一建模,衔接 LLM 生态。 |
自回归/VAR | 36 篇(8.1%) | 把图像当作 token 序列按尺度自回归生成。 |
流匹配/Rectified Flow | 34 篇(7.6%) | 学习向量场把噪声直推到数据,可近似少步采样。 |
3D/4D | 33 篇(7.4%) | 高斯泼溅/NeRF 等,把生成扩展到立体与时空。 |
知识蒸馏 | 30 篇(6.7%) | 用大模型监督训练小模型,压缩参数量或步数。 |
LoRA | 22 篇(4.9%) | 低秩适配,轻量微调主流手段。 |
概念擦除/安全 | 21 篇(4.7%) | 概念擦除、水印溯源与后门防护,回应版权与合规。 |
三、主题
按方法路线把 447 篇分为 13 类。每一类给出简述、研究意义与典型应用场景。
A. 可控生成与条件控制
简述:在文生图基础上引入布局、位姿、草图、深度、边缘等额外条件,把“随机创作”变成“按需生产”。
意义:让生成从“碰运气”变成“可指定”,是工业设计与内容生产落地的前提。
应用场景:广告/海报的可控构图、产品图按布局生成、草图→上色、姿态引导人物生成、室内平面图生成。
代表论文精读:《SketchDeco: Training-Free Latent Composition for Precise Sketch Colourisation》
B. 图像编辑
简述:对已有图像做局部或全局修改(换装、去物、换背景、风格化、修复),通常基于指令或参考图。
意义:比从零生成更贴近日常生产力,是设计师与修图工作流的核心环节。
应用场景:电商换装试穿、老照片修复、物体移除、指令式改图、参考图风格迁移。
代表论文精读:《Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing》
C. 采样加速与高效推理
简述:通过少步采样、步蒸馏、特征缓存、可学习调度等手段,把扩散模型几十步推理压到数步。
意义:推理成本是落地最大瓶颈;加速决定生成能否在端侧实时运行。
应用场景:实时对话式生图、移动端 App、视频生成的高吞吐推理、交互式编辑。
代表论文精读:《TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration》
D. 奖励建模与偏好对齐
简述:用奖励模型/人类偏好(RL/DPO/GRPO)把生成质量从“像不像”升级到“好不好、合不合意图”。
意义:让生成“听得懂人话”,组合正确性、审美、身份一致性成为可优化的目标。
应用场景:文生图审美提升、指令遵循对齐、品牌一致性、多偏好个性化、安全拒答。
代表论文精读:《Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models》
E. 视频、3D与多模态
简述:把单图生成扩展到时间维度(视频)与空间维度(3D/4D 高斯泼溅、NeRF),并融合文本/音频。
意义:是通向“动态世界模型”的入口;3D/物理一致性决定能否用于仿真与具身。
应用场景:文/图生视频、数字人/虚拟主播、3D 资产生成、机器人仿真、电影预演。
代表论文精读:《InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalization》
F. 概念擦除、溯源与模型安全
简述:概念擦除(让模型遗忘特定概念)、水印/指纹(溯源)、后门与隐私防护。
意义:回应版权与法规,生成进入“可被监管”阶段,是合规上线的刚需。
应用场景:版权风格擦除、AI 生成图溯源打标、防未授权微调、隐私保护生成。
代表论文精读:《Intra-finger Variability of Diffusion-based Latent Fingerprint Generation》
G. 数据集与评测基准
简述:构建新的训练数据集、评测基准与指标,覆盖身份保持、复杂性、安全性等维度。
意义:数据规模与评测合理性决定生成能力的上限与可复现的进步。
应用场景:细粒度身份保持评测、复杂性/组合性基准、安全合规评测、训练数据清洗。
代表论文精读:《Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models》
H. 模型架构、合并与训练
简述:新骨干(如 1D 视觉 tokenizer、DiT 变体)、模型合并/剪枝/调制、训练范式创新。
意义:架构是上述所有路线的性价比底座,决定“能力”与“成本”的交汇点。
应用场景:更高效的 tokenizer、多任务模型合并、端侧轻量骨干、训练稳定性优化。
代表论文精读:《MeanFlow Transformers with Representation Autoencoders》
I. 风格迁移与个性化
简述:把特定艺术风格或特定主体(人物/物体)迁移或固化到生成中,常借助 LoRA/适配器。
意义:支撑创意设计、品牌一致性与虚拟人,是消费级应用的高频需求。
应用场景:个人头像/形象定制、品牌视觉统一、艺术风格滤镜、虚拟偶像。
代表论文精读:《Hist2Style: Histogram-Guided Stylization with Bilateral Grids》
J. 自回归生成
简述:把图像当作 token 序列(VAR/Next-token),与 LLM 生态对齐的下一代架构。
意义:统一图文生成、便于与语言模型/推理链路融合,是架构演进的重要方向。
应用场景:统一多模态生成、与 LLM 联动的图文创作、可控 token 编辑、流式生成。
代表论文精读:《Markovian Scale Prediction: A New Era of Visual Autoregressive Generation》
K. 图像压缩、重建与复原
简述:用生成式方法做超分、压缩、去噪、修补、盲复原(“生成即重建”)。
意义:补足传统方法细节缺失,在受限带宽/低质量输入下恢复高保真结果。
应用场景:老照片/医学图超分、图像压缩传输、去噪去模糊、文物/监控复原。
代表论文精读:《NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration》
L. 扩散基础理论与新范式
简述:扩散/流匹配的理论突破(路径拉直、Mean Flow、最优传输、谱分析)。
意义:理论突破带来事半功倍——少步、稳定、可控,是方法的“放大器”。
应用场景:少步高质量采样、理论指导的架构设计、流匹配训练稳定、可控生成。
代表论文精读:《COT-FM: Cluster-wise Optimal Transport Flow Matching》
M. 人脸、人体与肖像
简述:人脸/人体相关的生成、编辑、换脸、虚拟人驱动(常结合身份约束)。
意义:虚拟主播、影视预演、数字人等高频商业场景的技术核心。
应用场景:换脸/换装、虚拟主播驱动、肖像风格化、表情/姿态重演、证件照生成。
代表论文精读:《High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning》