GAN、扩散与流匹配:一文看懂图像生成技术演进的AI Compendium指南
2026/9/17 20:43:43 网站建设 项目流程

GAN、扩散与流匹配:一文看懂图像生成技术演进的AI Compendium指南

【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium

Maths, CS & AI Compendium是一本以"直觉优先"著称的非传统开源教材,完整覆盖数学、计算机科学与机器学习知识体系。本文跟随这本 AI 教材的计算机视觉与多模态章节,带你从零梳理GAN、扩散模型(Diffusion)、流匹配(Flow Matching)三代图像生成技术的原理、优缺点与演进逻辑——无需工程背景,也能看懂 Midjourney、Stable Diffusion 这类 AI 绘图工具背后的机制。

一、AI 图像生成到底在做什么?

所有文生图模型的本质都是同一件事:学习真实图像的概率分布,再从中"采样"出一张新图

难点在于:一张 512×512 的图像是一个约 79 万维的向量空间,且同一个提示词(prompt)可以有无数张合理的图。十多年来,研究者先后用三条技术路线攻克了这个难题:

  1. GAN(生成对抗网络):让两个网络互相博弈来"造假"
  2. 扩散模型:先加噪、再去噪,把生成变成"逐步修复"
  3. 流匹配:直接学习一条从噪声到数据的"直线"

下面按时间线逐个拆解。

二、GAN:2014 年的"造币游戏"

🎮生成对抗网络(GAN)由 Goodfellow 等人于 2014 年提出,核心是两个竞争网络:

  • 生成器 G:从随机噪声出发,"画出"假图像
  • 判别器 D:负责分辨真图和假图

两者交替训练——G 努力骗过 D,D 努力抓出 G。达到均衡时,G 产出的图像已无法与真实数据区分。

⚠️ 注意:此图仅作章节示意,实际 GAN 训练过程请参考教材配套代码任务。

主要问题与改进:

  • 模式坍塌(Mode Collapse):G 只会画少数几种"安全"图像,忽略数据多样性,是 GAN 最顽固的失败模式
  • StyleGAN(2019):引入风格向量与 AdaIN 调制,能生成 1024×1024 的照片级人脸;不同层分别控制姿态、发型、皮肤纹理等细节,是 GAN 时代的巅峰
  • 常用稳定化技巧:谱归一化、渐进式生长、Wasserstein 距离替代原始目标

三、扩散模型:把生成变成"逐步去噪"

🌫️ 扩散模型(以DDPM为代表,2020 年)换了一个更优雅的思路:

  • 前向过程:给图像一步步加高斯噪声,直到变成纯噪声
  • 反向过程:训练神经网络逐步预测并减掉噪声,从纯噪声"还原"出图像

训练目标极其简单——让网络预测每一步加进去的噪声,用均方误差损失即可。相比 GAN,它没有对抗训练的不稳定,且天然覆盖整个数据分布。

三个关键进化

技术解决的问题
DDIM(2021)采样从 1000 步压缩到约 50 步,几乎不掉质量
潜在扩散 / Latent Diffusion(2022)先用 VAE 把 512×512×3 的像素压缩成 64×64×4 的潜空间张量,在潜空间去噪,计算量暴降,Stable Diffusion 由此而来
无分类器引导 CFG训练时随机丢弃文本条件,采样时放大"朝提示词方向"的信号;引导系数s=7.5是常见默认值,调得越高越贴合提示词但多样性下降

Stable Diffusion 的完整链路:文本编码器(CLIP/T5)→ 潜空间噪声 → U-Net 交叉注意力逐步去噪 → VAE 解码回像素。文字通过 cross-attention 注入——去噪到"红球"该出现的位置时,模型会 attend 到提示词中的 "red" 和 "ball"。

四、流匹配:从噪声到数据的"直线路径"

🚀流匹配(Flow Matching)是扩散模型的最新替代品,核心思想完全不同:

  • 不预测"要减掉的噪声",而是学习一个速度场$v_\theta(x, t)$,让样本沿 ODE 轨迹从噪声分布平滑地"流"到数据分布
  • 最优传输流匹配(2023)使用直线路径作为目标流:目标速度就是 $x_1 - x_0$,训练损失是简单的速度回归,不需要设计噪声调度
  • Rectified Flow(整流):训练一轮后,用模型自己生成的(噪声,数据)配对再训练,把路径越拉越直——路径越直,所需 ODE 积分步数越少,极端情况下一步出图

为什么现在的风向标都是流匹配?

  • 训练目标更简单:直接回归速度,无噪声调度
  • 采样 ODE 更平滑:所需积分步数更少,生成更快
  • 理论根基扎实:与最优传输直接挂钩

实践案例:Stable Diffusion 3 与 Flux均采用流匹配,并把骨干换成DiT(Diffusion Transformer)——用 Transformer 取代 U-Net,把噪声潜码像 ViT 一样切成 patch token 处理;再进一步用MM-DiT让文本 token 和图像 token 双向互相 attend。开源视频模型Wan也用流匹配学习从噪声到视频潜码的直线路径。

五、三代图像生成技术演进对照表

维度GAN(2014)扩散模型(2020)流匹配(2022+)
核心机制生成器 vs 判别器对抗逐步加噪 / 去噪学习噪声→数据的速度场
训练稳定性差(易模式坍塌)好(简单 MSE 损失)好(速度回归)
采样速度快(一步出图)慢(需多步迭代,DDIM 可加速)快(路径越直步数越少)
分布覆盖
代表系统StyleGANStable Diffusion、ImagenStable Diffusion 3、Flux、Wan

一句话总结演进逻辑:GAN 赢在速度但输在稳定性,扩散模型用"多步去噪"换来了质量与多样性,流匹配再把去噪路径"拉直",同时找回速度

六、如何用这份 Compendium 系统学习图像生成?

📚 本教材把图像生成技术拆进了多个章节,建议按以下路径阅读:

  • 入门篇:04. vision transformers and generation.md —— ViT 之后的完整生成脉络:GAN 与 StyleGAN、VAE、DDPM/DDIM、score-based 模型、潜在扩散、流匹配与整流流,还附 JAX 实现的 GAN 训练与扩散前向过程代码任务
  • 应用篇:04. cross-modal generation.md —— DALL-E、Stable Diffusion、Imagen、DiT 与流匹配在文生图/文生视频中的落地,含 CFG 实践参数与 Sora 式时空扩散
  • 基础篇:03. deep learning.md —— 重参数化技巧、ELBO 等生成模型所需的前置知识
  • 配套资源:仓库提供 MCP Server,可让 AI 助手(Cursor、VS Code 等)直接调用本教材作为知识库辅助学习

教材整体结构可参考 README.md,共 20 章从向量空间一路讲到前沿 AI,全部免费开源。

💡学习建议:先读第 08 章建立"噪声→图像"的直觉,再读第 10 章看工程化落地,最后用仓库内置的 JAX 代码任务亲手跑一遍 GAN 与扩散前向过程——直觉 + 动手,正是这本教材的方法论。

【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询