GAN、扩散与流匹配:一文看懂图像生成技术演进的AI Compendium指南
【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium
Maths, CS & AI Compendium是一本以"直觉优先"著称的非传统开源教材,完整覆盖数学、计算机科学与机器学习知识体系。本文跟随这本 AI 教材的计算机视觉与多模态章节,带你从零梳理GAN、扩散模型(Diffusion)、流匹配(Flow Matching)三代图像生成技术的原理、优缺点与演进逻辑——无需工程背景,也能看懂 Midjourney、Stable Diffusion 这类 AI 绘图工具背后的机制。
一、AI 图像生成到底在做什么?
所有文生图模型的本质都是同一件事:学习真实图像的概率分布,再从中"采样"出一张新图。
难点在于:一张 512×512 的图像是一个约 79 万维的向量空间,且同一个提示词(prompt)可以有无数张合理的图。十多年来,研究者先后用三条技术路线攻克了这个难题:
- GAN(生成对抗网络):让两个网络互相博弈来"造假"
- 扩散模型:先加噪、再去噪,把生成变成"逐步修复"
- 流匹配:直接学习一条从噪声到数据的"直线"
下面按时间线逐个拆解。
二、GAN:2014 年的"造币游戏"
🎮生成对抗网络(GAN)由 Goodfellow 等人于 2014 年提出,核心是两个竞争网络:
- 生成器 G:从随机噪声出发,"画出"假图像
- 判别器 D:负责分辨真图和假图
两者交替训练——G 努力骗过 D,D 努力抓出 G。达到均衡时,G 产出的图像已无法与真实数据区分。
⚠️ 注意:此图仅作章节示意,实际 GAN 训练过程请参考教材配套代码任务。
主要问题与改进:
- 模式坍塌(Mode Collapse):G 只会画少数几种"安全"图像,忽略数据多样性,是 GAN 最顽固的失败模式
- StyleGAN(2019):引入风格向量与 AdaIN 调制,能生成 1024×1024 的照片级人脸;不同层分别控制姿态、发型、皮肤纹理等细节,是 GAN 时代的巅峰
- 常用稳定化技巧:谱归一化、渐进式生长、Wasserstein 距离替代原始目标
三、扩散模型:把生成变成"逐步去噪"
🌫️ 扩散模型(以DDPM为代表,2020 年)换了一个更优雅的思路:
- 前向过程:给图像一步步加高斯噪声,直到变成纯噪声
- 反向过程:训练神经网络逐步预测并减掉噪声,从纯噪声"还原"出图像
训练目标极其简单——让网络预测每一步加进去的噪声,用均方误差损失即可。相比 GAN,它没有对抗训练的不稳定,且天然覆盖整个数据分布。
三个关键进化
| 技术 | 解决的问题 |
|---|---|
| DDIM(2021) | 采样从 1000 步压缩到约 50 步,几乎不掉质量 |
| 潜在扩散 / Latent Diffusion(2022) | 先用 VAE 把 512×512×3 的像素压缩成 64×64×4 的潜空间张量,在潜空间去噪,计算量暴降,Stable Diffusion 由此而来 |
| 无分类器引导 CFG | 训练时随机丢弃文本条件,采样时放大"朝提示词方向"的信号;引导系数s=7.5是常见默认值,调得越高越贴合提示词但多样性下降 |
Stable Diffusion 的完整链路:文本编码器(CLIP/T5)→ 潜空间噪声 → U-Net 交叉注意力逐步去噪 → VAE 解码回像素。文字通过 cross-attention 注入——去噪到"红球"该出现的位置时,模型会 attend 到提示词中的 "red" 和 "ball"。
四、流匹配:从噪声到数据的"直线路径"
🚀流匹配(Flow Matching)是扩散模型的最新替代品,核心思想完全不同:
- 不预测"要减掉的噪声",而是学习一个速度场$v_\theta(x, t)$,让样本沿 ODE 轨迹从噪声分布平滑地"流"到数据分布
- 最优传输流匹配(2023)使用直线路径作为目标流:目标速度就是 $x_1 - x_0$,训练损失是简单的速度回归,不需要设计噪声调度
- Rectified Flow(整流):训练一轮后,用模型自己生成的(噪声,数据)配对再训练,把路径越拉越直——路径越直,所需 ODE 积分步数越少,极端情况下一步出图
为什么现在的风向标都是流匹配?
- 训练目标更简单:直接回归速度,无噪声调度
- 采样 ODE 更平滑:所需积分步数更少,生成更快
- 理论根基扎实:与最优传输直接挂钩
实践案例:Stable Diffusion 3 与 Flux均采用流匹配,并把骨干换成DiT(Diffusion Transformer)——用 Transformer 取代 U-Net,把噪声潜码像 ViT 一样切成 patch token 处理;再进一步用MM-DiT让文本 token 和图像 token 双向互相 attend。开源视频模型Wan也用流匹配学习从噪声到视频潜码的直线路径。
五、三代图像生成技术演进对照表
| 维度 | GAN(2014) | 扩散模型(2020) | 流匹配(2022+) |
|---|---|---|---|
| 核心机制 | 生成器 vs 判别器对抗 | 逐步加噪 / 去噪 | 学习噪声→数据的速度场 |
| 训练稳定性 | 差(易模式坍塌) | 好(简单 MSE 损失) | 好(速度回归) |
| 采样速度 | 快(一步出图) | 慢(需多步迭代,DDIM 可加速) | 快(路径越直步数越少) |
| 分布覆盖 | 差 | 好 | 好 |
| 代表系统 | StyleGAN | Stable Diffusion、Imagen | Stable Diffusion 3、Flux、Wan |
一句话总结演进逻辑:GAN 赢在速度但输在稳定性,扩散模型用"多步去噪"换来了质量与多样性,流匹配再把去噪路径"拉直",同时找回速度。
六、如何用这份 Compendium 系统学习图像生成?
📚 本教材把图像生成技术拆进了多个章节,建议按以下路径阅读:
- 入门篇:04. vision transformers and generation.md —— ViT 之后的完整生成脉络:GAN 与 StyleGAN、VAE、DDPM/DDIM、score-based 模型、潜在扩散、流匹配与整流流,还附 JAX 实现的 GAN 训练与扩散前向过程代码任务
- 应用篇:04. cross-modal generation.md —— DALL-E、Stable Diffusion、Imagen、DiT 与流匹配在文生图/文生视频中的落地,含 CFG 实践参数与 Sora 式时空扩散
- 基础篇:03. deep learning.md —— 重参数化技巧、ELBO 等生成模型所需的前置知识
- 配套资源:仓库提供 MCP Server,可让 AI 助手(Cursor、VS Code 等)直接调用本教材作为知识库辅助学习
教材整体结构可参考 README.md,共 20 章从向量空间一路讲到前沿 AI,全部免费开源。
💡学习建议:先读第 08 章建立"噪声→图像"的直觉,再读第 10 章看工程化落地,最后用仓库内置的 JAX 代码任务亲手跑一遍 GAN 与扩散前向过程——直觉 + 动手,正是这本教材的方法论。
【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考