(论文速读)INPO:基于再参数DDIM的扩散模型高效配准的反演偏好优化
2026/8/28 17:18:26 网站建设 项目流程

论文题目:InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model Alignment(INPO:基于再参数ddim的扩散模型高效配准的反演偏好优化)

会议:CVPR2025

摘要:直接偏好优化(DPO)在不使用显式奖励的情况下,使用成对的人类偏好数据来微调生成模型,这一方法在大型语言模型(LLM)中得到了相当大的关注。然而,使文本到图像(T2I)扩散模型与人类偏好保持一致的探索仍然有限。与有监督的精调相比,现有的对准扩散模型的方法存在训练效率低和生成质量不佳的问题,这是由于马尔可夫链过程长和逆过程的难解性造成的。为了解决这些局限性,我们引入了一种有效的扩散模型直接偏好对齐方法--DDIM-INPO。我们的方法将扩散模型概念化为一步生成模型,允许我们有选择地微调特定潜在变量的输出。为了实现这一目标,我们首先通过重新参数化技术将隐含报酬直接分配给任何潜在变量。然后,我们构造了一种反演技术来估计适当的潜在变量以进行偏好优化。这一修改过程使扩散模型能够仅微调与偏好数据集具有很强相关性的潜在变量的输出。实验结果表明,我们的ddim-INPO只需400步的微调就能获得最先进的性能,超过了人类偏好评估任务中T2I扩散模型的所有偏好对齐基线。


DDIM-InPO:让扩散模型对齐人类偏好快 18 倍的新方法

一、背景:为什么需要让扩散模型"对齐"人类偏好?

近年来,以 Stable Diffusion、SDXL 为代表的文本生成图像(T2I)扩散模型在图像质量上取得了显著进展。然而,这些模型通常在海量噪声数据上进行预训练,生成的图像往往与真实用户的审美偏好存在差距——可能在构图、光线、风格或文字一致性上不尽如人意。

大语言模型(LLM)领域早已形成了一套成熟的"对齐"范式:先在大规模数据上预训练,再用少量人类偏好数据进行对齐微调(RLHF / DPO)。然而,将这套方法迁移到扩散模型并非易事,现有方法普遍存在训练效率低、生成质量差的问题。


二、现有方法的三大痛点

1. 奖励泄漏与显存爆炸

DRaFT、AlignProp 等方法通过训练一个奖励模型,然后将奖励梯度反向传播过整条采样链来更新扩散模型。这种做法需要在所有去噪步上保留计算图,显存开销极大,并且容易产生"奖励泄漏"(reward leakage)——模型会过度优化奖励函数,而非真正对齐人类偏好。

2. 稀疏奖励导致训练极慢

DPOK、DDPO 将扩散模型的去噪过程建模为马尔可夫决策过程(MDP),用策略梯度方法进行优化。但由于一张图片需要经历数十甚至数百个去噪步才能生成,有效的奖励反馈只能在完整轨迹末端获得,导致严重的稀疏奖励问题,训练极不稳定且效率低下。

3. DPO 方法的决策空间过大

Diffusion-DPO、D3PO 将 LLM 中的 DPO 思想引入扩散模型,通过在所有去噪步上展开奖励来构造训练目标。然而,这本质上仍然是将奖励分配到整条马尔可夫链上,稀疏奖励问题依然存在,在分布外输入上的泛化能力有限,训练效率也较低。


三、DDIM-InPO 的核心思路

本文的出发点是一个简洁的洞察:

能否把扩散模型当作"单步生成模型"来处理,直接优化与目标图像强相关的少数潜变量,而非展开整条马尔可夫链?

基于这一思路,作者提出了DDIM-InPO,其核心由两个技术模块组成。


四、技术方法详解

4.1 重参数化 DDIM:把任意时间步的潜变量与图像直接挂钩

【论文 Figure 2,Inversion for Preference Optimization 示意图】

传统 Diffusion-DPO 在噪声图像空间中操作,需要将奖励分摊到所有去噪步,导致决策空间庞大。

DDIM-InPO 的关键在于引入了一个"初始变量"

其中的含义是:在时间步 t 对噪声图像做单步去噪后,得到的近似干净图像,它处于空间中,且满足

这一重参数化的好处在于:联合分布变得良定义,可以在任意时间步 t 直接为分配隐式奖励,无需展开完整的去噪轨迹。

在此基础上,作者将原始 RLHF 目标改写为关于联合分布的优化问题,并类比 DPO 推导过程,得到了扩散模型的新优化目标(Eq. 11)。

4.2 基于 Inversion 的偏好优化:找到"合适"的潜变量

有了新的优化目标,下一个问题是:给定偏好数据集中的图像,如何找到对应的,使得能在单步内生成的近似?

这等价于求解一个非线性方程组(Eq. 12),而 DDIM Inversion 正好提供了一种有效的估计手段。具体来说:

  1. 先在空间利用 DDIM Inversion(Eq. 15),从出发迭代估计
  2. 再根据 Eq. 16 计算,其中由 Inversion 步骤给出。

这样得到的高度相关,保证了优化目标(Eq. 11)的有效性。

4.3 最终损失函数:简洁而高效

经过 Jensen 不等式近似与化简,最终的 DDIM-InPO 损失(Eq. 18)形式如下:

其中是由 Inversion 得到的目标噪声,w(t) 为与 Diffusion-DPO 一致的权重函数。

与 Diffusion-DPO 的联系:Diffusion-DPO 实际上是 DDIM-InPO 的一个特例——当被近似为独立同分布的随机噪声时,DDIM-InPO 退化为 Diffusion-DPO。也就是说,Diffusion-DPO 使用的是一个"粗糙"的估计,而 DDIM-InPO 通过 Inversion 获得了更精准的估计,因此性能更优。


五、实验设置

数据集:Pick-a-Pic v2,包含 851,293 对偏好图像和 58,960 个独特提示词(排除约 12% 无法判断偏好的样本)。

基础模型:Stable Diffusion 1.5(SD1.5)和 Stable Diffusion XL-base-1.0(SDXL)。

基线方法:Base model、SFT(监督微调)、Diffusion-DPO、Diffusion-KTO(仅用于 SD1.5)。

评估指标

  • 自动评估:LAION 美学分类器(Aesthetic)、CLIP 文本-图像对齐分数、PickScore、HPSv2;测试集为 Parti-Prompts(1632 条)和 HPDv2(3200 条)。
  • 人工评估:16 名参与者,回答三个问题:(1) 整体偏好;(2) 视觉吸引力;(3) 文字对齐程度。
  • 训练效率:H800 GPU 小时数。

训练配置:8 张 NVIDIA H800 GPU,每卡 batch size 为 1 对图像,梯度累积 128 步,等效 batch size 为 1024 对(Diffusion-DPO 的一半)。SD1.5 使用 AdamW 优化器,SDXL 使用 Adafactor。


六、实验结果

6.1 量化结果:全面超越基线

【论文 Table 1,Win-rate comparison between DDIM-InPO and baselines】

在 HPDv2 和 Parti-Prompts 两个测试集上,InPO 对齐的模型在几乎所有评估指标上均超越基线:

  • InPO-SDXL vs DPO-SDXL(HPDv2,HPSv2):win-rate65.81%
  • InPO-SDXL vs SFT-SDXL(HPDv2,HPSv2):win-rate89.91%
  • InPO-SDXL vs Base-SDXL(HPDv2,HPSv2):win-rate85.38%
  • InPO-SD1.5 vs KTO-SD1.5(HPDv2,HPSv2):win-rate60.94%
  • InPO-SD1.5 vs Base-SD1.5(HPDv2,HPSv2):win-rate90.22%

6.2 训练效率:大幅领先

【论文 Figure 4,训练效率与生成质量的权衡对比气泡图】

在 SD1.5 上的 HPDv2 测试集结果表明:

  • 仅需400 步微调即可达到 state-of-the-art;
  • 训练速度比 Diffusion-KTO 快18.4 倍
  • 训练速度比 Diffusion-DPO 快3.6 倍
  • 在使用更少训练数据的情况下,生成质量仍高于两者。

6.3 人工评估结果

【论文 Figure 3 上半部分,用户研究柱状图】

16 名人工评估者的结果如下(InPO-SDXL vs DPO-SDXL vs Base-SDXL):

评估维度InPO-SDXLDPO-SDXLBase-SDXL
Q1 整体偏好60%23%18%
Q2 视觉吸引力73%17%10%
Q3 文字对齐61%23%16%

InPO-SDXL 在三项指标上均大幅领先。

6.4 消融实验

【论文 Table 2,Ablation studies】

作者在 SD1.5 上进行了详细消融,主要发现包括:

  • DDIM Inversion 是核心:加入 Inversion 后,四项指标相较于 Base initialized 基准均有显著提升。
  • Inversion 步数:步数越多(n=30)性能越好,但训练时间增加(需 136 GPU 小时);n=10 在质量(Aesthetic 5.7734,PickScore 21.894,HPSv2 28.523,CLIP 36.876)与效率(57.6 GPU 小时)之间取得最佳平衡。
  • β 参数:β 设置过高会导致 KL 散度惩罚项过强,限制模型调整灵活性;SD1.5 选用 β=2000 最优。
  • Inversion 时的 CFG:Inversion 过程中使用会引入数值误差,影响偏好微调效果,因此采用无条件 DDIM Inversion()。

6.5 定性结果

【论文 Figure 3 下半部分,InPO-SDXL vs DPO-SDXL vs Base-SDXL 定性对比】

【论文 Figure 5,DDIM-InPO 的六项优势对比图】

InPO-SDXL 生成的图像相比基线展现出多方面优势:

  1. 增强的光线与空间结构
  2. 更真实的细节捕捉
  3. 更具想象力的创意设计
  4. 稳定的色彩一致性
  5. 优化的多实例布局
  6. 图像中文字的准确集成

七、扩展实验

7.1 AI 偏好优化

【论文 Figure 6,PickScore 和 HPSv2 中位数对比柱状图】

由于人工标注成本高昂,作者还探索了用 AI 评估器(PickScore 和 HPSv2)重新标注 Pick-a-Pic v2 数据集,并用重标注数据微调 SD1.5。结果显示 PickScore 和 HPSv2 两项指标相较于人工标注版本进一步提升,验证了 AI 反馈驱动对齐的可行性。

7.2 条件生成

【论文 Figure 7,InPO-SDXL 在 depth map / canny edge / inpainting 任务上的对比】

将 InPO-SDXL 与基于 Base-SDXL 训练的 ControlNet 结合,无需任何额外训练即可直接用于条件生成任务(深度图控制、Canny 边缘控制、图像修复)。结果表明,InPO 学到的偏好对齐能力可以无缝迁移到条件生成场景,生成质量显著优于 Base-SDXL 和 DPO-SDXL。


八、总结与局限性

DDIM-InPO 通过以下两个关键创新,系统性地解决了扩散模型偏好对齐中的训练效率与稀疏奖励问题:

  1. 重参数化 DDIM:将扩散模型视为单步生成模型,使隐式奖励可以在任意时间步直接分配;
  2. 基于 Inversion 的潜变量估计:精准定位与偏好数据高度相关的潜变量,集中优化资源。

最终效果:仅需400 步微调,训练速度提升最高18.4 倍,在所有主流评估指标上超越现有基线。

局限性

  • 方法基于离线微调,对数据集质量敏感;若训练数据中含有有害、暴力或色情内容,可能导致不当输出。
  • 在线训练范式(online RLHF)被作者认为是未来更可靠的方向。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询