扩散模型是一类受非平衡热力学启发的生成模型。其核心思想由两个过程构成:前向过程与反向过程。
前向过程是一个固定的马尔可夫链,它逐步向数据样本中添加高斯噪声,直至其完全演变为各向同性的纯噪声分布。若原始数据表示为 $x_0$,经过 $T$ 个时间步的加噪后,每一步可描述为:
$$q(x_t|x_{t-1}) = N(x_t; \sqrt{1 - \beta_t} x_{t-1}, \beta_t I)$$
其中 $\beta_t$ 是预设的方差调整参数,控制着每一步注入噪声的强度。这个过程的精妙之处在于,它支持重参数化,允许直接从初始状态 $x_0$ 推导任意时刻的含噪样本 $x_t$,公式为:
$$x_t = \sqrt{\alpha_t} x_0 + \sqrt{1 - \alpha_t} \epsilon_t$$
其中 $\alpha_t = \prod_{s=1}^t (1 - \beta_s)$,$\epsilon_t \sim N(0, I)$。这一性质极大地简化了后续训练时的采样计算。
反向过程是扩散模型的灵魂,目标是学会逆上述破坏过程,从纯噪声中一步步重建出清晰的数据。由于反向转移概率 $q(x_{t-1}|x_t)$ 依赖整个数据分布而无法直接计算,模型便训练一个神经网络 $\theta$ 来近似它,记作 $p_\theta(x_{t-1}|x_t)$。这个网络通常采用能够捕捉多尺度特征的 U-Net 架构。在训练阶段,模型并不直接预测 $x_{t-1}$,而是学习预测前向过程某个时刻所加入的噪声 $\epsilon_t$ 或原始数据 $x_0$。其核心训练目标由变分下界简化而来,通常表述为均方误差损失:
$$L = \mathbb{E}_{t,x_0,\epsilon} [| \epsilon - \epsilon_\theta(x_t, t) |^2]$$
这个优雅的公式意味着,模型在每个时间步只需尽力还原出添加的噪声,当噪声预测得足够准确时,反向去噪的路径便得以清晰确立。
为了突破计算效率的瓶颈,一系列采样加速算法被提出,其中去噪扩散模型是最具代表性的。标准的扩散模型要求反向过程遵循与正向一致的数百年至上千年的马尔可夫链,推理极其缓慢。DDIM 创造性地将其扩展为非马尔可夫过程,推导出了新的采样公式:
$$x_{t-1} = \sqrt{\alpha_{t-1}} \left( \frac{x_t - \sqrt{1 - \alpha_t} \epsilon_\theta(x_t, t)}{\sqrt{\alpha_t}} \right) + \sqrt{1 - \alpha_t} \epsilon_\theta(x_t, t)$$
通过设置噪声项系数为零,DDIM 可以实现完全确定性的采样,这意味着生成过程仅依赖于初始噪声,具备高精度插值能力。更重要的是,DDIM 允许仅使用原始步骤的一个子序列(如从 1000 步中选取 50 步)进行采样,在几乎不牺牲生成质量的前提下,将推理速度提升数十倍,为扩散模型的实时应用扫清了关键障碍。
扩散模型在条件生成领域展现了非凡的灵活度,其中最核心的方法是分类器无关引导。该方法在训练时以一定概率丢弃条件信号 $c$,使同一个网络同时学习条件分布 $p_\theta(x|c)$ 和无条件分布 $p_\theta(x)$。在推理采样时,预测噪声通过两个附加组件得到:
$$\hat{c}_\theta(x_t, c) = \epsilon_\theta(x_t, c) + w \cdot (\epsilon_\theta(x_t, c)-\epsilon_\theta(x_t, \emptyset))$$
其中 $w$ 为引导尺度,当 $w > 1$ 时,模型会放大条件信号的影响,显著提升生成内容与条件的对齐程度,同时往往也增强图像保真度。相比需要额外训练分类器的分类器引导方法,CFG 无需额外模型、实现简洁,且条件形式可涵盖文本、布局、图像等任意模态,因此成为当前主流文生图系统的标配技术。