✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

扩散模型原理介绍

创建时间:2026-05-19 更新时间:2026-05-20 阅读次数:1066 次

扩散模型是一类受非平衡热力学启发的生成模型。其核心思想由两个过程构成:前向过程与反向过程。

前向过程是一个固定的马尔可夫链,它逐步向数据样本中添加高斯噪声,直至其完全演变为各向同性的纯噪声分布。若原始数据表示为 $x_0$,经过 $T$ 个时间步的加噪后,每一步可描述为:

$$q(x_t|x_{t-1}) = N(x_t; \sqrt{1 - \beta_t} x_{t-1}, \beta_t I)$$

其中 $\beta_t$ 是预设的方差调整参数,控制着每一步注入噪声的强度。这个过程的精妙之处在于,它支持重参数化,允许直接从初始状态 $x_0$ 推导任意时刻的含噪样本 $x_t$,公式为:

$$x_t = \sqrt{\alpha_t} x_0 + \sqrt{1 - \alpha_t} \epsilon_t$$

其中 $\alpha_t = \prod_{s=1}^t (1 - \beta_s)$,$\epsilon_t \sim N(0, I)$。这一性质极大地简化了后续训练时的采样计算。

反向过程是扩散模型的灵魂,目标是学会逆上述破坏过程,从纯噪声中一步步重建出清晰的数据。由于反向转移概率 $q(x_{t-1}|x_t)$ 依赖整个数据分布而无法直接计算,模型便训练一个神经网络 $\theta$ 来近似它,记作 $p_\theta(x_{t-1}|x_t)$。这个网络通常采用能够捕捉多尺度特征的 U-Net 架构。在训练阶段,模型并不直接预测 $x_{t-1}$,而是学习预测前向过程某个时刻所加入的噪声 $\epsilon_t$ 或原始数据 $x_0$。其核心训练目标由变分下界简化而来,通常表述为均方误差损失:

$$L = \mathbb{E}_{t,x_0,\epsilon} [| \epsilon - \epsilon_\theta(x_t, t) |^2]$$

这个优雅的公式意味着,模型在每个时间步只需尽力还原出添加的噪声,当噪声预测得足够准确时,反向去噪的路径便得以清晰确立。

为了突破计算效率的瓶颈,一系列采样加速算法被提出,其中去噪扩散模型是最具代表性的。标准的扩散模型要求反向过程遵循与正向一致的数百年至上千年的马尔可夫链,推理极其缓慢。DDIM 创造性地将其扩展为非马尔可夫过程,推导出了新的采样公式:

$$x_{t-1} = \sqrt{\alpha_{t-1}} \left( \frac{x_t - \sqrt{1 - \alpha_t} \epsilon_\theta(x_t, t)}{\sqrt{\alpha_t}} \right) + \sqrt{1 - \alpha_t} \epsilon_\theta(x_t, t)$$

通过设置噪声项系数为零,DDIM 可以实现完全确定性的采样,这意味着生成过程仅依赖于初始噪声,具备高精度插值能力。更重要的是,DDIM 允许仅使用原始步骤的一个子序列(如从 1000 步中选取 50 步)进行采样,在几乎不牺牲生成质量的前提下,将推理速度提升数十倍,为扩散模型的实时应用扫清了关键障碍。

扩散模型在条件生成领域展现了非凡的灵活度,其中最核心的方法是分类器无关引导。该方法在训练时以一定概率丢弃条件信号 $c$,使同一个网络同时学习条件分布 $p_\theta(x|c)$ 和无条件分布 $p_\theta(x)$。在推理采样时,预测噪声通过两个附加组件得到:

$$\hat{c}_\theta(x_t, c) = \epsilon_\theta(x_t, c) + w \cdot (\epsilon_\theta(x_t, c)-\epsilon_\theta(x_t, \emptyset))$$

其中 $w$ 为引导尺度,当 $w > 1$ 时,模型会放大条件信号的影响,显著提升生成内容与条件的对齐程度,同时往往也增强图像保真度。相比需要额外训练分类器的分类器引导方法,CFG 无需额外模型、实现简洁,且条件形式可涵盖文本、布局、图像等任意模态,因此成为当前主流文生图系统的标配技术。

本教程共55节,当前为第54节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款服务于上班族的口袋书,让大家在地铁里/公交上可以学习大模型技术!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>