✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

温度参数入门介绍

创建时间:2026-06-28 更新时间:2026-06-28 阅读次数:1053 次

一、什么是温度参数 T?

温度参数最初源于统计力学,在机器学习中通过 Softmax 函数发挥作用:

标准 Softmax($T=1$): $$ p_i = \frac{e^{z_i}}{\sum_j e^{z_j}} $$

带温度的 Softmax($T>0$): $$ p_i = \frac{e^{z_i / T}}{\sum_j e^{z_j / T}} $$

其中 $z_i$ 是模型输出的原始分数(logits)。温度 $T$ 的作用如下:

  • $T = 1$:就是标准的 Softmax,输出的是常规概率。
  • $T \to 0$:分布变得极其尖锐,最大值对应的概率接近 $1$,其他接近 $0$,相当于“硬标签”。
  • $T \to \infty$:分布变得越来越平坦、平滑,所有类别的概率趋于相等。
  • $T > 1$:分布比原始概率更“软”,类别间的概率差异被缩小,次要类别的相对概率被放大。

举个例子:三分类任务 假设原始 logits 为 $[5, 2, 1]$,观察不同 $T$ 下的输出概率:

  • $T=1$:$[0.84, 0.12, 0.04]$ 类别 2 和类别 3 的概率很低,信息量少。

  • $T=4$:$[0.49, 0.29, 0.22]$ 类别 2 和类别 3 的概率被明显放大。这揭示了类别 2 比类别 3 更接近类别 1,这就是暗知识


二、温度在知识蒸馏中的作用

知识蒸馏的目标是让学生网络(小模型)不仅学习真实标签,更要模仿教师网络(大模型)的泛化能力。教师输出的概率分布中包含的类别间相似性信息,就是“暗知识”。

温度参数正是提取这些暗知识的关键工具。

1. 提取和传递“暗知识”

  • 问题:训练好的教师网络,其 Softmax 输出往往过于“自信”($T=1$ 时),正确类别的概率接近 $1$,而错误类别的概率被压制得极低。
  • 影响:此时,错误类别之间的概率差异(比如 $0.0001$ 和 $0.00001$ 的区别)所提供的相似性信息,几乎被忽略不计,学生模型从交叉熵损失中学不到多少东西。
  • 解决方法:通过设置 $T > 1$,将教师输出的概率分布“软化”。这放大了非正确类别的概率,清晰展示出教师认为哪些类别与正确类别更相似(例如,一张猫的照片,教师可能认为它像狗的概率远大于像汽车)。
  • 结果:这种软化的概率分布作为训练学生时的软标签,其信息量远比一个 one-hot 硬标签丰富。

2. 控制知识迁移的强度

温度 $T$ 就像一个旋钮,可以调节从教师模型传递的知识粒度。

  • $T$ 较低:教师分布较尖锐,侧重于传递样本与正确类别的核心特征,对次要相似性的关注度低。
  • $T$ 较高:教师分布很平坦,极度强调所有类别间的细微相似性。但 $T$ 过高也有风险,会把噪声也放大。
  • 需要调试:需要根据具体任务寻找一个合适的 $T$ 值,平衡有效知识的传递和噪声的抑制。通常学生网络越小,需要更软的目标,因此可能需要更高的 $T$。

3. 配合损失函数进行训练

在蒸馏中,温度参与的是学生与教师的蒸馏损失计算:

$$ L_{distill} = \text{KL}\left( \text{Softmax}\left(\frac{z_s}{T}\right) \parallel \text{Softmax}\left(\frac{z_t}{T}\right) \right) $$

这里关键的一点是:学生和教师必须使用完全相同的温度 $T$,才能在同一尺度上比较概率分布。

同时,学生的总损失通常是蒸馏损失和传统交叉熵损失的加权和。为了保证两部分损失的梯度尺度平衡,通常会给蒸馏损失乘以 $T^2$。


总的来说,温度参数让知识蒸馏从简单模仿“标准答案”,变成学习一个行业前辈的“判断直觉”,从而传递给轻量级模型。

本教程共55节,当前为第29节!
本教程最新修订时间为:2026-08-17 09:09:33

📌 面试天下网:一款服务于大一新生的口袋书,让大家在无聊的公共课上可以学习大模型技术!
📌 网站公告:程序出海:中国程序员当下最大的机遇>>>>>>