✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

知识蒸馏常见考题

创建时间:2025-11-13 更新时间:2025-11-13 阅读次数:1222 次

问题1:请简述知识蒸馏的核心思想,并说明Teacher模型和Student模型分别扮演什么角色?

回答要点:

  • 核心思想:将一个庞大而精确的“教师模型”所学到的“知识”,迁移到一个更小、更高效的“学生模型”中。这里的“知识”不仅指最终的预测结果(硬标签),更重要的是模型输出的概率分布(软标签)。

  • Teacher模型:大型、高性能、高精度的预训练模型。其作用是提供丰富的、包含类间相似性关系的软标签(例如,“猫”和“狗”的相似度可能高于“猫”和“汽车”)。

  • Student模型:小型、待训练的高效模型。其目标是模仿Teacher的输出行为,而不仅仅是拟合原始数据的硬标签。

问题2:知识蒸馏的损失函数通常由哪两部分组成?为什么要结合使用它们?

回答要点:

  • 两部分损失:

  • 蒸馏损失:衡量Student输出的软概率分布与Teacher输出的软概率分布之间的差异,通常使用KL散度。

  • 学生损失:衡量Student输出的硬概率分布与真实标签之间的差异,通常使用交叉熵损失。

  • 总损失函数:L_total = α * L_distill + (1 - α) * L_student (α是超参数)。

  • 结合原因:

  • 蒸馏损失:让学生学习Teacher的泛化能力和暗知识,平滑决策边界,通常效果更好。

  • 学生损失:作为一种保障,确保学生不会完全偏离真实的数据分布,起到锚定作用。

问题3(进阶):在大语言模型的蒸馏中,除了最终输出的logits,还可以从Teacher模型的哪些部分抽取“知识”?

回答要点:

  • 中间层特征:让学生模型的中间层输出尽可能接近教师模型的对应中间层输出。

  • 注意力矩阵:让学生模型的注意力图模仿教师模型的注意力图,学习其关注重点。

  • 隐藏状态:对齐中间隐藏层的激活值。

  • 思维链:让学生不仅学习最终答案,还学习教师模型生成答案的推理过程。

本教程共55节,当前为第21节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款便捷的大模型学习口袋书,让富士康流水线的打工人也能摸到改命逆天的机会!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>