✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

白盒蒸馏和黑盒蒸馏简介

创建时间:2026-06-28 更新时间:2026-06-28 阅读次数:1050 次

白盒蒸馏(White-box Distillation):蒸馏时,学生模型不仅可以访问教师模型的最终输出(logits),还可以获取其中间层特征、注意力矩阵等内部表示。典型做法是让学生模仿教师每一层的隐藏状态(如Hinton的FitNet),通过均方误差(MSE)约束中间特征。优点是信息丰富,学生能学习到更细腻的语义表征,精度更高;缺点是必须拥有教师模型的全部权重和结构,适用于开源教师(如LLaMA、Falcon)。

黑盒蒸馏(Black-box Distillation):学生模型只能访问教师模型的API输出,即给定输入,获得文本生成结果或概率分数,无法窥探中间层。在GPT-4、Claude 3等闭源商业模型上,这是唯一可行的蒸馏方式。通常做法是:使用大量提示词(Prompts)调用API,收集输入-输出对,然后作为监督数据训练学生模型(类似模仿学习)。其缺点是信息流通量小,仅能模仿最终行为,不易学习到内部的推理路径;优点是实操性强,不依赖开源权重。

在大模型时代的实际意义:黑盒蒸馏远大于白盒蒸馏。原因:

主流最强大的模型(GPT-4、Gemini等)均为闭源,白盒蒸馏无从下手。

工业界常用“大模型生成数据 → 小模型微调”流程,本质就是黑盒蒸馏,且可通过思维链(CoT)数据让学生学习推理步骤,弥补信息不足。

即使开源模型可用,黑盒方案也因实现简单(只需调用API,无需加载庞大师模型)而更受欢迎,尤其在算力有限的团队中。

前沿改进:为提高黑盒效果,可采用“上下文蒸馏”(通过构造多样的任务提示词)或“指令回译”等方法增强数据多样性。

本教程共55节,当前为第35节!
本教程最新修订时间为:2026-08-17 09:09:33

📌 面试天下网:一款便捷的大模型学习口袋书,让富士康流水线的打工人也能摸到改命逆天的机会!
📌 网站公告:程序出海:中国程序员当下最大的机遇>>>>>>