✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

大模型的剪枝问题

创建时间:2025-11-15 更新时间:2025-11-15 阅读次数:1223 次

问题1:请解释结构化剪枝和非结构化剪枝的区别,并比较它们的优缺点。

回答要点:

非结构化剪枝:

方式:剪掉网络中不重要的单个权重(细粒度)。

优点:粒度细,可以剪掉大量参数而不显著损失精度。

缺点:生成稀疏的权重矩阵,需要专门的稀疏计算库和硬件才能实现加速,通用硬件(如GPU)加速效果差。

结构化剪枝:

方式:剪掉整个通道、滤波器或神经元(粗粒度)。

优点:直接生成更小的稠密模型,可以直接在通用硬件上获得显著的加速。

缺点:粒度粗,对模型精度的伤害通常比非结构化剪枝大。

问题2:常见的剪枝准则有哪些?(即如何判断一个权重或结构是否重要?)

回答要点:

基于权重大小:L1或L2范数最小的权重/通道被认为最不重要。

基于梯度信息:在训练过程中,根据权重的重要性评分(如其梯度)进行剪枝。

基于激活值:平均激活值接近零的通道被认为不重要。

基于Hessian信息:通过计算损失函数对权重的二阶导数(Hessian矩阵)来估计剪枝对损失的影响(非常精确但计算昂贵)。

问题3:在实践中有一种“组合拳”策略,即先剪枝,再蒸馏,最后量化。为什么这个顺序是合理的?

回答要点:

剪枝首先:因为它通过移除冗余结构,从根本上改变了模型架构,使其变得更小、更紧凑。这是一个“外科手术”步骤。

蒸馏其次:剪枝后的模型精度会下降。此时使用强大的教师模型对其进行知识蒸馏,可以恢复甚至提升剪枝后小模型的性能,让它重新变得“聪明”。

量化最后:当模型结构和精度都稳定后,再进行量化。量化是一种“无损/微损”的转换,将确定好的稠密浮点模型转换为低精度格式,以实现最终的存储和加速收益。如果先量化,剪枝和蒸馏的训练过程会变得复杂且低效。

本教程共55节,当前为第23节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款服务于上班族的口袋书,让大家在地铁里/公交上可以学习大模型技术!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>