✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

模型压缩的基础问题

创建时间:2025-11-12 更新时间:2025-11-12 阅读次数:1228 次

问题1:为什么我们需要对大模型进行压缩?仅仅是为了减少存储空间吗?

回答要点:

  • 存储空间:确实是原因之一,动辄上百GB的模型文件不利于分发和部署。

  • 推理速度/延迟:这是最关键的原因之一。参数越多,计算量越大,响应时间越长,无法满足高并发或实时性要求(如对话、翻译)。

  • 内存占用:模型权重和中间激活值都需要加载到内存(通常是GPU显存)中。大模型会耗尽硬件资源,导致无法运行。

  • 功耗与成本:巨大的计算量带来高额的电力成本和云计算成本。

  • 部署环境:让大模型能够运行在资源受限的边缘设备(如手机、嵌入式设备)上。

问题2:请解释一下计算量(FLOPs)和参数量(Parameters)的区别,并说明哪个更能直接反映推理速度?

回答要点:

  • 参数量:模型中所有需要学习的权重和偏置的总数。它主要决定了模型的大小和内存占用。

  • 计算量:完成一次前向传播所需的浮点运算次数。它衡量的是计算复杂度。

  • 与推理速度的关系:计算量是更相关的指标,但不是唯一决定因素。推理速度还受到:

  • 内存带宽:如果模型参数量巨大,从内存中加载权重的时间可能成为瓶颈(即“内存墙”问题)。

  • 硬件并行度:GPU/TPU等硬件对密集矩阵运算(如大卷积)的优化程度远高于稀疏或不规则运算。

  • 软件和框架优化:算子融合、内核优化等。

结论:一个计算量低但参数量大的模型,其推理速度可能反而不如一个计算量稍高但参数更少的模型

本教程共55节,当前为第20节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款服务于大一新生的口袋书,让大家在无聊的公共课上可以学习大模型技术!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>