✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

大模型量化

创建时间:2026-06-28 更新时间:2026-06-28 阅读次数:1050 次

大模型量化简介

大模型量化,简单来说,就是给模型“减肥”和“提速”。它通过降低模型参数的数值精度(比如从32位浮点数降到8位整数),来显著减少模型对存储空间和计算能力的需求,同时尽可能保持其原有的性能。在大模型时代,量化已成为部署模型的核心技术之一,尤其是在资源受限的设备(如手机、边缘设备)上。

量化本质是将浮点数(通常为FP32)映射到低比特整数(如INT8、INT4)的过程,其基本公式为:

$$ Q = round \left(\frac {W - zero\_point} {scale} \right)^2 $$

其中,W 是原始浮点权重,scale(缩放因子)和 zero_point(零点)决定了映射的范围。量化后,矩阵乘法可由整数运算完成,大幅提升速度并减少显存占用(FP32转INT8理论可减少75%大小)。

核心目标:解决大模型的“三高”问题

现代大语言模型(LLMs)的参数量动辄数百亿甚至上千亿。以GPT-3为例,其175B参数在16位精度下就需要约350GB的显存才能加载,这对硬件是巨大的挑战。量化的目标就是直接解决这个痛点:

减少存储:模型体积可压缩至原来的1/4甚至更小。

加速推理:低精度计算更快,推理速度可提升2-4倍。

降低能耗:减少计算所需的能源消耗。

PTQ(训练后量化) 和 QAT(量化感知训练)

根据量化的介入时机,主要分为两大流派:

训练后量化 (Post-Training Quantization, PTQ):这是最主流、最便捷的方式。它直接在已训练好的模型上应用量化,无需重新训练。优点是速度快、成本低,适合计算资源有限的场景。缺点是可能带来1-3%的精度损失,尤其是在低比特(如4-bit)时。

量化感知训练 (Quantization-Aware Training, QAT):这是一种更精细的方法。它在模型训练或微调的过程中就模拟量化效果(“伪量化”),让模型提前适应精度降低带来的影响,从而在最终量化时最大程度地恢复精度。QAT是追求极致精度时的选择。

选型建议:对于大模型,PTQ(如GPTQ、AWQ算法)因其零训练成本更受欢迎;若精度不达标,再考虑对关键层做QAT微调。

本教程共55节,当前为第32节!
本教程最新修订时间为:2026-08-17 09:09:33

📌 面试天下网:一款服务于大一新生的口袋书,让大家在无聊的公共课上可以学习大模型技术!
📌 网站公告:程序出海:中国程序员当下最大的机遇>>>>>>