《大模型面试精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

模型量化常见考题

创建时间:2025-11-13 更新时间:2025-11-13 阅读次数:1202 次

问题1:什么是模型量化?请解释INT8量化的工作原理。

回答要点:

定义:将模型中高精度浮点数(如FP32)的权重和激活值,转换为低精度整数(如INT8)的过程。

工作原理(对称量化):

确定范围:找到Tensor(权重或激活值)的绝对最大值 |max|。

计算缩放因子:scale = |max| / (2^(b-1)-1), 对于INT8,分母是127。

量化:将FP32值除以scale,然后四舍五入到最近的整数:q = round(fp / scale)。

反量化:在计算时,将整数值转换回近似的FP32值:fp" = q * scale。

问题2:训练后量化(PTQ)和量化感知训练(QAT)有什么区别?各自适用于什么场景?

回答要点:

训练后量化:

过程:在模型训练完成后,直接对权重进行量化。对激活值的量化可能需要一个校准集来确定动态范围。

优点:简单、快速,无需重新训练。

缺点:精度损失通常较大,尤其是当模型权重或激活值分布不均匀时。

场景:作为部署前的快速优化步骤,对精度要求不极致的场景。

量化感知训练:

过程:在模型训练(或微调)过程中,模拟量化的效果。前向传播使用模拟的量化值,反向传播则通过直通估计器来更新高精度的权重。

优点:模型在训练时就“学会”了适应低精度表示,精度损失非常小,甚至可忽略。

缺点:需要额外的训练时间和计算资源。

场景:对精度要求严苛的工业级部署。

本教程共55节,当前为第22节!
本教程最新修订时间为:2026-07-09 20:21:04