✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

Transformer十大面试题2

创建时间:2026-05-04 更新时间:2026-05-04 阅读次数:1100 次

Transformer 架构已成为现代深度学习,尤其是自然语言处理领域的基石。以下面试考题,从基础概念到深层原理,是面试中常见的考察点。


6. 考题:什么是残差连接和层归一化?它们在 Transformer 中扮演什么角色?

答案:

在 Transformer 中,每个子层(自注意力和 FFN)的输出都会与输入相加(残差连接),然后再进行层归一化(Layer Normalization)。

  • 残差连接: $$ \text{Output} = \text{LayerNorm}(x + \text{Sublayer}(x)) $$

  • 网络深度:它允许梯度通过一条“高速公路”直传到底层,有效解决了深度网络中的梯度消失/爆炸问题,使堆叠数十层模型成为可能。

  • 身份映射:它使网络在初始阶段近似于一个恒等映射,保证了模型至少不会比浅层网络差。

  • 层归一化:对单个训练样本的所有特征维度进行归一化,使其均值为 $0$,方差为 $1$。

角色:
  • 稳定训练:极大地加速了训练收敛,减少了对初始化权重的敏感度。
  • 平滑损失曲面:有研究表明,归一化能让损失函数的地形更平滑,利于优化。

点评:

这道题考察的是对深度学习训练基础构建的理解,但其在 Transformer 中的作用有其特殊性。可以点出“后归一化(Post-LN)”和“前归一化(Pre-LN)”的区别。原始论文使用 Post-LN,即
$$ \text{LayerNorm}(x + \text{Sublayer}(x)) $$,但后来的实践发现 Pre-LN,即 $$ x + \text{Sublayer}(\text{LayerNorm}(x)) $$,训练更稳定,尤其是对于极深的模型,现已成为主流。能指出这一演进,体现了候选人密切追踪工程实践。

更重要的是,要强调残差连接在 Transformer 中的路径分解作用。有研究工作将 Transformer 的复杂计算图分解为大量不同长度的路径,残差连接正是这些路径存在的基础。它使得模型既能通过短路径(相当于浅层网络)快速学习低层特征,又能通过长路径学习复杂的层级化特征。这是一种从模型集成和路径视角出发的深刻理解,远胜于仅提及“防止梯度消失”。


7. 考题:Transformer 在训练和推理时的流程有何关键不同?

答案:

主要不同集中在 解码器和注意力机制上

1. 解码方式:

  • 训练时:采用 强制教学。解码器的输入是整个正确答案序列。通过一个三角掩码矩阵,确保在预测位置 $i$ 的词时,模型只能看到位置 $1$ 到 $i-1$ 的信息。这样,整个目标序列可以一次性并行输入,极大提高训练效率。

  • 推理时:采用 自回归生成。初始输入只有“起始标记”。每次模型预测出一个新的词,就将其拼接到输入序列的尾部,形成新的输入,再送入模型预测下一个词,如此循环直至生成结束标记。这是顺序过程,无法并行。

2. 注意力机制:

  • 自注意力:训练时对所有位置并行计算;推理时解码器自回归,但自注意力计算依然是在当前已生成的序列上进行。

  • 编码器-解码器注意力:训练时,解码器可一次性并行查询编码器的完整输出;推理时,每一步解码都要重新计算该层的注意力,但编码器的输出 $K$, $V$ 只需计算一次,可以缓存复用。

点评:

这题精准区分了理论与实践。死记硬背者可能只复述了“有掩码”,而深入理解者会抓住“并行”与“串行”这一核心矛盾,清晰描绘出两套截然不同的工作流。特别精彩的是点出“KV缓存”技术。由于推理时解码器的每一步,之前所有位置的 $K$, $V$ 向量都不会改变,因此可以将它们缓存起来,避免每步都重复计算。这直接将推理的计算复杂度从 $O(n^2)$ 优化到 $O(n)$,是 Transformer 模型能实际落地的关键工程加速。未能答出此点,说明候选人可能只做过训练,缺乏部署经验。

更深一层,可以提到训练时标签泄漏的风险和掩码的防御作用,以及自回归推理中存在的曝光偏差问题:训练时模型看的是标准答案,推理时看的却是自己产出的可能有错的词。这种对理论与工程差距的洞察,是高年级工程师的必备素质。


8. 考题:Transformer 的复杂度开销主要在哪儿?有哪些优化方案?

答案:

1. 核心瓶颈:

  • 计算复杂度 $O(n^2 \cdot d)$ : 自注意力需要计算 $n \times n$ 的分数矩阵,序列长度 $n$ 是主要瓶颈。当处理长序列时,计算量和显存占用会呈平方级爆炸。
  • 存储复杂度 $O(n^2)$ : 同样是为了存储注意力分数矩阵,对长序列来说显存需求巨大。

2. 主流优化方案:

  • 稀疏注意力和局部注意力:
  • 不计算全局所有 token 对的注意力,只关注局部窗口或进行全局信息的稀疏化选取,将复杂度从 $O(n^2)$ 降到 $O(n \log n)$ 或 $O(n)$。代表:Longformer, BigBird。
  • 线性注意力: 通过改变计算顺序 $(QK^T)V \to Q(K^TV)$ ,避免显式计算 $n \times n$ 矩阵,实现线性复杂度。代表:Linear Transformer, Performer。
  • 状态空间模型: 如 Mamba,完全抛弃了注意力机制,思想是构建一个压缩的序列状态,同时实现线性复杂度,近年来成为 Transformer 的有力挑战者。

点评:

此题面向实战与前沿。只说出平方复杂度是及格,能系统性地分类并提出代表性模型才是优秀。回答的关键在于点出本质:所有优化的目标都是在 维持长距离依赖建模能力和降低计算/存储开销之间寻找帕累托最优解。例如,稀疏注意力基于“不是所有信息都同等重要”的假设;线性注意力则是一个巧妙的计算魔术,以牺牲对常规注意力的完全拟合为代价换取速度。

更进一步,可以简单对比这些方案的优劣:稀疏注意力保留了显式注意力矩阵,可解释性较好,但实现复杂;线性注意力速度提升巨大,但实践中往往效果略有折损。最终如果能引导面试官看向新范式——状态空间模型,并点出其和线性注意力在思想上的联系,如将序列信息压缩进一个固定大小的状态,将充分展现你不仅关注存量技术,更是前沿动态的敏锐观察者。


9. 考题:为什么需要对注意力分数进行 mask 操作?有哪些类型的 mask?

答案:

Mask 操作的目的是防止模型访问不应看到的信息,保证模型的因果性或处理长序列。

主要有三种类型:

1. 因果掩码:

  • 应用于:解码器的自注意力层。
  • 方式与目的:构建一个上三角为 $-\infty$ 的矩阵,确保在预测位置 $i$ 时,只能关注位置 $i$ 及其之前的信息,不能看到未来信息。这是自回归模型成立的基石。

2. 填充掩码:

  • 应用于:所有注意力层。
  • 方式与目的:由于输入批次中的序列长度不一,较短的序列会被加上标记进行填充。为了不让这些无意义的填充词干扰真实信息的注意力计算,需要将它们对应的位置掩掉,通常置为 $-\infty$。

3. 序列掩码:

  • 应用于:某些特定的预训练任务。
  • 方式与目的:例如在 BERT 的掩码语言模型中,会随机掩盖掉输入序列中一定比例的 token。未做此处 mask 的 token 作为上下文,被掩掉的 token 在输出端进行预测。

点评:

此题看似基础,实则关乎模型设计的正当性与实用性。一个洞察是区分“功能性 Mask”和“结构性 Mask”。因果掩码是模型结构的根基,定义了模型的预测方式,是结构性的;而填充掩码则是处理数据差异的工程性手段,确保了批处理的高效执行。能做出这种划分,说明候选人理解了模型的核心逻辑与工程实现的边界。

面试官常在此处追问:“将 mask 值设为 $-\infty$ 后,softmax 会怎样?”精准的回答是,$e^{-\infty}$ 趋近于 $0$,这使得被掩住的注意力权重严格为零,从而在信息加权求和时被完美忽略。这个细节将理论公式与代码实现(如 float(1e-9)-10000)联系起来,考验了理论与实操的结合能力。进一步,提及在实现序列任务时,mask 的任何微小错误都会导致严重的泄漏或训练崩溃,强调了其严谨性。


10. 考题:除了 NLP,Transformer 在哪些领域取得了显著成功?请举例说明。

答案:

Transformer 的序列到序列建模能力极具通用性,已在多个领域大放异彩。

1、计算机视觉:这是最突出的跨界领域。ViT (Vision Transformer) 将图像切分为多个固定大小的图块,将其作为序列输入到标准 Transformer 中,在大型数据集上的表现超越了 CNN 的 SOTA。此后的许多工作进一步优化了效率和性能,如 Swin Transformer。

2、语音处理:语音可以看作一维的时间序列信号。Transformer 可直接用于语音识别(取代 RNN)、语音合成(如 FastSpeech)等任务,更好地捕捉长距离的声学依赖。

3、多模态学习:这是目前最前沿的方向。模型如 CLIP、DALL-E 2 等,利用 Transformer 将文本和图像编码到统一的语义空间,实现了跨模态的检索、理解和生成。

4、计算生物学:在蛋白质结构预测领域创造历史的 AlphaFold 2,其核心就使用了 Transformer 来处理氨基酸序列和残基之间的相互作用,建模复杂的空间关系。

点评:

这题考察的是技术视野和跨界迁移能力。回答的深度体现在,不能只罗列“ViT, AlphaFold”等空洞名词,而要一语道破 Transformer 之所以能跨界的元能力:即将不同来源、不同形态的数据(图像块、语音帧、分子式、文本 token)统一建模为无序集合中的密集关系图。正是这种对成对交互的建模能力和对序列长度的伸缩性,使其成为了通用的“关系计算引擎”。

更好的回答能点出不同领域的适配创新:例如,在视觉领域,由于“像素”序列过长,ViT 创造性地引入图像分块;在 AlphaFold 中,注意力精妙地用以模拟氨基酸残基在三维空间中的成对距离与相互约束。这种“通用核心+特定适配”的思考,展示了候选解复杂系统、进行创新性迁移应用的能力。把这题答得精彩,能将你从一个“NLP 工程师”的标签解放出来,塑造为充满洞察力的“通用 AI 架构师”。

本教程共55节,当前为第10节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款服务于大一新生的口袋书,让大家在无聊的公共课上可以学习大模型技术!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>