✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

LoRA 的原理是什么?为什么低秩有效?

创建时间:2026-08-30 更新时间:2026-08-30 阅读次数:1021 次

LoRA 的原理、低秩有效性及面试题价值分析

一、LoRA 的原理

LoRA(Low-Rank Adaptation)的核心思想是:冻结预训练模型的原始权重,只训练注入的低秩分解矩阵来近似权重的更新量。

1. 数学表达

对于预训练模型中的一个权重矩阵 $W_0 \in \mathbb{R}^{d \times k}$,在微调时,我们不直接更新 $W_0$,而是学习一个增量 $\Delta W$,并将其分解为两个低秩矩阵的乘积:

$$ \Delta W = B A $$

其中:

  • $A \in \mathbb{R}^{r \times k}$,$B \in \mathbb{R}^{d \times r}$,秩 $r \ll \min(d, k)$
  • 前向传播变为:

$$ h = W_0 x + \Delta W x = W_0 x + BAx $$

  • 通常对 $A$ 使用随机高斯初始化,$B$ 初始化为零矩阵,因此训练开始时 $\Delta W = 0$,模型行为与预训练模型完全一致。

2. 缩放因子

LoRA 中常引入一个缩放因子 $\alpha$,实际更新量为:

$$ h = W_0 x + \frac{\alpha}{r} BA x $$

$\alpha$ 与秩 $r$ 一起控制 LoRA 对原始模型行为的扰动幅度。$\alpha$ 越大,LoRA 的影响越强;$\alpha$ 越小,模型越接近原始预训练行为。


二、为什么低秩有效?

这是整道题最核心、也最有讨论深度的部分。可以从以下几个角度来解释:

1. 内在低秩假设(Intrinsic Rank Hypothesis)

Aghajanyan et al.(2020)的研究发现:预训练语言模型在适应下游任务时,权重的更新量 $\Delta W$ 即使是在满秩空间中进行微调,其有效的“内在维度”也很低。

换句话说,模型不需要在几百万维的参数空间中自由移动,只需要在一个低维子空间中调整就足以适应新任务。

LoRA 正是利用了这一观察:与其学习完整的 $\Delta W$($d \times k$ 个参数),不如只学习它在低秩子空间中的表示 $BA$($r(d+k)$ 个参数)。

2. 预训练权重已经提供了良好的基座

预训练模型经过大规模语料训练,其权重矩阵已经编码了丰富的通用语言知识。下游任务的微调本质上是在这个通用表示之上做“小幅修正”。

这种修正不需要推翻整个权重矩阵,只需要在某些关键方向上做调整即可。低秩分解恰好提供了一种结构化的、参数高效的方式来表达这种“小幅修正”。

3. 正则化效应

低秩约束本身就具有正则化作用。它限制了参数更新的自由度,迫使模型在低维流形上寻找解,从而:

  • 降低了过拟合风险,尤其是在下游任务数据量较小的情况下
  • 防止模型偏离预训练分布太远(避免灾难性遗忘)

这类似于权重衰减或 dropout 的效果,但 LoRA 是通过结构性约束实现的。

4. 与谱分析的联系

从奇异值分解的角度看,权重更新 $\Delta W$ 中最重要的方向通常对应最大的奇异值。低秩分解相当于只保留 $\Delta W$ 的前 $r$ 个主成分方向,丢弃噪声或次要方向。这与主成分分析的直觉一致:大部分“信号”集中在少数几个方向上。


三、作为面试题的考察点

这道题完全可以作为面试题,且质量很高。以下是它能够区分的层次:

1. 基础层(能说清楚“是什么”)

  • 能准确说出 LoRA 的公式 $W = W_0 + BA$
  • 知道 $A$、$B$ 的初始化方式
  • 知道只训练 $A$、$B$,冻结 $W_0$
  • 知道参数量的减少比例:从 $d \times k$ 降到 $r(d+k)$

2. 进阶层(能解释“为什么”)

  • 能引用内在维度/内在秩的研究
  • 能解释为什么预训练权重不需要大幅修改
  • 能说明低秩约束的正则化作用
  • 能讨论秩 $r$ 的选取经验(常见为 8、16、32 等)

3. 高阶层(能批判性思考)

  • 能讨论 LoRA 的局限性:不是所有任务都满足低秩假设(如需要学习全新知识的任务可能效果不如全参微调)
  • 能对比 LoRA 与其他 PEFT 方法的异同(Adapter、Prefix Tuning、Prompt Tuning)
  • 能讨论 LoRA 的变体:如 QLoRA、AdaLoRA、DoRA 等
  • 能分析为什么 LoRA 通常只应用于注意力层的 $W_q$、$W_v$ 而非所有层
  • 能讨论 $\alpha$ 与 $r$ 之间的缩放关系及其实际调参经验
  • 能讨论 LoRA 合并回原权重的利弊

四、总结

维度 内容
核心公式 $W = W_0 + BA$,$\text{rank}(BA) \le r$
关键洞察 微调时的权重更新量具有低内在秩
训练参数 $r(d+k)$ 而非 $d \times k$
正则化效果 低秩约束限制模型偏离预训练分布
面试价值 高——能区分候选人是对公式死记硬背还是有真正的数学直觉

这道题特别适合在大模型/LLM 微调相关的面试中提出,作为考察候选人理论与实践结合能力的标准题目。


📌 面试天下网:一款便捷的大模型学习口袋书,让富士康流水线的打工人也能摸到改命逆天的机会!
📌 网站公告:【悬赏 200 元/篇】寻找“大模型面试战场”的一手回忆录

评论专区

评论加载中...