Transformer模型由Google团队在2017年提出,最初用于机器翻译,却彻底改变了深度学习格局。它摒弃了此前统治序列建模的循环神经网络(RNN)和长短时记忆网络(LSTM),不再依赖逐步递归处理输入,而是引入完全基于“自注意力”(Self-Attention)的并行架构。这一设计的核心在于,每个位置的词可以直接计算与序列中所有其他词之间的关联权重,从而一次性捕捉长距离依赖关系,避免了RNN因时序传导导致的信息衰减或梯度消失。自注意力机制的并行计算能力也使训练效率大幅提升——过去处理一个长度为n的序列需要O(n)步,而Transformer只需常数步,仅付出O(n²)的注意力计算代价。这种革命性设计让模型能在翻译、文本摘要等任务中,同时关注上下文中的关键成分(如主语与宾语跨越多个从句的指代),并显著缩短训练时间。

为了增强注意力机制的表达能力,Transformer引入了“多头注意力”(Multi-Head Attention)。它将查询、键、值矩阵分别投影到多个低维子空间,在每个子空间中独立计算自注意力,最后拼接线性变换。不同“头”可以关注不同层面的语义关系:例如一个头学习句法依存,另一个头捕捉共指关系,再一个头聚焦相邻词汇的修饰模式。此外,由于自注意力本对词序不敏感(交换两个词会得到同样的注意力分布),模型设计了“位置编码”(Positional Encoding),用正弦/余弦函数生成的固定向量或可学习的嵌入,为每个词添加其在序列中的绝对或相对位置信号。这两项设计让Transformer既能像卷积网络一样并行处理,又能保留序列顺序信息,还能同时提取多层次特征。正是这种灵活而统一的架构,使它迅速从自然语言处理扩展到图像、语音等其他领域。
Transformer催生了现代大规模预训练模型的两大路线:仅编码器的BERT擅长理解任务(如分类、问答),仅解码器的GPT擅长生成任务(如对话、代码创作);而编码器-解码器结构则完美继承了原始的机器翻译框架。借助缩放定律(Scaling Law),研究者发现增加参数量、数据量和计算量可稳定提升性能,于是诞生了拥有千亿甚至万亿参数的GPT-4、LLaMA、Claude等模型。这些模型通过自回归生成、指令微调与人类反馈强化学习(RLHF),展现出强大的推理与涌现能力。然而Transformer并非完美——其O(n²)的注意力复杂度在处理超长上下文(如百万token的文档或高分辨率图像)时面临内存与计算瓶颈。为此,学界正探索线性注意力、状态空间模型(Mamba)以及混合架构,试图在保持全局建模能力的同时降低复杂度。但无论如何,Transformer已奠定了近十年人工智能发展的技术基石。