预训练 是大语言模型学习的第一个、也是最主要、最昂贵的阶段。它的目标是让模型从海量无标注的文本数据中,学习到语言的通用表示、内在规律和世界知识。你可以把它理解为给模型构建一个极其庞大且互联的“知识网络”。
预训练不需要人工标注数据。它使用一种叫 “自监督学习” 的巧妙方法,让模型自己生成学习任务。具体来说:
任务:给定一段文本中的前几个词(或遮盖掉其中一些词),让模型预测下一个词(或被遮盖的词)。
数据:模型会从万亿级别的token(词元)中反复进行这个练习。
目标:通过不断调整内部数百亿甚至万亿的参数,让这个预测越来越准确。
以经典的 GPT(生成式预训练模型) 系列为例:
模型输入:一个很长的文本序列,例如 “今天天气很好,我们一起去...”
模型的学习过程:
模型将这个序列转换成数字(词嵌入)。
经过多层Transformer解码器的自注意力机制,模型分析序列中每个词与其他所有词的关系。
在最后层,模型会输出一个概率分布,覆盖整个词汇表(可能包含几十万个词)。
模型的学习目标:让模型对 “...” 处的正确词(比如 “公园”)赋予最高的概率。
总之,通过海量重复,模型逐渐学会了:
语法:主谓宾搭配、时态、单复数。
事实:“巴黎是法国的首都”,“水的化学式是H₂O”。
逻辑:因为...所以...,如果...那么...
风格:新闻、小说、代码各自的语言风格。
推理链:虽然没有明确教,但通过大量例子,模型可以隐式地学习到多步推理的模式。
预训练所需要的数据量巨大,可达TB级别的文本,来自互联网、书籍、代码、学术论文等。并且,预训练的计算成本极高,需要成千上万个GPU训练数月,耗资巨大。
在预训练阶段,大模型学习的是“可能性”。大模型学到的不是死记硬背,而是“在某种上下文中,下一个词最可能是什么”的概率分布。这背后隐含着语法、逻辑、事实和常识。训练出的模型(称为“基座模型”),如GPT-3、LLaMA、Qwen,是一个“万事通”,但它还不知道如何具体地帮助你。
知识基础:模型在预训练中吸收的“养分”,是其所有后续能力的基石。没有好的预训练,后续微调就是“无米之炊”。
泛化能力:接触过极其多样的数据和语言模式,使得模型在面对新任务、新领域时,有更强的适应潜力。
“涌现能力”的来源:很多大模型的惊人能力(如复杂的推理、代码生成)是在模型参数和预训练数据量达到一定规模后突然涌现的,这主要归功于预训练。
想象一个孩子学习语言:
预训练:他每天听大人聊天、看电视、读书。没有人专门出题考他,但他自己慢慢学会了“吃饭”后面经常跟“了”,“天空”是“蓝色”的,“猫会抓老鼠”。他建立了一个巨大的语言和知识网络。
监督微调:现在,你想让他学会礼貌地回答客人问题。你给他一些示范:“当客人问‘你几岁了?’,你应该回答‘我五岁了,谢谢您的关心。’” 通过几次练习,他就学会了这种特定的交互模式。
总体来说,预训练是让模型“变得博学”的过程,而微调是教它“如何运用学识”的过程。 几乎所有大家现在接触到的主流AI对话模型(ChatGPT、文心一言、通义千问等),都是在强大的预训练基座模型(如GPT-4、Ernie、Qwen)基础上,经过后续的微调和对齐步骤打造而成的。