✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

预训练技术简介

创建时间:2026-01-18 更新时间:2026-01-19 阅读次数:1142 次

1、什么是预训练?

预训练 是大语言模型学习的第一个、也是最主要、最昂贵的阶段。它的目标是让模型从海量无标注的文本数据中,学习到语言的通用表示、内在规律和世界知识。你可以把它理解为给模型构建一个极其庞大且互联的“知识网络”。

2、预训练的核心思想:自监督学习

预训练不需要人工标注数据。它使用一种叫 “自监督学习” 的巧妙方法,让模型自己生成学习任务。具体来说:

  • 任务:给定一段文本中的前几个词(或遮盖掉其中一些词),让模型预测下一个词(或被遮盖的词)。

  • 数据:模型会从万亿级别的token(词元)中反复进行这个练习。

  • 目标:通过不断调整内部数百亿甚至万亿的参数,让这个预测越来越准确。

3、预训练具体做什么?

以经典的 GPT(生成式预训练模型) 系列为例:

模型输入:一个很长的文本序列,例如 “今天天气很好,我们一起去...”

模型的学习过程:

  • 模型将这个序列转换成数字(词嵌入)。

  • 经过多层Transformer解码器的自注意力机制,模型分析序列中每个词与其他所有词的关系。

  • 在最后层,模型会输出一个概率分布,覆盖整个词汇表(可能包含几十万个词)。

模型的学习目标:让模型对 “...” 处的正确词(比如 “公园”)赋予最高的概率。

总之,通过海量重复,模型逐渐学会了:

  • 语法:主谓宾搭配、时态、单复数。

  • 事实:“巴黎是法国的首都”,“水的化学式是H₂O”。

  • 逻辑:因为...所以...,如果...那么...

  • 风格:新闻、小说、代码各自的语言风格。

  • 推理链:虽然没有明确教,但通过大量例子,模型可以隐式地学习到多步推理的模式。

4、预训练的关键特点

预训练所需要的数据量巨大,可达TB级别的文本,来自互联网、书籍、代码、学术论文等。并且,预训练的计算成本极高,需要成千上万个GPU训练数月,耗资巨大。

在预训练阶段,大模型学习的是“可能性”。大模型学到的不是死记硬背,而是“在某种上下文中,下一个词最可能是什么”的概率分布。这背后隐含着语法、逻辑、事实和常识。训练出的模型(称为“基座模型”),如GPT-3、LLaMA、Qwen,是一个“万事通”,但它还不知道如何具体地帮助你。

5、为什么预训练如此重要?

  • 知识基础:模型在预训练中吸收的“养分”,是其所有后续能力的基石。没有好的预训练,后续微调就是“无米之炊”。

  • 泛化能力:接触过极其多样的数据和语言模式,使得模型在面对新任务、新领域时,有更强的适应潜力。

  • “涌现能力”的来源:很多大模型的惊人能力(如复杂的推理、代码生成)是在模型参数和预训练数据量达到一定规模后突然涌现的,这主要归功于预训练。

6、一个简单的生活化例子

想象一个孩子学习语言:

  • 预训练:他每天听大人聊天、看电视、读书。没有人专门出题考他,但他自己慢慢学会了“吃饭”后面经常跟“了”,“天空”是“蓝色”的,“猫会抓老鼠”。他建立了一个巨大的语言和知识网络。

  • 监督微调:现在,你想让他学会礼貌地回答客人问题。你给他一些示范:“当客人问‘你几岁了?’,你应该回答‘我五岁了,谢谢您的关心。’” 通过几次练习,他就学会了这种特定的交互模式。

总体来说,预训练是让模型“变得博学”的过程,而微调是教它“如何运用学识”的过程。 几乎所有大家现在接触到的主流AI对话模型(ChatGPT、文心一言、通义千问等),都是在强大的预训练基座模型(如GPT-4、Ernie、Qwen)基础上,经过后续的微调和对齐步骤打造而成的。

本教程共55节,当前为第12节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款服务于大一新生的口袋书,让大家在无聊的公共课上可以学习大模型技术!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>