✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

大模型技术总览

创建时间:2025-09-07 更新时间:2026-05-02 阅读次数:1389 次

前言

本文以“问-答”的形式,带领大家纵览大语言模型(LLM)所涉及到的技术。当然,有些技术早就存在的,大家了解一下即可,不必投入太多的时间和精力,只需要抓住大模型所特有的技术即可。

正文

问:使用大模型的时候,当人们向大模型提出一个问题之后,大模型会对问题进行分析,最后给出答案,这个过程的背后涉及什么技术呢?

答:当人们向大语言模型(LLM)提出一个问题时,模型拿到问题后进行分析的过程涉及一系列复杂的技术和步骤。这个过程的核心目标是理解用户的意图和查询内容,以便生成相关、准确和有用的回答。主要涉及的技术和环节包括:

第一阶段:分词与向量化

技术: 分词器、词嵌入。

过程: 模型首先将输入的文本(问题)分解成更小的单元,通常是词元。这些词元可以是单词、子词(如前缀、后缀、词根)甚至单个字符(对于某些语言)。然后,模型使用预训练好的词嵌入将每个词元映射成一个高维空间中的数值向量。这个向量捕获了词元的语义和语法信息(例如,“king”和“queen”的向量在“性别”维度上会有差异,但“统治”维度上可能相似)。

目的: 将人类可读的文本转化为模型能够进行数学运算的数值表示。

第二阶段:上下文理解与表征

核心技术: Transformer架构(特别是其中的Encoder部分或Decoder的自注意力机制)、自注意力机制、位置编码。

具体过程如下所示:

(1)位置编码: 将单词在句子中的顺序信息(词序对意义至关重要,如“猫追老鼠” vs. “老鼠追猫”)注入到词向量中。

(2)自注意力机制: 这是Transformer的核心。模型计算输入序列中每个词元相对于序列中所有其他词元(包括自身) 的“注意力分数”。这个分数决定了在理解当前词元时,应该“关注”序列中其他哪些词元以及关注的程度。

(3)上下文表征: 通过自注意力机制的计算,模型为序列中的每个词元生成一个新的、富含上下文信息的向量表示。这个表示不仅仅包含词元本身的含义,还包含了它与问题中其他所有词元的关系信息。例如,在问题“苹果公司最新发布的手机是什么?”中,“苹果”这个词元的上下文表示会强烈地受到“公司”、“发布”、“手机”等词元的影响,从而指向科技公司而非水果。

目的: 超越简单的词义理解,捕捉词语之间的依赖关系、指代关系(如代词指代什么)、修饰关系等,构建整个问题的深层语义表示。理解问题的真正意图和焦点。

第三阶段:意图识别与问题分类

技术: 模式识别、语义理解(基于上下文表征)、潜在的知识库激活。

过程: 模型分析经过编码的上下文表征,试图识别用户的核心意图。这可能包括:

这是一个事实性查询吗?(需要检索具体事实)

这是一个定义性问题吗?(需要解释概念)

这是一个比较性问题吗?(需要对比两个或多个事物)

这是一个推理性问题吗?(需要逻辑推理或基于知识的推断)

这是一个创造性请求吗?(需要生成故事、诗歌等)

这是一个指令性请求吗?(需要执行某个操作,如写代码、总结文本)

目的: 确定回答问题的策略和所需的知识类型。

第四阶段:实体识别与关系抽取

技术: 命名实体识别、关系抽取(通常内嵌在模型的上下文理解能力中)。

过程: 模型识别问题中的关键实体(如人名、地名、组织机构名、时间、日期、特定概念等)以及这些实体之间的关系。例如,在问题“爱因斯坦在哪一年获得了诺贝尔物理学奖?”中,模型需要识别出“爱因斯坦”(人名实体)、“诺贝尔物理学奖”(奖项实体)以及它们之间的关系是“获得”+“时间”。

目的: 精准定位问题中的核心要素及其联系,为后续的信息检索或推理提供精确的锚点。

第五阶段:知识检索与激活

技术: 基于检索的增强生成、内部参数化知识激活。

过程: 模型利用其庞大的参数化知识库(在预训练阶段学习到的世界知识、语言知识等),根据问题分析的结果(意图、焦点、实体、关系),激活存储在神经网络权重中的相关知识和信息片段。对于更复杂的或需要最新信息的问题,模型可能还需要访问外部知识库或搜索引擎(RAG - Retrieval-Augmented Generation)。

目的: 找到回答问题所需的具体事实、概念、规则或模式。

第六阶段:思维链与推理规划

技术: 推理能力(涌现或通过微调增强)、思维链提示。

过程: 对于需要多步逻辑推理、计算或复杂规划的问题,模型可能会在内部(或在某些架构中显式地)构建一个推理链条。这可能涉及分解问题、进行子推理、调用数学或逻辑规则、权衡不同可能性等。这个过程有时会显式地生成中间步骤(思维链),有时则在模型的隐藏状态中进行。

目的: 解决需要超越简单信息检索的复杂问题,确保答案的逻辑性和正确性。

第七阶段:响应生成规划

技术: 语言建模、文本规划。

过程: 在理解了问题并准备好所需的知识/推理结果后,模型开始规划如何组织答案。这包括决定回答的结构(例如,先给出定义再举例)、语气(正式、友好、幽默)、详略程度等。模型预测第一个词(或词元)应该是什么,并开始进入解码阶段。

目的: 确保生成的回答不仅内容正确,而且结构清晰、语言流畅、符合用户期望的格式和风格。

小结

总结来说,大模型分析问题的过程是一个高度集成、多阶段、交互式的计算过程:

  • 输入表示: 分词 -> 词嵌入 -> 位置编码。

  • 深度语义理解: 通过Transformer的自注意力机制,构建富含上下文的词元和整体问题表征。

  • 意图与要素解析: 识别意图、焦点、关键实体及其关系。

  • 知识关联: 激活内部知识或检索外部信息。

  • (可选)推理规划: 构建解决问题的逻辑步骤。

  • 响应规划: 设计回答的结构和风格。

这些步骤并非严格线性,而是相互交织、相互影响的。强大的上下文理解能力(Transformer)是整个分析过程的基础和核心,使得模型能够超越字面意思,捕捉到问题的深层含义和用户潜在的需求。最终,这个过程为模型生成高质量、针对性强的回答奠定了坚实的基础。

本教程共55节,当前为第3节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款服务于大一新生的口袋书,让大家在无聊的公共课上可以学习大模型技术!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>