本文以“问-答”的形式,带领大家纵览大语言模型(LLM)所涉及到的技术。当然,有些技术早就存在的,大家了解一下即可,不必投入太多的时间和精力,只需要抓住大模型所特有的技术即可。
问:使用大模型的时候,当人们向大模型提出一个问题之后,大模型会对问题进行分析,最后给出答案,这个过程的背后涉及什么技术呢?
答:当人们向大语言模型(LLM)提出一个问题时,模型拿到问题后进行分析的过程涉及一系列复杂的技术和步骤。这个过程的核心目标是理解用户的意图和查询内容,以便生成相关、准确和有用的回答。主要涉及的技术和环节包括:
技术: 分词器、词嵌入。
过程: 模型首先将输入的文本(问题)分解成更小的单元,通常是词元。这些词元可以是单词、子词(如前缀、后缀、词根)甚至单个字符(对于某些语言)。然后,模型使用预训练好的词嵌入将每个词元映射成一个高维空间中的数值向量。这个向量捕获了词元的语义和语法信息(例如,“king”和“queen”的向量在“性别”维度上会有差异,但“统治”维度上可能相似)。
目的: 将人类可读的文本转化为模型能够进行数学运算的数值表示。
核心技术: Transformer架构(特别是其中的Encoder部分或Decoder的自注意力机制)、自注意力机制、位置编码。
具体过程如下所示:
(1)位置编码: 将单词在句子中的顺序信息(词序对意义至关重要,如“猫追老鼠” vs. “老鼠追猫”)注入到词向量中。
(2)自注意力机制: 这是Transformer的核心。模型计算输入序列中每个词元相对于序列中所有其他词元(包括自身) 的“注意力分数”。这个分数决定了在理解当前词元时,应该“关注”序列中其他哪些词元以及关注的程度。
(3)上下文表征: 通过自注意力机制的计算,模型为序列中的每个词元生成一个新的、富含上下文信息的向量表示。这个表示不仅仅包含词元本身的含义,还包含了它与问题中其他所有词元的关系信息。例如,在问题“苹果公司最新发布的手机是什么?”中,“苹果”这个词元的上下文表示会强烈地受到“公司”、“发布”、“手机”等词元的影响,从而指向科技公司而非水果。
目的: 超越简单的词义理解,捕捉词语之间的依赖关系、指代关系(如代词指代什么)、修饰关系等,构建整个问题的深层语义表示。理解问题的真正意图和焦点。
技术: 模式识别、语义理解(基于上下文表征)、潜在的知识库激活。
过程: 模型分析经过编码的上下文表征,试图识别用户的核心意图。这可能包括:
这是一个事实性查询吗?(需要检索具体事实)
这是一个定义性问题吗?(需要解释概念)
这是一个比较性问题吗?(需要对比两个或多个事物)
这是一个推理性问题吗?(需要逻辑推理或基于知识的推断)
这是一个创造性请求吗?(需要生成故事、诗歌等)
这是一个指令性请求吗?(需要执行某个操作,如写代码、总结文本)
目的: 确定回答问题的策略和所需的知识类型。
技术: 命名实体识别、关系抽取(通常内嵌在模型的上下文理解能力中)。
过程: 模型识别问题中的关键实体(如人名、地名、组织机构名、时间、日期、特定概念等)以及这些实体之间的关系。例如,在问题“爱因斯坦在哪一年获得了诺贝尔物理学奖?”中,模型需要识别出“爱因斯坦”(人名实体)、“诺贝尔物理学奖”(奖项实体)以及它们之间的关系是“获得”+“时间”。
目的: 精准定位问题中的核心要素及其联系,为后续的信息检索或推理提供精确的锚点。
技术: 基于检索的增强生成、内部参数化知识激活。
过程: 模型利用其庞大的参数化知识库(在预训练阶段学习到的世界知识、语言知识等),根据问题分析的结果(意图、焦点、实体、关系),激活存储在神经网络权重中的相关知识和信息片段。对于更复杂的或需要最新信息的问题,模型可能还需要访问外部知识库或搜索引擎(RAG - Retrieval-Augmented Generation)。
目的: 找到回答问题所需的具体事实、概念、规则或模式。
技术: 推理能力(涌现或通过微调增强)、思维链提示。
过程: 对于需要多步逻辑推理、计算或复杂规划的问题,模型可能会在内部(或在某些架构中显式地)构建一个推理链条。这可能涉及分解问题、进行子推理、调用数学或逻辑规则、权衡不同可能性等。这个过程有时会显式地生成中间步骤(思维链),有时则在模型的隐藏状态中进行。
目的: 解决需要超越简单信息检索的复杂问题,确保答案的逻辑性和正确性。
技术: 语言建模、文本规划。
过程: 在理解了问题并准备好所需的知识/推理结果后,模型开始规划如何组织答案。这包括决定回答的结构(例如,先给出定义再举例)、语气(正式、友好、幽默)、详略程度等。模型预测第一个词(或词元)应该是什么,并开始进入解码阶段。
目的: 确保生成的回答不仅内容正确,而且结构清晰、语言流畅、符合用户期望的格式和风格。
总结来说,大模型分析问题的过程是一个高度集成、多阶段、交互式的计算过程:
输入表示: 分词 -> 词嵌入 -> 位置编码。
深度语义理解: 通过Transformer的自注意力机制,构建富含上下文的词元和整体问题表征。
意图与要素解析: 识别意图、焦点、关键实体及其关系。
知识关联: 激活内部知识或检索外部信息。
(可选)推理规划: 构建解决问题的逻辑步骤。
响应规划: 设计回答的结构和风格。
这些步骤并非严格线性,而是相互交织、相互影响的。强大的上下文理解能力(Transformer)是整个分析过程的基础和核心,使得模型能够超越字面意思,捕捉到问题的深层含义和用户潜在的需求。最终,这个过程为模型生成高质量、针对性强的回答奠定了坚实的基础。