✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

词嵌入技术简介

创建时间:2025-12-05 更新时间:2026-05-02 阅读次数:1241 次

1、词嵌入是什么?

词嵌入是深度学习中用于将自然语言中的词汇映射到低维连续向量空间的技术。它将离散的符号(词语)转换为稠密向量,使得语义相似的词在向量空间中的距离也相近。

2、词嵌入的基本概念与原理

词嵌入是自然语言处理中将离散的词语转换为连续向量的核心技术。其基本思想是:每个词被映射到高维空间中的一个稠密向量,使得语义相近的词在向量空间中也相互靠近。早期的独热编码虽能区分词汇,但每个词是独立的单位向量,维数高达词汇表大小,且无法表达词间相似性。词嵌入通过神经网络的嵌入层学习出低维实值向量,典型维度为50到300,每个维度捕捉词语的某种语义或句法特征。例如,“国王”和“王后”的嵌入向量在性别维度上可能有差异,而在王权维度上相近。这种表示方式能够挖掘词语之间的隐含关系,为后续的深度学习模型提供丰富的特征输入。词嵌入的实质是一种“分布式表示”,遵循语言学中“一个词的意义由它周围的词决定”的分布假说。通过在大规模语料上训练,模型自动学习到词语共现的统计规律,从而将语法和语义信息编码到向量数值中。相比稀疏表示,分布式表示具备泛化能力,能有效缓解数据稀疏问题,为机器理解语言建立了连续、可计算的数学基础。

3、词嵌入的核心特点

  • 稠密向量表示:与传统的独热编码(高维稀疏)不同,词嵌入是低维稠密的(通常50-300维)

  • 语义相似性:通过向量距离反映语义关系,如:king - man + woman ≈ queen

  • 上下文信息:现代词嵌入能捕捉词语在不同上下文中的含义

4、典型方法与模型演进

实现词嵌入的主流方法经历了从静态到动态、从浅层到深层的发展。Word2Vec是最具影响力的静态词嵌入模型,包含CBOW和Skip-gram两种架构:前者利用上下文预测中心词,后者用中心词预测上下文。它通过浅层神经网络学习得到固定词向量,能够捕捉线性语义关系,如“巴黎-法国+意大利≈罗马”。GloVe则融合了全局矩阵分解与局部上下文窗口的优点,基于词-词共现矩阵的对数构建损失函数,充分利用全局统计信息。FastText在Word2Vec基础上考虑了子词信息,将每个词表示为字符级n-gram向量的和,有效处理未登录词和形态丰富语言。然而,静态词嵌入为每个词分配唯一向量,无法解决一词多义问题。ELMo率先引入深度动态嵌入,通过双向LSTM基于上下文动态生成向量,使“bank”在河岸与银行两种语境下拥有不同表征。随后,基于Transformer的预训练语言模型如BERT、GPT等进一步推动词嵌入进入新阶段——它们在微调过程中根据上下文实时调整表示,实现了真正的语境化嵌入。这些模型通过大规模预训练捕获深层语言规律,为下游任务提供强大特征基础。

5、词嵌入的发展历史

5.1、早期阶段(2000年前)

  • 向量空间模型:基于文档-词矩阵的统计方法(如TF-IDF)

  • 潜在语义分析(LSA, 1990):使用奇异值分解降维,捕捉文档和词的潜在关系

主要局限:处理的是文档级别而非词语级别的语义,无法捕捉复杂语义关系

5.2、神经语言模型开端(2003-2013)

  • Bengio的神经语言模型(2003):首次提出通过学习得到词向量的概念

  • Word2Vec的突破(2013,Mikolov等人):

  • Skip-gram:用中心词预测上下文词

  • CBOW:用上下文预测中心词

创新之处:负采样和层次softmax加速训练,开源工具发布后迅速成为行业标准

5.3、全局向量方法(2014-2015)

  • GloVe(2014,斯坦福):结合全局统计信息(共现矩阵)与局部窗口方法

优势:更好地捕捉全局语料库统计信息

5.4、上下文相关词嵌入革命(2018至今)

  • ELMo(2018):首次实现上下文相关的词表示,同一词在不同语境中有不同向量。使用双向LSTM,生成基于完整句子的动态词向量

  • Transformer架构的兴起:GPT(2018)基于Transformer解码器的单向语言模型;BERT(2018,谷歌)基于Transformer编码器的双向预训练模型,大幅提升多项NLP任务性能

  • 大模型时代:GPT系列、T5、BART等,参数规模快速增长(亿级到万亿级)。从静态嵌入到动态生成,词表示完全由模型根据上下文即时生成。

6、应用价值与未来方向

词嵌入技术极大地推动了自然语言处理的实用化进程,在多个领域产生显著价值。在信息检索中,词嵌入支持语义匹配与近似检索,搜索引擎可基于向量相似度理解查询意图而非简单关键词匹配。机器翻译系统中,词嵌入作为源语言和目标语言的语义桥梁,帮助模型学习跨语言映射关系,提升翻译流畅性与准确性。推荐系统和情感分析利用词嵌入将用户评论、商品描述等文本转化为特征向量,从而挖掘产品属性与情感倾向。在金融风控领域,将合同条款与新闻文本嵌入后,可自动识别潜在风险事件并预警。医疗文本分析方面,词嵌入辅助电子病历的结构化与疾病模式挖掘,提升诊疗辅助系统的智能水平。展望未来,词嵌入研究将向更轻量化、可解释性与多模态融合方向发展。一方面,面向低资源语言和特定垂直领域的高效嵌入方法受到关注;另一方面,结合图像、语音与文本的联合嵌入空间成为多模态理解的关键基础设施。此外,公平性与伦理问题也逐渐被重视,研究者致力于消除词嵌入中隐含的社会偏见(如种族、性别刻板印象)。词嵌入作为连接符号世界与连续数学的桥梁,将持续在人工智能语言理解的底层发光发热。

本教程共55节,当前为第6节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款便捷的大模型学习口袋书,让富士康流水线的打工人也能摸到改命逆天的机会!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>