词嵌入是深度学习中用于将自然语言中的词汇映射到低维连续向量空间的技术。它将离散的符号(词语)转换为稠密向量,使得语义相似的词在向量空间中的距离也相近。
词嵌入是自然语言处理中将离散的词语转换为连续向量的核心技术。其基本思想是:每个词被映射到高维空间中的一个稠密向量,使得语义相近的词在向量空间中也相互靠近。早期的独热编码虽能区分词汇,但每个词是独立的单位向量,维数高达词汇表大小,且无法表达词间相似性。词嵌入通过神经网络的嵌入层学习出低维实值向量,典型维度为50到300,每个维度捕捉词语的某种语义或句法特征。例如,“国王”和“王后”的嵌入向量在性别维度上可能有差异,而在王权维度上相近。这种表示方式能够挖掘词语之间的隐含关系,为后续的深度学习模型提供丰富的特征输入。词嵌入的实质是一种“分布式表示”,遵循语言学中“一个词的意义由它周围的词决定”的分布假说。通过在大规模语料上训练,模型自动学习到词语共现的统计规律,从而将语法和语义信息编码到向量数值中。相比稀疏表示,分布式表示具备泛化能力,能有效缓解数据稀疏问题,为机器理解语言建立了连续、可计算的数学基础。
稠密向量表示:与传统的独热编码(高维稀疏)不同,词嵌入是低维稠密的(通常50-300维)
语义相似性:通过向量距离反映语义关系,如:king - man + woman ≈ queen
上下文信息:现代词嵌入能捕捉词语在不同上下文中的含义
实现词嵌入的主流方法经历了从静态到动态、从浅层到深层的发展。Word2Vec是最具影响力的静态词嵌入模型,包含CBOW和Skip-gram两种架构:前者利用上下文预测中心词,后者用中心词预测上下文。它通过浅层神经网络学习得到固定词向量,能够捕捉线性语义关系,如“巴黎-法国+意大利≈罗马”。GloVe则融合了全局矩阵分解与局部上下文窗口的优点,基于词-词共现矩阵的对数构建损失函数,充分利用全局统计信息。FastText在Word2Vec基础上考虑了子词信息,将每个词表示为字符级n-gram向量的和,有效处理未登录词和形态丰富语言。然而,静态词嵌入为每个词分配唯一向量,无法解决一词多义问题。ELMo率先引入深度动态嵌入,通过双向LSTM基于上下文动态生成向量,使“bank”在河岸与银行两种语境下拥有不同表征。随后,基于Transformer的预训练语言模型如BERT、GPT等进一步推动词嵌入进入新阶段——它们在微调过程中根据上下文实时调整表示,实现了真正的语境化嵌入。这些模型通过大规模预训练捕获深层语言规律,为下游任务提供强大特征基础。
向量空间模型:基于文档-词矩阵的统计方法(如TF-IDF)
潜在语义分析(LSA, 1990):使用奇异值分解降维,捕捉文档和词的潜在关系
主要局限:处理的是文档级别而非词语级别的语义,无法捕捉复杂语义关系
Bengio的神经语言模型(2003):首次提出通过学习得到词向量的概念
Word2Vec的突破(2013,Mikolov等人):
Skip-gram:用中心词预测上下文词
CBOW:用上下文预测中心词
创新之处:负采样和层次softmax加速训练,开源工具发布后迅速成为行业标准
优势:更好地捕捉全局语料库统计信息
ELMo(2018):首次实现上下文相关的词表示,同一词在不同语境中有不同向量。使用双向LSTM,生成基于完整句子的动态词向量
Transformer架构的兴起:GPT(2018)基于Transformer解码器的单向语言模型;BERT(2018,谷歌)基于Transformer编码器的双向预训练模型,大幅提升多项NLP任务性能
大模型时代:GPT系列、T5、BART等,参数规模快速增长(亿级到万亿级)。从静态嵌入到动态生成,词表示完全由模型根据上下文即时生成。
词嵌入技术极大地推动了自然语言处理的实用化进程,在多个领域产生显著价值。在信息检索中,词嵌入支持语义匹配与近似检索,搜索引擎可基于向量相似度理解查询意图而非简单关键词匹配。机器翻译系统中,词嵌入作为源语言和目标语言的语义桥梁,帮助模型学习跨语言映射关系,提升翻译流畅性与准确性。推荐系统和情感分析利用词嵌入将用户评论、商品描述等文本转化为特征向量,从而挖掘产品属性与情感倾向。在金融风控领域,将合同条款与新闻文本嵌入后,可自动识别潜在风险事件并预警。医疗文本分析方面,词嵌入辅助电子病历的结构化与疾病模式挖掘,提升诊疗辅助系统的智能水平。展望未来,词嵌入研究将向更轻量化、可解释性与多模态融合方向发展。一方面,面向低资源语言和特定垂直领域的高效嵌入方法受到关注;另一方面,结合图像、语音与文本的联合嵌入空间成为多模态理解的关键基础设施。此外,公平性与伦理问题也逐渐被重视,研究者致力于消除词嵌入中隐含的社会偏见(如种族、性别刻板印象)。词嵌入作为连接符号世界与连续数学的桥梁,将持续在人工智能语言理解的底层发光发热。