✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

大模型的重复问题

创建时间:2025-09-22 更新时间:2026-05-16 阅读次数:1316 次

大模型重复,这是一个非常常见且核心的问题。大模型(如ChatGPT、文心一言等)有时会陷入重复循环,说出像“总之,总之,总之…”或者不断重复同一个观点的情况。这并非因为模型“疯了”或“坏了”,而是其底层工作原理和局限性导致的。本文将带领大家明白大模型重复问题的底层原理。

1. 大模型为什么有时候会重复?

1.1. 解码策略与采样随机性

这是最核心的技术原因。模型生成文本是一个字一个字(或一个词一个词)“猜”出来的,这个过程叫做“解码”。常见的解码策略有:

(1)贪婪解码(Greedy Decoding)。每次都选择概率最高的下一个词。这种策略很容易导致重复。比如,模型生成了“这是一个”后,如果“很好的”概率最高,它就选“很好的”;然后下一个词,在“这是一个很好的”后面,可能“例子”的概率最高,它就选“例子”。但如果它生成了“这是一个很好的很好的”,而在这个上下文里“很好的”之后概率最高的还是“很好的”,它就会一直选下去,陷入循环。它太“贪婪”于眼前概率最高的词,缺乏长远视野。

(2)核采样(Top-p Sampling)。从概率最高的一个小集合(核)中随机选择一个词。这种解码策略引入了随机性,能生成更多样、更有创意的文本,但是这种随机性本身也是一把双刃剑。如果随机抽到的词恰好指向了一个重复的路径,模型也可能沿着这个路径走下去。虽然比贪婪解码好很多,但依然不能完全避免重复。

简单比喻:就像让你续写“天空是___”。如果只让你选最可能的词,你可能会一直选“蓝色的”;但如果让你从“蓝色的、蔚蓝的、晴朗的”里随机选,你可能会写出“天空是蔚蓝色的”,但有时运气不好,也可能选两次“蓝色的”。

1.2. 训练数据中的模式

大模型通过海量文本数据训练而成。如果训练数据本身存在大量重复模式(例如,某些套话、公式化的表达、列表项等),模型就会学会这些模式,并在生成文本时复现它们。

例子:如果模型在训练时看了很多“综上所述,……”、“总而言之,……”、“需要强调的是……”这类重复强调结构的文章,它在想要总结时,就可能过度使用这些结构,导致语言重复。

1.3. 注意力机制与上下文窗口

(1)注意力分散。Transformer模型依靠“注意力机制”来决定在生成下一个词时应该关注输入或已生成文本的哪些部分。有时,模型的“注意力”可能会过度集中在刚刚生成的几个词上,而忽略了更早的上下文,从而导致它不断围绕最近的内容“打转”。

(2)上下文长度限制。模型能“记住”的单次对话内容长度是有限的(即上下文窗口)。当对话变得很长时,模型可能会“忘记”很久之前说过的话,但又感觉到当前话题很熟悉,于是开始重复之前已经表达过的观点,因为它无法有效利用完整的对话历史来生成全新的内容。

1.4. 缺乏真正的理解和规划

这是最根本的原因。大模型本质上是“概率预测机器”,而非拥有意识和思维的“智能体”。首先,大模型不理解“重复”。模型不知道“重复”是一个需要避免的、令人类厌烦的概念。它只是在计算下一个词的概率。从它的角度来看,重复一个词有时就是概率上最合理的选择。其次,大模型没有宏观计划。人类在写作或说话前,心里会有一个大致的提纲和目标。而模型没有这种能力,它是“走一步看一步”的(自回归生成)。这种缺乏全局规划的特性,使得它很容易迷失在局部,陷入重复的循环而无法自主跳出。

2. 如何减少重复?

了解了原因,用户和开发者都可以采取一些措施来缓解这个问题:

2.1. 对于用户(调整提问方式):

(1)修改提示(Prompt)。在提问时直接要求模型避免重复。例如,可以在问题末尾加上“请用简洁且不重复的语言回答”或“请避免内容上的重复”。

(2)调整温度(Temperature)参数(如果平台提供)。调高温度值可以增加随机性,让输出更多样,有助于打破重复循环;但调得太高会导致内容不连贯。反之,调低温度值会使输出更确定、更集中,但也可能更容易重复。

(3)开启一个新对话。如果对话历史很长,模型可能已经混乱了。开启一个新会话相当于给模型“清空内存”,往往能解决问题。

2.2. 对于开发者(调整模型生成策略):

(1)使用重复惩罚(Repetition Penalty):这是一种常见的技术,在生成时降低已经出现过的词的概率,从而主动避免选择它们。

(2)设置N-gram惩罚:禁止在特定范围内(例如,禁止在连续的5个词内)出现完全相同的词组。

(3)优化解码算法:采用更先进的解码策略,如Beam Search(虽然它也可能导致重复,但比贪婪解码好),或对采样算法进行改进。

3. 总结

大模型重复的根本原因是其基于概率、缺乏真正理解的生成方式。它像是一个拥有惊人记忆力和拼图能力的“概率自闭症天才”,但缺乏对人类对话中“流畅性”和“冗余度”的直觉感知。重复是当前 generation-by-generation(逐代生成) 范式的一个固有缺陷,但随着技术的进步(如更好的解码策略、更长的上下文窗口、更高质量的训练数据),这个问题正在不断被改善。

本教程共55节,当前为第16节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款服务于大一新生的口袋书,让大家在无聊的公共课上可以学习大模型技术!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>