✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

强化学习的核心概念

创建时间:2026-06-30 更新时间:2026-06-30 阅读次数:1062 次

从一场游戏说起

在进入大模型的宏大叙事之前,我们先来玩一场简单的思想游戏。想象你面前有一只刚出生的小狗,你想教它“坐下”。你不会给小狗看一本《犬类行为规范手册》,也不会用复杂的语法向它解释坐下的好处。你只会举起一块零食,等它偶然坐下的一瞬间,立刻给予奖励。几次之后,小狗就会开始主动尝试坐下以换取美食。这就是强化学习的灵魂:在试错中学习,在反馈中成长。

这个场景抽象出来,便构成了强化学习最核心的四个要素。它们像乐高积木一样,可以搭建出从游戏高手到聊天机器人等一切智能系统。我们逐一来看。

要素一:智能体——谁在学习?

智能体就是那个学习和做决策的主体。在小狗的例子中,小狗是智能体;在围棋里,AlphaGo是智能体;而在大模型的语境下,大语言模型本身就是那个智能体。这是一个关键的身份转换。在之前讲预训练和监督微调时,我们把模型看作一个被动的接受者,它吸收数据、模仿答案。但一旦进入强化学习的框架,模型就“活”了——它变成了一个主动的行动者,需要自己产生输出,然后承受这个输出带来的后果。这个身份的变化,正是大模型从“知识库”走向“智能体”的分水岭。

要素二:环境与状态——智能体在哪里行动?

智能体不能悬在空中行动,它必须身处一个世界之中,这个世界就是环境。环境会向智能体提供它当前所处局面的快照,这就是状态。在小狗的例子中,环境包括主人、零食、周围的气味和声音;当前状态可能是“主人举着零食站着,小狗抬头看”。

那么,当大模型是智能体时,环境是什么?环境就是它与用户或外部系统交互的整个上下文。具体来说,状态就是当前输入的提示词加上模型自己已经生成的所有文本。比如用户问“请用唐诗的风格写一首关于月亮的诗”,这串文字就是初始状态。模型每写完一个字,这个字就被追加到状态里,形成新的状态,模型再基于这个新状态决定下一个字。这种“一个词接一个词”的生成过程,本质上就是智能体在一个由语言构成的迷宫中,一步步探索前行。

要素三:动作——智能体可以做什么?

动作是智能体在某个状态下可以采取的操作。小狗的动作是“坐”“卧”“叫”等身体行为;围棋智能体的动作是在棋盘某处落子。那么,大模型的动作是什么?答案出奇地简单,但又极其关键:模型的每一个动作,就是从词表中选择下一个输出的词或子词。 大模型有数万个词的词表,每一次生成,它都要在这数万个候选动作中做出选择。选择了“月”而不是“亮”,选择了“霜”而不是“雪”,整首诗的风格和意境就会截然不同。因此,生成一个完整的回答,其实是一场由数千个微小动作组成的长链决策。强化学习要优化的,正是这一整条动作链的质量,而不是某个孤立的选词是否正确。

要素四:奖励——什么是好的?

奖励是环境对智能体动作的即时打分,是驱动一切学习的根本动力。小狗得到零食是正奖励,被呵斥是负奖励。在强化学习中,智能体唯一的目标就是最大化从环境中获得的累积奖励,而不是单步的即时奖励。这意味着它需要学会为了长远的更大回报而忍受眼前的暂时低分。

在大模型中,奖励从哪里来?这是一个绝佳的问题,也恰恰是强化学习与大模型结合最精妙的地方。在游戏的棋盘上,胜负是天然的奖励;但在开放式的对话中,“什么是好的回答”是一个非常模糊和主观的问题。因此,我们训练一个专门的奖励模型来充当“虚拟裁判”。这个奖励模型预先用大量人类的偏好数据训练过,它能对模型的输出打出一个分数,判断这个回答是否有用、诚实、无害。大模型的目标,就从“预测下一个词的统计概率”,变成了“生成能获得奖励模型高分的文本”。奖励信号取代了语料统计,成为模型行为的新指南针。

核心矛盾:探索与利用

掌握了四个要素之后,你自然会遇到强化学习中最经典、也最像人生哲学的困境:探索与利用的平衡。 利用,是指做已知最好的事——去那家你确认好吃的餐馆,用那个你最熟悉的词。探索,是指冒险尝试新事物——推开一家新餐馆的门,选一个概率不高但可能让整句话增色的词。只懂利用的模型会变得陈词滥调、言之无物;只知道探索的模型会胡言乱语、无法控制。因此,所有强化学习算法的核心任务,都是优雅地管理这对矛盾。我们后面要讲的PPO算法之所以重要,就是因为它提供了一套精妙的机制,让模型在“乖乖听话”和“创意迸发”之间找到了一个可调节的平衡点。

一张对照表:用四个要素看懂大模型

强化学习概念通用定义在大模型场景中的映射
智能体学习和决策的主体大语言模型本身
状态环境在某一时刻的完整描述输入的提示词 + 当前已生成的文本
动作智能体在某个状态下的可行操作从词表中选择下一个生成的词/子词
奖励环境对单个动作的即时评价来自人类偏好数据训练的奖励模型给出的分数
目标最大化长期累积奖励生成整体上最有用、最无害、最诚实的完整回复

现在,让我们把上述四个要素打包,用一张简洁的对照表,将抽象概念和大模型场景一次性映射清楚。以后阅读任何与大模型相关的强化学习资料时,你都可以回到这张表:

理解并记下这张表,你就获得了学习后续所有内容的基础语言。接下来,我们将进入全章最令人激动的核心工程——RLHF,看看如何通过三个精妙的步骤,将这四个概念组装起来,真正把一个只会模仿的原始大模型,调教成一个“懂事”的协作伙伴。我们下一节见。

本教程共55节,当前为第45节!
本教程最新修订时间为:2026-08-17 09:09:33

📌 面试天下网:一款服务于上班族的口袋书,让大家在地铁里/公交上可以学习大模型技术!
📌 网站公告:程序出海:中国程序员当下最大的机遇>>>>>>