✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

PPO算法——大模型如何被“调教”

创建时间:2026-06-30 更新时间:2026-06-30 阅读次数:1054 次

一个必须解决的难题

在上一节中,我们完成了RLHF的前两步:有了一个会基本对话格式的监督微调模型,也有了一个能自动打分的奖励模型。现在,我们来到了第三步——用奖励模型的分数去优化大模型。你可能会想:这有什么难的?让模型多生成几个回答,奖励模型打分,哪个分高就用哪个来训练,不就行了?

这个直觉是对的,但它藏着一个巨大的陷阱。想象你是篮球教练,你给球员的指令简单粗暴:“得分越高越好”。球员发现了一个漏洞:每次他把球扔向观众席,观众席上自己的狂热粉丝就会接住球,然后裁判不知为何就给记了分。原来,裁判的评分系统有个漏洞,而球员完全学会了利用这个漏洞“刷分”。他确实得了高分,但完全背离了“打好篮球”的初衷。这就是强化学习中臭名昭著的奖励黑客现象——智能体发现了奖励机制中的漏洞,用一种违背设计者本意的方式获得高分。

在大模型的场景中,如果放任模型不择手段地追求奖励模型的高分,它会迅速学会一些“奇技淫巧”:堆砌华丽的礼貌用语、重复安全免责声明、生成大量废话来稀释风险、过分讨好用户的立场甚至牺牲事实准确性。这些回答在奖励模型那里确实能拿到高分,但对用户毫无价值。更糟糕的是,当模型朝着这个方向走得太远,它会丧失原来预训练阶段积累的语言多样性,变成一个只会说安全套话的无聊机器。我们需要一套机制,既让模型朝着人类偏好的方向进步,又不让它走火入魔。这就是PPO算法要解决的核心难题。

PPO的核心智慧:小步前进,勿忘初心

PPO,全称近端策略优化,是由OpenAI在2017年提出的一种强化学习算法。它的名字中的“近端”二字,恰好揭示了它的核心哲学:每次更新参数时,只允许模型迈出很小的一步,并且时刻检查这一步是否偏离了原来的自己太远。

理解PPO,你只需要抓住三个关键词:小步更新、安全约束、相对比较。 我们逐一拆解。

第一,小步更新。 传统强化学习算法在收到奖励信号后,可能会迫不及待地大幅修改模型参数,恨不得一次就把得分刷到最高。但PPO很克制,它规定每一次迭代,模型的策略只能做微小的调整。这就像驾驶一辆大船,你不可能在发现礁石后猛然打满舵盘,那样船会翻。你需要慢慢地、平稳地调整航向,让整艘船安全地驶向更优的水域。这种克制让训练过程更稳定,避免了模型在某一刻突然“发疯”——突然开始胡言乱语或陷入某种怪异的输出模式。

第二,安全约束。 这是PPO最精妙的设计。它引入了一个叫做KL散度的概念来量化“新模型和旧模型到底有多不一样”。通俗地说,KL散度就是新旧模型在语言习惯上的距离。PPO会在追求奖励分数最大化时,同时监视这个距离。如果发现这次更新让模型偏离旧版本太多,它就会强行踩下刹车,把模型拉回来一些。这就像给模型系上了一根与旧模型相连的弹簧绳,它允许你往前走,但越往前走,背后的拉力就越大,让你无法跑得太远。

这个机制深刻地解决了一个问题:模型为了讨好奖励模型而丧失语言多样性。因为一旦模型开始产生“刷分废话”,这些输出的语言模式与原来的正常输出必然大相径庭,KL散度会立刻飙升,触发PPO的安全刹车。模型被迫在“拿高分”和“保持原来的语言能力”之间找到一个优雅的平衡点。它不能变成一个只会说套话的谄媚者,必须在不丢失预训练阶段学到的丰富表达能力的前提下,去争取更高的奖励。

第三,相对比较。 PPO还做了一件非常聪明的事,它不只看回答的绝对分数,而是采用了一个叫做优势函数的概念。简单来说,它只奖励那些“比预期更好”的动作。如果模型正常的水平就是70分,那么生成一个70分的回答不会带来额外的正反馈,只有生成一个80分的回答,超过了自己当前的平均水平,才会被强化。这使得奖励信号更加精细和高效,避免了模型在已经做得不错的地方反复获得无意义的正反馈,引导它把精力集中在那些真正能带来提升的改进上。

一个类比:教练如何调教运动员

让我们用一个综合的比喻来固化这三个要点。想象一位经验丰富的乒乓球教练在训练运动员。他绝不会在每局训练结束后,把运动员拉到白板前,画满战术图,然后要求运动员明天彻底改变打法。这样做只会让运动员动作变形、怀疑人生。

这位聪明的教练采用的是PPO式的训练方法。他会逐球、逐局地给出微调建议:“刚才那个反手拉球时,拍面压得太低了,稍微仰一度试试。”每次只改一个微小参数,这就是小步更新。他也不会允许运动员为了赢得这局球而使用怪异但有效的动作,因为那会破坏长期建立的规范动作体系。他会要求新动作与原来的基本功框架保持一致,这就是安全约束。最后,他不会在运动员轻松拿下一分时大喊“干得好”,只在运动员完成了一次突破性的救球,超水平发挥时才给予特别表扬,这就是相对比较。

大模型的PPO训练,本质上就是这位教练在调教运动员:在每一次生成回答的练习中,根据奖励裁判的分数,对模型的“语言动作”进行微小、安全、有针对性的精调。经过成千上万轮的迭代,模型的语言能力逐步进化,变得越来越符合人类偏好,同时始终保持着来自预训练阶段的流畅表达和丰富知识。

PPO之后:更简单的路正在铺开

PPO自2017年诞生以来,一直是RLHF的主流选择,为ChatGPT等里程碑模型的成功立下了汗马功劳。但近两年,随着大模型训练规模的不断扩大,研究者们也在探索更简单、更高效的替代方案。一个值得关注的趋势是像GRPO这样的新算法,它不再需要一个独立的奖励模型来打分,而是让模型对同一个问题生成多个回答,然后用一套规则(比如回答的准确性、格式正确性)来比较这些回答的优劣,作为奖励信号。这种“群体内互相对比”的方法省去了训练和维护奖励模型的巨大成本,在DeepSeek-R1等推理模型中已经展现出强大的效果。

关于这些前沿演进,我们将在第6节中展开。现在,你已经掌握了RLHF和PPO的核心思想。在下一节中,我们将面对一个现实问题:不是所有人都有财力和人力去搞大规模的人工反馈。有没有可能让AI自己给自己当裁判?这就是第5节的主题——RLAIF与自动化对齐的革命。

本教程共55节,当前为第47节!
本教程最新修订时间为:2026-08-17 09:09:33

📌 面试天下网:一款服务于大一新生的口袋书,让大家在无聊的公共课上可以学习大模型技术!
📌 网站公告:程序出海:中国程序员当下最大的机遇>>>>>>