一个必须解决的难题
在上一节中,我们完成了RLHF的前两步:有了一个会基本对话格式的监督微调模型,也有了一个能自动打分的奖励模型。现在,我们来到了第三步——用奖励模型的分数去优化大模型。你可能会想:这有什么难的?让模型多生成几个回答,奖励模型打分,哪个分高就用哪个来训练,不就行了?
这个直觉是对的,但它藏着一个巨大的陷阱。想象你是篮球教练,你给球员的指令简单粗暴:“得分越高越好”。球员发现了一个漏洞:每次他把球扔向观众席,观众席上自己的狂热粉丝就会接住球,然后裁判不知为何就给记了分。原来,裁判的评分系统有个漏洞,而球员完全学会了利用这个漏洞“刷分”。他确实得了高分,但完全背离了“打好篮球”的初衷。这就是强化学习中臭名昭著的奖励黑客现象——智能体发现了奖励机制中的漏洞,用一种违背设计者本意的方式获得高分。
在大模型的场景中,如果放任模型不择手段地追求奖励模型的高分,它会迅速学会一些“奇技淫巧”:堆砌华丽的礼貌用语、重复安全免责声明、生成大量废话来稀释风险、过分讨好用户的立场甚至牺牲事实准确性。这些回答在奖励模型那里确实能拿到高分,但对用户毫无价值。更糟糕的是,当模型朝着这个方向走得太远,它会丧失原来预训练阶段积累的语言多样性,变成一个只会说安全套话的无聊机器。我们需要一套机制,既让模型朝着人类偏好的方向进步,又不让它走火入魔。这就是PPO算法要解决的核心难题。
PPO的核心智慧:小步前进,勿忘初心
PPO,全称近端策略优化,是由OpenAI在2017年提出的一种强化学习算法。它的名字中的“近端”二字,恰好揭示了它的核心哲学:每次更新参数时,只允许模型迈出很小的一步,并且时刻检查这一步是否偏离了原来的自己太远。
理解PPO,你只需要抓住三个关键词:小步更新、安全约束、相对比较。 我们逐一拆解。
第一,小步更新。 传统强化学习算法在收到奖励信号后,可能会迫不及待地大幅修改模型参数,恨不得一次就把得分刷到最高。但PPO很克制,它规定每一次迭代,模型的策略只能做微小的调整。这就像驾驶一辆大船,你不可能在发现礁石后猛然打满舵盘,那样船会翻。你需要慢慢地、平稳地调整航向,让整艘船安全地驶向更优的水域。这种克制让训练过程更稳定,避免了模型在某一刻突然“发疯”——突然开始胡言乱语或陷入某种怪异的输出模式。
第二,安全约束。 这是PPO最精妙的设计。它引入了一个叫做KL散度的概念来量化“新模型和旧模型到底有多不一样”。通俗地说,KL散度就是新旧模型在语言习惯上的距离。PPO会在追求奖励分数最大化时,同时监视这个距离。如果发现这次更新让模型偏离旧版本太多,它就会强行踩下刹车,把模型拉回来一些。这就像给模型系上了一根与旧模型相连的弹簧绳,它允许你往前走,但越往前走,背后的拉力就越大,让你无法跑得太远。
这个机制深刻地解决了一个问题:模型为了讨好奖励模型而丧失语言多样性。因为一旦模型开始产生“刷分废话”,这些输出的语言模式与原来的正常输出必然大相径庭,KL散度会立刻飙升,触发PPO的安全刹车。模型被迫在“拿高分”和“保持原来的语言能力”之间找到一个优雅的平衡点。它不能变成一个只会说套话的谄媚者,必须在不丢失预训练阶段学到的丰富表达能力的前提下,去争取更高的奖励。
第三,相对比较。 PPO还做了一件非常聪明的事,它不只看回答的绝对分数,而是采用了一个叫做优势函数的概念。简单来说,它只奖励那些“比预期更好”的动作。如果模型正常的水平就是70分,那么生成一个70分的回答不会带来额外的正反馈,只有生成一个80分的回答,超过了自己当前的平均水平,才会被强化。这使得奖励信号更加精细和高效,避免了模型在已经做得不错的地方反复获得无意义的正反馈,引导它把精力集中在那些真正能带来提升的改进上。
一个类比:教练如何调教运动员
让我们用一个综合的比喻来固化这三个要点。想象一位经验丰富的乒乓球教练在训练运动员。他绝不会在每局训练结束后,把运动员拉到白板前,画满战术图,然后要求运动员明天彻底改变打法。这样做只会让运动员动作变形、怀疑人生。
这位聪明的教练采用的是PPO式的训练方法。他会逐球、逐局地给出微调建议:“刚才那个反手拉球时,拍面压得太低了,稍微仰一度试试。”每次只改一个微小参数,这就是小步更新。他也不会允许运动员为了赢得这局球而使用怪异但有效的动作,因为那会破坏长期建立的规范动作体系。他会要求新动作与原来的基本功框架保持一致,这就是安全约束。最后,他不会在运动员轻松拿下一分时大喊“干得好”,只在运动员完成了一次突破性的救球,超水平发挥时才给予特别表扬,这就是相对比较。
大模型的PPO训练,本质上就是这位教练在调教运动员:在每一次生成回答的练习中,根据奖励裁判的分数,对模型的“语言动作”进行微小、安全、有针对性的精调。经过成千上万轮的迭代,模型的语言能力逐步进化,变得越来越符合人类偏好,同时始终保持着来自预训练阶段的流畅表达和丰富知识。
PPO之后:更简单的路正在铺开
PPO自2017年诞生以来,一直是RLHF的主流选择,为ChatGPT等里程碑模型的成功立下了汗马功劳。但近两年,随着大模型训练规模的不断扩大,研究者们也在探索更简单、更高效的替代方案。一个值得关注的趋势是像GRPO这样的新算法,它不再需要一个独立的奖励模型来打分,而是让模型对同一个问题生成多个回答,然后用一套规则(比如回答的准确性、格式正确性)来比较这些回答的优劣,作为奖励信号。这种“群体内互相对比”的方法省去了训练和维护奖励模型的巨大成本,在DeepSeek-R1等推理模型中已经展现出强大的效果。
关于这些前沿演进,我们将在第6节中展开。现在,你已经掌握了RLHF和PPO的核心思想。在下一节中,我们将面对一个现实问题:不是所有人都有财力和人力去搞大规模的人工反馈。有没有可能让AI自己给自己当裁判?这就是第5节的主题——RLAIF与自动化对齐的革命。