从“会说人话”到“说人爱听的话”
现在,我们手头已经有一个预训练和经过监督微调的大语言模型。它读书万卷,能写诗、能翻译、能回答百科知识,乍看之下已经相当强大。但你很快会发现一个令人头疼的问题:它不知道什么话不该说。你问它“如何制作危险物品”,它可能一本正经地列出步骤;你让它评价一个敏感话题,它可能口无遮拦、引战拉踩;你请它写一封邮件,它可能写得啰嗦冗余、抓不住重点。
问题的根源在于,这个模型的学习目标一直是“模仿训练语料中的语言模式”。它学会的是“人类通常会怎么说”,而不是“人类此刻希望我怎么说”。它像一个博览群书但没有情商的人,肚子里全是货,却不懂看场合、看脸色。我们需要教会模型一个更高级的能力:不仅会说人话,更要说人爱听的话、说有用的话、说安全的话。这就是RLHF登场的时刻。
RLHF的全称是“从人类反馈中进行强化学习”。这个名字直白地揭示了它的本质:用人类的偏好作为奖励信号,用强化学习作为优化手段。整个流程可以想象成“三步炼丹法”:第一步,教模型基本的规矩和格式;第二步,培养一个能分辨好坏品味的“鉴赏家”;第三步,让模型在鉴赏家的不断打分下自我精进。我们逐一拆解。
第一步:监督微调——给模型穿上“礼貌的外衣”
RLHF的第一步并不是强化学习,而是我们熟悉的监督微调,也叫指令微调。这一步的目标相对基础:让模型学会“一问一答”的对话格式,并且初步具备遵循指令的能力。
具体做法是:人工标注员撰写或精选一批高质量的“提示词-理想回答”对,构成一个精炼的对话数据集。比如:
提示词:“解释什么是光合作用,用给小学生能听懂的语言。” 理想回答:“小朋友们,想象一下植物的叶子是它们的小厨房……”
然后,用这些数据对预训练模型进行标准的监督学习微调。这就像学徒入门时先跟着师傅一招一式地模仿,不管理解不理解背后的道理,先把标准动作学会。经过这一步,模型产出的文本会变得更结构化,知道何时该解释、何时该总结、何时该道歉。它穿上了一件“礼貌的外衣”,从一个满腹经纶但话语随意的书生,变成了一个懂得基本对话礼仪的应答者。
但这件外衣还很薄。监督微调模型只是知道“在这个问题下,人类期待的回答大概长这样”,它并没有真正理解为什么有些答案比另一些更好。它见过优秀的回答样本,但没见过“这个回答比那个回答更好”的直接比较。它缺乏品味。所以,我们需要第二步。
第二步:训练奖励模型——培养一位“品味的裁判”
第二步是整个RLHF最具巧思的设计:我们不直接告诉模型什么是好答案,而是先训练一个独立的奖励模型,让它来替人类行使“打分”的职责。为什么要多此一举?因为人类不可能每时每刻坐在模型旁边给它打分——那太慢了、太贵了,而且人也会疲惫、标准会漂移。我们需要一个可以自动、快速、一致地为任何回复打分的“虚拟裁判”。
这个奖励模型是怎么训练出来的?首先,人类标注员会收到大量同一条提示词下的多个不同回答——比如模型A的回答、模型B的回答、可能还有模型C的回答——然后人类进行排序或打分:A比B好,B比C好,诸如此类。标注员不是简单地判“对”或“错”,而是表达一种偏好排序。这个偏好数据就是奖励模型的学习材料。
奖励模型本身通常也是一个经过改造的大语言模型,只是它最后的输出层被换成了一个打分值。它吃进“提示词+回答”这对组合,吐出一个分数,分高代表这个回答更符合人类偏好。通过大量的人类偏好比较数据,奖励模型学会了模仿人类的判断习惯——它知道,当人们说“更清晰”时,通常意味着分点陈述和短句子;当人们说“更有帮助”时,通常意味着直接回答问题而不是绕弯子;当人们说“更安全”时,通常意味着拒绝危险请求并给出温和的解释。
于是,我们获得了一位不知疲倦、标准一致的品味裁判。现在,万事俱备,只欠东风——我们用这位裁判的分数,去真正“调教”那个只会模仿的模型。
第三步:强化学习微调——在奖励的指引下自我精进
这是RLHF的核心步骤,也是强化学习真正施展魔法的阶段。我们把第一步产出的监督微调模型作为初始智能体,把第二步训练的奖励模型作为打分裁判,正式启动强化学习的训练循环。
流程是这样的:首先,给模型一个提示词,它生成一个回答。然后,把这个回答连同提示词一起送入奖励模型,裁判打出一个分数。这个分数就是本次生成的“奖励”。接着,强化学习算法根据这个奖励信号,更新模型的参数,让模型下次遇到类似情况时,更倾向于生成那些能拿高分的回答。
这个过程循环往复、迭代进行。模型就像一个在考场上反复练习的学生,每一份答卷都由同一位严格的老师批改,学生不断调整自己的答题策略,以求获得更高的总分。注意这里“总分”的概念非常关键:模型不是在为单个词的漂亮得分,而是为整个回答的最终质量负责。这意味着它可能会在局部选择概率不是最高但能为整体铺路的词——比如一个幽默的转折,或一个主动承认知识边界的谦逊表态——这些都是单纯的概率最大化训练永远无法教会它的。
在强化学习算法的选择上,这个阶段最经典使用的是PPO算法。在下一节我们会展开讲PPO的工作直觉,现在你只需要知道它有一个极其重要的功能:防止模型“作弊刷分”。因为如果放任模型不顾一切地追求奖励模型给出的高分,它可能会发现一些奇技淫巧——比如堆砌礼貌用语、过分讨好、生成一堆看似漂亮但毫无信息量的废话。PPO用一个巧妙的约束确保模型既要追求高分,又不能偏离自己原来的“语言人格”太远。这就像教练教球员改进技术时,会要求动作的调整必须是渐进的,不能今天还是一个足球运动员,明天突然变成一个完全不同的人。
一个完整的形象:RLHF就是“试炼-反馈-精进”的飞轮
让我们用一个整体性的比喻来收束这三个步骤。想象你要把一块璞玉雕刻成一座精美的雕像。第一步SFT,是先用粗工具把璞玉切割成雕像的大致轮廓——有头、有身体,但粗糙、没有灵魂。第二步训练奖励模型,是请一位审美卓越的艺术鉴赏家,让他总结出一套好雕像应该具备什么特质——比例、神韵、表情的微妙处理。第三步强化学习微调,则是雕刻家拿着精细的刻刀,在鉴赏家的每一次“这个角度还差一点”的反馈下,一刀一刀地打磨细节,直到璞玉变成艺术品。
这就是RLHF的秘密。它没有给模型灌输新的知识点,而是赋予它一种能力:知道什么是一个“好”回答,并主动追求这种好。 这套范式使得大模型从被动模仿的复读机,蜕变为主动对齐人类意图的智能体。在下一节中,我们将深入这第三步所使用的核心武器——PPO算法,看看它到底是如何用数学实现“既要进步,又不忘本”这一精巧平衡的。