从 SFT 监督微调 → Reward Model 奖励建模 → PPO 强化学习,三阶段环环相扣。点击下方阶段,逐帧看清每一步在做什么、数据从哪来、模型怎么更新。
🎯 面试速答:一句话讲清 RLHF
Q:RLHF 三个阶段分别做什么?
SFT 用人工标注的优质对话微调基座模型,让它会聊天;RM 用人工偏好排序(A>B>C)训练一个打分模型;PPO
用 RM 的分数作为奖励,强化学习优化 SFT 模型,让它生成更符合人类偏好的回答。
Q:为什么需要 Reward Model 而不是直接人工打分?
PPO 训练需要成千上万次反馈,人工打分成本太高且不可复用。RM
把"人类偏好"蒸馏成一个可自动打分的模型,训练时可以无限次调用。
Q:PPO 中的 KL 散度起什么作用?
防止策略模型跑偏。加 KL 惩罚项约束新策略不要偏离 SFT 模型太远,避免"刷分"生成无意义但高分的内容(reward
hacking),保持语言质量。
Q:DPO 和 PPO 的区别?
DPO 跳过显式的 Reward Model,直接用偏好数据构造损失函数优化策略,训练更简单稳定;PPO
是显式建模奖励再强化学习,流程更长但可控性更强。DPO 效果接近 PPO 且工程成本低,是当前主流替代方案。