RLHF 完整训练流程

从 SFT 监督微调 → Reward Model 奖励建模 → PPO 强化学习,三阶段环环相扣。点击下方阶段,逐帧看清每一步在做什么、数据从哪来、模型怎么更新。

创建时间:2026-09-09 更新时间:2026-09-11 阅读次数:1003 次
① SFT 监督微调 Supervised Fine-Tuning
② Reward Model 奖励建模
③ PPO 强化学习 策略优化
1
SFT
让基座模型学会"对话",用人工标注的优质问答对微调
2
Reward Model
让模型学会"打分",用人工偏好排序训练打分器
3
PPO
让模型学会"讨好",用奖励信号强化学习优化策略

🎯 面试速答:一句话讲清 RLHF

Q:RLHF 三个阶段分别做什么?
SFT 用人工标注的优质对话微调基座模型,让它会聊天;RM 用人工偏好排序(A>B>C)训练一个打分模型;PPO 用 RM 的分数作为奖励,强化学习优化 SFT 模型,让它生成更符合人类偏好的回答。
Q:为什么需要 Reward Model 而不是直接人工打分?
PPO 训练需要成千上万次反馈,人工打分成本太高且不可复用。RM 把"人类偏好"蒸馏成一个可自动打分的模型,训练时可以无限次调用。
Q:PPO 中的 KL 散度起什么作用?
防止策略模型跑偏。加 KL 惩罚项约束新策略不要偏离 SFT 模型太远,避免"刷分"生成无意义但高分的内容(reward hacking),保持语言质量。
Q:DPO 和 PPO 的区别?
DPO 跳过显式的 Reward Model,直接用偏好数据构造损失函数优化策略,训练更简单稳定;PPO 是显式建模奖励再强化学习,流程更长但可控性更强。DPO 效果接近 PPO 且工程成本低,是当前主流替代方案。