考察点:对RLHF流程中问题的深入思考。
期望回答:
复杂性:整个流程(SFT -> RM -> RL)非常复杂,需要维护多个模型,工程实现和调参成本高。
奖励模型的局限性:RM的质量决定了RL的天花板。如果RM无法准确捕捉人类的复杂偏好(比如安全性、创造性、事实准确性),RL优化出的模型也会有问题。
奖励黑客:模型可能会学会“欺骗”RM,生成一些看似高分但人类并不满意的内容。
过度优化:即使RM是完美的,过度优化一个代理奖励函数也可能导致模型行为怪异。
数据依赖:严重依赖高质量的人类偏好数据,成本高昂且可能存在偏见。
考察点:知识广度。
期望回答:
DPO:直接偏好优化。这是一种新兴的、更简单的方法,它绕过了训练独立奖励模型和运行PPO的复杂步骤,直接在偏好数据上通过一个闭式解来优化策略。目前非常热门,几乎必考。
Expert Iteration:类似AlphaGo,通过不断让模型与自身或另一个版本进行对抗来改进。
Constitutional AI:通过一套明确的“宪法”原则来引导和修正模型的行为,减少对人类偏好数据的依赖。
考察点:对前沿方法的理解深度。
期望回答:
RLHF:是两阶段方法。先训练一个RM来拟合偏好,再用RL优化策略。更灵活(RM可以单独更新),但更复杂。
DPO:是单阶段方法。它将偏好优化问题重新参数化,使得目标函数可以直接在偏好数据上通过类似SFT的方式最大化。更简单、稳定、计算高效,但策略和隐式奖励是绑定的。