✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

RLHF核心考题

创建时间:2025-11-16 更新时间:2025-11-16 阅读次数:1212 次

问题1:为什么在RLHF中通常使用PPO算法,而不是DQN或Policy Gradient?

考察点:对PPO优势的理解,以及将其应用于大模型场景的考量。

期望回答:

稳定性:PPO通过裁剪等技巧,能有效防止策略更新步幅过大,避免训练崩溃。这对于训练一个极其昂贵的大模型至关重要。

在线学习:PPO是一种在线策略算法,能有效利用当前策略产生的数据。

适用于连续动作空间:语言生成本质上是在一个巨大的词表(动作空间)上进行采样,PPO非常适合处理这种高维连续动作空间的问题。

问题2:奖励模型是如何训练的?损失函数是什么?

考察点:对奖励模型训练细节的掌握。

期望回答:RM的训练被构建为一个排序学习问题。给定一个提示和两个候选回答(A和B),以及人类标注的偏好(如A > B)。损失函数通常使用配对排序损失,例如基于Bradley-Terry模型的交叉熵损失: loss = -log(sigmoid(r_theta(A) - r_theta(B))) 这个损失函数会鼓励RM对优选回答A的打分 r_theta(A) 显著高于对回答B的打分 r_theta(B)。

问题3:在RLHF的RL阶段,除了奖励模型给出的奖励,通常还会加入哪些额外的奖励或惩罚项?为什么?

考察点:理解防止“奖励黑客”和模型退化的重要技巧。

期望回答:

KL惩罚项:这是最关键的一项。它惩罚当前RL策略模型与初始SFT模型输出之间的KL散度。目的是防止模型为了获得高RM奖励而“走火入魔”,生成一些虽然RM打分高但事实上毫无意义、怪异或偏离自然语言的文本。它起到了一个“锚定”的作用,确保模型不会偏离太远。

熵奖励:有时会加入一个小的熵奖励,鼓励策略保持一定的随机性,避免过早地收敛到单一模式。

本教程共55节,当前为第38节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款服务于大一新生的口袋书,让大家在无聊的公共课上可以学习大模型技术!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>