✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

GRPO入门介绍

创建时间:2025-11-26 更新时间:2025-11-26 阅读次数:1189 次

GRPO是什么?

GRPO 是 Group Policy Optimization 的缩写。它是一种用于直接对齐大语言模型与人类偏好的强化学习技术。

GRPO的技术背景与动机

要理解GRPO,我们首先需要了解它的背景和它要解决的问题。

人们为了让大语言模型的输出不仅“正确”,而且“好”——即符合人类的价值观,比如有帮助、无害、诚实,做出了很多努力。

在GRPO之前,最主流的方法是 RLHF。RLHF 分为三步:

  • 监督微调:用高质量的问答数据微调一个预训练模型。

  • 奖励模型训练:训练一个独立的“奖励模型”,让它学会判断哪个回答更受人类喜欢。

  • 强化学习优化:使用PPO等强化学习算法,以奖励模型的打分作为引导,去优化第一步中的SFT模型,使其生成高奖励的回答。

但是RLHF的缺点十分明显:流程复杂,需要训练和维护一个独立的、庞大的奖励模型,计算成本和工程难度都很高。

GRPO 的核心思想

GRPO的核心创新在于摒弃了独立的奖励模型。它通过一种非常巧妙的方式,直接从偏好数据中提取“奖励信号”:

  • 参考模型:使用经过监督微调后的模型作为固定的参考模型。

  • 策略模型:这是我们需要优化的模型,初始状态和参考模型相同。

  • 分组偏好数据:数据的形式是 (提示, 赢家回答, 输家回答)。

  • 关键洞察:对于一个给定的提示,赢家回答的对数概率(由策略模型产生)应该高于输家回答的对数概率。

  • 奖励计算:奖励信号直接来自于策略模型和参考模型输出概率的对数差异。具体来说,对于一个回答,其“隐式奖励”可以看作是:奖励 ∝ log(策略模型生成该回答的概率) - log(参考模型生成该回答的概率)。这个差值反映了当前策略模型相对于“安全底线”(参考模型)的偏离程度。如果策略模型对好回答的概率提升了很多,它就会获得正奖励;反之,如果它对差回答的概率提升了,就会获得负奖励。

  • 优化目标:GRPO的损失函数结合了两个部分:

  • 偏好损失:确保赢家回答的“隐式奖励”大于输家回答。这通常使用类似于DPO的配对损失。

  • KL惩罚项:防止策略模型偏离参考模型太远,以保持模型的性能稳定性和多样性,避免“模式崩溃”。

RLHF与GRPO的区别:

RLHF:像一个学生,旁边坐着一个严格的老师(奖励模型),学生每写一句话,老师就打分,学生根据分数调整写作风格。

GRPO:像一个学生,没有老师打分,而是直接给他看两篇范文(赢家和输家),让他学习模仿赢家的风格,同时提醒他不要忘记自己原本的基础(参考模型)。

本教程共55节,当前为第40节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款便捷的大模型学习口袋书,让富士康流水线的打工人也能摸到改命逆天的机会!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>