✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

SFT的理解

创建时间:2025-01-31 更新时间:2025-02-16 阅读次数:1362 次

在大模型中,SFT通常指的是监督微调(Supervised Fine-Tuning)。这是模型训练的一个关键步骤,具体如下:

1、定义

监督微调(SFT)是在预训练模型的基础上,使用有标签的数据进行进一步训练,使模型更好地适应特定任务。

2、步骤

预训练:模型在大规模无标签数据上训练,学习通用特征。

微调:在预训练后,使用有标签的任务数据对模型进行微调,使其更适应特定任务。

3、目的

任务适应:让模型在特定任务上表现更好。

性能提升:通过微调,模型能更准确地执行任务。

4、应用

文本分类:如情感分析、垃圾邮件检测。

机器翻译:将一种语言翻译成另一种语言。

问答系统:回答用户提出的问题。

5、优势

数据效率:利用预训练模型的通用特征,减少对大量标注数据的需求。

性能提升:通过微调,模型在特定任务上的表现显著提高。

6、示例

BERT:先在大量文本上预训练,再通过SFT在特定任务(如文本分类)上微调。

GPT:预训练后,通过SFT在对话生成等任务上微调。

总结

SFT是提升大模型在特定任务上性能的重要步骤,通过在有标签数据上微调,模型能更好地适应具体应用场

本教程共55节,当前为教程简介!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款服务于大一新生的口袋书,让大家在无聊的公共课上可以学习大模型技术!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>