✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

《大模型入门精华》


1 前言
    1.1  大模型的发展历史

    1.2  Hugging Face简介

    1.3  大模型技术总览

    1.4  GPT模型的发展历程

    1.5  BERT和GPT之战

2 Transformer技术
    2.1  词嵌入技术简介

    2.3  Transformer简介

3 预训练与监督微调
    3.1  预训练技术简介

    3.2  监督微调技术简介

4 大模型核心技术
    4.3  大模型的重复问题

    4.4  LoRA的诞生背景

    4.5  LoRA的数学原理

    4.6  LoRA的核心考点

    4.8  知识蒸馏常见考题

    4.9  模型量化常见考题

    4.10  大模型的剪枝问题

    4.12  RAG原理介绍

5 大模型压缩技术
    5.2  压缩技术全景图

    5.3  知识蒸馏入门介绍

    5.4  温度参数入门介绍

    5.5  落地选型的考量

    5.6  智能客服案例分析

    5.7  大模型量化

    5.8  模型剪枝入门介绍

    5.9  大模型压缩实战

6 大模型与强化学习
    6.1  大模型与强化学习

    6.2  强化学习面试要点

    6.3  RLHF核心考题

    6.4  RLHF的挑战

    6.5  GRPO入门介绍

    6.6  人类反馈强化学习

    6.8  PPO算法代码复现

    6.9  大模型与强化学习

    6.10  强化学习核心概念

    6.11  RLHF入门介绍

    6.12  PPO入门介绍

    6.13  RLAIF与自动化对齐

    6.16  规模定律详细介绍

    6.17  强化学习的未来

7 扩散模型与文生图
    7.1  文生图原理介绍

    7.2  扩散模型原理介绍

    7.3  扩散模型与文生图

8 手搓大模型

文生图原理介绍

创建时间:2025-10-30 更新时间:2026-05-21 阅读次数:1260 次

1、文生图简介

“文生图”是人工智能跨越感官界限的一次惊艳飞跃——它让机器不仅能“读懂”文字,更能“画出”想象。简单来说,你只需输入一段描述性的文本,AI模型便会自动解析其中的物体、属性、风格与空间关系,在短短几秒内生成一幅从未存在过的全新图像。

文生图的核心在于深度学习,模型通过海量的“图片-文字”配对数据,如同婴儿认识世界般学会了世间万物。文生图技术历史久远,从最初的抽象模糊甚至不堪入目,到如今Midjourney、Stable Diffusion等工具能驾驭照片级写实、油画、二次元等多种风格,文生图已不再是猎奇玩具,而是成为了设计师汲取灵感的创意引擎,以及普通人释放想象力的画笔。

文生图的底层流程可以概括为:一个经过海量数据训练的模型,理解你的文字描述,然后从一个纯粹的随机噪声开始,一步步“去噪”,最终“雕刻”出一幅符合描述的、逼真或风格化的图像。

2、文生图的核心思想:扩散模型

当今主流大模型(如 Stable Diffusion、DALL-E 3、Midjourney)的核心都是一个叫做 “扩散模型” 的技术。它的灵感来自于物理学中的扩散现象。扩散模型的核心是一个“先破坏,再修复”的学习过程:

  • 前向扩散(加噪):给一张训练用的图片(比如一只猫的照片)逐步添加噪声。一开始是少量噪声,图片有点模糊;到最后,图片完全变成了一团毫无意义的、纯粹的随机噪声。

  • 反向扩散(去噪):这是模型要学习的核心任务。模型需要学会如何将上述过程逆转。即,给定一团噪声,以及“这是第几步的噪声”,模型需要预测出“这一步的噪声是什么”,从而从图片中减去这个预测的噪声,得到一张更清晰的图片。

通过在海量(数亿张)图片-文字对上重复这个训练,模型最终学会了“如何从噪声中构建出任何它‘见过’的概念”。

3、文字生成图像的详细底层流程

当我们输入一段文字(称为 Prompt)时,整个过程如下:

第1步:文本编码

  • 目标:将人类可读的文字转换成机器能理解的、包含丰富语义的数学表示(向量)。

  • 如何实现:使用一个强大的文本编码器,最常见的是 CLIP 模型。CLIP 在训练时同时看图和文字,学会了将描述同一事物的图片和文字在数学空间里映射到相近的位置。

  • 过程:你的 Prompt “一只戴着宇航员头盔的猫在月球上” 被 CLIP 转换成一个或多个高维向量。这个向量就像一张详细的“建筑蓝图”,指导着后续图像的生成。

第2步:在潜空间中进行图像生成

这是最巧妙的一步,也是 Stable Diffusion 成功的关键。传统扩散模型直接在像素空间操作,计算量巨大。Stable Diffusion 引入了一个 “潜空间”。什么是潜空间?我们可以使用一个编码器(例如 VAE 的编码器)将任何一张图片压缩成一个更小的、包含其核心信息的表示(潜编码)。同样,我们可以用解码器将这个潜编码几乎无损地还原成原图。这个更小的、信息密集的空间就是潜空间。在潜空间里操作,比在像素空间快成百上千倍。

在潜空间中进行图像生成的过程是这样的:

  • 初始化:先生成一个纯粹的随机噪声张量(在潜空间中)。

  • 迭代去噪:这是一个循环过程,通常进行 20-50 步(采样步数)。将当前的噪声图像和从第1步得到的文本向量一起输入到 UNet(扩散模型的核心组件)中。

UNet 的任务:根据文本的指引,预测出当前噪声图像中“不应该存在”的噪声,并将其移除。

文本的引导作用:文本向量就像一个向导,告诉 UNet:“这里应该是一只猫的眼睛,所以这块区域的噪声要这样去除”;“那里应该是星空,所以那块区域的噪声要那样去除”。

每一步,图像都变得更清晰,更符合文字描述。

第3步:图像解码

  • 目标:将潜空间中生成的、清晰的潜编码,转换回我们肉眼可见的像素图像。

  • 如何实现:使用 VAE 的解码器。这个解码器在训练阶段就已经学会了如何将潜编码“翻译”成高质量的图片。经过这一步,最终的高清图片就诞生了。

关键角色总结:

  • CLIP:翻译官。负责理解你的文字,并将其转换成模型能懂的指令。

  • 扩散模型(UNet):核心艺术家。在文本指令的指导下,负责从噪声中一步步“雕刻”出图像。

  • VAE:材料处理专家。负责将原材料(潜编码)和最终作品(像素图)进行高效转换,极大提升了创作速度。

4、文生图技术的历史发展过程

文生图技术并非某一家公司凭空创造的,它的历史是学术界和多家公司共同书写的。如果把文生图比作一栋大厦,那么:

打地基的是学术研究:公认的第一个现代文本生成图像模型是2015年多伦多大学提出的AlignDRAW。

奠定技术基石的是几项关键发明:近年来文生图的大爆发,直接得益于扩散模型(Diffusion Model) 等基础技术的提出,以及像OpenAI的CLIP这样能连接文本与图像的技术。

推向大众的是开源与产品化公司:2022年,Stability AI开源了Stable Diffusion模型,让文生图技术迅速普及;同年,OpenAI的DALL-E 2让人们看到了惊人的生成效果,它们共同拉开了AIGC元年的序幕。

5、Stable Diffusion模型和DALL-E 2模型的比较

简单来说,如果你想上手就用、生成又快又好,那DALL-E 2在当时的易用性和出图质量上更占优势。研究数据显示,在建筑图像生成等特定领域的评估中,DALL-E 2的生成效果在准确性上要好于未经精细调整的Stable Diffusion。 但是,如果你的标准是自由度和可玩性,那Stable Diffusion无疑更“厉害”。它的核心优势在于完全开源和高度可定制。这意味着技术用户可以在本地免费运行,用它训练自己的专属模型,甚至衍生出一个庞大的工具生态。这种灵活性和可塑性是DALL-E 2这类闭源商业模型无法比拟的。

从全球搜索热度来看,DALL-E和Stable Diffusion的知名度在伯仲之间,DALL-E整体略高一点点,不过在不同国家受欢迎的程度差异挺大:比如在美国、中国和日本,Stable Diffusion更受关注;而在德国、波兰和法国,则是DALL-E更流行。

另外值得留意的是,这两款模型作为曾经的“顶流”,如今都已算是“前辈”了。DALL-E 2将于2026年5月12日被OpenAI正式停用,彻底告别舞台;而Stable Diffusion则在持续迭代,其最新的3.5版本依然是开源社区的热门选择。

补充介绍:Midjourney的出现

Midjourney出现在2022年,正是扩散模型等AI文生图技术取得突破并开始进入公众视野的年份。几乎在同一时期,DALL-E 2和Stable Diffusion也相继发布,Midjourney作为其中一员,共同拉开了“AIGC元年”的序幕,并凭借独特的艺术风格脱颖而出。

Midjourney选择将服务搭载在Discord平台上。这为其带来了天然的巨大优势,因为Discord本身就聚集着海量乐于接受新技术的游戏玩家和数字艺术爱好者。这种社区化的运营模式,让Midjourney迅速获得了第一批核心用户,并形成了独特的共创文化,实现了快速口碑传播。

在目前的文生图领域,Midjourney和Stable Diffusion的知名度都很高,只是它们“出名”的圈子不太一样。如果从大众出圈和艺术效果的角度来看,Midjourney的名气会更大一些;而如果在开发者、技术爱好者和追求高度自由的用户群体中,Stable Diffusion则有着不可撼动的地位。

Midjourney成名更早,通过《太空歌剧院》获奖、“中国情侣”等作品在社交媒体上实现了破圈传播。用户只需要输入简单的文字,就能轻松得到极具电影感和美学风格的图像,这大大降低了艺术创作的门槛。它的社区文化也很独特,用户们在Discord上一起创作、分享,这让Midjourney更像是一个创意潮流的风向标。

Stable Diffusion的名气则根植于“开源”和“可控”这两个标签。作为首个面向大众的开源大模型,它催生了无数二次开发的工具、社区模型和插件。这意味着用户可以深度自定义,甚至在自己的电脑上免费运行,创造属于自己的独特风格和工具。因此,它更像一个庞大的技术生态系统和创作者工具底座,是很多前沿应用和研究的基石。

总结一下,Midjourney更像是一个技术精湛的艺术家,用惊艳的作品赢得了大众的掌声;而Stable Diffusion则像是一位提供了无限可能的工匠铺,用极致的自由度吸引了一大批深度玩家。

本教程共55节,当前为第53节!
本教程最新修订时间为:2026-07-24 19:18:38

📌 面试天下网:一款服务于上班族的口袋书,让大家在地铁里/公交上可以学习大模型技术!
📌 网站公告:人人都需要的干眼克星上线啦>>>>>>
📌 网站公告:2026年7月招聘兼职>>>>>>