✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

AI背后的数学三驾马车|线性代数+概率统计+微积分如何驱动机器学习

创建时间:2026-07-22 更新时间:2026-07-24 阅读次数:1109 次

很多人都觉得,人工智能的核心是编程、是数据、是GPU轰鸣的算力。这些东西当然重要,但如果我们把AI比作一座大厦,那数学就是它的地基。没有数学,这座大厦根本建不起来,建起来了也会塌。

那数学到底在AI里干了什么?

为了讲清楚这个问题,我们不如从一个最简单、最具体的例子开始:预测房价

假设你是一名房产中介的实习生,老板给了你一份过去成交的房屋数据,让你练练手——如果来了一套新房,你能不能大致估出它该卖多少钱?

这个任务,本质上就是AI在做的事情。我们就顺着这个例子,把AI背后的数学一步一步拆开来看。


最简单的模型:一条直线

我们先别把事情搞复杂。影响房价的因素可以有很多——面积、楼层、装修、地段……但为了入门,我们只抓最核心的一个特征:房屋面积

你拿到了一批历史数据,把它画在纸上:横轴是面积,纵轴是总价。你会惊奇地发现,这些点虽然不是完美地排成一条直线,但确实大致沿着一条直线分布。

于是你灵机一动:能不能用一条直线来近似地描述面积和房价的关系?

这条直线,就是我们整个故事的起点。用数学来写,它就是:

$$ y = wx + b $$

这里:

  • $x$ 是房屋面积(我们喂给模型的“输入”);
  • $y$ 是模型预测出来的房价(“输出”);
  • $w$ 和 $b$ 是两个需要确定的数,$w$ 叫权重,$b$ 叫偏置

在AI领域,这个 $y = wx + b$ 就是最简单的模型。它的思想朴素得可爱:房价约等于面积乘上一个系数,再加一个基础值。就这么简单。

可是,从一个简单的等式,到真正能让机器“学会”预测,背后需要三个关键步骤。而这三个步骤,恰好对应了AI所依赖的三门核心数学。


第一步:怎么用数学表示数据和模型?——线性代数

真实情况里,我们手里的数据不可能只有两三条,往往是成百上千条。而且,影响房价的因素也绝不止面积一个。

这时,如果还是用初中的“一个 $x$ 一个 $y$”来写,就会又长又乱。我们需要一套更高效、更结构化的数学语言——这就是线性代数登场的地方。

在线性代数的视角下,我们不再一条一条地处理数据,而是把它们整齐地堆进矩阵向量里。

比如,我们不再只考虑面积 $x$,而是考虑多个特征:面积、卧室数量、房龄、到地铁站的距离……对一套房子,这些特征可以排成一个行向量

$$ \mathbf{x} = [x_1, x_2, x_3, \ldots, x_n] $$

所有的权重也可以排成一个列向量

$$ \mathbf{w} = \begin{bmatrix} w_1 \\ w_2 \ \vdots \\ w_n \end{bmatrix} $$

再加上偏置 $b$,我们原来那条简单的直线,就摇身一变,成了一个更加通用的线性模型:

$$ y = \mathbf{x} \mathbf{w} + b = x_1 w_1 + x_2 w_2 + \ldots + x_n w_n + b $$

这还没完。如果手上有 $m$ 套历史房屋数据,我们完全可以把它们一次性堆叠起来,形成一个大的特征矩阵 $X$:

$$ X = \begin{bmatrix} x_{11} & x_{12} & \ldots & x_{1n} \\ x_{21} & x_{22} & \ldots & x_{2n} \\ \vdots & \vdots & \ldots & \vdots \\ x_{m1} & x_{m2} & \ldots & x_{mn} \end{bmatrix} $$

每一行是一套房子,每一列是一个特征。那么,所有房子的预测价格,就可以用一个极其简洁的矩阵乘法一次性算出来:

$$ \hat{\mathbf{y}} = X \mathbf{w} + b $$

你看,用线性代数的语言,无论数据量多大、特征多少,模型的表达始终干净、统一。这不仅仅是为了写起来省事。当计算机真正做运算时,它调用的底层库就是按照矩阵运算来优化的,这就是为什么AI能在海量数据上跑起来。

线性代数解决了“数据和模型如何表示”的问题。它给AI提供了数据结构和运算框架。


第二步:怎么判断模型好坏?——概率统计

现在我们有了模型 $y = wx + b$,也能用矩阵表示一大堆数据了。但问题是,随便画一条直线都能预测吗?显然不是。

比如,我们随手瞎猜一个 $w = 1000$、$b = 50000$。对一套 100 平米的房子,模型给出的预测价格是:

$$ y = 1000 \times 100 + 50000 = 150000 \ \text{(即15万)} $$

但真实成交数据里,同样面积的房子可能卖了 200 万。那这个模型就错得离谱。

于是,一个极其根本的问题出现了:怎么判断一个模型到底有多好,或者说有多烂?

这要靠概率统计

在统计视角下,我们把每一套真实成交价 $y_{\text{true}}$ 和模型预测值 $y_{\text{pred}}$ 之间的差距,叫做误差或者残差

单看一套房子的误差意义不大,我们需要一个能概括整体表现的指标。最常用的一个,就是把所有误差先平方(消除正负抵消的影响),再求平均,最后开方。但实践中,连开方都经常省略,直接用均方误差,也就是MSE:

$$ \text{MSE} = \frac{1}{m} \sum_{i=1}^{m} (y_{\text{pred}}^{(i)} - y_{\text{true}}^{(i)})^2 $$

这个数字越大,说明模型预测得越离谱;越接近 0,说明模型预测得越准。

但统计思维给我们的远远不止是一个“评分”。它让我们意识到,数据本身就包含着不确定性噪声。即使我们把面积、楼层、地段全部考虑进去,房价还是会有波动——可能是买家那天的心情,也可能是房东突然急用钱。

统计学告诉我们:模型不可能做到 100% 精确,但我们可以在概率的意义上,让模型尽可能地逼近真实规律。而MSE这样的损失函数,就为模型的好坏提供了客观的定量标准。

概率统计解决了“模型好坏如何衡量”的问题。它为AI提供了评价标准和不确定性处理的视角。


第三步:怎么让模型自动变好?——微积分

现在,我们能把数据表示成矩阵了,也知道用MSE来给模型打分了。剩下最关键的一步是:

我们不想靠人手动去瞎猜 $w$ 和 $b$,我们希望机器能自己找到让MSE最小的那个 $w$ 和 $b$。

这就需要微积分了,具体来说,是微积分里的梯度下降

我们先想一个简化情况:假设 $b = 0$,模型就是 $y = wx$,此时MSE的大小只取决于 $w$。如果把 $w$ 当成横坐标,MSE当成纵坐标,画出来的曲线会是一个“碗”的形状。

我们的目标就是走到这个碗的最低点,因为那里对应着误差最小的 $w$。

怎么走?微积分给我们一个强有力的工具——导数

函数 $f(w)$ 在某一点的导数,可以告诉我们:在这里,函数是往上走的还是往下走的,坡度有多陡。具体来说:

  • 如果导数是正数,说明函数在上升,我们应该减小 $w$,才能往下坡走;
  • 如果导数是负数,说明函数在下降,我们应该增大 $w$,继续往下坡走。

用数学写出来,更新规则就是:

$$ w_{\text{新}} = w_{\text{旧}} - \alpha \cdot \frac{d(\text{MSE})}{dw} $$

这里的 $\frac{d(\text{MSE})}{dw}$ 是导数,也就是梯度; $\alpha$ 是一个很小的正数,叫学习率,控制我们每一步迈多大。

在真实的模型里,$w$ 和 $b$ 是同时存在的,甚至 $w$ 本身可能有几十上百个。这时候我们就得用偏导数梯度来同时更新所有参数。但本质上思想完全一样:沿着梯度的反方向,一小步一小步地更新参数,MSE就会逐步下降,最终收敛到一个比较理想的最低点。

整个过程完全自动:计算机先随机取一组 $w$ 和 $b$,算出预测值,再跟真实值比较,求梯度,更新参数;然后再算一遍,再更新……如此循环几千几万次后,误差已经小到几乎不能再小了,我们就得到了一个“学好了”的模型。

微积分解决了“如何让模型自动优化”的问题。它为AI提供了学习算法和迭代更新的核心引擎。


三者合力,这就是AI的基本骨架

回顾一下,我们用一条直线 $y = wx + b$ 来预测房价,背后其实藏着数学的三大支柱在默契配合:

  • 1、线性代数负责“表示”——把成千上万的数据和复杂的模型,装进矩阵和向量的框架,让运算变得高效统一。

  • 2、概率统计负责“评判”——告诉我们模型预测得准不准、误差有多大,数据中的不确定性该如何理解。

  • 3、微积分负责“优化”——通过梯度的指引,让模型能一步一步自动调整参数,越变越好。

你以后会听到的各种AI名词——深度学习、神经网络、卷积网络、Transformer——本质上都是在这个骨架之上进行了更复杂的扩展。但无论模型多复杂,把数学内核剥开来看,依然是这三件事:怎么表示,怎么评判,怎么优化。

所以说,数学在AI里到底干了什么?

它让一堆看似死板的数据,有了能够自我调整、逐渐逼近真相的能力。而这,正是“智能”二字的数学根基。

本教程共26节,当前为第1节!
本教程最新修订时间为:2026-08-17 12:04:19


评论专区

评论加载中...