✨ 复制成功!

以文会友,打造好学人设!

📋 已复制到剪贴板:

从向量到矩阵:打开空间变换的大门

创建时间:2026-07-22 更新时间:2026-07-31 阅读次数:1041 次

在线性代数的世界里,向量和矩阵是两个最基础却又最强大的概念。它们不仅是数学工具,更是理解多维空间和复杂变换的钥匙。

一、向量:空间中的箭头

1.1 行向量与列向量

向量可以看作是一组有序的数字,用来表示空间中的一个点或一个方向。根据数字的排列方式,向量分为两种:

  • 行向量:数字横向排列,如 $$\begin{bmatrix} 1 & 2 & 3 \end{bmatrix}$$

  • 列向量:数字纵向排列,如 $$\begin{bmatrix} 1 \\ 2 \\ 3 \end{bmatrix}$$

从数学本质上看,这两者表示的是同一个向量,只是书写形式不同。但在实际应用中,它们会影响到后续运算的规则和便利性。

1.2 为什么列向量更普遍?

在数学、物理和计算机科学等领域,列向量远比行向量常见。这并非偶然,主要基于以下几点:

第一,与矩阵乘法的自然配合。 矩阵乘法要求左侧矩阵的列数等于右侧矩阵的行数。当我们想用一个矩阵 $A$ 去变换一个向量 $\mathbf{v}$ 时,通常写成 $A\mathbf{v}$。如果 $\mathbf{v}$ 是列向量,乘法形式非常直观:矩阵在左,向量在右。如果 $\mathbf{v}$ 是行向量,就不得不写成 $\mathbf{v}^T A$ 或把矩阵转置,显得别扭。

第二,符合线性变换的书写习惯。 在线性代数中,我们习惯把线性变换写作 $\mathbf{y} = A\mathbf{x}$,其中 $\mathbf{x}$ 和 $\mathbf{y}$ 都是列向量。这种形式简洁清晰,所有主流教科书和软件(如 MATLAB)都采用这种约定。

第三,列向量更利于表示多维数据。 在数据科学中,一个包含 $n$ 个特征的数据样本通常写成一个列向量,每一行代表一个特征。当多个样本组成数据集时,按列堆叠形成矩阵,每一列是一个样本,这种结构便于批量处理。

正因为这些原因,本书后续内容中如无特别说明,所说的“向量”均指列向量。

二、矩阵:空间的变换器

2.1 什么是矩阵?

矩阵是一组数字按照行和列排列成的矩形阵列。一个 $m \times n$ 的矩阵有 $m$ 行、$n$ 列,比如:

$$ A = \begin{bmatrix} a_{11} & a_{12} & \cdots & a_{1n} \\ a_{21} & a_{22} & \cdots & a_{2n} \\ \vdots & \vdots & \ddots & \vdots \\ a_{m1} & a_{m2} & \cdots & a_{mn} \end{bmatrix} $$

矩阵可以看作是由多个列向量并排组成的,也可以看作是由多个行向量堆叠而成的。

2.2 矩阵的核心作用:空间映射

矩阵最核心的作用是表示线性变换,也就是把一个空间中的向量映射到另一个空间。

想象二维平面上的所有点。如果我们用一个 $2 \times 2$ 的矩阵去乘每一个点的坐标向量,整个平面就会发生旋转、缩放、剪切、反射等变化。矩阵就是这个变换的“操作手册”。

更形式化地说,一个 $m \times n$ 矩阵定义了一个从 $\mathbb{R}^n$ 到 $\mathbb{R}^m$ 的映射:

$$ \mathbf{y} = A\mathbf{x} $$

其中 $\mathbf{x} \in \mathbb{R}^n$,$\mathbf{y} \in \mathbb{R}^m$。这里的 $A$ 就像一台机器,把 $n$ 维空间中的向量加工成 $m$ 维空间中的新向量。

2.3 矩阵是基变换的记录。

当我们说一个矩阵表示线性变换时,实际上它记录了在给定基底下,每个基向量被映射到了哪里。矩阵的第一列就是原空间第一个基向量变换后的新坐标,第二列是第二个基向量的映射结果,以此类推。这一理解方式非常有助于直观把握矩阵的几何意义。

三、矩阵与向量的相遇:乘法与映射

3.1 矩阵与向量相乘的计算法则

给定一个 $m \times n$ 的矩阵 $A$ 和一个 $n$ 维列向量 $\mathbf{x}$,它们的乘积 $A\mathbf{x}$ 是一个 $m$ 维列向量。计算方法如下:

将矩阵 $A$ 的每一行与向量 $\mathbf{x}$ 进行点积,结果作为新向量的对应分量:

$$ A\mathbf{x} = \begin{bmatrix} a_{11} & a_{12} & \cdots & a_{1n} \\ a_{21} & a_{22} & \cdots & a_{2n} \\ \vdots & \vdots & \ddots & \vdots \\ a_{m1} & a_{m2} & \cdots & a_{mn} \end{bmatrix} \begin{bmatrix} x_1 \\ x_2 \\ \vdots \\ x_n \end{bmatrix} = \begin{bmatrix} a_{11}x_1 + a_{12}x_2 + \cdots + a_{1n}x_n \\ a_{21}x_1 + a_{22}x_2 + \cdots + a_{2n}x_n \\ \vdots \\ a_{m1}x_1 + a_{m2}x_2 + \cdots + a_{mn}x_n \end{bmatrix} $$

也可以用列向量的线性组合来理解:把矩阵 $A$ 的每一列当作一个向量,乘法的结果就是这些列向量分别乘以 $x_1, x_2, \ldots, x_n$ 后相加:

$$ A\mathbf{x} = x_1 \begin{bmatrix} a_{11} \\ a_{21} \\ \vdots \\ a_{m1} \end{bmatrix} + x_2 \begin{bmatrix} a_{12} \\ a_{22} \\ \vdots \\ a_{m2} \end{bmatrix} + \cdots + x_n \begin{bmatrix} a_{1n} \\ a_{2n} \\ \vdots \\ a_{mn} \end{bmatrix} $$

这两种视角在计算上是等价的,但后一种更清晰地揭示了矩阵乘法的几何本质。

3.2 为什么矩阵乘法能把向量映射到新空间?

接续上面“列向量线性组合”的思路,就能自然地理解这个作用。

矩阵 $A$ 的每一列,对应的是原空间基向量变换后在目标空间中的位置。向量 $\mathbf{x} = (x_1, x_2, \ldots, x_n)^T$ 本身表示“将各基向量分别缩放 $x_i$ 倍然后组合起来”。变换后,这个组合规则不变,但所使用的基向量已经变成了 $A$ 的各列。因此,$A\mathbf{x}$ 就是原向量在新基下的坐标表示,也就是被映射到了新空间。

举个直观例子: 考虑二维空间中的矩阵 $$ A = \begin{bmatrix} 2 & 0 \\ 0 & 1 \end{bmatrix} $$ 和一个向量 $\mathbf{x} = \begin{bmatrix} 1 \\ 1 \end{bmatrix}$。 $A$ 的第一列 $(2, 0)^T$ 是原 $x$ 轴基向量被拉长到 2 倍的结果,第二列 $(0, 1)^T$ 保持不变。 $\mathbf{x}$ 原本表示 $x$ 轴基向量的 1 倍加上 $y$ 轴基向量的 1 倍。 经过 $A$ 变换后,变成了:$1 \cdot (2, 0)^T + 1 \cdot (0, 1)^T = (2, 1)^T$。 可见,向量在 $x$ 方向被拉伸了 2 倍,完成了空间的映射。

四、矩阵乘法:变换的组合

掌握了矩阵和向量的乘法后,自然会想:如果先用矩阵 $B$ 变换一个向量,再用矩阵 $A$ 变换结果,会怎样?这就引出了矩阵乘法,它本质上是线性变换的复合。

设 $B$ 是一个 $p \times n$ 的矩阵,$A$ 是一个 $m \times p$ 的矩阵。先施加 $B$ 的变换再施加 $A$ 的变换,最终效果相当于用一个矩阵 $C = AB$ 直接作用在向量上:

$$ A(B\mathbf{x}) = (AB)\mathbf{x} = C\mathbf{x} $$

矩阵乘法的计算规则是:$C$ 的第 $i$ 行第 $j$ 列元素等于 $A$ 的第 $i$ 行与 $B$ 的第 $j$ 列的点积。更几何化的理解是:$AB$ 的每一列,就是 $A$ 对 $B$ 的每一列分别进行变换后的结果。

这一性质非常强大,意味着无论多复杂的线性变换序列,都可以压缩成一个矩阵。例如,在计算机图形学中,物体的平移、旋转、缩放等操作可以各自用矩阵表示,将它们相乘得到一个综合变换矩阵,然后一次性对所有顶点进行变换,效率极高。

总结

向量是我们描述空间位置和方向的工具,列向量因其与矩阵乘法的自然配合而成为主流选择。矩阵则是空间变换的载体,它通过每一列记录基向量的“去往何方”,从而定义了整个空间的映射规则。矩阵与向量的乘法,表面是数字的运算,实质是将向量从旧基底表示转换为新基底表示的过程。在这个意义上,每做一次矩阵乘法,我们都见证了一次空间的变形与重生。

本教程共26节,当前为第13节!
本教程最新修订时间为:2026-08-17 12:04:19


评论专区

评论加载中...