Administrator
发布于 2026-09-09 / 0 阅读
0
0

线性代数基础:特殊矩阵及其性质

特殊矩阵及其性质

矩阵的基本定义与表示方法

我们首先要理解什么是实方阵。当我们说 A \in M_{n \times n}(\mathbb{R}) 时,这表示 A 是一个 n 阶实方阵,也就是说它是一个 nn 列的矩阵,且所有元素都是实数。这里的 \mathbb{R} 就代表实数域。

对于这样一个矩阵,我们有多种表示方法,每种方法都有其特定的用途。第一种是按列向量来表示矩阵。我们可以把矩阵 A 写成由 n 个列向量组成的形式:

A = [a_1, a_2, \ldots, a_n]

这里每个 a_i 都是一个 n 维列向量,i 的范围是从 1n。这种表示方法在讨论矩阵的列空间、列秩等概念时特别有用。

第二种表示方法是按照矩阵元素来表示。我们用 a_{ij} 来表示矩阵 A 中第 i 行第 j 列的元素,其中 1 \leq i \leq n1 \leq j \leq n。于是整个矩阵可以写成:

A = (a_{ij})_{1 \leq i,j \leq n}

我们也可以把矩阵 A 完整地写成分块形式,展示其所有元素的排列:

A = \begin{bmatrix} a_{11} & a_{12} & \cdots & a_{1n} \\ a_{21} & a_{22} & \cdots & a_{2n} \\ \vdots & \vdots & \ddots & \vdots \\ a_{n1} & a_{n2} & \cdots & a_{nn} \end{bmatrix}

这种完整的矩阵表示让我们能够清楚地看到所有元素的位置关系。

几种基本的矩阵运算

在深入讨论特殊矩阵之前,我们需要理解几个基本的矩阵运算。首先是转置运算。对于矩阵 A,它的转置 A^T 定义为将行和列互换,即:

A^T = (a_{ji})

注意这里的下标顺序变了,原来 A 中第 i 行第 j 列的元素 a_{ij},在 A^T 中变成了第 j 行第 i 列的元素。转置运算在处理对称性质时非常重要。

接下来是共轭转置运算,也叫做 Hermitian 转置。对于复矩阵(元素可以是复数),共轭转置 A^* 定义为:

A^* = \overline{A}^T = \overline{(a_{ji})}

这个运算包含两步:先对矩阵的每个元素取共轭(即把虚部的符号反转),然后再转置。为什么要这样定义呢?因为在复数空间中,我们需要这种运算来保持内积的良好性质,这在后面讨论 Hermitian 矩阵时会更清楚。

最后,我们来看单位矩阵 I_n,它是一个 n 阶方阵,主对角线上的元素全是 1,其余元素全是 0

I_n = \begin{bmatrix} 1 & 0 & \cdots & 0 \\ 0 & 1 & \cdots & 0 \\ \vdots & \vdots & \ddots & \vdots \\ 0 & 0 & \cdots & 1 \end{bmatrix}

单位矩阵具有非常重要的性质:任何矩阵乘以单位矩阵都等于它本身,即 AI_n = I_n A = A。这使得单位矩阵在矩阵运算中扮演着类似于数字 1 在普通乘法中的角色。

矩阵的对称性质

现在我们来讨论各种特殊矩阵,这些矩阵都具有某种对称性质。首先是对称矩阵。当一个实方阵 A \in M_{n \times n}(\mathbb{R}) 满足 A = A^T 时,我们称它为对称矩阵。这意味着矩阵关于主对角线对称,即 a_{ij} = a_{ji} 对所有 i, j 都成立。对称矩阵在许多实际应用中出现,比如协方差矩阵、距离矩阵等。

当我们把讨论范围扩展到复数域时,简单的转置就不够用了。这时我们引入 Hermitian 矩阵(也叫 Hermite 矩阵或厄米矩阵)。一个复矩阵 A 是 Hermitian 矩阵,当且仅当 A = A^*,即它等于自己的共轭转置。这意味着 a_{ij} = \overline{a_{ji}}。特别地,主对角线上的元素必须是实数(因为 a_{ii} = \overline{a_{ii}})。Hermitian 矩阵是对称矩阵在复数域上的推广,它们在量子力学等领域有重要应用。

接下来是酉矩阵(Unitary 矩阵)。一个复矩阵 A 是酉矩阵,如果它满足 A A^* = A^* A = I。这个条件等价于说 A 的逆矩阵等于它的共轭转置,即 A^{-1} = A^*。为什么这个性质重要呢?因为酉矩阵保持向量的长度和角度不变,它代表一种旋转或反射变换。

正交矩阵是酉矩阵在实数域上的特例。一个实矩阵 A 是正交矩阵,如果 A^T A = A A^T = I_n。由于实矩阵的共轭转置就是转置,所以正交矩阵就是满足 A^{-1} = A^T 的矩阵。正交矩阵的列向量(和行向量)构成标准正交基,这在许多数值计算中很有用。

最后是正规矩阵(normal 矩阵)。一个矩阵 A 是正规矩阵,如果它与自己的共轭转置可交换,即 A^* A = A A^*。这个条件看似简单,但它统一了前面提到的所有特殊矩阵:对称矩阵、Hermitian 矩阵、酉矩阵和正交矩阵都是正规矩阵的特例。正规矩阵的重要性在于,它们可以被酉对角化。

特征值与特征向量的基本概念

现在我们转向矩阵理论中最核心的概念之一:特征值和特征向量。对于 n 阶方阵 A,如果存在非零向量 v_i 和标量 \lambda_i,使得 A v_i = \lambda_i v_i,那么我们称 \lambda_iA 的特征值,v_i 是对应于 \lambda_i 的特征向量。

这个方程的几何意义非常直观:当矩阵 A 作用在特征向量 v_i 上时,只会把 v_i 伸缩 \lambda_i 倍,而不会改变它的方向。这就是为什么特征向量和特征值如此重要——它们揭示了线性变换的本质结构。

关于特征向量,有几个重要的性质需要理解。首先,如果 v_i = 0,那么方程 A v_i = \lambda_i v_i 变成 0 = 0,这对任何 \lambda_i 都成立,因此没有意义。所以我们要求特征向量必须是非零向量。

其次,如果 v_i 是特征值 \lambda_i 对应的特征向量,那么任何非零的倍数 k v_ik \neq 0)也是对应于同一特征值的特征向量。这是因为 A(k v_i) = k(A v_i) = k(\lambda_i v_i) = \lambda_i (k v_i)。这意味着特征向量不是唯一的,但特征空间(所有对应于某个特征值的特征向量加上零向量构成的空间)是唯一确定的。笔记中用 v_i-2v_i 作为例子,说明它们都是特征向量。

特征多项式及其根

为了实际计算特征值,我们需要引入特征多项式的概念。矩阵 A 的特征多项式定义为:

P_A(\lambda) = \det(A - \lambda I)

这个定义是如何产生的呢?从特征值方程 A v = \lambda v 出发,我们可以改写为 (A - \lambda I) v = 0。这个齐次线性方程组有非零解的充要条件是系数矩阵 A - \lambda I 不可逆,也就是说它的行列式必须为零。因此,\lambdaA 的特征值,当且仅当 \det(A - \lambda I) = 0

特征多项式 P_A(\lambda) 是一个 n 次多项式,它可以分解为:

P_A(\lambda) = \prod_{i=1}^{k} (\lambda_i - \lambda)^{m_i}

这里 \lambda_1, \lambda_2, \ldots, \lambda_kA 的所有不同的特征值,m_i 是特征值 \lambda_i 的代数重数(即它作为 P_A(\lambda) 的根的重数)。注意这个乘积展开式告诉我们,计算特征值就是求解特征多项式的根。

笔记中给出了一个具体例子。假设我们计算出某个矩阵的特征多项式为 P_A(\lambda) = (1-\lambda)^2 (2-\lambda)。从这个式子我们可以立即读出:\lambda_1 = 1 的代数重数 m_1 = 2\lambda_2 = 2 的代数重数 m_2 = 1

\lambda_i 是一个特征值时,齐次方程组 (A - \lambda_i I) v = 0 必有非零解。这等价于说矩阵 A - \lambda_i I 不是满秩的(即它的秩小于 n)。笔记中强调"A - \lambda I 不满秩"正是这个意思。

矩阵的谱与谱半径

有了特征值的概念,我们可以定义矩阵的谱。矩阵 A 的谱 \sigma(A) 是它所有特征值的集合。在笔记中用 \xi(A)\sigma(A) 来表示。谱这个概念在泛函分析和算子理论中有更广泛的推广。

基于谱,我们可以定义谱半径 \rho(A)

\rho(A) = \max_{1 \leq i \leq n} |\lambda_i|

谱半径就是所有特征值的模(绝对值或复数的模)中最大的那个。为什么谱半径重要呢?因为它在矩阵级数的收敛性、迭代法的收敛速度等问题中起着决定性作用。比如,矩阵幂级数 \sum_{k=0}^{\infty} A^k 收敛的充要条件是 \rho(A) < 1

内积空间的定义

现在我们转向内积的讨论。内积是向量空间中定义"长度"和"角度"的基础工具。在实数空间 \mathbb{R}^n 中,Euclidean 内积定义为:

\langle x, y \rangle = x^T y = y^T x = \sum_{i=1}^{n} x_i y_i

这个定义有几个关键特点。首先,它是对称的:\langle x, y \rangle = \langle y, x \rangle。其次,它是双线性的。第三,它是正定的:\langle x, x \rangle \geq 0,且等号成立当且仅当 x = 0

当我们扩展到复数空间 \mathbb{C}^n 时,内积的定义需要修改。复数空间的内积定义为:

\langle x, y \rangle = \langle y, x \rangle^* = y^* x = \overline{y}^T x

注意这里有个关键差别:复数内积满足的是 Hermitian 对称性,即 \langle x, y \rangle = \overline{\langle y, x \rangle},而不是简单的对称性。为什么要这样定义呢?因为我们希望保持 \langle x, x \rangle 是实数且非负的性质。如果简单地定义为 x^T y,那么 \langle x, x \rangle = x^T x = \sum x_i^2 可能是复数,这就失去了"长度"的意义。

内积与矩阵运算的关系

内积与矩阵运算之间有深刻的联系。对于实矩阵 B,我们有以下性质:

\langle Bx, y \rangle = \langle x, B^T y \rangle

这个等式如何理解呢?左边是先用 B 变换 x,然后与 y 做内积;右边是先用 B^T 变换 y,然后与 x 做内积。我们来验证为什么这两者相等:

\langle Bx, y \rangle = (Bx)^T y = x^T B^T y = \langle x, B^T y \rangle

这个性质说明转置运算与内积运算之间的关系,也揭示了为什么我们要定义伴随算子。

类似地,对于复矩阵,相应的性质是:

\langle Bx, y \rangle = \langle x, B^* y \rangle

这里 B^*B 的共轭转置。验证过程类似,但要注意共轭的处理。这个性质在定义 Hermitian 算子和酉算子时起着核心作用。

正定矩阵的定义与性质

最后,我们来讨论正定矩阵。设 A \in M_n(\mathbb{R}) 是一个实方阵,如果对所有非零向量 x \neq 0,都有 \langle Ax, x \rangle > 0,那么我们称 A 是正定矩阵。用内积的坐标表示,这个条件可以写成:

x^T A x > 0, \quad \forall x \neq 0

为了更具体地理解这个条件,我们来看一个 2 \times 2 矩阵的例子。设:

A = \begin{bmatrix} a_{11} & a_{12} \\ a_{21} & a_{22} \end{bmatrix}

那么对于向量 x = \begin{bmatrix} x_1 \\ x_2 \end{bmatrix},我们有:

x^T A x = (x_1, x_2) \begin{bmatrix} a_{11} & a_{12} \\ a_{21} & a_{22} \end{bmatrix} \begin{bmatrix} x_1 \\ x_2 \end{bmatrix}

展开这个乘积:

x^T A x = a_{11} x_1^2 + a_{12} x_1 x_2 + a_{21} x_1 x_2 + a_{22} x_2^2

正定性要求这个二次型对所有非零的 (x_1, x_2) 都是正的。这是一个关于矩阵元素的约束条件,它确保了相关的二次型总是正的。正定矩阵在优化理论、统计学、物理学等众多领域都有重要应用,因为它们保证了某些极值问题有唯一解。

从特征值的角度看,一个对称矩阵是正定的,当且仅当它的所有特征值都是正数。这提供了判断正定性的另一种方法,也揭示了正定性与矩阵谱之间的深刻联系。

正定矩阵的二次型表示及对角化理论

正定矩阵的二次型展开式

在前面我们定义了正定矩阵需要满足 x^T A x > 0 对所有非零向量成立。现在我们来看这个二次型的具体展开形式。对于 n \times n 矩阵 A = (a_{ij}),二次型可以写成双重求和的形式:

x^T A x = \sum_{i=1}^{n} \sum_{j=1}^{m} a_{ij} x_i x_j

这个展开式的含义是什么呢?当我们计算 x^T A x 时,实际上是在对矩阵 A 的每个元素 a_{ij} 乘以相应的 x_i x_j,然后把所有这些项加起来。第一个求和符号表示遍历所有的行索引 i,第二个求和符号表示遍历所有的列索引 j。这种展开形式清楚地展示了矩阵 A 的每个元素是如何贡献到最终的二次型值的。

矩阵对角化的充要条件

现在我们进入一个核心问题:什么时候一个矩阵可以对角化?这个问题对于理解矩阵的结构至关重要。矩阵 A 可对角化意味着存在可逆矩阵 P,使得 P^{-1} A P = D,其中 D 是对角矩阵。这等价于说 A 可以写成 A = P D P^{-1} 的形式。

首先我们来看充分性。充分条件告诉我们,如果某个性质成立,那么矩阵就能对角化。笔记中提到"给定特征值等于0(或者说重数大于0)",这个表述可能不太清楚,但其实想说的是:如果矩阵的所有特征值对应的特征空间的维数之和等于 n,那么矩阵可以对角化。换句话说,如果我们能找到 n 个线性无关的特征向量,矩阵就能对角化。

必要性则说明,如果矩阵能对角化,那么必然存在 n 个线性无关的特征向量。这是因为对角化矩阵 A = PDP^{-1} 中,P 的列向量恰好就是这 n 个线性无关的特征向量,而对角矩阵 D 的对角元素就是对应的特征值。

三角化的充分条件

即使矩阵不能对角化,我们仍然可以问:能否把它变成一个更简单的形式?三角矩阵就是这样一个"次优"的选择。笔记中给出了一个例子来说明什么情况下矩阵可以三角化。

考虑一个具体的线性方程组:

\begin{cases} 2x + 5y - z = 1 \\ y - 3z = 2 \\ z = 5 \end{cases}

这个方程组具有特殊的结构:第三个方程只包含 z,第二个方程只包含 yz,第一个方程包含所有三个变量。这种"阶梯状"的结构对应于三角矩阵的形式。这个例子说明,如果系数矩阵可以通过相似变换化为三角形式,那么对应的线性系统就具有这种递推求解的结构。

笔记中进一步说明,三角化要求存在可逆矩阵 B,使得 B^{-1} A B 是上三角矩阵。具体的上三角矩阵形式如笔记所示:

B^{-1} A B = \begin{pmatrix} \times & \times & \times \\ 0 & \times & \times \\ 0 & 0 & \times \end{pmatrix}

这里的 \times 表示非零元素(或可能为零),而对角线下方的元素全是 0。关键的观察是:上三角矩阵的特征值恰好就是它的对角元素。这是因为 \det(A - \lambda I) 对于上三角矩阵特别容易计算——行列式就是对角元素的乘积。因此,如果矩阵 A 能三角化为上三角矩阵,那么 A 与这个三角矩阵有相同的特征值(因为相似变换不改变特征值),而这些特征值就是三角矩阵的对角元素。笔记中提到"A 能三角化意味着 A = B"实际上是说 A 相似于某个上三角矩阵。

Toeplitz 矩阵的定义与结构

现在我们来看一类非常特殊且在信号处理、时间序列分析中极其重要的矩阵——Toeplitz 矩阵。这类矩阵的特点是:沿着每条对角线(从左上到右下的对角线),所有元素都相同。

一个 Toeplitz 矩阵的一般形式可以写成:

A = \begin{bmatrix} a_0 & a_1 & a_2 & \cdots & a_{n-1} \\ a_{-1} & a_0 & a_1 & \cdots & a_{n-2} \\ a_{-2} & a_{-1} & a_0 & \cdots & a_{n-3} \\ \vdots & \vdots & \vdots & \ddots & \vdots \\ a_{-(n-1)} & a_{-(n-2)} & a_{-(n-3)} & \cdots & a_0 \end{bmatrix}

注意这个矩阵的结构:主对角线上的所有元素都是 a_0;主对角线上方第一条对角线的所有元素都是 a_1;主对角线下方第一条对角线的所有元素都是 a_{-1},以此类推。这种结构意味着矩阵元素 (i,j) 位置的值只依赖于 i-j 的差值,即 A_{ij} = a_{j-i}

笔记中用更紧凑的集合记号来表示这个事实:Toeplitz 矩阵可以用序列 \{a_{-(n-1)}, \ldots, a_0, a_1, \ldots, a_{n-1}\} 来完全确定。这个序列包含 2n-1 个参数,而不是一般 n \times n 矩阵所需的 n^2 个参数,这大大减少了存储和计算的复杂度。

协方差矩阵与 Toeplitz 结构的关系

现在我们来看一个深刻的联系:为什么在统计信号处理中,自相关矩阵经常是 Toeplitz 矩阵?这涉及到平稳随机过程的概念。

考虑一个随机向量 X(n),它可以写成:

X(n) = \begin{bmatrix} x(n) \\ x(n-1) \\ \vdots \\ x(1) \end{bmatrix}

这个向量包含了时刻 n, n-1, \ldots, 1 的观测值。现在我们计算这个随机向量与另一个随机向量 Y 之间的互相关矩阵。期望运算 E[X(n) \cdot Y(n \times 1)^T] 给出了互相关矩阵 R_{xy}(k)

让我们详细展开这个期望的计算。首先:

E\left[\begin{bmatrix} x(n) \\ x(n-1) \\ \vdots \\ x(1) \end{bmatrix} [x(n), x(n-1), \cdots, 1]\right] = E\left[\begin{bmatrix} Z_n \\ Z_n \end{bmatrix}^T\right]

这里笔记用 Z_n 表示数据向量的某种记号。继续展开,我们得到期望的矩阵形式:

= \begin{bmatrix} E[x(n)] & E[x(n)x(n-1)] & \cdots \\ & E[x(n-1)] & \cdots \\ & & \ddots \end{bmatrix}

关键的步骤来了。如果我们考虑自相关的情况,即 Y = X,那么我们需要计算 E[x(i)x(j)] 对所有 i, j 的值。这个期望矩阵可以写成:

= \begin{bmatrix} R_{xx}(0) & R_{xx}(1) & R_{xx}(2) & \cdots \\ R_{xx}(1) & R_{xx}(0) & \cdots & \\ \vdots & & \ddots & \\ \end{bmatrix}

这里 R_{xx}(k) 定义为 E[x(n)x(n-k)],即时间相隔 k 的两个观测值的期望乘积。

为什么这是一个 Toeplitz 矩阵呢?这是因为平稳性假设:对于平稳随机过程,E[x(i)x(j)] 只依赖于时间差 |i-j|,而不依赖于具体的时刻 ij。因此,所有相同时间间隔的元素具有相同的值。具体来说,(i,j) 位置的元素是 R_{xx}(|i-j|),这正是 Toeplitz 矩阵的定义特征。笔记最后明确标注"Toeplitz 矩阵",强调了这个重要的结构性质。这个结论在信号处理、时间序列分析、最优滤波等领域有广泛的应用。

Hankel 矩阵:反对角线的恒定性

与 Toeplitz 矩阵类似,Hankel 矩阵也是一类具有特殊结构的矩阵,但它的恒定性体现在反对角线上(从右上到左下的对角线)。Hankel 矩阵可以用序列 \{a_1, \ldots, a_{2n-1}\} 来定义,其形式为:

A = \begin{bmatrix} a_1 & a_2 & \cdots & a_n \\ a_2 & a_3 & \cdots & a_{n+1} \\ \vdots & \vdots & \ddots & \vdots \\ a_n & a_{n+1} & \cdots & a_{2n-1} \end{bmatrix}

观察这个矩阵的结构:从右上到左下的每条反对角线上,所有元素都相同。具体来说,(i,j) 位置的元素是 a_{i+j-1},这意味着矩阵元素只依赖于行索引和列索引的和。这与 Toeplitz 矩阵形成对比:Toeplitz 矩阵的元素依赖于索引的差,而 Hankel 矩阵的元素依赖于索引的和。

笔记中特别强调"到对角线上下相等"和"n \times n 的 Hankel 矩阵由 2n-1 个参数确定"。这说明 Hankel 矩阵也具有参数压缩的优势,类似于 Toeplitz 矩阵,只需要 2n-1 个参数而不是 n^2 个参数。

循环矩阵:周期性的体现

循环矩阵(Circulant matrix)是 Toeplitz 矩阵的一个特殊子类,它不仅具有 Toeplitz 矩阵的对角线恒定性,还具有额外的循环对称性。一个循环矩阵可以从一个序列 \{a_0, a_1, \ldots, a_{n-1}\} 构造,称为"给定 n 个参数,再循环之后得到一个矩阵"。

循环矩阵的形式为:

A = \begin{bmatrix} a_1 & a_2 & \cdots & a_n \\ a_n & a_1 & \cdots & a_{n-1} \\ a_{n-1} & a_n & a_1 & \cdots \\ \vdots & & & \ddots \\ a_2 & \cdots & & a_1 \end{bmatrix}

这个矩阵的特点是什么呢?每一行都是前一行的循环右移一位。第一行是 (a_1, a_2, \ldots, a_n),第二行是将第一行循环右移一位得到 (a_n, a_1, a_2, \ldots, a_{n-1}),第三行继续右移,以此类推。这种循环结构使得循环矩阵具有非常好的性质:它们可以用离散傅里叶变换(DFT)来对角化,这在信号处理中极其有用。

笔记中强调"循环矩阵的特征值是离散的,易于计算",这正是因为循环矩阵与傅里叶变换的深刻联系。相比一般的 Toeplitz 矩阵需要 2n-1 个参数,循环矩阵只需要 n 个参数就能完全确定,这进一步简化了表示和计算。

Vandermonde 矩阵:多项式插值的基础

最后,我们来看 Vandermonde 矩阵,它在多项式插值、离散傅里叶变换等问题中扮演着核心角色。给定 n 个数 a_1, a_2, \ldots, a_n,对应的 Vandermonde 矩阵定义为:

A = \begin{bmatrix} 1 & 1 & 1 & \cdots & 1 \\ a_1 & a_2 & a_3 & \cdots & a_n \\ a_1^2 & a_2^2 & a_3^2 & \cdots & a_n^2 \\ \vdots & \vdots & \vdots & \ddots & \vdots \\ a_1^{n-1} & a_2^{n-1} & a_3^{n-1} & \cdots & a_n^{n-1} \end{bmatrix}

注意矩阵的结构:第一行全是 1(也就是 a_i^0),第二行是 a_1, a_2, \ldots, a_n(即 a_i^1),第三行是它们的平方(a_i^2),依此类推直到第 n 行是 n-1 次幂(a_i^{n-1})。每一列都是以某个 a_i 为底的幂次序列。

Vandermonde 矩阵有一个非常优美的行列式公式,笔记中明确给出:

\det A = \prod_{1 \leq i < j \leq n} (a_j - a_i)

这个公式告诉我们,Vandermonde 矩阵的行列式等于所有 (a_j - a_i)(其中 j > i)的乘积。这个结果有什么含义呢?它说明 Vandermonde 矩阵可逆当且仅当所有的 a_i 两两不同。如果有任何两个 a_i 相等,比如 a_i = a_j,那么因子 (a_j - a_i) = 0 会出现在乘积中,导致行列式为零,矩阵不可逆。

这个性质在多项式插值中至关重要:给定 n 个不同的点 (a_1, y_1), (a_2, y_2), \ldots, (a_n, y_n),我们想找一个 n-1 次多项式 p(x) = c_0 + c_1 x + \cdots + c_{n-1} x^{n-1} 通过这些点。这等价于求解线性方程组 Vc = y,其中 V 是上述 Vandermonde 矩阵,c 是系数向量,y 是给定的函数值向量。由于当所有 a_i 不同时 V 可逆,这个线性方程组有唯一解,从而保证了插值多项式的存在性和唯一性。这就是为什么 Vandermonde 矩阵在数值分析和逼近理论中如此重要。

矩阵乘法与基本运算性质

矩阵形状的分类术语

在讨论矩阵运算之前,我们先要理解矩阵形状的一些常用术语。对于一个 n \times m 的矩阵 A,当行数大于列数(n > m)时,我们称这个矩阵是"瘦高的"(tall),因为它看起来像一个高瘦的长方形。相反,当列数大于行数(m > n)时,我们称矩阵是"矮胖的"(fat),因为它看起来像一个矮宽的长方形。这些术语在讨论矩阵的秩、零空间、列空间等性质时会经常用到。

矩阵乘法的定义

矩阵乘法是线性代数中最基本也是最重要的运算之一。设 A 是一个 n \times m 矩阵,B 是一个 m \times p 矩阵,那么它们的乘积 C = AB 是一个 n \times p 矩阵,其第 i 行第 j 列的元素定义为:

(AB)_{ij} = \sum_{k=1}^{m} A_{ik} B_{kj}

这个定义告诉我们什么呢?乘积矩阵 C 中位置 (i,j) 的元素,是通过将矩阵 A 的第 i 行与矩阵 B 的第 j 列进行"内积"运算得到的。具体来说,我们取 A 的第 i 行的所有元素 (A_{i1}, A_{i2}, \ldots, A_{im})B 的第 j 列的所有元素 (B_{1j}, B_{2j}, \ldots, B_{mj}),然后对应位置相乘再求和:A_{i1}B_{1j} + A_{i2}B_{2j} + \cdots + A_{im}B_{mj}

这里有一个重要的维度匹配要求:A 的列数必须等于 B 的行数(都是 m),否则矩阵乘法无法定义。结果矩阵的维度由 A 的行数和 B 的列数决定。

需要特别注意的是,矩阵乘法一般来说是不可交换的,即 AB \neq BA。笔记中提到"如果 B \cdot (B \cdot B)AB = BA",这里想表达的是只有在特殊情况下矩阵乘法才满足交换律。实际上,即使 ABBA 都有定义,它们通常也不相等。只有当两个矩阵满足某些特殊条件(比如一个是单位矩阵的倍数,或者两个矩阵可同时对角化且有相同的特征向量)时,乘法才可交换。

矩阵乘法的结合律

虽然矩阵乘法不满足交换律,但它满足结合律。对于三个矩阵 ABC(假设维度匹配使得乘法有定义),我们有:

(AB)C = A(BC) = ABC

这个性质意味着,当我们计算多个矩阵的连续乘积时,可以任意选择先计算哪两个矩阵的乘积,最终结果都是一样的。因此我们可以直接写成 ABC 而不需要加括号。这个性质在实际计算中非常重要,因为它允许我们选择计算代价最小的顺序来进行矩阵乘法。

矩阵乘法的分配律

矩阵乘法对矩阵加法满足分配律。对于适当维度的矩阵,我们有:

A(B + C) = AB + AC

这个性质说明,矩阵 A 乘以两个矩阵的和,等于分别乘以这两个矩阵再相加。这与普通数的乘法分配律是类似的。分配律在展开矩阵表达式、简化矩阵运算时经常用到。

转置运算的乘法规则

转置运算与矩阵乘法的结合有一个非常重要的规则:乘积的转置等于转置的逆序乘积。对于两个矩阵的乘积,我们有:

(AB)^T = B^T A^T

注意这里的顺序反转了!原来是 AB,转置后变成了 B^TA^T。为什么会这样呢?我们可以从元素的角度来理解:(AB)^T 的第 i 行第 j 列元素是 (AB) 的第 j 行第 i 列元素,即 \sum_k A_{jk} B_{ki}。而 B^T A^T 的第 i 行第 j 列元素是 \sum_k (B^T)_{ik} (A^T)_{kj} = \sum_k B_{ki} A_{jk},由于乘法交换律,这与前面的结果相同。

对于三个矩阵的乘积,这个规则推广为:

(ABC)^T = C^T B^T A^T

顺序完全反转。这个规律对任意多个矩阵的乘积都成立。

共轭转置运算的乘法规则

对于复矩阵,共轭转置(Hermitian转置)也遵循类似的规则:

(AB)^{\dagger} = B^{\dagger} A^{\dagger}

这里 \dagger 表示共轭转置。注意顺序同样反转。对于三个矩阵:

(ABC)^T = C^T B^T A^T

笔记中还提到了共轭转置的表示,记为 (ABC)^{\dagger} = C^{\dagger} B^{\dagger} A^{\dagger}。这个规则在量子力学、信号处理等涉及复数运算的领域中非常重要。

逆矩阵的乘法规则

逆矩阵的乘法规则与转置类似,也是顺序反转。对于可逆矩阵 ABC,有:

(ABC)^{-1} = C^{-1} B^{-1} A^{-1}

为什么是这样呢?我们可以验证:(ABC)(C^{-1}B^{-1}A^{-1}) = AB(CC^{-1})B^{-1}A^{-1} = AB(I)B^{-1}A^{-1} = A(BB^{-1})A^{-1} = AIA^{-1} = AA^{-1} = I。因此 C^{-1}B^{-1}A^{-1} 确实是 ABC 的逆。这个性质在求解复杂矩阵表达式的逆时非常有用。

矩阵的迹

矩阵的迹(trace)是一个非常重要的标量函数,它定义为方阵主对角线元素的和。对于 n \times n 矩阵 A,迹定义为:

\text{Tr}(A) = \sum_{i=1}^{n} a_{ii}

迹只对方阵有定义,因为只有方阵才有主对角线。迹具有许多优美的性质,我们逐一讨论。

首先,矩阵的迹等于其转置的迹:

\text{Tr}(A) = \text{Tr}(A^T)

这是显然的,因为转置不改变主对角线元素。

其次,迹满足循环性质,这是迹最重要的性质之一:

\text{Tr}(AB) = \text{Tr}(BA)

这个性质说明,两个矩阵乘积的迹不依赖于乘法顺序。让我们验证一下:\text{Tr}(AB) = \sum_i (AB)_{ii} = \sum_i \sum_j A_{ij} B_{ji} = \sum_j \sum_i B_{ji} A_{ij} = \sum_j (BA)_{jj} = \text{Tr}(BA)。注意这里我们交换了求和顺序,并利用了矩阵乘法的定义。这个循环性质在计算中非常有用,它允许我们在某些情况下重新排列矩阵的乘法顺序。

第三,迹是线性的:

\text{Tr}(\lambda A) = \lambda \text{Tr}(A)

这意味着标量可以从迹中提出来。如果我们把矩阵 A 的每个元素都乘以 \lambda,那么主对角线元素也都乘以 \lambda,所以迹也乘以 \lambda

第四,迹对加法也是线性的:

\text{Tr}(A + B) = \text{Tr}(A) + \text{Tr}(B)

两个矩阵和的迹等于各自迹的和。这是因为 (A+B) 的对角元素是 a_{ii} + b_{ii},求和后自然分成两部分。

第五,也是最深刻的性质之一:矩阵的迹等于其所有特征值的和:

\text{Tr}(A) = \sum_{i=1}^{n} \lambda_i

这个关系揭示了迹与矩阵特征值之间的联系。虽然特征值的计算可能很困难,但迹的计算是平凡的(只需加对角元素),因此这个等式给出了特征值和的一个简单表达式。这个性质的证明涉及矩阵的特征多项式和相似不变量的理论。

行列式的定义

行列式是方阵的另一个重要标量函数,它比迹更复杂但也更强大。对于 n \times n 矩阵 A,行列式的定义使用了排列的概念:

\det(A) = \sum_{\varepsilon \in S_n} (-1)^{\mathcal{E}(\varepsilon)} a_{1\varepsilon(1)} a_{2\varepsilon(2)} \cdots a_{n\varepsilon(n)}

这个定义看起来很复杂,让我们仔细分析。首先,S_n 是所有 n 元素排列的集合,它包含 n! 个不同的排列。一个排列 \varepsilon 是把 (1,2,\ldots,n) 重新排列得到的一个序列。对于每个排列 \varepsilon,我们从矩阵的每一行中选取一个元素,其中第 i 行选第 \varepsilon(i) 列的元素,然后把这 n 个元素乘起来。

关键的部分是符号 (-1)^{\mathcal{E}(\varepsilon)}。这里 \mathcal{E}(\varepsilon) 称为排列 \varepsilon 的逆序数(inversion number),它定义为:

\mathcal{E}(\varepsilon) = \#\{(i,j) : i < j \text{ 且 } \varepsilon(i) > \varepsilon(j)\}

逆序数统计的是排列中"逆序对"的个数——即有多少对位置 (i,j) 满足 ij 前面但 \varepsilon(i) 却大于 \varepsilon(j)。如果逆序数是偶数,(-1)^{\mathcal{E}(\varepsilon)} = +1;如果是奇数,(-1)^{\mathcal{E}(\varepsilon)} = -1。笔记中明确指出"\mathcal{E}(\varepsilon) = \# inversion",即逆序数等于逆序对的个数。

这个定义虽然复杂,但它给出了行列式的精确数学表达。对于小矩阵(如 2 \times 23 \times 3),我们可以直接用这个定义展开计算。

行列式的基本性质

行列式具有许多重要性质。首先是关于列向量的线性性质。如果我们把矩阵 A 写成列向量的形式 A = [a_1, a_2, \ldots, a_n],那么当我们对某一列(比如第 k 列)乘以标量 \lambda 时:

\det[a_1, \ldots, \lambda a_k, \ldots, a_n] = \lambda \det[a_1, \ldots, a_n]

这个性质说明,行列式关于每一列都是线性的。但要注意,这并不意味着 \det(\lambda A) = \lambda \det(A)。实际上,如果我们对整个矩阵乘以 \lambda(即对所有列都乘以 \lambda),那么行列式会变成 \lambda^n \det(A),笔记后面会提到这一点。

第二个性质是行列式对列向量加法的线性性:

\det[a_1, \ldots, a_k + b, \ldots, a_n] = \det[a_1, \ldots, a_k, \ldots, a_n] + \det[a_1, \ldots, b, \ldots, a_n]

如果我们把某一列替换为两个向量的和,行列式会分解成两个行列式的和。这个性质在证明行列式的其他性质时非常有用。

第三,单位矩阵的行列式等于1:

\det(I_n) = 1

这是一个基本的归一化条件。笔记中标注"k 列",可能是想强调这些性质都是关于列向量的。

第四,当我们对整个矩阵乘以标量时:

\det(aA) = a^n \det(A)

如果 An \times n 矩阵,那么 aA 的行列式是 a^n 倍的原行列式。这是因为 aA 相当于对每一列都乘以 a,而每一列乘以 a 都会让行列式乘以 a,总共 n 列,所以是 a^n

行列式的乘法性质

行列式最重要的性质之一是它对矩阵乘法的乘法性:

\det(AB) = \det(A) \det(B) = \det(BA)

两个矩阵乘积的行列式等于各自行列式的乘积。这个性质非常强大,因为它把矩阵乘法这个复杂的运算,通过行列式变成了普通数的乘法。注意这里 \det(AB) = \det(BA) 成立,即使 AB \neq BA,因为行列式把矩阵"压缩"成了一个数,而数的乘法是交换的。

第二个重要性质是行列式与矩阵可逆性的关系:

A \text{ 可逆} \Leftrightarrow \det(A) \neq 0

矩阵可逆当且仅当其行列式非零。这给出了判断矩阵是否可逆的一个简单方法。如果 \det(A) = 0,我们称矩阵为奇异矩阵(singular),它不可逆;如果 \det(A) \neq 0,矩阵是非奇异的(non-singular),它可逆。

第三,转置不改变行列式:

\det(A^T) = \det(A)

这个性质说明行列式关于行和列是对称的:所有关于列的性质,对行也成立。这是因为转置把列变成行、把行变成列,但行列式保持不变。

第四,对于正交矩阵或酉矩阵,有特殊的性质。如果 A 是正交矩阵,满足 AA^T = A^T A = I,那么:

|\det(A)| = 1

为什么呢?因为 \det(AA^T) = \det(A)\det(A^T) = \det(A)\det(A) = (\det(A))^2,而 \det(AA^T) = \det(I) = 1,所以 (\det(A))^2 = 1,即 \det(A) = \pm 1,因此 |\det(A)| = 1。类似的性质对酉矩阵 AA^* = A^*A = I 也成立,只是这时 \det(A) 可能是复数,但其模为1。

Laplace 展开式

对于大矩阵,直接用定义计算行列式是不现实的(n! 项的求和)。Laplace 展开提供了一种递归计算行列式的方法。我们可以按某一行或某一列展开行列式。按第 i 行展开的公式是:

\det(A) = \sum_{j=1}^{n} (-1)^{i+j} a_{ij} \det(\widehat{A}_{ij})

这里 \widehat{A}_{ij} 是一个 (n-1) \times (n-1) 的子矩阵,它是从 A 中删除第 i 行和第 j 列后得到的。\det(\widehat{A}_{ij}) 称为元素 a_{ij} 的余子式(minor),而 (-1)^{i+j} \det(\widehat{A}_{ij}) 称为代数余子式(cofactor)。

笔记中强调"把第 i 行第 j 列去掉之后的 (n-1) \times (n-1) 子矩阵",这正是 \widehat{A}_{ij} 的定义。类似地,我们也可以按列展开:

\det(A) = \sum_{i=1}^{n} (-1)^{i+j} a_{ij} \det(\widehat{A}_{ij})

这个公式按第 j 列展开。

Laplace 展开的好处是把 n 阶行列式的计算归约为 n(n-1) 阶行列式的计算。虽然这仍然是递归的,但对于稀疏矩阵(有很多零元素)或具有特殊结构的矩阵,选择合适的行或列展开可以大大简化计算。笔记中的图示展示了矩阵分块的概念,说明了在实际计算中如何利用矩阵的结构(比如某些位置是零)来简化行列式的计算。当矩阵有大量零元素时,选择包含最多零的行或列来展开,可以显著减少计算量。

线性方程组的求解与矩阵秩理论

伴随矩阵的定义与求解线性方程组

现在我们来探讨如何用行列式的方法来求解线性方程组 Ax = b。首先需要引入伴随矩阵(adjugate matrix 或 classical adjoint)的概念。对于一个 n \times n 方阵 A,它的伴随矩阵定义如下:

假设线性方程组是 Ax = b,其中 An \times n 矩阵,bn \times 1 的列向量。如果矩阵 A 可逆,那么方程的解可以写成 x = A^{-1}b。但如何用行列式来表示 A^{-1} 呢?这就需要伴随矩阵。

笔记中指出,当 1 \leq i \leq n 时,解的第 i 个分量可以表示为:

x_i = \frac{\det(\widehat{A}_i)}{\det(A)}

这里的 \widehat{A}_i 是一个特殊构造的矩阵。它的维度仍然是 n \times n,构造方法是:将矩阵 A 的第 i 列替换为右端向量 b,其他列保持不变。用矩阵的列向量表示,如果 A = [a_1, a_2, \ldots, a_n],那么:

\widehat{A}_i = [a_1, \ldots, a_{i-1}, b, a_{i+1}, \ldots, a_n]

这个公式被称为 Cramer 法则(Cramer's Rule),它给出了线性方程组解的显式表达式。但要注意,这个公式只在 \det(A) \neq 0 时才有意义,即矩阵 A 必须可逆。

Jacobian 矩阵与变量替换

现在我们转向一个在多元微积分和变量替换中极其重要的概念——Jacobian 矩阵。考虑从一个坐标系 (x, y) 到另一个坐标系 (u, v) 的变换。假设变换关系为:

\begin{cases} u = \varphi(x, y) \\ v = \psi(x, y) \end{cases}

这里 \varphi\psi 是两个函数,它们定义了从 (x,y) 平面到 (u,v) 平面的映射。反过来,我们也可以表示逆变换:

\begin{cases} x = \alpha(u, v) \\ y = \beta(u, v) \end{cases}

现在考虑在 (x,y) 坐标系中对某个函数进行二重积分:

\int\int f(x,y) \, dx \, dy = g(u,v) \, du \, dv

这个等式右边应该是什么形式呢?变量替换的关键在于计算微元的变换关系。笔记中详细说明了 (x,y) \leftrightarrow (u,v) 之间的对应关系,以及如何将积分域从 (x,y) 空间变换到 (u,v) 空间。

这里的核心工具是 Jacobian 矩阵。Jacobian 矩阵 J 定义为所有一阶偏导数组成的矩阵:

J = \frac{\partial(x,y)}{\partial(u,v)} = \begin{bmatrix} \frac{\partial x}{\partial u} & \frac{\partial x}{\partial v} \\ \frac{\partial y}{\partial u} & \frac{\partial y}{\partial v} \end{bmatrix}

这个矩阵描述了局部线性变换的性质。Jacobian 行列式(Jacobian determinant)定义为:

\det J = \frac{\partial x}{\partial u} \frac{\partial y}{\partial v} - \frac{\partial x}{\partial v} \frac{\partial y}{\partial u}

变量替换公式告诉我们,微元的变换关系是:

dx \, dy = |\det J| \, du \, dv

因此,完整的积分变换公式是:

\int\int f(x,y) \, dx \, dy = \int\int g(u,v) |\det J| \, du \, dv

笔记中强调了这个关系的重要性:微元变换由 Jacobian 行列式控制。Jacobian 行列式的绝对值告诉我们,当我们从 (u,v) 坐标系的一个小矩形映射到 (x,y) 坐标系时,面积被放大或缩小了多少倍。

现在考虑逆向的 Jacobian 矩阵:

\widetilde{J} = \frac{\partial(u,v)}{\partial(x,y)} = \begin{bmatrix} \frac{\partial u}{\partial x} & \frac{\partial u}{\partial y} \\ \frac{\partial v}{\partial x} & \frac{\partial v}{\partial y} \end{bmatrix}

一个深刻的关系是,这两个 Jacobian 矩阵互为逆矩阵:

J \cdot \widetilde{J} = I_2

为什么呢?这来自链式法则。因此,它们的行列式满足:

\det(J) \cdot \det(\widetilde{J}) = \det(I_2) = 1

这意味着 \det(\widetilde{J}) = \frac{1}{\det(J)},即两个 Jacobian 行列式互为倒数。笔记中明确标注 "J \cdot \widetilde{J} = I_N",这正是这个关系的体现。

从另一个角度看,我们有:

du \, dv = |\det \widetilde{J}| \, dx \, dy

结合 \det(\widetilde{J}) = \frac{1}{\det(J)},我们得到:

du \, dv = \frac{1}{|\det J|} \, dx \, dy

这与前面的关系 dx \, dy = |\det J| \, du \, dv 是一致的。这些关系在多元积分的变量替换中起着核心作用。

正交矩阵的充要条件

现在我们回到正交矩阵的讨论。回忆正交矩阵的定义是满足 A^T A = AA^T = I_n 的方阵。笔记中给出了正交矩阵的另一种等价刻画,从列向量的角度来理解。

设矩阵 A 的列向量为 a_1, a_2, \ldots, a_n,即:

A = \begin{bmatrix} a_1 & a_2 & \cdots & a_n \end{bmatrix}

矩阵 A^T 可以写成行向量的形式:

A^T = \begin{bmatrix} a_1^T \\ a_2^T \\ \vdots \\ a_n^T \end{bmatrix}

那么乘积 A^T A 的第 (i,j) 元素是什么呢?它等于 a_i^T \cdot a_j,也就是第 i 个列向量与第 j 个列向量的内积。因此:

(A^T A)_{ij} = a_i^T \cdot a_j = \langle a_i, a_j \rangle

条件 A^T A = I_n 意味着:

(A^T A)_{ij} = \begin{cases} 1 & \text{如果 } i = j \\ 0 & \text{如果 } i \neq j \end{cases}

用内积的语言,这等价于:

\langle a_i, a_j \rangle = \|a_i\|^2 = 1 \quad \text{(当 } i = j \text{ 时)}

以及:

\langle a_i, a_j \rangle = 0 \quad \text{(当 } i \neq j \text{ 时)}

笔记中特别强调了这两点。第一个条件 a_i^T a_i = \langle a_i, a_i \rangle = \|a_i\|^2 = 1 说明每个列向量的长度(范数)都是1,即它们都是单位向量。笔记中标注"这与范数、列向量单位化是相关的概念",正是强调这一点。

第二个条件 a_i^T a_j = \langle a_i, a_j \rangle = 0(当 i \neq j 时)说明不同的列向量互相正交。笔记中标注"正交复数(正交)",指出这是正交性的体现。

因此,矩阵 A 是正交矩阵,当且仅当它的列向量构成一组标准正交基(orthonormal basis)。标准正交意味着:向量两两正交,且每个向量的长度§(都是1。这给出了正交矩阵的几何解释:正交矩阵代表一种保持向量长度和夹角的变换(即刚体变换,包括旋转和反射)。

矩阵的像空间与秩

现在我们开始系统地研究矩阵的秩理论。首先定义矩阵的像空间(image space 或 range space)。对于 m \times n 矩阵 A,它定义了一个从 \mathbb{R}^n\mathbb{R}^m 的线性映射。矩阵 A 的像空间定义为:

E = \{Ax : x \in \mathbb{R}^n\}

这个集合包含了所有可以写成 Ax 形式的向量,其中 x 可以是 \mathbb{R}^n 中的任意向量。换句话说,E 是矩阵 A 作用在整个空间 \mathbb{R}^n 上得到的所有可能输出的集合。笔记中标注"向量的空间",强调这是一个向量空间。

像空间还有另一个名字:列空间(column space)。为什么叫列空间呢?如果我们把矩阵 A 写成列向量的形式 A = [a_1, a_2, \ldots, a_n],那么对于任意向量 x = (x_1, x_2, \ldots, x_n)^T,有:

Ax = x_1 a_1 + x_2 a_2 + \cdots + x_n a_n

这说明 Ax 是矩阵 A 的列向量的线性组合。因此,像空间 E 恰好是矩阵 A 的所有列向量张成的空间,即它们所有可能线性组合的集合。笔记中明确指出"E = \{\text{所有列的线性组合}\}",这正是列空间的定义。

矩阵的秩(rank)定义为像空间(列空间)的维数:

\dim(E) = \text{rng}(A)

这里 \text{rng} 表示秩(rank)。秩告诉我们矩阵的列向量中有多少个是线性无关的。如果秩等于列数 n,我们说矩阵是列满秩的;如果秩等于行数 m,我们说矩阵是行满秩的。

转置矩阵的秩

一个非常重要的定理是:矩阵的秩等于其转置的秩。用公式表示:

\text{rank}(A^T) = \text{rank}(A)

这个结果看似简单,但它的含义深刻。矩阵 A 的秩等于其列空间的维数,而 A^T 的秩等于 A^T 的列空间的维数。但 A^T 的列空间恰好是 A 的行空间(因为转置把行变成列)。因此,这个定理告诉我们:矩阵的列秩等于行秩。这就是为什么我们可以简单地说"矩阵的秩",而不需要区分"列秩"和"行秩"。

可逆矩阵的秩

对于 n \times n 方阵,可逆性与秩有着简单而深刻的联系:

A \text{ 可逆} \Rightarrow \text{rank}(A) = n

如果 n \times n 矩阵 A 可逆,那么它的秩必定等于 n(即满秩)。为什么呢?如果 A 可逆,那么对任意 b \in \mathbb{R}^n,方程 Ax = b 都有唯一解 x = A^{-1}b。这意味着 A 的像空间包含 \mathbb{R}^n 中的所有向量,即 E = \mathbb{R}^n。因此 \dim(E) = n,即 \text{rank}(A) = n

反过来也成立:如果 n \times n 方阵 A 满秩(\text{rank}(A) = n),那么 A 可逆。这给出了判断方阵可逆性的一个充要条件。

矩阵 AA^T 的像空间关系

对于一般的 m \times n 矩阵 A,定义从 \mathbb{R}^n\mathbb{R}^m 的线性映射:

A : \mathbb{R}^n \longrightarrow \mathbb{R}^m \quad (m \times n)

那么 A^T 定义的是反向的映射:

A^T : \mathbb{R}^m \longrightarrow \mathbb{R}^n \quad (n \times m)

前面我们已经知道 \text{rank}(A^T) = \text{rank}(A),这意味着虽然映射的方向不同,但它们的"有效维数"是相同的。笔记中标注"rank(A) 小于等于 min(m,n)",这是秩的一个基本上界:秩不能超过行数和列数的较小值,因为秩既不能超过列空间的最大可能维数(即列数),也不能超过行空间的最大可能维数(即行数)。

矩阵秩的基本性质

秩满足许多重要的不等式和等式。首先是矩阵和的秩的次可加性:

\text{rank}(A + B) \leq \text{rank}(A) + \text{rank}(B)

两个矩阵和的秩不超过各自秩的和。这是因为 (A+B)x = Ax + Bx,所以 A+B 的列空间包含在 A 的列空间与 B 的列空间的和空间中,而和空间的维数不超过各自维数之和。笔记中标注"相加",指出这是关于矩阵加法的性质。

其次是矩阵乘积的秩的不等式。对于 A \in \mathbb{R}^{m \times n}B \in \mathbb{R}^{n \times p},有:

\text{rank}(AB) \leq \min(\text{rank}(A), \text{rank}(B))

乘积的秩不超过任一因子的秩。为什么呢?AB 的列空间中的任意向量可以写成 (AB)x = A(Bx) 的形式,这是 A 作用在 Bx 上的结果。因此 AB 的列空间包含在 A 的列空间中,所以 \text{rank}(AB) \leq \text{rank}(A)。类似地,通过转置的技巧可以证明 \text{rank}(AB) \leq \text{rank}(B)

特殊情况下秩的等式

现在考虑一些特殊情况,在这些情况下我们能得到秩的等式而不仅仅是不等式。笔记中列举了几种重要情况:

第一种情况:如果 Ax = b 有解且 bA 的列空间相关(即 b 已经在 A 的列空间中),那么:

\text{rank}([A, b]) = \text{rank}(A)

这里 [A, b] 表示将向量 b 作为额外的一列添加到矩阵 A 的右边。如果 b 已经可以表示为 A 的列的线性组合,那么添加 b 不会增加列空间的维数,因此秩不变。笔记标注"b 已经在其中,不会增加",正是这个意思。

第二种情况:如果 Ax = b 有解,那么这等价于 bA 的列空间中,从而:

\text{rank}([A, b]) = \text{rank}(A)

这与第一种情况本质上是相同的结论。

第三种情况:如果矩阵 A 可逆(假设 A 是方阵),那么对任意矩阵 B

\text{rank}(AB) = \text{rank}(B)

为什么呢?因为 A 可逆意味着它是一个可逆的线性变换,它把 \mathbb{R}^n 一一映射到自己。因此 A 不会"压缩"任何空间的维数。具体地,B 的列空间在 A 作用下被映射到 AB 的列空间,而由于 A 可逆(是双射),这个映射保持维数不变。笔记中标注"如果 A 为逆,则是满射",以及 "b \in E = (A \text{的列空间})",都在说明这个道理。

第四种情况:如果 A 对角化,即可以写成 A = PDP^{-1} 的形式,那么由于 P 可逆,我们有:

\text{rank}(A) = \text{rank}(D)

而对角矩阵的秩等于其非零对角元素的个数,这为计算秩提供了便利。笔记强调"状态——对角化后",指出对角化在秩的计算中的作用。


评论