Administrator
发布于 2026-09-09 / 0 阅读
0
0

优化理论(二):数学工具基础——希尔伯特空间与泛函分析

课程概述

本讲座是ATSI优化课程的第一讲,主要聚焦于数学工具的基础内容。整个讲座分为两大部分:代数的基本回顾和泛函分析的相关概念。这些数学工具将为后续优化理论的学习奠定基础。

希尔伯特空间

预希尔伯特空间的定义

我们从预希尔伯特空间开始讨论。一个实的预希尔伯特空间 \mathcal{H} 首先是一个实向量空间,但它还被赋予了一个特殊的函数结构——内积。这个内积是一个从 \mathcal{H}^2\mathbb{R} 的函数,记作 \langle \cdot | \cdot \rangle: \mathcal{H}^2 \to \mathbb{R} 。这个内积需要满足四个基本性质。

第一个性质是对称性。对于空间中的任意两个向量 x y ,它们的内积满足 \langle x | y \rangle = \langle y | x \rangle 。这个性质保证了内积运算的顺序不影响结果。

第二个性质是第一个变量的线性性。对于空间中的任意三个向量 x, y, z ,内积满足 \langle x + y | z \rangle = \langle x | z \rangle + \langle y | z \rangle 。这意味着当第一个位置是两个向量的和时,内积可以分配到每个向量上分别计算。

第三个性质是关于标量乘法的齐次性。对于空间中的任意两个向量 x, y 和任意实数 \alpha ,有 \langle \alpha x | y \rangle = \alpha \langle y | x \rangle 。这表明标量可以从内积中提取出来。

第四个性质是正定性。对于空间中的任意向量 x ,它与自身的内积非负,即 \langle x | x \rangle \geq 0 ,并且等号成立当且仅当 x 是零向量。这个性质确保了内积具有度量长度的能力。

范数的引入

有了内积之后,我们可以自然地定义空间上的范数。对于空间 \mathcal{H} 中的任意向量 x ,其范数定义为

\|x\| = \sqrt{\langle x | x \rangle}

这个定义直接来源于内积的正定性。范数度量了向量的"长度"或"大小"。由于内积 \langle x | x \rangle 总是非负的,所以开方运算是有意义的。这个范数具有向量空间范数应有的所有性质,包括非负性、齐次性和三角不等式。

平行四边形恒等式

在预希尔伯特空间中,有一个重要的恒等式称为平行四边形恒等式。对于空间 \mathcal{H}^2 中的任意两个向量 x y ,这个恒等式表述为

\|x + y\|^2 + \|x - y\|^2 = 2(\|x\|^2 + \|y\|^2)

这个恒等式的几何意义是:在由向量 x y 构成的平行四边形中,两条对角线长度的平方和等于四条边长度平方和的一半再乘以2。从代数角度看,这个恒等式揭示了内积空间中范数的特殊结构。

现在我们来推导这个恒等式。将左边展开,利用范数的定义:

\|x + y\|^2 + \|x - y\|^2 = \langle x + y | x + y \rangle + \langle x - y | x - y \rangle

继续展开第一项。利用内积的双线性性质, \langle x + y | x + y \rangle 可以写成 \langle x | x \rangle + \langle x | y \rangle + \langle y | x \rangle + \langle y | y \rangle ,即 \|x\|^2 + \|y\|^2 + 2\langle x, y \rangle

类似地展开第二项, \langle x - y | x - y \rangle 等于 \|x\|^2 + \|y\|^2 - 2\langle x, y \rangle

将两项相加,交叉项 2\langle x, y \rangle -2\langle x, y \rangle 相互抵消,得到 2(\|x\|^2 + \|y\|^2) ,这正是等式右边的表达式。

中线恒等式

另一个重要的恒等式是中线恒等式。设 a, b, c 是空间 \mathcal{H}^3 中的三个点, m 是线段 [b, c] 的中点,即 m = \frac{1}{2}(b + c) 。中线恒等式表述为

\|a - b\|^2 + \|a - c\|^2 = 2\|a - m\|^2 + \frac{1}{2}\|b - c\|^2

这个恒等式描述了从点 a 到线段两端点 b, c 的距离平方和,与从 a 到中点 m 的距离以及线段本身长度之间的关系。

让我们推导这个恒等式。首先将 b c 用中点 m 表示。由于 m = \frac{1}{2}(b + c) ,我们可以写成 b = m + (b - m) c = m + (c - m) 。观察到 b - m = \frac{b - c}{2} c - m = \frac{c - b}{2}

现在计算左边:

\|a - b\|^2 + \|a - c\|^2 = \|(a - m) + (m - b)\|^2 + \|(a - m) + (m - c)\|^2

(m - b) 表示为 -\frac{b - c}{2} (m - c) 表示为 \frac{b - c}{2} ,展开得:

= \|a - m\|^2 + \left\|\frac{c - b}{2}\right\|^2 + 2\langle a - m, m - b \rangle + \|a - m\|^2 + \left\|\frac{b - c}{2}\right\|^2 + 2\langle a - m, m - c \rangle

注意到 \frac{c - b}{2} \frac{b - c}{2} 范数相同。同时, \langle a - m, m - b \rangle + \langle a - m, m - c \rangle = \langle a - m, (m - b) + (m - c) \rangle 。由于 (m - b) + (m - c) = 2m - b - c = 0 (因为 m b c 的中点),这两个内积项的和为零。

因此得到:

= 2\|a - m\|^2 + \frac{1}{2}\|b - c\|^2

这正是中线恒等式的右边。这个恒等式在优化理论中具有重要作用,特别是在研究凸优化和投影算法时。

柯西-施瓦茨不等式

在预希尔伯特空间中,内积和范数之间存在一个基本的不等式关系,称为柯西-施瓦茨不等式。对于空间 \mathcal{H}^2 中的任意两个向量 x y ,这个不等式表述为

|\langle x | y \rangle| \leq \|x\|\|y\|

这个不等式的几何意义是:两个向量的内积的绝对值不会超过它们范数的乘积。等号成立的条件具有特殊的几何含义:当且仅当 x = \alpha y (其中 \alpha \in \mathbb{R} )或者 y = 0 时,不等式取等号。这意味着等号成立时,两个向量要么其中一个是零向量,要么它们是共线的(即一个是另一个的标量倍数)。

内积的连续性

内积作为一个函数具有连续性,这对于后续的分析至关重要。我们需要证明当两个向量分别发生微小扰动时,它们的内积也只会发生相应的微小变化。

考虑两个向量 x y ,以及它们的微小扰动 \epsilon_x \epsilon_y 。我们要分析 \langle x + \epsilon_x, y + \epsilon_y \rangle \langle x, y \rangle 之间的差异。利用内积的双线性性质展开扰动后的内积:

\langle x + \epsilon_x, y + \epsilon_y \rangle = \langle x, y \rangle + \langle x, \epsilon_y \rangle + \langle \epsilon_x, \epsilon_y \rangle + \langle \epsilon_x, \epsilon_y \rangle

从这个展开式可以看出,扰动后的内积等于原内积加上三个额外项。为了估计这个差值的大小,我们取其绝对值并利用三角不等式:

|\langle x + \epsilon_x, y + \epsilon_y \rangle - \langle x, y \rangle| \leq \|x\|\|\epsilon_y\| + \|y\|\|\epsilon_x\| + \|\epsilon_x\|\|\epsilon_y\|

这里应用了柯西-施瓦茨不等式来估计每个交叉项的内积。右边的三项分别对应于 x \epsilon_y 的相互作用、 y \epsilon_x 的相互作用、以及两个扰动之间的相互作用。

现在可以看出连续性:当 \epsilon_x, \epsilon_y \to 0 时,右边的三项都趋于零,因此

|\langle x + \epsilon_x, y + \epsilon_y \rangle - \langle x, y \rangle| \xrightarrow{\epsilon_x, \epsilon_y \to 0} 0

这证明了内积函数是连续的。

希尔伯特空间

完备性与希尔伯特空间的定义

现在我们可以引入希尔伯特空间的完整定义。一个实的希尔伯特空间 \mathcal{H} 是一个完备的预希尔伯特空间。这里的"完备"是指空间在由范数诱导的度量下是完备的,即空间中的每个柯西序列都在空间内收敛。

一个重要的特例是 N 维欧几里得空间 \mathcal{H} = \mathbb{R}^N ,它配备标准内积就构成了一个希尔伯特空间。在本课程的后续讨论中,我们将专注于有限维希尔伯特空间的情况。有限维空间的优势在于它们自动是完备的,并且许多性质可以通过线性代数的工具来处理。

线性算子的范数

算子范数的定义

\mathcal{H} \mathcal{G} 是两个有限维希尔伯特空间。对于从 \mathcal{H} \mathcal{G} 的线性算子 L: \mathcal{H} \to \mathcal{G} ,我们需要定义它的范数来度量算子的"大小"或"强度"。算子范数有几种等价的定义方式,每种都提供了不同的理解角度。

第一种定义是

\|L\| = \sup_{\|x\|_{\mathcal{H}} \leq 1} \|Lx\|_{\mathcal{G}}

这个定义表示:算子 L 的范数等于它作用在单位球上所有向量时,得到的像的范数的上确界。换句话说,它度量了算子对单位球内向量的最大放大倍数。

第二种等价定义是

\|L\| = \sup_{\|x\| = 1} \|Lx\|

这个定义只考虑单位球面(而非整个单位球)上的向量。由于算子的线性性,单位球内部的向量可以表示为单位球面上向量的缩放,因此在单位球内取上确界和在单位球面上取上确界是等价的。

第三种等价定义是

\|L\| = \sup_{x \in \mathcal{H}\setminus\{0\}} \frac{\|Lx\|}{\|x\|}

这个定义考虑所有非零向量,计算算子作用后的范数与原向量范数的比值,然后取上确界。这个比值 \frac{\|Lx\|}{\|x\|} 表示算子对向量 x 的放大(或缩小)倍数。由于线性性,我们可以将任意非零向量归一化为单位向量,因此这个定义与前两个定义等价。

线性算子的连续性

在有限维希尔伯特空间之间,从 \mathcal{H} \mathcal{G} 的任何线性算子都是连续的。这是有限维空间的一个重要性质。在无限维空间中,线性性并不自动保证连续性,但在有限维情况下,所有线性算子都是连续的,并且它们的范数都是有限的。

有界性与连续性的等价关系

对于从希尔伯特空间 \mathcal{H} \mathcal{G} 的线性算子 f ,存在一个基本的等价关系:算子连续当且仅当算子有界。这个结论联系了算子的拓扑性质(连续性)和代数性质(有界性)。

首先考虑有界的情形。如果算子 f 有界,即存在常数 M 使得范数 \|f\| \leq M ,那么对于任意向量 x 和任意扰动 \epsilon ,根据线性性和范数的定义,有

\|f(x + \epsilon) - f(x)\| = \|f(\epsilon)\| \leq M\|\epsilon\|

这个不等式直接说明了连续性:当扰动 \epsilon 趋于零时,函数值的变化 \|f(x + \epsilon) - f(x)\| 也趋于零,且这个收敛速度由常数 M 控制。

反过来,如果算子 f 无界,我们需要证明它必然不连续。无界意味着不存在有限的常数 M 能够界定算子的范数。在这种情况下,必然存在一个趋于无穷的序列 M_n \in \mathbb{R} 满足 M_n \xrightarrow{n \to \infty} \infty ,以及空间 \mathcal{H} 中的一个向量序列 x_n ,使得对于每个 n ,都有

\frac{\|f(x_n)\|}{\|x_n\|} \geq M_n

这个不等式表明向量 x_n 在算子 f 作用下被放大了至少 M_n 倍。现在我们构造一个新的序列

y_n = \frac{x_n}{\|x_n\|M_n}

这个构造巧妙地将 x_n 进行归一化和缩放。通过计算 y_n 的范数,可以看出

\|y_n\| = \frac{1}{M_n} \xrightarrow{n \to \infty} 0

因此序列 y_n 趋于零向量。然而,观察 f(y_n) 的范数,利用线性性和之前的不等式:

\|f(y_n)\| = \frac{\|f(x_n)\|}{\|x_n\|M_n} \geq \frac{M_n \|x_n\|}{\|x_n\|M_n} = 1

这说明尽管 y_n 趋于零,但 f(y_n) 的范数始终不小于1,不会趋于零。因此 f 在零点处不连续,进而在整个空间上不连续(由线性性可得)。

巴拿赫空间

\mathcal{B}(\mathcal{H}, \mathcal{G}) 为从希尔伯特空间 \mathcal{H} \mathcal{G} 的所有线性算子构成的巴拿赫空间。这个空间在算子范数下构成一个完备的赋范向量空间,为后续的算子理论提供了框架。

伴随算子

伴随算子的定义

\mathcal{H} \mathcal{G} 是两个希尔伯特空间, L \in \mathcal{B}(\mathcal{H}, \mathcal{G}) 是一个线性算子。算子 L 的伴随记作 L^* ,它是 \mathcal{B}(\mathcal{G}, \mathcal{H}) 中的一个算子,定义通过以下内积关系:对于所有 (x, y) \in \mathcal{H} \times \mathcal{G} ,有

\langle y | Lx \rangle_{\mathcal{G}} = \langle L^*y | x \rangle_{\mathcal{H}}

这个定义的核心思想是将算子 L 作用在 x 上后与 y 的内积,等同于 y 经过伴随算子 L^* 作用后与 x 的内积。伴随算子本质上是将原算子在内积意义下"转置"到另一个方向。需要注意的是,左边的内积在空间 \mathcal{G} 中计算,而右边的内积在空间 \mathcal{H} 中计算。

随着PPT的展示,定义的表述逐渐简化。首先出现的形式是

\langle y | Lx \rangle_{\mathcal{G}} = \langle L^*y | x \rangle_{\mathcal{H}}

然后省略下标,写成

\langle y | Lx \rangle = \langle L^*y | x \rangle

最后进一步简化为

\langle Lx | y \rangle = \langle x | L^*y \rangle

这最后一个形式利用了内积的对称性,将 y Lx 的顺序交换。这几种形式本质上是等价的,只是书写习惯不同。

伴随算子的例子

考虑一个具体例子来理解伴随算子的概念。设算子 L: \mathcal{H} \to \mathcal{H}^n 定义为

L: x \mapsto (x, \ldots, x)

这个算子将单个向量 x 复制 n 次,得到 n 维空间中的向量,其每个分量都等于 x

算子 L 的伴随 L^*: \mathcal{H}^n \to \mathcal{H} 定义为

L^*: y = (y_1, \ldots, y_n) \mapsto \sum_{i=1}^n y_i

伴随算子将 n 维向量的所有分量求和,得到一个单一向量。

我们来验证这个伴随算子确实满足定义。对于任意 x \in \mathcal{H} y = (y_1, \ldots, y_n) \in \mathcal{H}^n ,计算左边的内积:

\langle Lx | y \rangle = \langle (x, \ldots, x) | (y_1, \ldots, y_n) \rangle = \sum_{i=1}^n \langle x | y_i \rangle

这里使用了 \mathcal{H}^n 空间中内积的定义:两个 n 维向量的内积等于对应分量内积的和。利用内积的对称性和线性性:

\sum_{i=1}^n \langle x | y_i \rangle = \left\langle x \middle| \sum_{i=1}^n y_i \right\rangle

右边恰好等于 \langle x | L^*y \rangle ,这验证了伴随算子的定义。这个例子展示了伴随算子如何将"复制"操作转化为"求和"操作,体现了伴随的对偶性质。

伴随算子的基本性质

伴随算子具有三个重要性质,这些性质在优化理论中经常被使用。

第一个性质是范数不变性。对于任意线性算子 L 及其伴随 L^* ,它们的范数相等,即

\|L^*\| = \|L\|

这个性质表明伴随算子不会改变算子的"强度"。虽然伴随算子改变了作用的方向(从 \mathcal{H} \mathcal{G} 变为从 \mathcal{G} \mathcal{H} ),但它对向量的最大放大倍数保持不变。

第二个性质涉及同构算子。如果 L 是一个双射(即同构),那么它存在逆算子 L^{-1} \in \mathcal{B}(\mathcal{G}, \mathcal{H}) 。在这种情况下,逆算子的伴随与伴随算子的逆相等,即

(L^{-1})^* = (L^*)^{-1}

这个等式说明求逆和求伴随这两个操作的顺序可以交换。

第三个性质是关于欧几里得空间的特殊情况。当 \mathcal{H} = \mathbb{R}^N \mathcal{G} = \mathbb{R}^M 时,线性算子可以表示为矩阵。在这种情况下,伴随算子就是矩阵的转置,即

L^* = L^\top

这联系了抽象的伴随算子概念和具体的矩阵转置运算。

伴随算子范数相等的证明

现在我们来证明第一个性质 \|L^*\|_{op} = \|L\|_{op} 。这里下标 op 表示算子范数。证明的思路是通过内积的性质建立两个范数之间的关系。

从伴随算子的范数定义出发,对于任意向量 y ,考虑比值

\frac{\|L^*y\|}{\|y\|}

利用范数的定义,这个比值可以写成

\frac{\|L^*y\|}{\|y\|} = \frac{\sqrt{\langle L^*y | L^*y \rangle}}{\|y\|}

应用伴随算子的定义,内积 \langle L^*y | L^*y \rangle 可以转化为 \langle LL^*y | y \rangle ,因此

= \frac{\sqrt{\langle LL^*y | y \rangle}}{\|y\|}

利用柯西-施瓦茨不等式,内积 \langle LL^*y | y \rangle 的绝对值不超过两个向量范数的乘积,即

\leq \frac{\sqrt{\|LL^*y\|\|y\|}}{\|y\|}

分子分母中的 \|y\| 相消(准确地说是 \sqrt{\|y\|} 相消),得到

\leq \frac{\sqrt{\|LL^*y\|\|y\|}}{\|y\|} = \sqrt{\frac{\|LL^*y\|}{\|y\|}}

继续简化

\leq \sqrt{\frac{\|L\|_{op}\|L^*y\|\|y\|}{\|y\|}} = \sqrt{\|L\|_{op}\|L^*\|_{op}}

这里使用了算子范数的定义: \|LL^*y\| \leq \|L\|_{op}\|L^*y\| ,以及 \|L^*y\| \leq \|L^*\|_{op}\|y\|

对于所有非零向量 y ,上述不等式都成立,因此取上确界得到

\|L^*\|_{op} \leq \sqrt{\|L\|_{op}\|L^*\|_{op}}

对这个不等式两边平方,得到 \|L^*\|_{op}^2 \leq \|L\|_{op}\|L^*\|_{op} 。如果 \|L^*\|_{op} \neq 0 ,两边同时除以 \|L^*\|_{op} ,得到 \|L^*\|_{op} \leq \|L\|_{op}

同理,将 L L^* 的角色互换,可以证明 \|L\|_{op} \leq \|L^*\|_{op} 。由于 (L^*)^* = L (伴随的伴随等于自身),我们可以对 L^* 应用同样的论证。因此两个范数相等。

同构情况下的伴随

对于同构的情况,我们需要证明 (L^{-1})^* = (L^*)^{-1} 。证明的思路是验证这两个算子对所有向量的作用效果相同。

对于任意 y, y' \in \mathcal{G} ,计算内积 \langle y, y' \rangle 。利用 L 是同构这一事实,可以将 y' 表示为 y' = LL^{-1}y' ,因此

\langle y, y' \rangle = \langle y, LL^{-1}y' \rangle

应用伴随算子的定义,将 L 从右边移到左边变成 L^*

= \langle L^*y, L^{-1}y' \rangle

再次应用伴随算子的定义,这次将 L^{-1} 从右边移到左边:

= \langle (L^{-1})^*L^*y, y' \rangle

现在我们有 \langle y, y' \rangle = \langle (L^{-1})^*L^*y, y' \rangle 对所有 y, y' 成立。定义算子 K = (L^{-1})^*L^* - \text{Id} (单位算子),那么 \langle Ky, y' \rangle = 0 对所有 y, y' 成立。

特别地,取 y' = Ky ,得到 \langle Ky, Ky \rangle = 0 ,即 \|Ky\| = 0 。由范数的正定性,这意味着 Ky = 0 对所有 y 成立,因此 K = 0 ,即 (L^{-1})^*L^* = \text{Id} ,从而 (L^{-1})^* = (L^*)^{-1}

欧氏空间中的情况

当考虑有限维欧氏空间 \mathcal{H} = \mathbb{R}^N \mathcal{G} = \mathbb{R}^M 时,线性算子 L 可以表示为一个 M \times N 矩阵。在这种情况下,伴随算子的内积关系可以用矩阵乘法表示。

对于向量 x \in \mathbb{R}^N y \in \mathbb{R}^M ,内积 \langle Lx, y \rangle 可以写成

\langle Lx, y \rangle = (Lx)^\top y = x^\top L^\top y

这里使用了标量的转置等于自身,以及矩阵乘法的性质 (Lx)^\top = x^\top L^\top 。继续化简:

= \langle x, L^\top y \rangle

对比伴随算子的定义 \langle Lx, y \rangle = \langle x, L^*y \rangle ,可以看出 L^* = L^\top 。因此在欧氏空间中,伴随算子就是矩阵的转置。

泛函分析基础

现在我们转向第二部分:泛函分析的基本定义。这些定义将为后续的优化理论提供函数分析的框架。

函数的定义域

S 是希尔伯特空间 \mathcal{H} 中的一个非空子集, f: S \to [-\infty, +\infty] 是一个函数。这里函数的值域包含了正负无穷,这允许我们处理一些特殊情况。

函数 f 的定义域记作 \text{dom } f ,定义为

\text{dom } f = \{x \in S \mid f(x) < +\infty\}

定义域包含所有使得函数值有限(即不等于正无穷)的点。这个定义排除了函数值为正无穷的点,但允许函数值为负无穷的点存在于定义域中。

真函数

函数 f 被称为真函数,如果同时满足两个条件:对于所有 x \in S ,有 f(x) \neq -\infty ;并且定义域非空,即 \text{dom } f \neq \varnothing 。第一个条件排除了函数取负无穷的情况,第二个条件确保至少存在一个点使得函数值有限。

真函数的概念在凸优化中特别有用,因为它避免了一些病态情况。通过配图可以看到两个例子。左图展示了一个在整个实数轴上定义的函数,其定义域是全体实数 \text{dom } f = \mathbb{R} ,这是一个真函数。右图展示了一个只在某个点 \delta 右侧有定义的函数,虽然它不是在整个空间上定义的,但只要它不取负无穷值且定义域非空,它仍然可以是一个真函数。

从配图可以更清楚地看到,左图的函数定义域是整个实数轴 \text{dom } f = \mathbb{R} ,是一个真函数。右图的函数定义域是从0到某个点 \delta 的闭区间 \text{dom } f = [0, \delta] ,同样也是一个真函数。

示性函数

C \subset \mathcal{H} 是希尔伯特空间的一个子集。集合 C 的示性函数(也称指示函数) \iota_C 定义为

(\forall x \in \mathcal{H}) \quad \iota_C(x) = \begin{cases} 0 & \text{if } x \in C \\ +\infty & \text{otherwise} \end{cases}

示性函数是一个特殊的函数,它将集合的成员资格转化为函数值。如果点 x 属于集合 C ,函数值为0;如果点 x 不属于集合 C ,函数值为正无穷。这个函数在优化理论中扮演重要角色,特别是在处理约束条件时。通过将约束集合表示为示性函数,我们可以将约束优化问题转化为无约束优化问题的形式。

考虑一个具体例子:设 C = [\delta_1, \delta_2] 是实数轴上的一个闭区间。那么示性函数 f(x) = \iota_{[\delta_1, \delta_2]}(x) 在区间 [\delta_1, \delta_2] 内取值为0,在区间外取值为正无穷。从配图可以看到,这个函数在 \delta_1 \delta_2 之间的值为0(用实线表示),在区间外没有定义(或者说取值为正无穷)。这个函数的定义域恰好是 [\delta_1, \delta_2] ,因为只有这些点的函数值是有限的。

希尔伯特空间中的收敛性

序列收敛的定义

\mathcal{H} 是一个有限维希尔伯特空间, (x_n)_{n \in \mathbb{N}} 是空间中的一个序列, \bar{x} \in \mathcal{H} 是空间中的一个点。序列 (x_n)_{n \in \mathbb{N}} 收敛到 \bar{x} ,如果

\lim_{n \to +\infty} \|x_n - \bar{x}\| = 0

这个定义说明收敛就是序列的项与极限点之间的距离(由范数度量)趋于零。这是度量空间中收敛的标准定义。当序列收敛到 \bar{x} 时,记作 x_n \to \bar{x}

有界集、闭集与紧集

S 是希尔伯特空间 \mathcal{H} 的一个子集。我们需要定义三个重要的拓扑性质。

集合 S 称为有界的,如果它能够被包含在某个球内。更准确地说,如果存在一个中心点和一个有限半径,使得 S 中的所有点到中心的距离都不超过这个半径,那么 S 就是有界的。有界性刻画了集合在空间中的"大小"是有限的。

集合 S 称为闭的,如果 S 中元素构成的任何收敛序列的极限仍然属于 S 。换句话说,如果序列 (x_n)_{n \in \mathbb{N}} 满足每个 x_n \in S ,且 x_n 收敛到某个点 \bar{x} ,那么必有 \bar{x} \in S 。闭性保证了集合在极限运算下的封闭性。

集合 S 称为紧的,如果从 S 中的任何序列 (x_n)_{n \in \mathbb{N}} 中,都能提取出一个子序列 (x_{n_k})_{k \in \mathbb{N}} ,使得这个子序列收敛到 S 中的某个点。紧性是一个强于闭性和有界性的性质,它保证了序列的聚点存在性。

在有限维希尔伯特空间中,存在一个重要的等价性结果:集合 S 是紧的,当且仅当它既是闭的又是有界的。这是海涅-博雷尔定理在有限维空间中的表述。这个等价性在无限维空间中不成立,但在我们讨论的有限维情况下,紧性可以通过闭性和有界性来刻画。

上下极限

上极限与下极限的定义

(\xi_n)_{n \in \mathbb{N}} 是扩展实数 [-\infty, +\infty] 中的一个序列。序列的下极限记作 \liminf ,定义为

\liminf \xi_n = \lim_{n \to +\infty} \inf\{\xi_k \mid k \geq n\} \in [-\infty, +\infty]

这个定义分两步理解。首先,对于每个 n ,考虑"尾部"集合 \{\xi_k \mid k \geq n\} (即从第 n 项开始的所有后续项),取这个集合的下确界。随着 n 增加,这个尾部集合变小(包含的项更少),因此下确界构成一个单调不减的序列。然后对这个单调序列取极限,得到下极限。下极限捕捉了序列"最终"的最小行为。

类似地,序列的上极限定义为

\limsup \xi_n = \lim_{n \to +\infty} \sup\{\xi_k \mid k \geq n\} \in [-\infty, +\infty]

对于每个 n ,取尾部集合的上确界,这形成一个单调不增的序列,然后取这个序列的极限。上极限捕捉了序列"最终"的最大行为。

上下极限的性质

上下极限之间存在一些基本关系。首先,上极限与下极限通过取负运算相关:

\limsup \xi_n = -\liminf(-\xi_n)

这个等式说明对序列取负后的下极限,等于原序列上极限的相反数。这反映了上下的对偶性。

其次,下极限总是不大于上极限:

\liminf \xi_n \leq \limsup \xi_n

这是因为对任何集合,下确界不超过上确界。这个不等式总是成立的,不等号可能严格成立(当序列振荡时),也可能等号成立(当序列收敛时)。

最后,序列收敛到某个值 \bar{\xi} \in [-\infty, +\infty] 的充要条件是下极限和上极限都等于这个值:

\lim_{n \to +\infty} \xi_n = \bar{\xi} \in [-\infty, +\infty] \text{ if and only if } \liminf \xi_n = \limsup \xi_n = \bar{\xi}

这个等价性提供了判断序列收敛的另一种方法。当上下极限相等时,序列被"夹"在这个共同的值上,因此必然收敛。反之,如果序列收敛,那么所有尾部的上下确界都会趋于同一个极限值。这个判据在处理不易直接验证收敛性的序列时特别有用。

上下极限收敛判据的证明

现在我们来证明序列收敛的充要条件: \lim_{n \to \infty} \xi_n = \bar{\xi} 当且仅当 \liminf \xi_n = \limsup \xi_n = \bar{\xi}

首先考虑必要性方向。假设上极限等于某个值 \bar{\xi} ,即 \limsup \xi_n = \bar{\xi} 。这意味着对于任意给定的 \epsilon > 0 ,存在某个指标 N_1 ,使得当 n \geq N_1 时,序列的项满足

\xi_n \leq \bar{\xi} + \epsilon

这是因为上极限是尾部上确界的极限,当上极限存在时,最终所有的项都不会超过 \bar{\xi} + \epsilon

类似地,如果下极限等于 \bar{\xi} ,即 \liminf \xi_n = \bar{\xi} ,那么对于任意 \epsilon > 0 ,存在某个指标 N_2 ,使得当 n \geq N_2 时,

\xi_n \geq \bar{\xi} - \epsilon

下极限是尾部下确界的极限,当下极限存在时,最终所有的项都不会低于 \bar{\xi} - \epsilon

现在将这两个条件结合起来。取 N = \max\{N_1, N_2\} ,那么对于任意 \epsilon > 0 ,当 n \geq N 时,同时有

\bar{\xi} - \epsilon \leq \xi_n \leq \bar{\xi} + \epsilon

这等价于

|\xi_n - \bar{\xi}| \leq \epsilon

这正是序列 \xi_n 收敛到 \bar{\xi} 的定义,即 \lim_{n \to \infty} \xi_n = \bar{\xi}

反过来的充分性是显然的:如果序列收敛到 \bar{\xi} ,那么序列的所有子序列的极限都是 \bar{\xi} ,因此上下极限作为特殊的极限也必然等于 \bar{\xi}

上图

上图的定义

f: \mathcal{H} \to [-\infty, +\infty] 是一个函数。函数 f 的上图记作 \text{epi } f ,定义为

\text{epi } f = \{(x, \zeta) \in \text{dom } f \times \mathbb{R} \mid f(x) \leq \zeta\}

上图是函数图像及其上方区域的集合。对于定义域中的每个点 x ,上图包含所有高度不低于 f(x) 的点 (x, \zeta) 。这个概念将函数的性质转化为集合的几何性质,在凸分析中特别有用。

通过两个例子可以更好地理解上图的几何意义。第一个例子是函数 f(x) = |x| (绝对值函数)。这个函数的图像是一个V形曲线,其上图 \text{epi}_f 是这个V形曲线及其上方的所有点,形成一个无界的V形区域。这个区域在图中用阴影表示。

第二个例子是示性函数 f(x) = \iota_{[-\delta, \delta]}(x) 。回顾示性函数的定义,它在区间 [-\delta, \delta] 内取值为0,在区间外取值为正无穷。这个函数的上图包含两部分:在区间 [-\delta, \delta] 内,上图是从高度0开始向上延伸的所有点;在区间外,由于函数值为正无穷,不存在有限高度的点使得 \zeta \geq f(x) ,因此上图在区间外是空的。结果是一个矩形的无界区域,底部是区间 [-\delta, \delta] ,向上无限延伸。

下半连续性

下半连续的定义

f: \mathcal{H} \to ]-\infty, +\infty] 是一个函数。函数 f 在点 x \in \mathcal{H} 处称为下半连续的,如果对于希尔伯特空间 \mathcal{H} 中的每个序列 (x_n)_{n \in \mathbb{N}} ,只要

x_n \to x

就有

\liminf f(x_n) \geq f(x)

下半连续性是连续性的一个弱化版本。对于连续函数,如果 x_n \to x ,那么 f(x_n) \to f(x) ,即 \lim f(x_n) = f(x) 。下半连续性只要求函数值的下极限不低于极限点的函数值,允许函数在极限点处有跳跃,但跳跃只能是向下的(即 \liminf f(x_n) 可以严格大于 f(x) ,但不能小于)。

上图封闭性的等价刻画

函数 f 在整个希尔伯特空间 \mathcal{H} 上下半连续,当且仅当它的上图 \text{epi } f 是一个闭集。这个等价性建立了函数的分析性质(下半连续性)和几何性质(上图的闭性)之间的联系。

通过图示可以直观理解哪些函数是下半连续的。左边的图展示了一个有波动的函数。在左图的配图中,函数有一些局部的波动和跳跃。观察函数在某些点的行为:如果从两侧接近某个点,函数值的下极限是否不小于该点的函数值。右边的图展示了另一个函数的例子。

在第二组图中,左图添加了一些虚线,这些虚线可能表示函数的某种延拓或者用于说明下半连续性的检验。对于下半连续函数,如果我们沿着任何收敛序列接近某个点,函数值的下极限总是被该点的函数值所界定。右图展示了一个在右侧趋于无穷的函数,这种函数可以是下半连续的,因为即使函数值趋于无穷,只要下极限条件满足,下半连续性仍然成立。

从图示中可以更清楚地理解下半连续函数的特征。第一组图展示了两种情况。左图展示了一个在某个区间上定义的常函数,它在区间端点处用方括号标记(开区间或闭区间的端点)。这个函数是下半连续的,因为函数在定义域内是常数,从任何序列接近定义域内的点,函数值的下极限都等于该点的函数值。右图也展示了一个类似的区间上的常函数。

第二组图中,左图添加了虚线构成的X形图案。这个X形图案可能用来说明某种不下半连续的情况或者用于对比。如果一个函数在某点有向上的跳跃(即从两侧接近时函数值的极限小于该点的函数值),那么这个函数不是下半连续的。但如果跳跃是向下的(即从两侧接近时函数值的下极限大于或等于该点的函数值),函数仍可能是下半连续的。右图保持不变,继续展示下半连续函数的例子。

下半连续函数的性质

下半连续函数具有一些重要的保持性质,这些性质使得下半连续性在优化理论中成为一个有用的概念。

第一个性质是关于连续函数的。希尔伯特空间 \mathcal{H} 上的每个连续函数都是下半连续的。这是显然的,因为如果函数在某点连续,那么当序列收敛到该点时,函数值也收敛到该点的函数值,因此下极限等于函数值,自然满足下半连续的条件。连续性是下半连续性的充分条件,但不是必要条件。

第二个性质是关于有限和的。下半连续函数的有限和仍然是下半连续的。如果 f_1, f_2, \ldots, f_n 都是下半连续函数,那么它们的和 f = f_1 + f_2 + \cdots + f_n 也是下半连续的。这个性质允许我们通过组合简单的下半连续函数来构造更复杂的下半连续函数。

第三个性质是关于上确界的,这是下半连续性最强大的性质之一。设 (f_i)_{i \in I} 是一族下半连续函数,那么它们的逐点上确界 \sup_{i \in I} f_i 也是下半连续的。这里逐点上确界的定义是:对每个点 x (\sup_{i \in I} f_i)(x) = \sup_{i \in I} f_i(x) 。这个性质表明下半连续性在取任意上确界运算下保持,即使是无限族的上确界。这与连续性形成对比,因为连续函数的无限上确界通常不连续。

上确界下半连续性的证明

现在我们来证明第三个性质。设 (f_i)_{i \in I} 是一族下半连续函数,我们需要证明 f = \sup_{i \in I} f_i 也是下半连续的。

证明的关键是利用上图的几何性质。设 C_i 表示函数 f_i 的上图, C 表示函数 f 的上图。根据上图的定义和上确界的定义,我们可以建立 C 与各个 C_i 之间的关系。

首先观察到, C 实际上是所有 C_i 的交集,即

C = \bigcap_{i \in I} C_i

这可以通过等价关系链来验证。点 (x, t) 属于 C 当且仅当 t \geq f(x) = \sup_{i \in I} f_i(x) 。这等价于对所有 i \in I 都有 t \geq f_i(x) ,即

(x, t) \in C \Longleftrightarrow \forall i \in I, t \geq f_i(x)

t \geq f_i(x) 对所有 i 成立,等价于 (t, x) \in C_i 对所有 i 成立,即

\Longleftrightarrow \forall i \in I, (t, x) \in C_i

这进一步等价于 (x, t) 属于所有 C_i 的交集:

\Longleftrightarrow (x, t) \in \bigcap_{i \in I} C_i

现在利用下半连续性的上图刻画。由于每个 f_i 都是下半连续的,每个上图 C_i 都是闭集。在拓扑空间中,闭集的任意交集仍然是闭集(这是闭集的基本性质)。因此 C = \bigcap_{i \in I} C_i 作为闭集的交集,也是闭集。

由于 f 的上图 C = \text{epi } f 是闭集,根据上图封闭性与下半连续性的等价关系,函数 f 是下半连续的。这就完成了证明。

这个证明展示了为什么下半连续性如此适合处理上确界运算:因为上确界对应于上图的交集,而闭集在交集运算下是封闭的。


评论