Administrator
发布于 2026-09-09 / 0 阅读
0
0

优化理论(三):凸性与共轭函数

ATSI优化课程讲义 - 第二讲:数学工具——凸性与共轭

课程概述

本讲座是ATSI优化课程的第二讲,主题聚焦于凸性理论和共轭函数。这一讲的内容包括四个主要目标:给出凸集和凸函数的精确定义、刻画可微凸函数的性质、定义函数的共轭概念、以及探讨凸函数的共轭性质。

讲座的组织结构分为两大部分。第一部分深入讨论凸性,包括基本定义和可微凸函数的特征刻画。第二部分介绍Fenchel-Legendre共轭的概念及其相关性质。

第一部分:凸性

凸集的定义

\mathcal{H} 是一个希尔伯特空间。集合 C \subset \mathcal{H} 称为凸集,如果对于集合中的任意两个点 x y ,以及任意比例参数 \alpha \in ]0, 1[ ,它们的凸组合仍然属于集合 C 。用数学语言表达:

(\forall (x, y) \in C^2)(\forall \alpha \in ]0, 1[) \quad \alpha x + (1 - \alpha)y \in C

这个定义的几何意义是:连接集合中任意两点的线段完全包含在集合内部。凸组合 \alpha x + (1 - \alpha)y 表示从点 x 到点 y 的线段上的点,其中 \alpha 控制这个点在线段上的位置。当 \alpha = 1 时得到点 x ,当 \alpha = 0 时得到点 y ,而 \alpha \in ]0, 1[ 时得到线段内部的点。

通过三个图形可以直观理解凸集的概念。第一个图形展示了一个不规则形状,它有凹陷的部分。第二个图形展示了一个类似水滴形状的平滑曲线区域。第三个图形展示了一个菱形或倾斜的矩形。这三个形状中,哪些是凸集取决于能否在集合内任意两点间画直线而不离开集合。

在第一个图形上添加了虚线,这条虚线连接了集合中的两个点,但虚线的某些部分超出了集合的边界。这说明第一个形状不是凸集,因为存在两个点,它们之间的连线不完全包含在集合内。第二个形状(水滴形)和第三个形状(菱形)都是凸集,因为它们内部任意两点的连线都保持在集合内部。

凸集的性质

凸集具有一系列重要的性质,这些性质使得凸集成为优化理论中的基本对象。

首先,空集 \varnothing 被规定为凸集。虽然这看起来是平凡的,但在数学理论的完整性上是必要的。空集满足凸集的定义是空虚的:因为不存在空集中的两个点,所以关于这两个点的任何陈述都自动成立。

其次,凸集在凸组合运算下具有闭性,这个性质可以推广到有限多个点的情况。如果 C 是一个凸集,那么对于任意正整数 n \in \mathbb{N}^* 和任意 n 个点 (x_1, \ldots, x_n) \in C^n ,以及任意满足和为1的非负系数 (\alpha_1, \ldots, \alpha_n) \in [0, +\infty[^n ,即

\sum_{i=1}^n \alpha_i = 1

它们的凸组合

\sum_{i=1}^n \alpha_i x_i \in C

仍然属于集合 C 。这个性质将两点的凸组合推广到多点的情况。满足 \sum_{i=1}^n \alpha_i = 1 \alpha_i \geq 0 的系数称为凸系数,而 \sum_{i=1}^n \alpha_i x_i 称为点 x_1, \ldots, x_n 的凸组合。这个性质表明凸集包含其任意有限个点的所有凸组合。

第三个性质是关于特殊的凸集类型。每个向量空间(或仿射空间)都是凸集。向量空间满足线性组合的封闭性,因此自然满足凸组合的封闭性。仿射空间是向量空间的平移,也保持凸性。

第四个性质涉及拓扑运算。如果 C 是一个凸集,那么它的内部 \text{int}(C) 和闭包 \bar{C} 都是凸集。这说明凸性在取内部和闭包运算下保持不变。内部运算去除了集合的边界,而闭包运算添加了极限点,但这两个运算都不破坏凸性。

最后一个性质涉及凸锥的概念。集合 [0, +\infty[^n \mathbb{R}^n 中的一个凸锥。凸锥是同时满足凸性和锥性(对于正标量乘法封闭)的集合。非负象限 [0, +\infty[^n 由所有分量都非负的向量组成,它既是凸集(任意两个非负向量的凸组合仍然非负),也是锥(非负向量乘以正标量仍然非负)。

凸集内部的凸性

现在我们来证明一个重要性质:如果 C 是一个凸集,那么它的内部 \text{int}(C) 也是凸集。

证明的思路是利用内部的定义和凸性的定义。设 x y 是内部 \text{int}(C) 中的两个点, \alpha \in ]0, 1[ 是一个比例参数。我们需要证明凸组合 \alpha x + (1 - \alpha)y 也属于 \text{int}(C)

由于 x y 都是 C 的内部点,根据内部的定义,存在某个正数 \rho > 0 ,使得以 y 为中心、半径为 \rho 的开球 B(y, \rho) 完全包含在 C 内,即 B(y, \rho) \subset C

现在对于开球 B(y, \rho) 中的任意点 y' ,由于 y' \in B(y, \rho) \subset C ,而 x \in C (因为内部点必然是集合的点),根据 C 的凸性,凸组合 \alpha x + (1 - \alpha)y' 属于 C

关键观察是:当 y' 取遍整个球 B(y, \rho) 时,点 \alpha x + (1 - \alpha)y' 构成了一个新的球。具体地,这些点构成的集合是

B(\alpha x + (1 - \alpha)y, (1 - \alpha)\rho) \subset C

这个新球的中心是 \alpha x + (1 - \alpha)y ,半径是 (1 - \alpha)\rho 。由于 (1 - \alpha) > 0 ,这个半径是正数,因此 \alpha x + (1 - \alpha)y C 的内部点,即 \alpha x + (1 - \alpha)y \in \text{int}(C)

凸集闭包的凸性

类似地,如果 C 是一个凸集,那么它的闭包 \bar{C} 也是凸集。这个证明利用了极限的保持性。

x y 是闭包 \bar{C} 中的两个点, \alpha \in ]0, 1[ 。根据闭包的定义,存在 C 中的两个序列 (x_n)_{n \in \mathbb{N}} (y_n)_{n \in \mathbb{N}} 分别收敛到 x y ,即 \lim_{n \to \infty} x_n = x ,对 y 的情况也类似。

由于每个 x_n \in C y_n \in C ,而 C 是凸集,因此凸组合 \alpha x_n + (1 - \alpha)y_n \in C 对所有 n 成立。

现在考虑序列 (\alpha x_n + (1 - \alpha)y_n)_{n \in \mathbb{N}} 。由于加法和标量乘法的连续性,这个序列收敛到 \alpha x + (1 - \alpha)y 。而这个序列的每一项都属于 C ,因此其极限 \alpha x + (1 - \alpha)y 必然属于 C 的闭包 \bar{C}

凸集族的交集

如果 (C_i)_{i \in I} 是一族凸集,那么它们的交集 \bigcap_{i \in I} C_i 也是凸集。这个性质的证明直接来自于凸性定义的应用。

x y 是交集 \bigcap_{i \in I} C_i 中的两个点, \alpha \in ]0, 1[ 。由于 x y 都属于交集,它们必然属于每一个 C_i 。对于任意 i \in I ,由于 x \in C_i y \in C_i ,而 C_i 是凸集,因此 \alpha x + (1 - \alpha)y \in C_i

由于这对所有 i \in I 都成立,凸组合 \alpha x + (1 - \alpha)y 属于所有的 C_i ,因此属于它们的交集 \bigcap_{i \in I} C_i

这个性质与前面关于下半连续函数的上确界性质形成对照。在那里我们看到,闭集的任意交集仍是闭集。这里我们看到,凸集的任意交集仍是凸集。这两个性质都说明了相应的结构在交集运算下是封闭的。

标量乘法下的凸性

如果 C 是一个凸集,那么对于任意实数 \alpha \in \mathbb{R} ,标量倍数集合

\alpha C = \{\alpha x \mid x \in C\}

也是凸集。这个性质说明凸集在标量伸缩变换下保持凸性。

笛卡尔积与Minkowski和

如果 C_1 C_2 是两个凸集,那么它们的笛卡尔积

C_1 \times C_2

以及Minkowski和

C_1 + C_2 = \{x_1 + x_2 \mid (x_1, x_2) \in C_1 \times C_2\}

都是凸集。笛卡尔积将两个空间的凸集组合成高维空间的凸集,而Minkowski和将两个集合中的点逐一相加形成新的集合,这两种运算都保持凸性。

最后,如果 (C_i)_{i \in I} 是希尔伯特空间 \mathcal{H} 中的一族凸集,那么它们的交集 \bigcap_{i \in I} C_i 是凸的。这再次强调了交集运算保持凸性的性质。

凸包

凸包的定义

\mathcal{H} 是一个希尔伯特空间, C \subset \mathcal{H} 是一个子集。集合 C 的凸包记作 \text{conv}(C) ,定义为包含 C 的最小凸集。换句话说,凸包是所有包含 C 的凸集的交集。

凸包的第一个刻画是通过交集给出的: \text{conv}(C) 是所有包含 C 的凸集的交集。由于凸集的交集仍是凸集,而 C 本身被这个交集包含,因此 \text{conv}(C) 确实是包含 C 的最小凸集。

第二个刻画更具构造性。点 x \in \mathcal{H} 属于 \text{conv}(C) ,当且仅当存在某个正整数 n \in \mathbb{N}^* 、集合 C 中的 n 个点 (x_1, \ldots, x_n) \in C^n ,以及满足和为1的非负系数 (\alpha_1, \ldots, \alpha_n) \in ]0, +\infty[^n ,即

\sum_{i=1}^n \alpha_i = 1

使得

x = \sum_{i=1}^n \alpha_i x_i

这个刻画说明凸包恰好由 C 中有限个点的所有凸组合构成。

凸包的等价刻画证明

现在我们来证明上述两个刻画是等价的。定义集合

A = \left\{x = \sum_{i=1}^n \alpha_i x_i \mid n \in \mathbb{N}^*, (x_1, \ldots, x_n) \in C^n, (\alpha_1, \ldots, \alpha_n) \text{ with } \alpha_i > 0, \sum_{i=1}^n \alpha_i = 1\right\}

我们需要证明 A = \text{conv}(C)

首先证明 A \subset \text{conv}(C) 。设 x = \sum_{i=1}^n \alpha_i x_i \in A 。由于每个 x_i \in C \subset \text{conv}(C) ,而 \text{conv}(C) 是凸集,根据凸集的性质(有限点凸组合的封闭性), x \in \text{conv}(C)

反过来证明 \text{conv}(C) \subset A 。我们需要证明 A 本身是一个包含 C 的凸集。首先, C \subset A 是显然的,因为 C 中的任何点 x 都可以写成 x = 1 \cdot x 的形式(即 n = 1 的情况)。

其次, A 是凸集。由于 A 包含 C A 是凸的,而 \text{conv}(C) 是包含 C 的最小凸集,因此 \text{conv}(C) \subset A (根据最小性,任何包含 C 的凸集都包含 \text{conv}(C) )。

综合两个方向,得到 A = \text{conv}(C)

凸函数

凸函数的定义

函数 f: \mathcal{H} \to ]-\infty, +\infty] 称为凸函数,如果对于定义域中的任意两个点 (x, y) \in \mathcal{H}^2 和任意比例参数 \alpha \in ]0, 1[ ,函数在凸组合点的值不超过函数值的凸组合,即

f(\alpha x + (1 - \alpha)y) \leq \alpha f(x) + (1 - \alpha)f(y)

这个不等式是凸函数的核心性质。几何上,它意味着连接函数图像上任意两点的线段位于函数图像的上方或与之重合。换句话说,函数图像总是"向下弯曲"的,没有任何向上的凸起部分。

这里需要注意凸函数定义的一个关键细节:不等式只要求在定义域内的点对 (x, y) \in (\text{dom } f)^2 上成立。这意味着我们只考虑那些使得 f(x) f(y) 都有限的点。对于定义域外的点,由于函数值可能是正无穷,凸性条件不需要验证。

凸函数的例子

通过三个具体例子可以更好地理解凸函数的概念。

第一个例子是绝对值函数 f(x) = |x| 。这个函数的图像是一个V形,在原点处有一个尖点。尽管这个函数在原点不可微,但它仍然是凸函数。对于任意两点,连接它们函数值的线段总是位于函数图像的上方或与之重合。

第二个例子是 f(x) = \sqrt{|x|} 。这个函数的图像是一个向下凹的曲线形状,但它实际上是一个凸函数。这个例子说明"向下凹"这个直观描述可能产生误导——数学上的凸函数对应的几何形状可能看起来像是"凹"的。

第三个例子是示性函数 f(x) = \iota_{[-\delta, \delta]}(x) 。这个函数在区间 [-\delta, \delta] 内取值为0,在区间外取值为正无穷。虽然这个函数的定义域只是一个区间,但它仍然是凸函数。对于区间内的任意两点,它们的凸组合仍在区间内,且函数值的凸组合(即0)等于凸组合点的函数值(也是0)。

在第二组图中,添加了虚线来说明凸性的验证。对于绝对值函数,虚线连接了曲线上的两个点,显示这条线段位于函数图像上方。对于平方根函数,虚线同样展示了弦在曲线上方的性质。这些虚线直观地展示了凸性条件的几何意义。

凹函数

与凸函数相对应的概念是凹函数。函数 f: \mathcal{H} \to [-\infty, +\infty] 称为凹函数,如果 -f 是凸函数。换句话说,凹函数满足相反的不等式:

f(\alpha x + (1 - \alpha)y) \geq \alpha f(x) + (1 - \alpha)f(y)

凹函数的图像是"向上凸"的,连接任意两点的线段位于函数图像的下方或与之重合。通过取负运算,凸性和凹性之间可以相互转化,因此关于凸函数的许多结果可以直接应用到凹函数上。

凸函数的上图刻画

凸函数有一个重要的几何刻画:函数 f: \mathcal{H} \to [-\infty, +\infty] 是凸函数,当且仅当它的上图 \text{epi } f 是一个凸集。这个等价性将函数的凸性完全转化为集合的凸性问题。

这个刻画的证明基于上图的定义和凸性定义的直接对应。如果函数是凸的,那么对于上图中的任意两点 (x, \zeta_1) (y, \zeta_2) ,它们的凸组合 (\alpha x + (1-\alpha)y, \alpha\zeta_1 + (1-\alpha)\zeta_2) 也在上图中,因为

\alpha\zeta_1 + (1-\alpha)\zeta_2 \geq \alpha f(x) + (1-\alpha)f(y) \geq f(\alpha x + (1-\alpha)y)

最后一个不等式来自函数的凸性。反之,如果上图是凸集,那么通过类似的推理可以得到函数的凸性。

配图展示了三个凸函数的上图。第一个是绝对值函数 f(x) = |x| 的上图,它是一个无界的V形区域,向上延伸。第二个是 f(x) = \sqrt{|x|} 的上图,它是一个抛物线形状的区域。第三个是示性函数 f(x) = \iota_{[-\delta,\delta]}(x) 的上图,它是一个矩形的无界区域,底部是区间 [-\delta, \delta] 。这三个上图都是凸集,与对应函数的凸性一致。

这个上图刻画非常有用,因为它允许我们用集合的几何性质来研究函数的分析性质。许多关于凸函数的定理可以通过研究其上图的几何性质来证明。

在中间的图中,添加了红色虚线来说明上图的凸性验证。特别是对于平方根函数,虚线形成了一个X形图案,用来说明上图中任意两点的连线仍在上图内部。这些虚线直观地展示了上图作为凸集的性质。

上图凸性等价定理的证明

现在我们来完整证明函数凸性与上图凸性的等价关系。这个证明分为两个方向。

第一个方向:假设上图是凸集,证明函数是凸的。

假设 \text{epi } f 是一个凸集。对于定义域中的任意两点 (x, y) \in (\text{dom } f)^2 和任意两个实数 (\eta, \rho) \in \mathbb{R}^2 满足 \eta \geq f(x) \rho \geq f(y) ,根据上图的定义,点 (x, \eta) \in \text{epi } f (y, \rho) \in \text{epi } f

由于上图是凸集,对于任意 \alpha \in ]0, 1[ ,凸组合

\alpha(x, \eta) + (1 - \alpha)(y, \rho) = (\alpha x + (1 - \alpha)y, \alpha\eta + (1 - \alpha)\rho) \in \text{epi } f

这意味着

f(\alpha x + (1 - \alpha)y) \leq \alpha\eta + (1 - \alpha)\rho

现在让 \eta 趋向于 f(x) \rho 趋向于 f(y) 。由于上述不等式对所有满足条件的 \eta \rho 都成立,取极限得到

f(\alpha x + (1 - \alpha)y) \leq \alpha f(x) + (1 - \alpha)f(y)

这正是凸函数的定义。

第二个方向:假设函数是凸的,证明上图是凸集。

假设 f 是凸函数。设 (x, \eta) \in \text{epi } f (y, \rho) \in \text{epi } f 是上图中的两个点。这意味着 f(x) \leq \eta f(y) \leq \rho

对于任意 \alpha \in ]0, 1[ ,由于 f 是凸函数,有

f(\alpha x + (1 - \alpha)y) \leq \alpha f(x) + (1 - \alpha)f(y) \leq \alpha\eta + (1 - \alpha)\rho

第二个不等式来自于 f(x) \leq \eta f(y) \leq \rho 。这个不等式链说明

(\alpha x + (1 - \alpha)y, \alpha\eta + (1 - \alpha)\rho) \in \text{epi } f

因此 \alpha(x, \eta) + (1 - \alpha)(y, \rho) \in \text{epi } f ,这证明了上图是凸集。

凸函数的性质

凸函数具有一系列重要性质,这些性质使得凸函数在优化理论中成为易于处理的对象。

下水平集的凸性

如果 f: \mathcal{H} \to [-\infty, +\infty] 是凸函数,那么函数 f 的定义域 \text{dom } f 是凸集。进一步地,对于任意高度 \eta \in \mathbb{R} ,下水平集

\text{lev}_{\leq \eta} f = \{x \in \mathcal{H} \mid f(x) \leq \eta\}

是凸集。下水平集包含所有函数值不超过 \eta 的点。这个性质说明凸函数的所有下水平集都是凸的。

我们来证明这个性质。设 x y 是下水平集 \text{lev}_{\leq \eta} f 中的两个点,即 f(x) \leq \eta f(y) \leq \eta 。对于任意 \alpha \in ]0, 1[ ,由于 f 是凸函数,

f(\alpha x + (1 - \alpha)y) \leq \alpha f(x) + (1 - \alpha)f(y)

由于 f(x) \leq \eta f(y) \leq \eta ,右边可以进一步估计:

\alpha f(x) + (1 - \alpha)f(y) \leq \alpha\eta + (1 - \alpha)\eta = \eta

因此

f(\alpha x + (1 - \alpha)y) \leq \eta

这说明 \alpha x + (1 - \alpha)y \in \text{lev}_{\leq \eta} f ,即下水平集是凸的。

限制函数的凸性

函数 f: \mathcal{H} \to ]-\infty, +\infty] 是凸函数,当且仅当对于定义域中的任意两点 (x, y) \in (\text{dom } f)^2 ,限制在线段上的单变量函数

\varphi_{x,y}: [0, 1] \to ]-\infty, +\infty]: \alpha \mapsto f(\alpha x + (1 - \alpha)y)

是凸函数。这个性质将多变量凸函数的凸性归约为单变量函数的凸性,提供了一个验证凸性的有效方法。

凸函数的和与上确界

凸函数的有限和仍然是凸函数。如果 f_1, f_2, \ldots, f_n 都是凸函数,那么它们的和 f = f_1 + f_2 + \cdots + f_n 也是凸函数。这可以直接从凸性的定义验证。

更强的性质是关于上确界的。设 (f_i)_{i \in I} 是一族凸函数,那么它们的逐点上确界 f = \sup_{i \in I} f_i 也是凸函数。这里上确界定义为:对每个点 x f(x) = \sup_{i \in I} f_i(x)

我们来证明上确界的凸性。设 C_i 表示函数 f_i 的上图, C 表示函数 f 的上图。根据上图的定义,点 (x, t) 属于 C 当且仅当 t \geq f(x) = \sup_{i \in I} f_i(x) ,这等价于对所有 i \in I 都有 t \geq f_i(x) ,即

(x, t) \in C \Longleftrightarrow \forall i \in I, t \geq f_i(x) \Longleftrightarrow \forall i \in I, (t, x) \in C_i \Longleftrightarrow (x, t) \in \bigcap_{i \in I} C_i

因此 C = \bigcap_{i \in I} C_i ,即上确界的上图是各个上图的交集。

由于每个 f_i 是凸函数,每个上图 C_i 是凸集。凸集的交集仍然是凸集,因此 C 是凸集。根据上图凸性的等价刻画, f 是凸函数。

这个证明与之前关于下半连续函数上确界的证明类似,都利用了上图的交集性质和闭集(或凸集)在交集下的封闭性。

\Gamma_0(\mathcal{H}) 函数类

\Gamma_0(\mathcal{H}) 为从希尔伯特空间 \mathcal{H} ]-\infty, +\infty] 的所有凸的、下半连续的、真函数构成的类。这个函数类在凸优化理论中扮演核心角色,因为它同时具有良好的凸性、拓扑性和非平凡性。

C \subset \mathcal{H} 是一个子集。集合 C 的示性函数 \iota_C 属于 \Gamma_0(\mathcal{H}) ,当且仅当 C 是一个非空闭凸集。这可以通过上图来证明: \iota_C 的上图恰好是 C \times [0, +\infty[ ,这是一个凸集当且仅当 C 是凸集,是一个闭集当且仅当 C 是闭集。

严格凸函数

严格凸性的定义

\mathcal{H} 是一个希尔伯特空间, f: \mathcal{H} \to ]-\infty, +\infty] 是一个函数。函数 f 称为严格凸的,如果对于定义域中的任意两个不同的点 x, y \in \text{dom } f 满足 x \neq y ,以及任意 \alpha \in ]0, 1[ ,严格不等式

f(\alpha x + (1 - \alpha)y) < \alpha f(x) + (1 - \alpha)f(y)

成立。严格凸性要求凸性不等式严格成立(除了端点处),这排除了线性函数这类"边界"情况。严格凸函数的几何意义是:连接函数图像上任意两个不同点的线段严格位于函数图像的上方,函数图像没有任何直线段。

严格凸函数的判别

通过三个图形可以判断哪些函数是严格凸的。第一个图形展示了一个函数,它在某个区间内有一段平坦的部分(水平线段)。虽然这个函数整体上是凸的,但由于存在线性段,它不是严格凸的。对于线性段上的两个不同点,凸性不等式取等号而非严格不等号。

第二个图形展示了一个U形函数,它在底部有一个平坦的区域。类似第一个例子,这个平坦区域使得函数不是严格凸的。

第三个图形展示了一个光滑的抛物线形函数,没有任何平坦的部分。这样的函数是严格凸的,因为连接任意两个不同点的线段严格位于函数图像的上方。

在第二组图中,添加了红色虚线来说明严格凸性的验证。对于前两个函数,虚线与函数图像相交或重合的部分说明了为什么它们不是严格凸的。对于第三个函数,虚线始终严格位于函数图像上方(除了端点处),这验证了严格凸性。

严格凸性在优化理论中很有用,因为严格凸函数的极小值点(如果存在)是唯一的。相比之下,一般的凸函数可能有多个极小值点,这些极小值点构成一个凸集。

练习

练习1:非凸函数与凸集的和

这个练习要求给出一个例子,其中包含函数 f: \mathbb{R} \to \mathbb{R} 和非空集合 C \subset \mathbb{R} ,满足三个条件: f 是非凸函数, C 是凸集,以及 f + \iota_C 是凸函数。

这个例子说明了一个重要的现象:即使函数 f 本身不是凸的,通过添加一个凸集的示性函数,可以使得组合函数变成凸的。示性函数 \iota_C 的作用是将定义域限制到集合 C 上,而在 C 外部函数值为正无穷。如果限制后的函数 f C 上表现出凸性,那么 f + \iota_C 就是凸的。

一个可能的例子是取 f(x) = -x^2 (这是一个凹函数,因此非凸), C = \{0\} (单点集是凸的)。那么 f + \iota_C 在点0处取值为0,在其他地方取值为正无穷,这是一个凸函数(实际上是点 \{0\} 的示性函数)。

练习1的第二部分:凸锥的证明

(a_k)_{1 \leq k \leq K} \mathbb{R}^N 中的向量。定义集合

C = \left\{\sum_{k=1}^K \xi_k a_k \mid (\forall k \in \{1, \ldots, K\}) \xi_k \geq 0\right\}

需要证明 C \mathbb{R}^N 的一个非空凸锥。此外,当向量 (a_k)_{1 \leq k \leq K} 线性独立时,需要证明 C 是闭的。括号中补充说明,实际上对于任意向量族(不要求线性独立),后面的结果仍然成立。

凸锥性的证明:

首先, 0 \in C 是显然的,因为取所有 \xi_k = 0 即可得到零向量。因此 C 非空。

其次, C 满足锥的性质。如果 x \in C ,那么存在非负系数 (\xi_k)_{1 \leq k \leq K} \in [0, \infty[^K 使得 x = \sum_{k=1}^K \xi_k a_k 。对于任意 \lambda > 0 ,有

\lambda x = \sum_{k=1}^K (\lambda\xi_k)a_k \in C

因为 \lambda\xi_k \geq 0 对所有 k 成立。这证明了 C 是一个锥。

现在证明凸性。设 x = \sum_{k=1}^K \xi_k a_k \in C y = \sum_{k=1}^K \eta_k a_k \in C ,其中所有 \xi_k, \eta_k \geq 0 。对于任意 \alpha \in ]0, 1[ ,计算凸组合:

\alpha x + (1 - \alpha)y = \sum_{k=1}^K (\alpha\xi_k + (1 - \alpha)\eta_k)a_k \in C

因为 \alpha\xi_k + (1 - \alpha)\eta_k \geq 0 对所有 k 成立(这是两个非负数的凸组合)。这证明了 C 是凸的。

闭性的证明(当向量线性独立时):

假设向量族 \{a_k\}_{1 \leq k \leq K} 是线性独立的。在这种情况下,集合 C 中每个点 x 在向量族 \{a_k\} 上的分解是唯一的。定义映射

\phi: x \mapsto (\xi_k)_{1 \leq k \leq K}

其中 x = \sum_{k=1}^K \xi_k a_k 。由于向量族线性独立,这个映射是良定义的。

这个映射 \phi 是线性映射,因此在有限维空间中是连续的。集合 C 可以表示为

C = \phi^{-1}([0, \infty[^K)

C 是非负象限 [0, \infty[^K 在连续映射 \phi^{-1} 下的原像。由于非负象限是闭集,而连续映射的逆映射保持闭性(在有限维空间中,闭集的原像是闭集),因此 C 是闭的。

这个证明展示了线性独立性如何保证凸锥的闭性。当向量不线性独立时,仍然可以证明 C 是闭的,但需要不同的论证方法。凸锥在优化理论中非常重要,特别是在研究可行域和对偶理论时。

练习2:强凸函数

这个练习探讨强凸性的概念,这是比严格凸性更强的一个性质。练习分为三个部分。

第一部分要求证明函数 x \mapsto \|x\|^2 是严格凸的。

第二部分引入强凸性的定义。函数 f: \mathcal{H} \to ]-\infty, +\infty] 称为模为 \beta \in ]0, +\infty[ 的强凸函数,如果存在一个凸函数 g: \mathcal{H} \to ]-\infty, +\infty] 使得

f = g + \frac{\beta}{2}\|\cdot\|^2

换句话说,强凸函数可以分解为一个凸函数加上一个严格凸的二次项。参数 \beta 称为强凸模数,它度量了函数的"强凸程度"。需要证明每个强凸函数都是严格凸的。

第三部分要求证明函数 f: \mathcal{H} \to ]-\infty, +\infty] 是模为 \beta \in ]0, +\infty[ 的强凸函数,当且仅当对于所有 (x, y) \in \mathcal{H}^2 和所有 \alpha \in ]0, 1[ ,有

f(\alpha x + (1 - \alpha)y) + \alpha(1 - \alpha)\frac{\beta}{2}\|x - y\|^2 \leq \alpha f(x) + (1 - \alpha)f(y)

这个不等式是强凸性的一个等价刻画,它在标准凸性不等式的左边添加了一个额外的正项 \alpha(1 - \alpha)\frac{\beta}{2}\|x - y\|^2

练习2的解答

第一部分的证明:

要证明 f(x) = \|x\|^2 严格凸,需要验证对于任意不同的点 x \neq y 和任意 \alpha \in ]0, 1[ ,严格不等式成立。对于函数 h ,引入记号

\Delta_h = h(\alpha x + (1 - \alpha)y) - (\alpha h(x) + (1 - \alpha)h(y))

这个量度量了凸性不等式的"松弛度"。对于范数的平方,计算这个差值。首先展开凸组合的范数平方:

\|\alpha x + (1 - \alpha)y\|^2 = \alpha^2\|x\|^2 + (1 - \alpha)^2\|y\|^2 + 2\alpha(1 - \alpha)\langle x | y \rangle

利用恒等式 \alpha^2 + (1 - \alpha)^2 = \alpha + (1 - \alpha) - 2\alpha(1 - \alpha) ,可以改写为:

= \alpha\|x\|^2 + (1 - \alpha)\|y\|^2 + \alpha(1 - \alpha)(2\langle x | y \rangle - \|x\|^2 - \|y\|^2)

因此

\Delta_{\|\cdot\|^2} = \alpha(1 - \alpha)(2\langle x | y \rangle - \|x\|^2 - \|y\|^2)

观察到

2\langle x | y \rangle - \|x\|^2 - \|y\|^2 = -(x - y, x - y) = -\|x - y\|^2

所以

\Delta_{\|\cdot\|^2} = -\alpha(1 - \alpha)\|x - y\|^2

x \neq y 时, \|x - y\|^2 > 0 ,而 \alpha(1 - \alpha) > 0 (因为 \alpha \in ]0, 1[ ),因此 \Delta_{\|\cdot\|^2} < 0 。这证明了 \|\cdot\|^2 是严格凸的。

第二部分的证明:

假设 f = g + \frac{\beta}{2}\|\cdot\|^2 ,其中 g 是凸函数, \beta > 0 。对于不同的点 x \neq y \alpha \in ]0, 1[ ,计算 \Delta_f

\Delta_f = \Delta_g + \frac{\beta}{2}\Delta_{\|\cdot\|^2}

由于 g 是凸的, \Delta_g \leq 0 。由第一部分的结果, \Delta_{\|\cdot\|^2} = -\alpha(1 - \alpha)\|x - y\|^2 < 0 (当 x \neq y 时)。因此

\Delta_f \leq 0 + \frac{\beta}{2}(-\alpha(1 - \alpha)\|x - y\|^2) < 0

这证明了 f 是严格凸的。

第三部分的证明:

需要证明 f 是模为 \beta 的强凸函数,当且仅当条件(*)成立。记 g 为某个凸函数,需要建立以下等价关系链。

首先, f 是模为 \beta 的强凸函数等价于存在凸函数 g 使得 f = g + \frac{\beta}{2}\|\cdot\|^2

这等价于 g = f - \frac{\beta}{2}\|\cdot\|^2 是凸函数。

g 是凸函数等价于 \Delta_g \leq 0

由第一部分的结果, \Delta_{\|\cdot\|^2} = -\alpha(1 - \alpha)\|x - y\|^2 ,因此

\Delta_g = \Delta_f - \frac{\beta}{2}\Delta_{\|\cdot\|^2} \leq 0

等价于

\Delta_f \leq \frac{\beta}{2}\Delta_{\|\cdot\|^2} = -\frac{\beta}{2}\alpha(1 - \alpha)\|x - y\|^2

这正是条件(*)。将不等式改写就得到练习中给出的形式。

这个等价刻画说明强凸性本质上是在凸性不等式中添加了一个二次下界,这个下界与点之间距离的平方成正比。

可微凸函数的刻画

现在我们转向讲座的第二个主要部分:可微凸函数的刻画。这部分内容将凸性与微分之间建立联系。

Gâteaux可微性

首先引入Gâteaux可微性的概念,这是一种方向导数的推广。

\mathcal{H} \mathcal{K} 是赋范空间, C \subset \mathcal{H} 是一个集合, x C 的一个内点, T: C \to \mathcal{K} 是一个映射。映射 T 在点 x 处称为Gâteaux可微的,如果存在 T'(x) \in \mathcal{B}(\mathcal{H}, \mathcal{K}) (从 \mathcal{H} \mathcal{K} 的有界线性算子)使得对于所有 y \in \mathcal{H} ,有

T'(x)y = \lim_{\substack{\alpha \to 0 \\ \alpha > 0}} \frac{T(x + \alpha y) - T(x)}{\alpha}

这个极限存在且等于 T'(x)y 。算子 T'(x) 称为 T 在点 x 处的Gâteaux导数,而 T'(x)y 称为 T 在点 x 沿方向 y 的Gâteaux微分。

Gâteaux导数是唯一定义的。如果 T x 处Gâteaux可微,那么对所有方向 y \in \mathcal{H} ,方向导数存在,并且可以通过线性算子 T'(x) 来表达:

(\forall y \in \mathcal{H}) \quad T'(x)y = \lim_{\substack{\alpha \to 0 \\ \alpha \neq 0}} \frac{T(x + \alpha y) - T(x)}{\alpha}

这里极限的形式稍有不同, \alpha 可以从两侧趋于0,而不仅仅是正侧。这是因为一旦Gâteaux导数存在,它必然是线性的,因此从正侧和负侧的极限必然相同。

Gâteaux可微性的双侧极限

我们来证明一个重要性质:如果 T x 处Gâteaux可微,那么方向导数的极限可以从双侧取得。

对于任意方向 y \in \mathcal{H} ,需要证明

\lim_{\substack{\alpha \to 0 \\ \alpha \neq 0}} \frac{T(x + \alpha y) - T(x)}{\alpha} = T'(x)y

即极限可以从 \alpha 的正负两侧同时趋于0。证明的思路是利用Gâteaux导数的线性性。

考虑从负侧趋近的情况。设 \alpha < 0 趋于0,那么 -\alpha > 0 。利用这个变换,可以将负侧的极限转化为正侧的极限:

\lim_{\substack{\alpha \to 0 \\ \alpha < 0}} \frac{T(x + \alpha y) - T(x)}{\alpha} = \lim_{\substack{\alpha \to 0 \\ \alpha > 0}} \frac{T(x - \alpha y) - T(x)}{-\alpha}

这等于

= -T'(x)(-y) = T'(x)y

第一个等式使用了Gâteaux导数在方向 -y 上的定义,第二个等式使用了 T'(x) 作为线性算子的性质。由于正侧和负侧的极限都等于 T'(x)y ,双侧极限存在且等于这个值。

梯度

当目标空间是实数域 \mathcal{K} = \mathbb{R} ,且定义域是希尔伯特空间 \mathcal{H} 时,Gâteaux可微性有一个特殊的表示。如果 T x 处Gâteaux可微,那么存在唯一的向量 \nabla T(x) \in \mathcal{H} ,称为 T x 处的梯度,使得对所有 y \in \mathcal{H}

T'(x)y = \langle \nabla T(x) | y \rangle

这个结果是Riesz表示定理的直接推论。Riesz表示定理指出,希尔伯特空间上的每个连续线性泛函都可以表示为与某个固定向量的内积。这里 T'(x) 是一个从 \mathcal{H} \mathbb{R} 的连续线性泛函,因此必然存在唯一的向量 \nabla T(x) 使得上述表示成立。

梯度 \nabla T(x) 的几何意义是函数在点 x 处增长最快的方向。沿着梯度方向,函数值的变化率最大。

Fréchet可微性

Gâteaux可微性只要求方向导数存在且可以通过线性算子表示,但它不保证函数在该点附近的良好逼近性质。Fréchet可微性是一个更强的概念,它要求导数能够在所有方向上一致地逼近函数。

Fréchet可微性的定义

\mathcal{H} \mathcal{K} 是赋范空间, x C \subset \mathcal{H} 的一个内点, T: C \to \mathcal{K} 是一个映射。映射 T 在点 x 处称为Fréchet可微的,如果存在 T'(x) \in \mathcal{B}(\mathcal{H}, \mathcal{K}) 使得

\lim_{\substack{y \to 0 \\ y \in \mathcal{H} \setminus \{0\}}} \frac{\|T(x + y) - T(x) - T'(x)y\|}{\|y\|} = 0

这个条件说明差值 T(x + y) - T(x) - T'(x)y y 的高阶无穷小,即 T(x) + T'(x)y T x 附近的一阶线性逼近。算子 T'(x) 称为 T x 处的Fréchet导数, T'(x)y 称为 T x 处关于增量 y 的Fréchet微分。

Fréchet可微性与Gâteaux可微性的区别在于:Gâteaux可微性只要求沿每个固定方向的导数存在,而Fréchet可微性要求导数能够一致地逼近所有方向的增量。

Fréchet可微性的性质

如果 T x 处Fréchet可微,那么它也在 x 处Gâteaux可微,且两种导数相等。这可以通过将Fréchet可微性的定义应用到特定方向来证明。

证明如下:假设 T x 处Fréchet可微。对于任意非零方向 y \in \mathcal{H} \setminus \{0\} ,考虑极限

\lim_{\substack{\alpha \to 0 \\ \alpha > 0}} \frac{\|T(x + \alpha y) - T(x) - T'(x)(\alpha y)\|}{\|\alpha y\|} = 0

这可以改写为

\lim_{\substack{\alpha \to 0 \\ \alpha > 0}} \frac{T(x + \alpha y) - T(x) - \alpha T'(x)y}{\alpha\|y\|} = 0

进一步等价于

\lim_{\substack{\alpha \to 0 \\ \alpha > 0}} \frac{T(x + \alpha y) - T(x)}{\alpha} = T'(x)y

这正是Gâteaux导数在方向 y 上的定义。因此Fréchet可微性蕴含Gâteaux可微性。

Fréchet导数是唯一定义的。这是因为如果两个线性算子 A B 都满足Fréchet可微性的定义,那么对于所有非零 y ,有

\frac{\|(A - B)y\|}{\|y\|} = \frac{\|T(x + y) - T(x) - Ay - (T(x + y) - T(x) - By)\|}{\|y\|} \to 0

这意味着 (A - B)y = 0 对所有 y 成立,因此 A = B

另一个重要性质是:如果 T x 处Fréchet可微,那么 T x 处连续。这可以从Fréchet可微性的定义直接得出,因为

\|T(x + y) - T(x)\| = \|T'(x)y + o(\|y\|)\| \leq \|T'(x)\|\|y\| + o(\|y\|)

y \to 0 时右边趋于0,因此 T 连续。这个性质说明Fréchet可微性是一个相当强的条件,它不仅保证了导数的存在,还保证了函数的连续性。相比之下,Gâteaux可微性不一定蕴含连续性。

Fréchet可微性蕴含连续性的证明

现在详细证明如果 T x 处Fréchet可微,那么 T x 处连续。证明的关键是利用Fréchet可微性的定义来估计 \|T(x + y) - T(x)\|

对于任意 y \in \mathcal{H} 使得 x + y \in C ,利用三角不等式分解差值:

\|T(x + y) - T(x)\| \leq \|T(x + y) - T(x) - T'(x)y\| + \|T'(x)y\|

第一项是Fréchet可微性定义中的余项,根据定义它是 \|y\| 的高阶无穷小,即

\|T(x + y) - T(x) - T'(x)y\| = o(\|y\|)

第二项可以用算子范数估计。由于 T'(x) \in \mathcal{B}(\mathcal{H}, \mathcal{K}) 是有界线性算子,有

\|T'(x)y\| \leq \|T'(x)\|\|y\|

综合两个估计:

\|T(x + y) - T(x)\| \leq o(\|y\|) + \|T'(x)\|\|y\|

y \to 0 时,右边的两项都趋于零(第一项是高阶无穷小,第二项是 \|y\| 的一阶项),因此 \|T(x + y) - T(x)\| \to 0 。这证明了 T x 处连续。

Fréchet可微性的例子

例1:多元向量值函数

C \subset \mathbb{R}^N 是一个集合, T: C \to \mathbb{R}^M 是一个映射,形式为 T: x = (x^{(i)})_{1 \leq i \leq N} \mapsto (T^{(j)}(x))_{1 \leq j \leq M} ,其中每个分量函数 T^{(j)}: C \to \mathbb{R} 。设 \bar{x} C 的一个内点。

如果对于每个 j \in \{1, \ldots, M\} ,函数 T^{(j)} \bar{x} 的某个邻域内承认连续的偏导数,那么 T \bar{x} 处Fréchet可微,且Fréchet导数 T'(\bar{x}) 由Jacobi矩阵给出:

(\forall y \in \mathbb{R}^N) \quad T'(\bar{x})y = \begin{bmatrix} \frac{\partial T_1}{\partial x_1}(\bar{x}) & \cdots & \frac{\partial T_1}{\partial x_N}(\bar{x}) \\ \vdots & & \vdots \\ \frac{\partial T_M}{\partial x_1}(\bar{x}) & \cdots & \frac{\partial T_M}{\partial x_N}(\bar{x}) \end{bmatrix} y

这个结果将多元微积分中的全微分概念推广到抽象的赋范空间设置。Jacobi矩阵的第 j 行包含第 j 个分量函数的所有偏导数。当所有这些偏导数在 \bar{x} 附近连续时,函数 T \bar{x} 处Fréchet可微,这是经典的全微分存在定理。

例2:有界线性算子

\mathcal{H} \mathcal{K} 是赋范空间, T \in \mathcal{B}(\mathcal{H}, \mathcal{K}) 是一个有界线性算子。那么 T \mathcal{H} 的每个点 x 处都是Fréchet可微的,且 T'(x) = T

证明非常直接。对于任意 y \in \mathcal{H} ,由于 T 是线性的,有

T(x + y) - T(x) - T(y) = 0

因此Fréchet可微性条件的分子恒为零。此外, T 作为有界线性算子本身就属于 \mathcal{B}(\mathcal{H}, \mathcal{K}) ,可以作为自己的导数。

这个例子说明线性映射是最简单的可微映射——它们在每个点的导数就是自身。这与一元微积分中常数函数的导数是常数,线性函数的导数是常数的情况类似。

例3:双线性函数

\mathcal{H} \mathcal{K} 是赋范空间, B: \mathcal{H}^2 \to \mathcal{K} 是一个双线性函数,满足有界性条件

\sup_{\substack{(x_1, x_2) \in \mathcal{H}^2 \\ x_1 \neq 0, x_2 \neq 0}} \frac{\|B(x_1, x_2)\|}{\|x_1\|\|x_2\|} = M_B \in \mathbb{R}

这个条件说明 B 是有界的:存在常数 M_B 使得对所有非零向量对,双线性函数的值不超过两个向量范数乘积的 M_B 倍。

定义映射 T: \mathcal{H} \to \mathcal{K}: x \mapsto B(x, x) 。那么 T \mathcal{H} 的每个点 x 处都是Fréchet可微的,且对所有 y \in \mathcal{H}

T'(x)y = B(x, y) + B(y, x)

这个导数公式与一元微积分中 (x^2)' = 2x 的形式类似,但这里由于双线性函数可能不对称,需要考虑两个项。

证明过程如下。首先验证 y \mapsto B(x, y) + B(y, x) 确实是一个有界线性算子。线性性来自于 B 在每个变量上的线性性。有界性可以通过估计范数得到:

\|B(x, y) + B(y, x)\| \leq \|B(x, y)\| + \|B(y, x)\| \leq 2M_B\|x\|\|y\|

这说明映射是有界的。

接下来验证Fréchet可微性条件。计算余项:

\|T(x + y) - T(x) - B(x, y) - B(y, x)\|

利用 T 的定义和双线性性展开:

= \|B(x + y, x + y) - B(x, x) - B(x, y) - B(y, x)\|

双线性函数 B(x + y, x + y) 可以展开为:

B(x + y, x + y) = B(x, x) + B(x, y) + B(y, x) + B(y, y)

因此余项简化为:

= \|B(y, y)\| \leq M_B\|y\|^2

这正是 \|y\| 的二阶项,因此

\lim_{\substack{y \to 0 \\ y \in \mathcal{H} \setminus \{0\}}} \frac{\|T(x + y) - T(x) - B(x, y) - B(y, x)\|}{\|y\|} = 0

这验证了Fréchet可微性条件。这个例子展示了二次型函数的可微性,其导数是相应的双线性形式的对称化(或者说两倍,如果 B 已经是对称的)。

二次Fréchet可微性

二次可微性的定义

\mathcal{H} 是一个希尔伯特空间, C \subset \mathcal{H} 是一个开集, T: C \to \mathbb{R} 是一个在 C 上Fréchet可微的函数。函数 T 在点 x \in C 处称为二次Fréchet可微的,如果存在 \nabla^2 T(x) \in \mathcal{B}(\mathcal{H}, \mathcal{H}) 使得

\lim_{\substack{y \to 0 \\ y \in \mathcal{H} \setminus \{0\}}} \frac{\|\nabla T(x + y) - \nabla T(x) - (\nabla^2 T(x))y\|}{\|y\|} = 0

这个定义说明梯度 \nabla T 本身在点 x 处Fréchet可微,且其导数是算子 \nabla^2 T(x) 。算子 \nabla^2 T(x) \in \mathcal{B}(\mathcal{H}, \mathcal{H}) 称为 T x 处的Hessian(或称海森算子)。

Hessian算子刻画了函数的二阶变化率,类似于一元函数的二阶导数。在多元微积分中,Hessian对应于二阶偏导数构成的矩阵。

二次可微性的性质

如果 T x 处二次Fréchet可微,那么对于所有 (y, z) \in \mathcal{H}^2 ,有一个关于二阶差分的极限公式:

\lim_{\substack{\alpha \to 0 \\ \alpha \neq 0}} \frac{T(x + \alpha(y + z)) - T(x + \alpha y) - T(x + \alpha z) + T(x)}{\alpha^2} = \langle z | (\nabla^2 T(x))y \rangle

这个公式将二阶混合差分与Hessian的双线性形式联系起来。左边是关于 y z 方向的二阶混合差商,右边通过内积表示了Hessian作用的结果。

另一个重要性质是Hessian的对称性。如果 T x 处二次Fréchet可微,那么它在 x 处的Hessian是自伴随算子。即对于所有 y, z \in \mathcal{H} ,有

\langle (\nabla^2 T(x))y | z \rangle = \langle y | (\nabla^2 T(x))z \rangle

这个对称性对应于经典微积分中混合偏导数相等的Schwarz定理。自伴随性保证了Hessian的双线性形式是对称的,这在优化理论中具有重要意义。

Taylor-Young公式

\mathcal{H} 是希尔伯特空间, C \subset \mathcal{H} 是开集, x \in C h \in \mathcal{H} 使得 x + h \in C 。假设 T: C \to \mathbb{R} C 上Fréchet可微,且在 x 处二次Fréchet可微。那么

T(x + h) = T(x) + \langle \nabla T(x) | h \rangle + \frac{1}{2}\langle h | (\nabla^2 T(x))h \rangle + \|h\|^2\epsilon(h)

其中 \epsilon: \mathcal{H} \to \mathbb{K} 是一个函数,满足 \epsilon(h) \to 0 h \to 0

这是Taylor展开公式在抽象希尔伯特空间中的推广。前三项分别对应于零阶、一阶和二阶近似。第一项 T(x) 是函数在 x 处的值,第二项 \langle \nabla T(x) | h \rangle 是线性近似(由梯度给出),第三项 \frac{1}{2}\langle h | (\nabla^2 T(x))h \rangle 是二次近似(由Hessian给出)。余项 \|h\|^2\epsilon(h) 是高于二阶的无穷小。

Taylor-McLaurin公式

\mathcal{H} 是希尔伯特空间, C \subset \mathcal{H} 是开集, T: C \to \mathbb{R} 。假设 T C 上Fréchet可微, \nabla T 在闭区间 [x, x + h] \subset C 上连续,且 T 在开区间 ]x, x + h[ 上二次Fréchet可微。那么存在 \alpha \in ]0, 1[ 使得

T(x + h) = T(x) + \langle \nabla T(x) | h \rangle + \frac{1}{2}\langle h | (\nabla^2 T(x + \alpha h))h \rangle

这个公式与Taylor-Young公式的区别在于,二次项中的Hessian不是在点 x 处计算,而是在 x x + h 之间的某个中间点 x + \alpha h 处计算。这类似于一元微积分中的中值定理。这个形式在某些情况下更便于应用,因为它给出了余项的精确表达式而非渐近估计。

可微凸函数的刻画

现在我们来到本讲的核心定理之一:可微凸函数的一阶充要条件。

一阶充要条件定理

f: \mathcal{H} \to ]-\infty, +\infty] 是一个函数,在其定义域 \text{dom } f (假设是非空开凸集)上Gâteaux可微。那么 f 是凸函数,当且仅当对于所有 (x, y) \in (\text{dom } f)^2 ,有

f(y) \geq f(x) + \langle \nabla f(x) | y - x \rangle

这个不等式具有深刻的几何和分析意义。右边 f(x) + \langle \nabla f(x) | y - x \rangle 表示过点 (x, f(x)) 的切超平面在点 y 处的高度。不等式说明对于凸函数,函数图像总是位于其任何一点的切超平面的上方或与之重合。换句话说,凸函数的每个切超平面都是函数的一个全局下估计。

这个刻画将凸性的全局性质(定义要求对所有点对和所有比例参数验证不等式)转化为局部可微性质(只需在每个点验证梯度给出的线性下估计)。这大大简化了验证凸性的工作,同时也为优化算法提供了理论基础。

一阶充要条件定理的证明

现在我们来详细证明可微凸函数的一阶刻画定理。证明分为两个方向。

第一个方向(充分性):假设 f 是凸函数,证明梯度不等式成立。

f 是凸函数, x \in \text{dom } f 。对于任意 \alpha \in ]0, 1[ y \in \mathcal{H} ,由于定义域是凸的,点 x + \alpha(y - x) = (1 - \alpha)x + \alpha y 也在定义域内。应用凸性不等式:

f(x + \alpha(y - x)) \leq (1 - \alpha)f(x) + \alpha f(y)

重新整理这个不等式,将所有含 f(x) 的项移到左边:

f(x + \alpha(y - x)) - (1 - \alpha)f(x) \leq \alpha f(y)

左边可以改写为:

f(x + \alpha(y - x)) - f(x) + \alpha f(x) \leq \alpha f(y)

两边同时除以 \alpha > 0

\frac{f(x + \alpha(y - x)) - f(x)}{\alpha} \leq f(y) - f(x)

现在考虑当 \alpha \to 0^+ 时的极限。左边恰好是Gâteaux导数的定义,因此:

\langle \nabla f(x) | y - x \rangle = \lim_{\substack{\alpha \to 0 \\ \alpha > 0}} \frac{f(x + \alpha(y - x)) - f(x)}{\alpha} \leq f(y) - f(x)

重新整理得到:

f(y) \geq f(x) + \langle \nabla f(x) | y - x \rangle

这正是我们要证明的梯度不等式。

第二个方向(必要性):假设梯度不等式成立,证明 f 是凸函数。

反过来,假设对于所有 (x, y) \in (\text{dom } f)^2 ,梯度不等式成立。现在需要证明 f 是凸的,即对于任意 (x, y) \in (\text{dom } f)^2 \alpha \in ]0, 1[ ,有 f(\alpha x + (1 - \alpha)y) \leq \alpha f(x) + (1 - \alpha)f(y)

z = \alpha x + (1 - \alpha)y 。由于定义域是凸集, z \in \text{dom } f 。分别对 x y 应用梯度不等式:

在点 z 处对 x 应用梯度不等式:

f(x) \geq f(\alpha x + (1 - \alpha)y) + \langle \nabla f(\alpha x + (1 - \alpha)y) | x - (\alpha x + (1 - \alpha)y) \rangle

注意到 x - (\alpha x + (1 - \alpha)y) = x - \alpha x - (1 - \alpha)y = (1 - \alpha)(x - y) ,因此:

f(x) \geq f(\alpha x + (1 - \alpha)y) + (1 - \alpha)\langle \nabla f(\alpha x + (1 - \alpha)y) | x - y \rangle

类似地,在点 z 处对 y 应用梯度不等式:

f(y) \geq f(\alpha x + (1 - \alpha)y) + \langle \nabla f(\alpha x + (1 - \alpha)y) | y - (\alpha x + (1 - \alpha)y) \rangle

注意到 y - (\alpha x + (1 - \alpha)y) = y - \alpha x - (1 - \alpha)y = \alpha(y - x) ,因此:

f(y) \geq f(\alpha x + (1 - \alpha)y) + \alpha\langle \nabla f(\alpha x + (1 - \alpha)y) | y - x \rangle

现在将第一个不等式两边乘以 \alpha ,第二个不等式两边乘以 (1 - \alpha) ,然后相加:

\alpha f(x) + (1 - \alpha)f(y) \geq \alpha f(\alpha x + (1 - \alpha)y) + \alpha(1 - \alpha)\langle \nabla f(\alpha x + (1 - \alpha)y) | x - y \rangle
+ (1 - \alpha)f(\alpha x + (1 - \alpha)y) + \alpha(1 - \alpha)\langle \nabla f(\alpha x + (1 - \alpha)y) | y - x \rangle

观察到交叉项相互抵消,因为 \langle \nabla f(\alpha x + (1 - \alpha)y) | x - y \rangle \langle \nabla f(\alpha x + (1 - \alpha)y) | y - x \rangle 符号相反。合并同类项:

\alpha f(x) + (1 - \alpha)f(y) \geq f(\alpha x + (1 - \alpha)y)

这正是凸性的定义。因此梯度不等式蕴含凸性。

严格凸函数的一阶刻画

严格凸函数的梯度不等式

对于严格凸函数,有一个类似但更强的刻画。设 f: \mathcal{H} \to ]-\infty, +\infty] 在其定义域 \text{dom } f (假设是非空开凸集)上Gâteaux可微。那么 f 是严格凸函数,当且仅当对于所有 (\text{dom } f)^2 中满足 x \neq y 的点对 (x, y) ,严格不等式成立:

f(y) > f(x) + \langle \nabla f(x) | y - x \rangle

这个刻画说明对于严格凸函数,任何切超平面都是函数的严格下估计(除了切点本身)。

证明充分性:假设 f 是严格凸的,证明严格梯度不等式成立。

f 是严格凸的, (x, y) \in \text{dom } f x \neq y 。对于 \alpha \in ]0, 1[ ,设 z = \alpha x + (1 - \alpha)y 。由严格凸性:

f(z) < \alpha f(x) + (1 - \alpha)f(y)

由于 f 是凸的(严格凸性蕴含凸性),我们已经知道梯度不等式成立。在点 z 应用对 x 的梯度不等式:

f(x) \geq f(z) + \langle \nabla f(z) | x - z \rangle = f(z) + (1 - \alpha)\langle \nabla f(z) | x - y \rangle

改写为:

f(\alpha x + (1 - \alpha)y) \geq f(x) + (1 - \alpha)\langle \nabla f(x) | y - x \rangle

利用严格凸性不等式 \alpha f(x) + (1 - \alpha)f(y) > f(\alpha x + (1 - \alpha)y)

\alpha f(x) + (1 - \alpha)f(y) > f(x) + (1 - \alpha)\langle \nabla f(x) | y - x \rangle

化简得到:

f(y) > f(x) + \langle \nabla f(x) | y - x \rangle

证明必要性:假设严格梯度不等式成立,证明 f 是严格凸的。

假设对所有 x \neq y ,严格梯度不等式成立。对于 (x, y) \in (\text{dom } f)^2 满足 x \neq y ,以及 \alpha \in ]0, 1[ ,我们需要证明严格不等式 f(\alpha x + (1 - \alpha)y) < \alpha f(x) + (1 - \alpha)f(y)

z = \alpha x + (1 - \alpha)y 。注意 z \neq x z \neq y (因为 x \neq y \alpha \in ]0, 1[ )。应用严格梯度不等式:

f(x) > f(\alpha x + (1 - \alpha)y) + (1 - \alpha)\langle \nabla f(\alpha x + (1 - \alpha)y) | x - y \rangle
f(y) > f(\alpha x + (1 - \alpha)y) + \alpha\langle \nabla f(\alpha x + (1 - \alpha)y) | y - x \rangle

将第一个不等式乘以 \alpha ,第二个乘以 (1 - \alpha) 并相加,交叉项抵消后得到严格不等式:

\alpha f(x) + (1 - \alpha)f(y) > f(\alpha x + (1 - \alpha)y)

这证明了 f 是严格凸的。

梯度的单调性

梯度单调性的等价刻画

可微凸函数还有另一个重要的等价刻画,通过梯度的单调性来表达。设 f: \mathcal{H} \to ]-\infty, +\infty] 在其定义域 \text{dom } f (假设是非空开凸集)上Gâteaux可微。那么 f 是凸函数,当且仅当梯度 \nabla f 在定义域上是单调的,即对于所有 (x, y) \in (\text{dom } f)^2 ,有

\langle \nabla f(y) - \nabla f(x) | y - x \rangle \geq 0

这个条件说明梯度向量场的变化方向与空间位置的变化方向之间的夹角不超过90度。几何上,这意味着梯度向量场是"指向外"的,不会向内折叠。

这个刻画的证明可以通过梯度不等式直接得到。在点 x 和点 y 分别应用梯度不等式并相加即可。

梯度单调性的证明

现在我们来详细证明梯度单调性等价于凸性这个重要结果。

充分性证明:假设 f 是凸函数,证明梯度单调。

假设 f 是凸函数。对于任意两点 (x, y) \in (\text{dom } f)^2 ,根据前面证明的梯度不等式,我们可以在两个点分别应用这个不等式。

在点 y 处对 x 应用梯度不等式:

f(x) - f(y) \geq \langle \nabla f(y) | x - y \rangle

在点 x 处对 y 应用梯度不等式:

f(y) - f(x) \geq \langle \nabla f(x) | y - x \rangle

将这两个不等式相加:

(f(x) - f(y)) + (f(y) - f(x)) \geq \langle \nabla f(y) | x - y \rangle + \langle \nabla f(x) | y - x \rangle

左边的两项相互抵消,得到0。右边利用内积的线性性,可以改写为:

0 \geq \langle \nabla f(y) | x - y \rangle + \langle \nabla f(x) | y - x \rangle = \langle \nabla f(y) - \nabla f(x) | x - y \rangle

将不等号两边都取相反数:

\langle \nabla f(y) - \nabla f(x) | y - x \rangle \geq 0

这正是梯度单调性的定义。

必要性证明:假设梯度单调,证明 f 是凸函数。

反过来,假设梯度 \nabla f 在定义域上单调。对于任意 (x, y) \in (\text{dom } f)^2 ,定义辅助函数 \varphi: [0, 1] \to \mathbb{R}

\varphi(\alpha) = f(x + \alpha(y - x))

这个函数描述了从 x y 的线段上函数值的变化。函数 \varphi [0, 1] 上连续,在 ]0, 1[ 上可微,且其导数为:

(\forall \alpha \in ]0, 1[) \quad \varphi'(\alpha) = \langle \nabla f(x + \alpha(y - x)) | y - x \rangle

根据微积分基本定理的中值形式(mean value theorem),存在 \alpha \in ]0, 1[ 使得:

\varphi(1) - \varphi(0) = \varphi'(\alpha)

f(y) - f(x) = \langle \nabla f(x + \alpha(y - x)) | y - x \rangle

另一方面,由于 x + \alpha(y - x) \in \text{dom } f (定义域是凸的),应用梯度单调性:

\langle \nabla f(x + \alpha(y - x)) - \nabla f(x) | (x + \alpha(y - x)) - x \rangle \geq 0

\langle \nabla f(x + \alpha(y - x)) - \nabla f(x) | \alpha(y - x) \rangle \geq 0

由于 \alpha > 0 ,这等价于:

\langle \nabla f(x + \alpha(y - x)) - \nabla f(x) | y - x \rangle \geq 0

因此

\langle \nabla f(x + \alpha(y - x)) | y - x \rangle \geq \langle \nabla f(x) | y - x \rangle

结合之前的等式:

f(y) - f(x) = \langle \nabla f(x + \alpha(y - x)) | y - x \rangle \geq \langle \nabla f(x) | y - x \rangle

整理得到:

f(y) \geq f(x) + \langle \nabla f(x) | y - x \rangle

这正是梯度不等式,根据前面的结果,它等价于凸性。

严格可微凸函数的梯度单调性刻画

对于严格凸函数,梯度单调性有一个相应的严格版本。设 f: \mathcal{H} \to ]-\infty, +\infty] 在其定义域 \text{dom } f (假设是非空开凸集)上Gâteaux可微。那么 f 是严格凸函数,当且仅当梯度 \nabla f 在定义域上严格单调,即对于所有 (\text{dom } f)^2 中满足 x \neq y 的点对 (x, y) ,严格不等式成立:

\langle \nabla f(y) - \nabla f(x) | y - x \rangle > 0

这个条件比普通的单调性更强,它要求梯度差与位置差的内积严格为正(当两点不同时)。这意味着梯度向量场的变化必须严格指向外部,不能有平行移动的部分。严格单调性排除了线性函数这类退化情况,因为线性函数的梯度是常数,不满足严格单调性。

二次可微凸函数的二阶刻画

对于二次可微的函数,凸性可以通过Hessian的正定性来刻画。

二阶充要条件定理

\mathcal{H} 是希尔伯特空间, f: \mathcal{H} \to ]-\infty, +\infty] 是一个在其定义域 \text{dom } f (假设是非空开凸集)上二次Fréchet可微的函数。那么 f 是凸函数,当且仅当对于每个 x \in \text{dom } f ,Hessian \nabla^2 f(x) 是半正定的,即对所有 z \in \mathcal{H} ,有

\langle z | \nabla^2 f(x)z \rangle \geq 0

这个条件说明Hessian诱导的二次型非负。几何上,这意味着函数在每个点的局部曲率都是向上的(或平坦的,但不向下弯曲)。

进一步,如果对于每个 x \in \text{dom } f 和每个非零向量 z \in \mathcal{H} \setminus \{0\} ,严格不等式成立:

\langle z | \nabla^2 f(x)z \rangle > 0

那么 f 是严格凸函数。这个条件说明Hessian是正定的(而非仅仅半正定),函数的曲率处处严格向上。

二阶充要条件的证明

充分性证明:假设Hessian半正定,证明 f 是凸函数。

(x, y) \in (\text{dom } f)^2 x \neq y 。根据Taylor-McLaurin公式,存在 u 在线段 ]x, y[ 上使得:

f(y) = f(x) + \langle \nabla f(x) | y - x \rangle + \frac{1}{2}\langle y - x | \nabla^2 f(u)(y - x) \rangle

由于Hessian半正定,二次项非负:

\langle y - x | \nabla^2 f(u)(y - x) \rangle \geq 0

因此

f(y) \geq f(x) + \langle \nabla f(x) | y - x \rangle

这正是梯度不等式,根据一阶刻画定理, f 是凸函数。

对于严格凸性的证明类似。如果Hessian处处正定,那么对于 y \neq x ,有 y - x \neq 0 ,因此:

\langle y - x | \nabla^2 f(u)(y - x) \rangle > 0

这导致严格梯度不等式,进而得到严格凸性。

必要性证明:假设 f 是凸函数,证明Hessian半正定。

反过来,假设 f 是凸函数。由于定义域是开集,对于任意 x \in \text{dom } f z \in \mathcal{H} ,存在 \delta \in ]0, +\infty[ 使得对所有 \alpha \in [0, \delta] ,都有 x + \alpha z \in \text{dom } f

由梯度单调性,对于任意 \alpha \in ]0, \delta[ ,有:

\langle \nabla f(x + \alpha z) - \nabla f(x) | \alpha z \rangle \geq 0

由于 \alpha > 0 ,可以简化为:

\langle \nabla f(x + \alpha z) - \nabla f(x) | z \rangle \geq 0

改写为:

\alpha^{-1}\langle \nabla f(x + \alpha z) - \nabla f(x) | z \rangle \geq 0

现在让 \alpha \to 0 。根据二次可微性的定义,左边的极限恰好是:

\lim_{\alpha \to 0} \alpha^{-1}\langle \nabla f(x + \alpha z) - \nabla f(x) | z \rangle = \langle \nabla^2 f(x)z | z \rangle

由于不等式在整个过程中保持,取极限后得到:

\langle z | \nabla^2 f(x)z \rangle \geq 0

这证明了Hessian的半正定性。这个证明的关键在于利用了梯度单调性(它等价于凸性)以及二次可微性的定义,通过取极限将一阶的单调性条件转化为二阶的正定性条件。

Fenchel-Legendre共轭的定义与性质

基本定义

\mathcal{H} 是一个Hilbert空间,函数 f: \mathcal{H} \to [-\infty, +\infty] 。函数 f 的Fenchel-Legendre共轭定义为函数 f^*: \mathcal{H} \to [-\infty, +\infty] ,满足

(\forall u \in \mathcal{H}) \quad f^*(u) = \sup_{x \in \text{dom } f} \left( \langle x | u \rangle - f(x) \right)

这个定义的核心思想是:对于空间中的每个元素 u ,我们考察所有可能的 x (在 f 的定义域内),计算内积 \langle x | u \rangle 与函数值 f(x) 的差值,然后取这个差值的上确界。从几何角度理解, \langle x | u \rangle 可以看作是一个关于 x 的线性函数,而 f^*(u) 衡量的是这个线性函数相对于 f(x) 能够达到的最大"超出程度"。

图中展示了这一几何意义:蓝色曲线代表原函数 f(x) ,红色直线 \langle x | u \rangle 表示由 u 确定的线性函数。对于固定的 u ,当我们在不同的 x 处考察 \langle x | u \rangle - f(x) 时,实际上是在测量直线与曲线之间的垂直距离。 -f^*(u) 对应的是使得直线 \langle x | u \rangle - f^*(u) 成为 f(x) 的支撑函数的位置,也就是说,这条直线在所有点处都不高于 f(x) ,并且至少在一点处与 f(x) 相切或相接。

共轭函数的基本性质

定义域的非空性

共轭函数 f^* 的取值与原函数 f 的定义域有密切关系。具体来说, \text{dom } f \neq \varnothing 当且仅当对所有 u \in \mathcal{H} 都有 f^*(u) \neq -\infty

这个结论的证明采用反证法。假设存在某个 u \in \mathcal{H} 使得 f^*(u) = -\infty ,根据定义这意味着

\sup_{x \in \text{dom } f} \left( \langle x | u \rangle - f(x) \right) = -\infty

上确界为 -\infty 只能发生在求上确界的集合本身为空集的情况下,因为如果集合非空,即使只有一个元素,上确界也至多是某个有限值或 +\infty ,不可能是 -\infty 。因此 \text{dom } f = \varnothing 。反过来,如果 \text{dom } f = \varnothing ,则对任意 u ,我们在空集上求上确界,自然得到 f^*(u) = -\infty

原函数取值为负无穷的情形

如果存在某个点 x \in \mathcal{H} 使得 f(x) = -\infty ,那么对所有 u \in \mathcal{H} 都有 f^*(u) = +\infty

这是因为当 f(x) = -\infty 时,对任意 u ,表达式 \langle x | u \rangle - f(x) = \langle x | u \rangle - (-\infty) = +\infty 。由于我们对所有 x \in \text{dom } f 求上确界,而其中包含了一个能让表达式达到 +\infty 的点,因此 f^*(u) = +\infty 。这说明原函数在某点取 -\infty 会导致共轭函数在整个空间上都"爆炸"到 +\infty

典型例子

二次范数函数的自共轭性

考虑函数 f = \frac{1}{2}\|\cdot\|^2 ,则其共轭函数 f^* = \frac{1}{2}\|\cdot\|^2

对于任意 (x, u) \in \mathcal{H}^2 ,我们需要最大化表达式 \langle x | u \rangle - \frac{1}{2}\|x\|^2 。通过配方可以将这个表达式改写为

\langle x | u \rangle - \frac{1}{2}\|x\|^2 = \frac{1}{2}\|u\|^2 - \frac{1}{2}\|u - x\|^2

右边的表达式中, \frac{1}{2}\|u\|^2 是常数(相对于 x 而言),而 -\frac{1}{2}\|u - x\|^2 是一个关于 x 的非正函数,当 x = u 时达到最大值0。因此整个表达式在 x = u 处取得最大值 \frac{1}{2}\|u\|^2 。这直接给出 f^*(u) = \frac{1}{2}\|u\|^2 ,表明二次范数函数是自共轭的。

幂函数的共轭关系

对于定义在 \mathbb{R} 上的函数 f(x) = \frac{1}{q}|x|^q ,其中 q \in ]1, +\infty[ ,其共轭函数为

(\forall u \in \mathbb{R}) \quad f^*(u) = \frac{1}{q^*}|u|^{q^*}

其中 q^* 满足共轭指数关系 \frac{1}{q} + \frac{1}{q^*} = 1

这个例子展示了幂函数之间的对偶关系。当 q > 1 时,共轭指数 q^* = \frac{q}{q-1} 也大于1,并且 q q^* 通过调和关系相互确定。这种共轭关系在分析中具有深刻的理论意义,特别是在Lebesgue空间的对偶理论中, L^p 空间和 L^{p'} 空间(其中 \frac{1}{p} + \frac{1}{p'} = 1 )构成对偶对,而这里的共轭函数关系正是这种对偶性在函数层面的体现。

幂函数共轭的详细推导

继续前面关于 f(x) = \frac{1}{q}|x|^q (其中 q \in ]1, +\infty[ )的共轭函数计算。首先需要找到使 \langle x|u\rangle - f(x) 达到最大值的点 \hat{x}_u

对于给定的 u \geq 0 ,我们需要求解 \hat{x}_u = \text{argmax}(\langle x|u\rangle - f(x)) 。由于函数的对称性,可以验证 f^*(-u) = f^*(u) \hat{x}_{-u} = -\hat{x}_u ,这表明我们只需考虑 u \geq 0 的情况。

u \geq 0 x \geq 0 时,对表达式 xu - \frac{1}{q}x^q 关于 x 求导得到一阶条件

\frac{\partial}{\partial x}\left(xu - \frac{1}{q}x^q\right) = u - x^{q-1}

令一阶导数为零,得到临界点 x = u^{\frac{1}{q-1}} 。通过计算二阶导数可以确认这是最大值点,因为二阶导数 -\frac{q-1}{q}x^{q-2} x > 0 时为负。因此

\hat{x}_u = u^{\frac{1}{q-1}}

\hat{x}_u 代入共轭函数的定义式中计算

f^*(u) = uu^{\frac{1}{q-1}} - \frac{1}{q}u^{\frac{q}{q-1}} = u \cdot u^{\frac{1}{q-1}} - \frac{1}{q}u^{\frac{q}{q-1}}

化简上式。注意到 u \cdot u^{\frac{1}{q-1}} = u^{1 + \frac{1}{q-1}} = u^{\frac{q}{q-1}} ,因此

f^*(u) = u^{\frac{q}{q-1}} - \frac{1}{q}u^{\frac{q}{q-1}} = \left(1 - \frac{1}{q}\right)u^{\frac{q}{q-1}} = \frac{q-1}{q}u^{\frac{q}{q-1}}

定义共轭指数 q^* 满足 \frac{1}{q} + \frac{1}{q^*} = 1 ,即 q^* = \frac{q}{q-1} 。同时注意到 \frac{q-1}{q} = \frac{1}{q^*} ,最终得到

f^*(u) = \frac{1}{q^*}|u|^{q^*}

共轭函数的运算性质

偶函数的共轭仍为偶函数

如果原函数 f 是偶函数,即 f(-x) = f(x) 对所有 x 成立,则其共轭函数 f^* 也是偶函数。证明过程从定义出发:对任意 u \in \mathcal{H}

f^*(-u) = \sup_{x \in \mathcal{H}} (\langle x | -u \rangle - f(x)) = \sup_{x \in \mathcal{H}} (\langle -x | -u \rangle - f(-x))

第二个等号利用了内积的线性性将 x 替换为 -x 。由于 f 是偶函数, f(-x) = f(x) ,而 \langle -x | -u \rangle = \langle x | u \rangle ,因此

f^*(-u) = \sup_{x \in \mathcal{H}} (\langle x | u \rangle - f(x)) = f^*(u)

正标量乘法的性质

对于任意 \alpha > 0 ,函数 \alpha f 的共轭满足 (\alpha f)^* = \alpha f^*(\cdot/\alpha) 。从定义开始推导:

(\alpha f)^*(u) = \sup_{x \in \mathcal{H}} (\langle x|u\rangle - \alpha f(x))

提取常数 \alpha ,将内部表达式改写为

(\alpha f)^*(u) = \alpha \sup_{x \in \mathcal{H}} \left(\left\langle x\left|\frac{u}{\alpha}\right.\right\rangle - f(x)\right)

注意到右边上确界内的表达式正是 f^* 在点 u/\alpha 处的定义,因此

(\alpha f)^*(u) = \alpha f^*\left(\frac{u}{\alpha}\right)

这个性质说明对函数进行正标量缩放时,共轭函数也会相应地在定义域和值域上进行缩放变换。

平移和仿射变换的性质

对于任意 (y, v) \in \mathcal{H}^2 \alpha \in \mathbb{R} ,函数 f(\cdot - y) + \langle \cdot | v \rangle + \alpha 的共轭为

(f(\cdot - y) + \langle \cdot|v\rangle + \alpha)^* = f^*(\cdot - v) + \langle y | \cdot - v \rangle - \alpha

左边的函数表示对 f 进行了三种操作:空间平移( y )、添加线性项( v )和常数偏移( \alpha )。推导过程如下:

(f(\cdot - y) + \langle \cdot|v\rangle + \alpha)^*(u) = \sup_{x \in \mathcal{H}} (\langle x|u\rangle - (f(x-y) + \langle x|v\rangle + \alpha))

重新整理括号内的表达式

= \sup_{x \in \mathcal{H}} (\langle x|u\rangle - f(x-y) - \langle x|v\rangle - \alpha) = \sup_{x \in \mathcal{H}} (\langle x|u-v\rangle - f(x-y)) - \alpha

通过变量替换 x' = x - y ,注意到 x = x' + y ,上确界变为

= \sup_{x \in \mathcal{H}} (\langle x + y|u-v\rangle - f(x)) - \alpha

利用内积的线性性展开 \langle x + y|u-v\rangle = \langle x|u-v\rangle + \langle y|u-v\rangle ,得到

= \sup_{x \in \mathcal{H}} (\langle x|u-v\rangle - f(x)) + \langle y|u-v\rangle - \alpha = f^*(u-v) + \langle y|u-v\rangle - \alpha

这个结果显示,在原函数上进行仿射变换后,共轭函数的变换规则具有对偶的结构。

复合线性算子的性质

\mathcal{G} 是另一个Hilbert空间, L \in \mathcal{B}(\mathcal{G}, \mathcal{H}) 是从 \mathcal{G} \mathcal{H} 的有界线性同构映射。复合函数 f \circ L 的共轭满足

(f \circ L)^* = f^* \circ (L^{-1})^*

这里 (L^{-1})^* 表示 L^{-1} 的伴随算子。推导从定义开始:

(f \circ L)^*(u) = \sup_{x \in \mathcal{G}} (\langle x|u\rangle - f(Lx))

通过变量替换 y = Lx ,即 x = L^{-1}y ,上确界转换为在 y \in \mathcal{H} 上求取

= \sup_{y \in \mathcal{H}} (\langle L^{-1}y|u\rangle - f(y))

根据伴随算子的定义, \langle L^{-1}y|u\rangle = \langle y|(L^{-1})^*u\rangle ,因此

= \sup_{y \in \mathcal{H}} (\langle y|(L^{-1})^*u\rangle - f(y)) = f^*((L^{-1})^*u)

这个性质表明,当原函数通过线性算子复合时,共轭函数通过对应的逆伴随算子复合。

共轭函数的凸性和下半连续性

共轭函数 f^* 具有两个基本的拓扑和几何性质:它总是下半连续的和凸的,无论原函数 f 是否具有这些性质。

将共轭函数表示为一族函数的上确界。定义辅助函数 h_x(u) = \langle x|u\rangle - f(x) ,对于每个固定的 x \in \mathcal{H} h_x 是关于 u 的函数。则共轭函数可以写成

f^*(u) = \sup_{x \in \mathcal{H}} (\langle x|u\rangle - f(x)) = \sup_{x \in \mathcal{H}} h_x(u)

关键观察是:对于每个固定的 x ,函数 h_x(u) = \langle x|u\rangle - f(x) u 的仿射函数(实际上是线性函数加上常数 -f(x) )。仿射函数既是凸的又是连续的(因此下半连续)。

凸分析中的一个基本结果是:任意多个凸函数(即使无穷多个)的逐点上确界仍然是凸函数;任意多个下半连续函数的逐点上确界仍然是下半连续函数。因此 f^* = \sup_{x \in \mathcal{H}} h_x 作为下半连续凸函数族的上确界,必然是下半连续和凸的。

共轭函数在零点的取值

共轭函数在零点的取值与原函数的下确界有直接关系:

f^*(0) = -\inf f

这个等式从定义直接得出。当 u = 0

f^*(0) = \sup_{x \in \mathcal{H}} (\langle x|0\rangle - f(x)) = \sup_{x \in \mathcal{H}} (0 - f(x)) = \sup_{x \in \mathcal{H}} (-f(x)) = -\inf_{x \in \mathcal{H}} f(x)

这个关系说明,共轭函数在原点的值编码了原函数的全局最小值信息。如果原函数在某点达到有限最小值,则 f^*(0) 是该最小值的相反数;如果原函数无下界,则 f^*(0) = +\infty

Fenchel-Young不等式

对于真函数 f: \mathcal{H} \to ]-\infty, +\infty] (这里"真"的含义是函数不恒为 +\infty 且不在定义域内取 -\infty ),Fenchel-Young不等式给出了原函数值、共轭函数值和内积之间的基本关系。该不等式断言:对于任意 (x, u) \in \mathcal{H}^2 ,都有

f(x) + f^*(u) \geq \langle x | u \rangle

这个不等式的证明直接来自共轭函数的定义。由定义可知,对于任意 u \in \mathcal{H} 和任意 x \in \mathcal{H} ,共轭函数满足

(\forall u \in \mathcal{H})(\forall x \in \mathcal{H}) \quad f^*(u) \geq \langle x | u \rangle - f(x)

这是因为 f^*(u) 被定义为 \langle x | u \rangle - f(x) 对所有 x 的上确界,而上确界必然大于等于该表达式在任何特定 x 处的值。将上述不等式重新整理,将 f(x) 移到不等式左边,立即得到Fenchel-Young不等式。

Fenchel-Young不等式在凸分析中具有核心地位,它可以被理解为Young不等式在更一般函数空间中的推广。这个不等式建立了一个点的函数值与另一个点的共轭函数值之间的约束关系,这种约束在优化理论和变分分析中有广泛应用。

双共轭函数

引入双共轭函数的概念: f^{**} = (f^*)^* ,即对共轭函数 f^* 再次取共轭。双共轭函数揭示了原函数与其凸包络之间的深刻联系。

首先,双共轭函数总是不大于原函数,即 f^{**} \leq f 。这个结果可以从Fenchel-Young不等式直接推出。考虑原函数值 f(x) 在某点 x 处不是 -\infty 的情形(否则不等式平凡成立)。根据Fenchel-Young不等式,对任意 u \in \mathcal{H} 都有

(\forall x \in \mathcal{H}) \quad (\forall u \in \mathcal{H}) \quad \langle x | u \rangle - f^*(u) \leq f(x)

这个不等式对所有 u 都成立,因此我们可以对左边关于 u 取上确界,而不等式依然保持

\Rightarrow f^{**}(x) = \sup_{u \in \mathcal{H}} (\langle x | u \rangle - f^*(u)) \leq f(x)

这表明双共轭函数是原函数的一个下逼近。特别地,如果原函数的定义域中存在某点使得 f(x) = -\infty ,则由之前讨论的性质可知 f^* = +\infty ,进而 f^{**} = -\infty ,不等式 f^{**} \leq f 依然成立。因此我们可以假设 f 是真函数来进行讨论,这不会失去一般性。

共轭运算的单调性

共轭运算具有保序性,但方向相反。如果两个函数 f, g: \mathcal{H} \to [-\infty, +\infty] 满足逐点不等式 f \leq g (即对所有 x \in \mathcal{H} 都有 f(x) \leq g(x) ),则它们的共轭函数满足反向不等式 f^* \geq g^* ,并且双共轭也满足 f^{**} \leq g^{**}

共轭函数的单调性证明如下。对于任意 u

f^*(u) = \sup_{x \in \mathcal{H}} (\langle x|u\rangle - f(x))

由于 f(x) \leq g(x) ,我们有 -f(x) \geq -g(x) ,因此 \langle x|u\rangle - f(x) \geq \langle x|u\rangle - g(x) 。对每个 x 都成立的不等式在取上确界后依然保持,所以

f^*(u) = \sup_{x \in \mathcal{H}} (\langle x|u\rangle - f(x)) \geq \sup_{x \in \mathcal{H}} (\langle x|u\rangle - g(x)) = g^*(u)

这说明共轭运算反转函数之间的序关系。对于双共轭,由于我们已经知道 f^* \geq g^* ,再次应用共轭运算的单调性(注意两次反转会恢复原来的方向),得到 f^{**} \leq g^{**}

三共轭等于一共轭

共轭运算的一个重要性质是:对任何函数 f ,三重共轭等于一重共轭,即 f^{***} = f^*

这个结果来自于我们已经证明的 f^{**} \leq f 。将这个不等式应用于函数 f^* (注意 f^* 本身也是一个函数,所以可以考虑它的双共轭),得到 (f^*)^{**} \leq f^* ,也就是 f^{***} \leq f^*

另一方面,由于 f^{**} \leq f ,根据共轭运算的单调性(反转不等号),我们有 (f^{**})^* \geq f^* ,即 f^{***} \geq f^*

结合 f^{***} \leq f^* f^{***} \geq f^* 这两个不等式,得到 f^{***} = f^* 。这说明共轭运算经过三次后会回到一次共轭的结果,表明共轭运算在某种意义上具有"投影"性质: f^* 已经是某种"标准形式",再次进行共轭-双共轭操作不会改变它。

引理A:仿射函数与下半连续凸函数的关系

第一部分:仿射函数的上确界表示

\mathcal{H} 是Hilbert空间。如果 f \in \Gamma_0(\mathcal{H}) (即 f 是真的、下半连续且凸的函数),定义 \mathcal{A}_f 为所有从 \mathcal{H} \mathbb{R} 的仿射函数的集合,这些仿射函数是 f 的下界。引理断言:集合 \mathcal{A}_f 非空,且对于所有 x \in \mathcal{H}

(\forall x \in \mathcal{H}) \quad f(x) = \sup_{a \in \mathcal{A}_f} a(x)

这个结果的核心含义是:任何下半连续凸函数都可以表示为其所有仿射下界的逐点上确界。这种表示方式揭示了凸函数的本质结构——它完全由支撑它的仿射函数族所决定。仿射函数 a(x) = \langle x | v \rangle + \alpha 在几何上对应于超平面,而这个结果说明凸函数是所有支撑超平面的包络。

从图示可以看出,红色曲线 f(x) 位于所有绿色仿射函数 -a(x) 的上方,而 f(x) 恰好等于这些仿射函数的逐点上确界。每条绿色线代表一个支撑超平面,它们从下方逼近 f ,而 f 作为这些超平面的上确界被完整刻画。

第二部分:内点处仿射函数的接触性质

\mathcal{H} 是有限维空间时,引理的第二部分提供了更强的结论。如果 f: \mathcal{H} \to ]-\infty, +\infty] 是凸函数,且 \bar{x} 属于 f 定义域的内部(记作 \bar{x} \in \text{int}(\text{dom } f) ),则存在某个仿射函数 a \in \mathcal{A}_f 使得 f(\bar{x}) = a(\bar{x})

这意味着在定义域的内部点,必然存在至少一个支撑超平面与函数图像在该点相切。这个性质在有限维空间中特别有用,因为它保证了凸函数在其定义域内部具有良好的可分离性质。图中标记的点 x_0 处,可以看到存在一条仿射函数恰好与 f 相接触。

Moreau-Fenchel定理

Moreau-Fenchel定理给出了一个函数何时等于其双共轭的完整刻画。设 \mathcal{H} 是Hilbert空间, f: \mathcal{H} \to ]-\infty, +\infty] 是真函数,则

f \text{ 是下半连续且凸} \Leftrightarrow f^{**} = f

这个定理的重要性在于它建立了函数的拓扑与几何性质(下半连续性和凸性)与代数性质(双共轭运算的不动点)之间的等价关系。

充分性证明

如果 f^{**} = f ,那么 f \in \Gamma_0(\mathcal{H}) 。这个方向的证明依赖于我们已经证明的性质:共轭函数 f^* 总是下半连续且凸的。既然 f = f^{**} = (f^*)^* ,而 (f^*)^* 作为共轭函数必然是下半连续且凸的,因此 f 也具有这些性质。

必要性证明:仿射函数的情形

反向证明更为精细。假设 f \in \Gamma_0(\mathcal{H}) ,首先考虑 f 是仿射函数的特殊情况,即存在 (v, \alpha) \in \mathcal{H} \times \mathbb{R} 使得 f = \langle \cdot | v \rangle + \alpha 。此时需要计算 f 的共轭:

(\forall u \in \mathcal{H}) \quad f^*(u) = \sup_{x \in \mathcal{H}} (\langle x | u - v \rangle) - \alpha = \iota_{\{v\}}(u) - \alpha

其中 \iota_{\{v\}} 是集合 \{v\} 的示性函数(indicator function),即当 u = v 时取值0,否则取值 +\infty 。这是因为上确界 \sup_{x \in \mathcal{H}} \langle x | u - v \rangle u \neq v 时为 +\infty ,当 u = v 时为0。

继续计算双共轭:

(\forall x \in \mathcal{H}) \quad f^{**}(x) = \sup_{u \in \mathcal{H}} (\langle u | x \rangle - \iota_{\{v\}}(u) + \alpha)

由于 \iota_{\{v\}}(u) 只在 u = v 时有限(为0),上确界实际上只在 u = v 处达到,得到

f^{**}(x) = \langle v | x \rangle + \alpha = f(x)

这证明了仿射函数是其双共轭的不动点。

必要性证明:一般情形

对于一般的 f \in \Gamma_0(\mathcal{H}) ,设 a: \mathcal{H} \to \mathbb{R} 是任意满足 a \leq f 的仿射函数。由于仿射函数满足 a = a^{**} (刚才已证),且根据共轭运算的单调性, a \leq f 蕴含 a^{**} \leq f^{**} ,因此

a = a^{**} \leq f^{**}

这对所有 a \in \mathcal{A}_f 都成立。根据引理A的第一部分, f 可以表示为所有这些仿射下界的上确界,即 f = \sup_{a \in \mathcal{A}_f} a 。由于每个 a 都满足 a \leq f^{**} ,取上确界后得到

f = \sup_{a \in \mathcal{A}_f} a \leq f^{**}

结合之前已知的 f^{**} \leq f ,得到 f = f^{**}

图示展示了Moreau-Fenchel定理的几何意义:左图显示 f(x) (蓝色)与 f^{**}(x) (红色虚线)重合;右图显示对应的共轭函数 f^*(u) 。当函数是下半连续且凸时,双共轭运算不改变函数,这从图像上看就是 f f^{**} 完全一致。

定理的重要推论

Moreau-Fenchel定理的一个直接推论涉及共轭函数的性质。如果 f \in \Gamma_0(\mathcal{H}) ,则有两个结果:

首先, \text{dom } f \neq \varnothing 当且仅当 f^* > -\infty 。这是因为如果定义域非空,根据 f 是真函数的假设, f 在某些点取有限值,这防止了 f^* 恒为 -\infty

其次, f^{**} = f > -\infty 当且仅当 \text{dom } f^* \neq \varnothing 。这展示了原函数与共轭函数的定义域之间的对偶关系。

综合这两个条件,可以得出 f^* 本身也是真函数,即 f^* \in \Gamma_0(\mathcal{H}) 。这说明在真的下半连续凸函数类 \Gamma_0(\mathcal{H}) 上,共轭运算是良定的并且保持函数在该类中。

下半连续凸包络

\mathcal{H} 是Hilbert空间, f: \mathcal{H} \to ]-\infty, +\infty] 是真函数且 \text{dom } f^* \neq \varnothing 。双共轭函数 f^{**} 具有特殊的意义:它是 f 的下半连续凸包络,即满足 g(x) \leq f(x) 对所有 x \in \mathcal{H} 成立的最大下半连续凸函数 g: \mathcal{H} \to ]-\infty, +\infty]

定义集合 F 为所有满足 (\forall x \in \mathcal{H}) \ g(x) \leq f(x) 的下半连续凸函数 g: \mathcal{H} \to ]-\infty, +\infty] 的集合。由于 \text{dom } f^* \neq \varnothing ,可以验证 f^{**} > -\infty 。又因为 f^{**} \leq f f^{**} 是下半连续且凸的(共轭函数的固有性质),所以 f^{**} \in F ,这说明 F 是非空集。

为了证明 f^{**} 是集合 F 中的最大元素,定义函数 \hat{f}: x \mapsto \sup\{g(x) \mid g \in F\} 。这个函数是所有下半连续凸下界的逐点上确界。由于 \hat{f} \leq f (定义就要求 g \leq f 对所有 g \in F ),且 \hat{f} 本身也可以验证是下半连续且凸的(作为下半连续凸函数族的上确界),因此 \hat{f} \in \Gamma_0(\mathcal{H})

根据Moreau-Fenchel定理, \hat{f} = \hat{f}^{**} 。同时,由于 \hat{f} \leq f ,应用共轭运算的单调性得到 \hat{f}^{**} \geq f^{**} (注意方向反转两次)。结合 f^{**} \in F 以及 \hat{f} F 的上确界,必有 \hat{f} \geq f^{**} 。因此

\hat{f} \leq f \Rightarrow f^{**} \geq \hat{f}^{**} = \hat{f}

另一方面 \hat{f} \geq f^{**} (因为 f^{**} \in F \hat{f} 是上确界)。两个不等式结合得到 \hat{f} = f^{**} ,即 f^{**} 恰好是所有下半连续凸下界的上确界,这正是下半连续凸包络的定义。

这个结果的几何意义是: f^{**} 是从下方用下半连续凸函数逼近 f 所能得到的最好结果。如果 f 本身已经是下半连续且凸的,则 f^{**} = f ;否则 f^{**} 是对 f 进行"凸化"和"下半连续化"后的结果,它是小于等于 f 的最大下半连续凸函数。

双共轭函数的几何解释

图示展示了双共轭运算的效果。左图中蓝色曲线表示原函数 f(x) ,红色虚线表示双共轭 f^{**}(x) 。可以观察到当 f 不是凸函数时(图中 f 在某些区域呈现非凸性), f^{**} 是对 f 进行凸化后的结果——它是从下方包络 f 的最大凸函数。在 f 本身是凸的区域, f^{**} f 重合;而在 f 非凸的部分, f^{**} 通过"拉直"这些区域来形成凸包络。右图显示对应的共轭函数 f^*(u) ,它描述了原函数与双共轭函数的对偶结构。

可分离函数的共轭

考虑函数定义在乘积空间上的特殊情形。设 (\mathcal{H}_i)_{i \in I} 是一族Hilbert空间,其中指标集 I \subset \mathbb{N} ,定义乘积空间 \mathcal{H} = \times_{i \in I} \mathcal{H}_i 。对每个 i \in I ,设 f_i: \mathcal{H}_i \to ]-\infty, +\infty] 是真函数。定义在乘积空间上的可分离函数为

f: \mathcal{H} \to ]-\infty, +\infty]: x = (x_i)_{i \in I} \mapsto \sum_{i \in I} f_i(x_i)

可分离函数的特点是它可以写成各个坐标函数值的和,每个坐标函数只依赖于对应坐标上的变量。对于这类函数,其共轭函数具有非常优美的可分离性质。定理断言:对所有 u = (u_i)_{i \in I} \in \mathcal{H}

f^*(u) = \sum_{i \in I} f_i^*(u_i)

这个结果说明可分离函数的共轭等于各分量函数共轭的和。证明过程利用了共轭函数的定义和上确界运算与求和的可交换性。从定义出发,设 u = (u_i)_{i \in I} \in \mathcal{H}

f^*(u) = \sup_{x \in \mathcal{H}} (\langle x | u \rangle - f(x))

由于 x = (x_i)_{i \in I} ,内积可以写成各坐标内积的和 \langle x | u \rangle = \sum_{i \in I} \langle x_i | u_i \rangle ,而函数值是 f(x) = \sum_{i \in I} f_i(x_i) ,因此

f^*(u) = \sup_{x = (x_i)_{i \in I} \in \mathcal{H}} \left(\sum_{i \in I} \langle x_i | u_i \rangle - \sum_{i \in I} f_i(x_i)\right) = \sup_{x = (x_i)_{i \in I} \in \mathcal{H}} \sum_{i \in I} (\langle x_i | u_i \rangle - f_i(x_i))

关键步骤是将对乘积空间上的上确界分解为对各个坐标空间分别取上确界。由于各个坐标之间是独立的(每项只涉及一个坐标),求和与上确界可以交换顺序

= \sum_{i \in I} \sup_{x_i \in \mathcal{H}_i} (\langle x_i | u_i \rangle - f_i(x_i)) = \sum_{i \in I} f_i^*(u_i)

每项 \sup_{x_i \in \mathcal{H}_i} (\langle x_i | u_i \rangle - f_i(x_i)) 正是 f_i^*(u_i) 的定义。

应用:有限维空间中的 \ell^q 范数共轭

这个可分离性质的一个直接应用是有限维空间 \mathbb{R}^N \ell^q 范数的共轭关系。对于函数 f(x) = \frac{1}{q}\|x\|_q^q (其中 q \in ]1, +\infty[ ),这里 \|x\|_q^q = \sum_{i=1}^N |x_i|^q ,可以将 f 写成可分离形式

f(x) = \sum_{i=1}^N \frac{1}{q}|x_i|^q

每个分量函数 f_i(x_i) = \frac{1}{q}|x_i|^q 是定义在 \mathbb{R} 上的幂函数,其共轭函数我们已经计算过是 f_i^*(u_i) = \frac{1}{q^*}|u_i|^{q^*} (其中 \frac{1}{q} + \frac{1}{q^*} = 1 )。根据可分离函数的共轭性质,

(\forall u \in \mathbb{R}^N) \quad f^*(u) = \sum_{i=1}^N f_i^*(u_i) = \sum_{i=1}^N \frac{1}{q^*}|u_i|^{q^*} = \frac{1}{q^*}\|u\|_{q^*}^{q^*}

这建立了 \ell^q 范数幂函数与 \ell^{q^*} 范数幂函数之间的完整对偶关系,其中共轭指数 q q^* 满足 \frac{1}{q} + \frac{1}{q^*} = 1

支撑函数

\mathcal{H} 是Hilbert空间, C \subset \mathcal{H} 。集合 C 的支撑函数定义为

(\forall u \in \mathcal{H}) \quad \sigma_C(u) = \sup_{x \in C} \langle x | u \rangle = \iota_C^*(u)

这里 \iota_C 是集合 C 的示性函数(indicator function),定义为当 x \in C \iota_C(x) = 0 ,当 x \notin C \iota_C(x) = +\infty 。支撑函数实际上就是示性函数的共轭。

从几何角度理解,支撑函数 \sigma_C(u) 衡量的是集合 C 在方向 u 上的"延伸程度"。对于给定的 u \sigma_C(u) 是使得超平面 \{x: \langle x | u \rangle = \sigma_C(u)\} 成为 C 的支撑超平面的最大常数值。换句话说,这个超平面在 u 方向上支撑着集合 C ,且 C 完全位于这个超平面的一侧。

左图展示了这个几何关系。蓝色区域表示集合 C = [\delta_1, \delta_2] (一维情况下的闭区间),示性函数 \iota_{[\delta_1, \delta_2]}(x) 在区间内为0,区间外为 +\infty (用蓝色水平线段表示)。红色直线 \langle x | u \rangle 表示由 u 确定的线性函数。当 u > 0 时,在 C \langle x | u \rangle 的最大值在右端点 \delta_2 处达到,因此 \sigma_C(u) = \langle \delta_2 | u \rangle = \delta_2 u ;当 u < 0 时,最大值在左端点 \delta_1 处达到, \sigma_C(u) = \delta_1 u 。右图显示支撑函数 \sigma_C(u) 作为 u 的函数,它是一个分段线性的凸函数,在 u = 0 处有一个"拐角"。

支撑函数与示性函数的双共轭关系

支撑函数与示性函数之间存在深刻的对偶关系。如果 C 是非空闭凸集,则有

\sigma_C^* = \iota_C^{**} = \iota_C

这个等式包含两层含义。首先, \sigma_C^* = \iota_C^{**} 成立是因为 \sigma_C = \iota_C^* (支撑函数的定义),对两边再取共轭得到 \sigma_C^* = (\iota_C^*)^* = \iota_C^{**} 。其次,等式 \iota_C^{**} = \iota_C 的成立依赖于Moreau-Fenchel定理:当 C 是非空闭凸集时,示性函数 \iota_C 是下半连续且凸的函数(闭凸集的示性函数满足这些性质),因此根据Moreau-Fenchel定理, \iota_C^{**} = \iota_C

这个关系表明,对于闭凸集,支撑函数的共轭恰好回到示性函数。从几何上说,如果我们知道一个闭凸集在所有方向上的支撑函数值,就可以完全重构这个集合——这就是对偶的力量。支撑函数 \sigma_C 编码了集合 C 的全部几何信息,通过对 \sigma_C 取共轭,我们能够恢复出原集合的示性函数,进而确定集合本身。

支撑函数的具体例子

例1:分段线性函数作为支撑函数

考虑定义在 \mathbb{R} 上的函数

f: \mathbb{R} \to ]-\infty, +\infty]: x \mapsto \begin{cases} \delta_1 x & \text{如果 } x < 0 \\ 0 & \text{如果 } x = 0 \\ \delta_2 x & \text{如果 } x > 0 \end{cases}

其中 -\infty \leq \delta_1 < \delta_2 \leq +\infty 。这个函数实际上就是某个闭区间 C 的支撑函数 \sigma_C ,其中 C 是满足 \inf C = \delta_1 \sup C = \delta_2 的闭实区间。

为了理解这个结论,需要回顾支撑函数的定义: \sigma_C(u) = \sup_{x \in C} \langle x | u \rangle = \sup_{x \in C} xu (在一维情况下内积就是普通乘法)。当 u > 0 时,要使 xu 最大,应该选择 x 尽可能大,即 x = \sup C = \delta_2 ,因此 \sigma_C(u) = \delta_2 u 。当 u < 0 时,要使 xu 最大(注意 u 是负数,所以要选 x 尽可能小),应该选择 x = \inf C = \delta_1 ,因此 \sigma_C(u) = \delta_1 u 。当 u = 0 时, \sigma_C(0) = 0 。这恰好与函数 f 的定义一致。

这个例子展示了支撑函数的一个重要特征:它可以是分段线性的,每一段对应于集合 C 在不同方向上的"极端点"贡献。对于区间这样的一维凸集,只有两个极端点(左右端点),因此支撑函数只有两段(分别对应正负方向)。

例2: \ell^q 范数的支撑函数

f \mathbb{R}^N 上的 \ell^q 范数( q \in [1, +\infty] ),我们有 f = \sigma_C ,其中

C = \{y \in \mathbb{R}^N \mid \|y\|_{q^*} \leq 1\}

这里 q^* q 的共轭指数,满足 \frac{1}{q} + \frac{1}{q^*} = 1

这个结果的证明依赖于Hölder不等式。对任意 u \in \mathbb{R}^N ,支撑函数为

(\forall u \in \mathbb{R}^N) \quad \sigma_C(u) = \sup_{x \in C} \langle u | x \rangle = \sup_{x \in C} \|u\|_q \|x\|_{q^*} = \|u\|_q

关键步骤是应用Hölder不等式: |\langle u | x \rangle| \leq \|u\|_q \|x\|_{q^*} ,且等号在某个特定的 x 处达到(当 x 的分量与 u 的分量具有特定关系时)。由于我们在 \|x\|_{q^*} \leq 1 的约束下最大化 \langle u | x \rangle ,而Hölder不等式告诉我们这个最大值不超过 \|u\|_q \cdot 1 = \|u\|_q ,并且这个上界可以达到(通过选择适当的 x 使得 \|x\|_{q^*} = 1 x 的方向与 u "对齐"),因此 \sigma_C(u) = \|u\|_q

换句话说, \ell^q 范数球的支撑函数恰好是对偶空间中的 \ell^{q^*} 范数。这揭示了 \ell^p 空间对偶理论的深层几何结构。

特殊情况: \ell^1 范数

q = 1 时,共轭指数 q^* = \infty 。对应的集合是

C = [-1, 1]^N

N 维超立方体。这说明 \ell^1 范数实际上是这个超立方体的支撑函数。从几何上看, \ell^1 范数测量的是沿坐标轴方向的总距离,而 \ell^\infty 范数球(超立方体)正是使得这个测量有界的点集。

练习解答

练习1.1:线性函数的共轭

对于函数 f: \mathbb{R}^N \to ]-\infty, +\infty] 定义为 f(x) = \langle c | x \rangle ,其中 c \in \mathbb{R}^N 是固定向量,求其共轭函数。

从共轭函数的定义出发:

f^*(u) = \sup_{x \in \mathbb{R}^n} (\langle u | x \rangle - \langle c | x \rangle) = \sup_{x \in \mathbb{R}^n} \langle u - c | x \rangle

这个上确界的值取决于 u - c 是否为零。如果 u - c \neq 0 ,则存在方向使得 \langle u - c | x \rangle 可以任意大(沿着 u - c 的方向让 \|x\| \to \infty ),因此上确界为 +\infty 。如果 u = c ,则对所有 x 都有 \langle u - c | x \rangle = 0 ,上确界为0。因此

f^*(u) = \begin{cases} \infty & \text{如果 } u - c \neq 0 \\ 0 & \text{如果 } u = c \end{cases} = \iota_{\{c\}}(u)

这正是单点集 \{c\} 的示性函数。这个结果与我们之前讨论的仿射函数的共轭是一致的(这里常数项为0的特殊情况)。线性函数的共轭是单点集的示性函数,这展示了线性函数的"刚性"——它完全由单个向量 c 所决定,而共轭运算正是提取了这个决定性的向量。

练习1.2:平移后半空间示性函数的共轭

对于函数 g: \mathbb{R}^N \to ]-\infty, +\infty] 定义为 g(x) = \iota_{[0, \infty[^N}(x - c) ,其中 c \in \mathbb{R}^N ,求其共轭函数。

这个函数是正象限在平移后的示性函数。从定义出发:

g^*(u) = \sup_{x \in \mathbb{R}^n} (\langle u | x \rangle - \iota_{[0, \infty[^N}(x - c))

示性函数的作用是限制上确界只在 x - c \in [0, \infty[^N 上求取,即 x \in c + [0, \infty[^N 。因此

g^*(u) = \sup_{x - c \in [0, \infty[^N} \langle u | x \rangle

通过变量替换 y = x - c ,得到 x = y + c ,上确界变为

= \sup_{y \in [0, \infty[^N} \langle u | y + c \rangle = \sup_{y \in [0, \infty[^N} (\langle u | y \rangle + \langle u | c \rangle)

将常数项 \langle u | c \rangle 提出,得到

= \langle u | c \rangle + \sup_{y \in [0, \infty[^N} \langle u | y \rangle

现在需要计算 \sup_{y \in [0, \infty[^N} \langle u | y \rangle 。由于 y 的每个分量 y_i \geq 0 ,如果存在某个 i 使得 u_i > 0 ,则可以让 y_i \to \infty 使得上确界为 +\infty 。只有当所有 u_i \leq 0 时,上确界才是有限的(此时最优选择是 y = 0 ,上确界为0)。因此

\sup_{y \in [0, \infty[^N} \langle u | y \rangle = \begin{cases} 0 & \text{如果 } \forall i \in \{1, \ldots, N\}, u_i \leq 0 \\ \infty & \text{否则} \end{cases} = \iota_{]-\infty, 0]^N}(u)

最终结果为

g^*(u) = \langle u | c \rangle + \iota_{]-\infty, 0]^N}(u)

这个结果揭示了一个一般规律:对集合的示性函数进行平移,其共轭函数会增加一个线性项,而示性函数本身变为另一个相关集合(这里是负象限)的示性函数。几何上,正象限的支撑函数(即其示性函数的共轭)是负象限的示性函数,因为只有负方向的 u 才能使得在正象限上的线性函数有界。


评论