第2章 · 多元函数的导数
2.4 反函数定理
在一元微积分中,若 $f: \mathbb{R} \to \mathbb{R}$ 在 $a$ 处可微且 $f'(a) \neq 0$,则存在 $a$ 附近的一个开区间,$f$ 在其上是单射,且反函数可微,满足 $(f^{-1})'(f(a)) = 1/f'(a)$。这个结论的证明依赖于 $f$ 的单调性——而单调性又源于导数的符号在一维情形具有"方向"信息。
在多元情形,$f'(a)$ 是一个矩阵,没有"正负"可言。"导数非零"应该推广为什么条件?答案是:导数 $Df(a)$ 作为线性映射可逆,即雅可比行列式 $\det f'(a) \neq 0$。此时,$f$ 在 $a$ 附近的行为近似于一个可逆线性映射,而反函数定理断言:这种近似的可逆性可以"提升"为 $f$ 本身的局部可逆性。
2.4.1 定理的陈述
设 $f: \mathbb{R}^n \to \mathbb{R}^n$ 在包含 $\boldsymbol{a}$ 的开集上连续可微(即 $C^1$),且 $\det f'(\boldsymbol{a}) \neq 0$。则存在包含 $\boldsymbol{a}$ 的开集 $U$ 和包含 $f(\boldsymbol{a})$ 的开集 $V$,使得
1. $f: U \to V$ 是双射(一一到上),
2. 反函数 $f^{-1}: V \to U$ 连续可微,
3. 对任意 $\boldsymbol{y} \in V$,设 $\boldsymbol{x} = f^{-1}(\boldsymbol{y})$(即满足 $f(\boldsymbol{x}) = \boldsymbol{y}$ 的点),则
换言之,反函数在 $\boldsymbol{y}$ 处的雅可比矩阵,等于原函数在对应点 $\boldsymbol{x}$ 处的雅可比矩阵的逆矩阵。
下表逐层拆解结论 3 的各个符号——
| 符号 | 含义 |
|---|---|
| $\boldsymbol{y} = f(\boldsymbol{x})$ | $\boldsymbol{y}$ 和 $\boldsymbol{x}$ 通过 $f$ 互相对应 |
| $\boldsymbol{x} = f^{-1}(\boldsymbol{y})$ | 用反函数从 $\boldsymbol{y}$ 找回 $\boldsymbol{x}$ |
| $f'(\boldsymbol{x})$ | 原函数在 $\boldsymbol{x}$ 处的雅可比矩阵($n \times n$) |
| $[f'(\boldsymbol{x})]^{-1}$ | 这个矩阵的逆矩阵 |
| $(f^{-1})'(\boldsymbol{y})$ | 反函数在 $\boldsymbol{y}$ 处的雅可比矩阵 |
整个公式说了一件事:反函数的雅可比矩阵 = 原函数雅可比矩阵的逆矩阵。在一维情形,这就是 $(f^{-1})'(y) = 1/f'(x)$,只是"倒数"换成了"逆矩阵"。将 $\boldsymbol{x} = f^{-1}(\boldsymbol{y})$ 代入,就得到完全用 $\boldsymbol{y}$ 表达的紧凑形式 $(f^{-1})'(\boldsymbol{y}) = [f'(f^{-1}(\boldsymbol{y}))]^{-1}$,初读时不必强求一次看懂——用 $\boldsymbol{x}$ 来思考更符合直觉。
$f$ 是 $C^1$ 的:$f$ 的所有偏导数存在且连续。
$\det f'(\boldsymbol{a}) \neq 0$:雅可比矩阵在 $\boldsymbol{a}$ 处的行列式非零,等价于线性映射 $Df(\boldsymbol{a})$ 可逆。
反函数定理断言的是"局部反函数存在"。要使一个映射在局部有反函数,它的定义域维数和值域维数必须相等。直观上,如果维数不同,映射要么将高维信息"压缩"到低维(丢失信息,无法恢复),要么将低维信息"嵌入"到高维(像集无法填满任何开集,不能成为反函数的定义域)。定理条件 $\det f'(\boldsymbol{a}) \neq 0$ 本身已经要求 $f'(\boldsymbol{a})$ 是方阵,因而维数自然相等。
在给出证明之前,先理解为什么导数的可逆性是关键。考虑变量 $\boldsymbol{h} = \boldsymbol{x} - \boldsymbol{a}$(即从点 $\boldsymbol{a}$ 出发的微小位移),我们希望解方程 $f(\boldsymbol{a}+\boldsymbol{h}) = \boldsymbol{y}$,其中 $\boldsymbol{y} \approx f(\boldsymbol{a})$。由可微性定义(§2.1),当 $\boldsymbol{h} \approx \boldsymbol{0}$ 时,
这里的极限过程是 $\boldsymbol{h} \to \boldsymbol{0}$,即将 $f(\boldsymbol{a}+\boldsymbol{h})$ 视为关于变量 $\boldsymbol{h}$ 在 $\boldsymbol{h}=\boldsymbol{0}$ 附近的函数。如果我们暂时忽略高阶误差项 $o(\|\boldsymbol{h}\|)$,只保留线性部分,那么方程 $f(\boldsymbol{a}+\boldsymbol{h}) = \boldsymbol{y}$ 变成近似线性方程
移项得 $Df(\boldsymbol{a})(\boldsymbol{h}) \approx \boldsymbol{y} - f(\boldsymbol{a})$。如果 $Df(\boldsymbol{a})$ 可逆(这正是定理的条件),两边作用逆映射 $[Df(\boldsymbol{a})]^{-1}$,得
回到原变量 $\boldsymbol{x} = \boldsymbol{a} + \boldsymbol{h}$,即
这就从 $\boldsymbol{h} = \boldsymbol{0}$ 附近的线性近似中解出了 $\boldsymbol{x}$ 的近似值。反函数定理说:如果再加上 $f$ 是 $C^1$ 的(偏导数连续),这个"近似可解"可以严格化为"精确可解"——在足够小的范围内,对每个 $\boldsymbol{y} \approx f(\boldsymbol{a})$,方程 $f(\boldsymbol{x}) = \boldsymbol{y}$ 有唯一解,且解 $\boldsymbol{x} = f^{-1}(\boldsymbol{y})$ 也属于 $C^1$。定理的证明正是通过压缩映射原理,将上述线性近似给出的候选解迭代修正为精确解。
在一维情形,$Df(a) = f'(a)$ 是一个数。可逆条件就是 $f'(a) \neq 0$。上述推导退化为:从 $f(a+h) \approx f(a) + f'(a)h$ 解出 $h \approx (y-f(a))/f'(a)$,即 $x \approx a + (y-f(a))/f'(a)$。反函数定理保证这个近似解在局部可以严格化。
2.4.2 证明的思想:等价变换不改变问题的本质
在进入具体证明之前,我们先明确反函数定理的任务,并建立贯穿整个证明的核心思想。
反函数定理要做什么?给定一个映射 $f: \mathbb{R}^n \to \mathbb{R}^n$ 和一个点 $\boldsymbol{a}$。已知 $f$ 在 $\boldsymbol{a}$ 附近是 $C^1$ 的,且 $\det f'(\boldsymbol{a}) \neq 0$。要证明:存在 $\boldsymbol{a}$ 的一个开邻域 $U$ 和 $f(\boldsymbol{a})$ 的一个开邻域 $V$,使得对于每个给定的 $\boldsymbol{y} \in V$(值域中足够靠近 $f(\boldsymbol{a})$ 的任意一点),方程
在 $U$ 中有唯一解 $\boldsymbol{x}$。这个解记为 $f^{-1}(\boldsymbol{y})$,并且 $f^{-1}: V \to U$ 是 $C^1$ 的。
在以上陈述中,$f$ 是已知的映射,$\boldsymbol{y}$ 是给定的值域点,而 $\boldsymbol{x}$ 是未知的——我们要证明对每个足够靠近 $f(\boldsymbol{a})$ 的 $\boldsymbol{y}$,存在唯一的 $\boldsymbol{x}$ 靠近 $\boldsymbol{a}$ 满足 $f(\boldsymbol{x}) = \boldsymbol{y}$。这正是"反函数存在"的含义。
核心困难在于 $f$ 是一个非线性映射。直接处理非线性方程 $f(\boldsymbol{x}) = \boldsymbol{y}$ 是很困难的。但如果 $f$ 是一个简单的线性映射——比如恒等映射 $f(\boldsymbol{x}) = \boldsymbol{x}$——那么方程 $f(\boldsymbol{x}) = \boldsymbol{y}$ 的解显然就是 $\boldsymbol{x} = \boldsymbol{y}$,反函数就是 $f^{-1}(\boldsymbol{y}) = \boldsymbol{y}$,一切都很平凡。这就提示我们:能否通过某种变换,把一般的非线性映射 $f$ 转化为一个更简单的映射,而不改变"是否存在局部反函数"这一性质?
答案是肯定的。这里我们需要引入两个概念——同胚和微分同胚。
在拓扑学中,如果两个空间之间存在连续的双射且反函数也连续,我们称它们是同胚的。这是拓扑等价——同胚保持空间的"连续结构"(开集、闭集、紧集等)。
在微分学中,如果两个空间之间的双射不仅是同胚,而且映射和反函数都是 $C^1$ 的(或 $C^\infty$ 的),我们称它们是微分同胚。这是更强的等价——它不仅保持了"连续结构",还保持了"可微结构"。如果一个映射是微分同胚,那么它当然是局部可逆的,而且它的反函数也具备同样的光滑性。
在第 5 章中,微分同胚将是核心概念。流形在局部正是通过微分同胚与 $\mathbb{R}^n$ 的开集建立联系的。此处的思想是:通过已知的微分同胚将问题归约到标准情形,然后证明标准情形本身也是局部微分同胚。
现在,我们可以用微分同胚的语言来理解反函数定理的证明策略了。假设 $\Phi$ 和 $\Psi$ 是微分同胚,定义
我们需要确认:$f$ 局部可逆当且仅当 $\tilde{f}$ 局部可逆。这可以通过一个与矩阵乘法完全平行的代数计算来验证。
回忆 §1.2.3 的核心事实:线性映射的复合对应于矩阵乘法,而矩阵乘法的逆满足 $(BA)^{-1} = A^{-1}B^{-1}$——顺序反转,各自取逆。这一代数规则在一般的映射复合中同样成立:如果 $A$ 和 $B$ 是可逆映射(不必是线性的),那么
现在,假设 $\tilde{f}$ 有局部反函数 $\tilde{f}^{-1}$,即 $\tilde{f}^{-1} \circ \tilde{f} = I$。由 $\tilde{f} = \Phi \circ f \circ \Psi$,两边"取逆"(与矩阵乘法的规则完全一致——顺序反转,各自取逆),得
在这个等式的左边复合 $\Psi$、右边复合 $\Phi$,解出 $f^{-1}$:
这就证明了:如果 $\tilde{f}$ 局部可逆,则 $f$ 也局部可逆(且反函数由上式给出)。同理,如果 $f$ 局部可逆,从 $\tilde{f} = \Phi \circ f \circ \Psi$ 直接得 $\tilde{f}^{-1} = \Psi^{-1} \circ f^{-1} \circ \Phi^{-1}$。因此,$f$ 与 $\tilde{f}$ 的局部可逆性是等价的。
特别地,如果我们取 $\Phi$ 和 $\Psi$ 为特别简单的微分同胚——比如平移(它把任意点移到原点)和可逆线性映射——我们就可以在不改变问题本质的前提下,把 $f$ 简化为一个在原点附近导数为恒等映射的标准情形。这正是我们在 §2.4.3 第一步中要做的事情。
有了标准情形 $Df(\boldsymbol{0}) = I$ 之后,由可微性,在原点附近有 $f(\boldsymbol{x}) \approx \boldsymbol{x}$。将这一近似代入方程 $f(\boldsymbol{x}) = \boldsymbol{y}$,得 $\boldsymbol{x} \approx \boldsymbol{y}$。这就是说,$\boldsymbol{x}$ 的"零阶近似"就是 $\boldsymbol{y}$ 本身。为了提高精度,我们考虑迭代:设当前猜测为 $\boldsymbol{x}_n$,我们希望找到修正量 $\Delta\boldsymbol{x}$ 使得 $f(\boldsymbol{x}_n + \Delta\boldsymbol{x}) \approx \boldsymbol{y}$。再次使用线性近似 $f(\boldsymbol{x}_n + \Delta\boldsymbol{x}) \approx f(\boldsymbol{x}_n) + \Delta\boldsymbol{x}$(因为 $Df \approx I$),得 $f(\boldsymbol{x}_n) + \Delta\boldsymbol{x} \approx \boldsymbol{y}$,即 $\Delta\boldsymbol{x} \approx \boldsymbol{y} - f(\boldsymbol{x}_n)$。因此我们设计迭代
其中 $\boldsymbol{g}(\boldsymbol{x}) = \boldsymbol{x} - f(\boldsymbol{x})$ 满足 $\boldsymbol{g}(\boldsymbol{0}) = \boldsymbol{0}$ 和 $D\boldsymbol{g}(\boldsymbol{0}) = 0$。接下来的任务是严格证明:由于 $\boldsymbol{g}$ 在原点附近是压缩的(偏导数可任意小),这个迭代序列收敛到唯一的不动点,该不动点即为所求的 $\boldsymbol{x}$。下面我们用压缩映射原理来完成这一论证。
2.4.3 证明
证明的技术核心是压缩映射原理——如果一个映射将一个完备度量空间中的闭球映到自身且是严格压缩的,则它有唯一不动点。这里"完备度量空间"是指一个有距离且其中每个柯西序列都收敛的空间。在 §1.3 中我们已经知道 $\mathbb{R}^n$ 本身是完备的(任何柯西序列必收敛),而闭球 $\overline{B}(\boldsymbol{0}, r)$ 作为 $\mathbb{R}^n$ 的闭子集,也对极限封闭(定理 1.3.9),因此继承完备性。"严格压缩"是指存在常数 $c \in [0, 1)$,使得映射后任意两点之间的距离不超过映射前这两点距离的 $c$ 倍。压缩映射原理(也称巴拿赫不动点定理)断言:完备度量空间上的严格压缩映射必有唯一的不动点,且从任意初始点出发反复应用该映射,都会收敛到这个不动点。我们将构造一个依赖于参数 $\boldsymbol{y}$ 的压缩映射,其不动点恰为 $f^{-1}(\boldsymbol{y})$。
第一步:通过等价变换简化问题。
已知 $f$ 在 $\boldsymbol{a}$ 处的导数是 $T = Df(\boldsymbol{a})$,且 $T$ 可逆(因为 $\det T \neq 0$)。由 §2.1,$f$ 在 $\boldsymbol{a}$ 附近的行为近似于 $T$。按照 §2.4.2 的策略,我们通过两个微分同胚——平移和可逆线性映射——将问题"拉直"。
平移。将 $\boldsymbol{a}$ 和 $f(\boldsymbol{a})$ 都移到原点:定义 $\tilde{f}_1(\boldsymbol{x}) = f(\boldsymbol{x} + \boldsymbol{a}) - f(\boldsymbol{a})$。则 $\tilde{f}_1(\boldsymbol{0}) = \boldsymbol{0}$,且 $D\tilde{f}_1(\boldsymbol{0}) = Df(\boldsymbol{a}) = T$。平移是一个微分同胚(它是 $C^\infty$ 的,其反函数也是 $C^\infty$ 的),因此 $\tilde{f}_1$ 是否局部可逆等价于 $f$ 是否局部可逆。
线性修正。现在定义 $\tilde{f} = T^{-1} \circ \tilde{f}_1$。这意味着对任意 $\boldsymbol{x}$,
为什么这样做?因为 $\tilde{f}_1$ 在 $\boldsymbol{0}$ 附近近似于 $T$,而我们对 $\tilde{f}_1$ 作用 $T^{-1}$ 后,复合映射 $T^{-1} \circ \tilde{f}_1$ 就近似于 $T^{-1} \circ T = I$(恒等映射)。换句话说,$\tilde{f}$ 在 $\boldsymbol{0}$ 附近的线性近似是恒等映射,这是最简单、最容易处理的线性映射。$T^{-1}$ 作为可逆线性映射,也是一个微分同胚(它是 $C^\infty$ 的,其反函数也是线性的,因而也是 $C^\infty$ 的)。
严格计算 $\tilde{f}$ 在 $\boldsymbol{0}$ 处的导数。因为 $T^{-1}$ 是线性映射(其导数处处等于自身),由链式法则:
推导细节如下:
- 第一步:链式法则 $D(g \circ f)(\boldsymbol{a}) = Dg(f(\boldsymbol{a})) \circ Df(\boldsymbol{a})$,取 $g = T^{-1}$,$f = \tilde{f}_1$。
- 第二步:$T^{-1}$ 是线性映射,由 §2.1 例 2.1.8,线性映射的导数就是它本身,即 $D(T^{-1})(\boldsymbol{y}) = T^{-1}$ 对所有 $\boldsymbol{y}$ 成立(与 $\boldsymbol{y}$ 无关)。
- 第三步:代入 $D\tilde{f}_1(\boldsymbol{0}) = T$,得 $T^{-1} \circ T = I$。
现在,如果定理对 $\tilde{f}$ 成立(导数为 $I$ 的局部微分同胚),那么对原 $f$ 也成立。因为按照 §2.4.2 中"取逆"的规则,我们有 $\tilde{f} = T^{-1} \circ \tilde{f}_1$,两边取逆得 $\tilde{f}^{-1} = \tilde{f}_1^{-1} \circ T$,即 $\tilde{f}_1^{-1} = \tilde{f}^{-1} \circ T^{-1}$。而 $\tilde{f}_1$ 与 $f$ 只差一个平移,故
若 $\tilde{f}$ 局部可逆,则上式给出了 $f$ 的局部反函数(微分同胚的复合),因此 $f$ 也局部可逆。
综上,通过等价变换(平移和可逆线性映射这两个微分同胚),不妨设
这使得导数在原点恰好是恒等映射,后续的估计将大大简化。
第二步:从导数条件到不动点方程。
经过第一步的简化,我们现在有 $f(\boldsymbol{0}) = \boldsymbol{0}$ 且 $Df(\boldsymbol{0}) = I$。由可微性定义,这等价于
这个极限等式是我们从"导数等于恒等映射"得到的全部精确信息。它说明在原点附近,$f(\boldsymbol{x})$ 与 $\boldsymbol{x}$ 的差异相对于 $\|\boldsymbol{x}\|$ 而言可以任意小。
现在面临的问题是:我们要解方程 $f(\boldsymbol{x}) = \boldsymbol{y}$(其中 $\|\boldsymbol{y}\|$ 很小)。这个方程是非线性的,难以直接处理。但如果我们把 $f(\boldsymbol{x})$ 改写为 $\boldsymbol{x} - (\boldsymbol{x} - f(\boldsymbol{x}))$,方程就变成了
令 $\boldsymbol{g}(\boldsymbol{x}) = \boldsymbol{x} - f(\boldsymbol{x})$。则 $\boldsymbol{g}(\boldsymbol{0}) = \boldsymbol{0}$,直接计算得 $D\boldsymbol{g}(\boldsymbol{0}) = I - Df(\boldsymbol{0}) = 0$。方程等价于
这个方程的含义是:未知的 $\boldsymbol{x}$ 出现在等号两边。这种形式的方程称为不动点方程——如果我们定义映射 $\phi_{\boldsymbol{y}}(\boldsymbol{x}) = \boldsymbol{g}(\boldsymbol{x}) + \boldsymbol{y}$,那么 (3) 的解 $\boldsymbol{x}$ 恰好满足 $\phi_{\boldsymbol{y}}(\boldsymbol{x}) = \boldsymbol{x}$,即 $\boldsymbol{x}$ 是 $\phi_{\boldsymbol{y}}$ 的不动点。
将 $\boldsymbol{y}$ 放在下标的位置,是为了强调在讨论反函数的存在性时,$\boldsymbol{y}$ 是一个固定的参数——我们先选定一个足够靠近 $\boldsymbol{0}$ 的 $\boldsymbol{y}$,然后求解关于 $\boldsymbol{x}$ 的方程。此时 $\phi_{\boldsymbol{y}}$ 是一个定义在 $\mathbb{R}^n$ 上、取值在 $\mathbb{R}^n$ 中的一元映射,压缩映射原理可以直接应用于它。将 $\boldsymbol{y}$ 写成下标可以使后续的构造——压缩映射原理的验证、不动点的存在唯一性、以及反函数对 $\boldsymbol{y}$ 的连续性和可微性——在符号层面更清晰。如果把 $\phi$ 写成 $\phi(\boldsymbol{x}, \boldsymbol{y})$,它是一个从 $\mathbb{R}^n \times \mathbb{R}^n$ 到 $\mathbb{R}^n$ 的二元映射,反而不容易看出对固定的 $\boldsymbol{y}$ 应该如何应用压缩映射原理。这种"将参数放在下标,视为一族一元映射"的记法在分析学中十分常见。
这里引入 $\boldsymbol{g}$ 和不动点方程并非另起炉灶,而是将同一个导数条件从"表述形式"转化为"可操作形式"。"导数等于恒等映射"和"$\boldsymbol{g}(\boldsymbol{x}) = o(\|\boldsymbol{x}\|)$ 且 $D\boldsymbol{g}(\boldsymbol{0}) = 0$"是同一个事实的两种等价表述——前者是导数的语言,后者是直接计算的语言。为什么需要两种表述?因为前者告诉我们 $f$ 的局部行为(近似于恒等映射),但它本身不提供求解方程的手段;后者将这一近似信息转化为一个可用于迭代的形式,使压缩映射原理能够介入。
现在来看 $\boldsymbol{g}$ 的性质。因为 $f$ 是 $C^1$ 的,$\boldsymbol{g}$ 也是 $C^1$ 的,且 $\boldsymbol{g}(\boldsymbol{0}) = \boldsymbol{0}$,$D\boldsymbol{g}(\boldsymbol{0}) = 0$。由 §2.3 推论 2.3.6(偏导数在原点为零时的局部压缩),对任意常数 $c \in (0,1)$,存在 $r_0 > 0$ 使得 $\boldsymbol{g}$ 在开球 $B(\boldsymbol{0}, r_0)$ 上的 Lipschitz 常数不超过 $c$。特别地,取 $c = 1/2$,我们得到:存在 $r_0 > 0$,使得对所有 $\boldsymbol{x}, \boldsymbol{z} \in B(\boldsymbol{0}, r_0)$,
换言之,$\boldsymbol{g}$ 在 $B(\boldsymbol{0}, r_0)$ 上是压缩的,压缩系数为 $1/2$。
推论 2.3.6 将"导数在原点为零"这一局部信息,通过偏导数的连续性,转化为"映射在局部是压缩的"这一整体性质。一旦获得了压缩性,不动点方程 (3) 右端的映射 $\phi_{\boldsymbol{y}}(\boldsymbol{x}) = \boldsymbol{g}(\boldsymbol{x}) + \boldsymbol{y}$(常数项 $\boldsymbol{y}$ 不影响压缩性)也就成为压缩映射。至此,链条完整了:导数等于恒等映射 $\Rightarrow$ $D\boldsymbol{g}(\boldsymbol{0}) = 0$ $\Rightarrow$($C^1$ 条件)$\boldsymbol{g}$ 在局部压缩 $\Rightarrow$ 不动点方程有唯一解。
第三步:确定定义域和值域。
现在,对固定的 $\boldsymbol{y} \in \mathbb{R}^n$(待定范围),定义映射
由前一步,$\phi_{\boldsymbol{y}}$ 与 $\boldsymbol{g}$ 有相同的压缩性质。我们需要确定 $\boldsymbol{y}$ 的范围,使得 $\phi_{\boldsymbol{y}}$ 将某个闭球映到自身。
这里有一个需要注意的技术细节:压缩映射原理需要在完备空间上应用。在 $\mathbb{R}^n$ 中,闭球是完备的(它是闭子集,继承 $\mathbb{R}^n$ 的完备性),而开球不是完备的。然而,我们在第二步得到的不等式是在开球 $B(\boldsymbol{0}, r_0)$ 上成立的。幸运的是,开球上的不等式可以自然地延续到闭球上:对边界上的任意两点 $\boldsymbol{x}, \boldsymbol{z} \in \partial B(\boldsymbol{0}, r_0)$,取开球内的序列 $\boldsymbol{x}_n \to \boldsymbol{x}$,$\boldsymbol{z}_n \to \boldsymbol{z}$。由于 $\boldsymbol{g}$ 连续(它是 $C^1$ 的),不等式在极限下保持:
因此,压缩不等式在整个闭球 $\overline{B}(\boldsymbol{0}, r_0)$ 上也成立。
取 $r = r_0$。对 $\boldsymbol{x} \in \overline{B}(\boldsymbol{0}, r)$,由 $\boldsymbol{g}(\boldsymbol{0}) = \boldsymbol{0}$ 和压缩估计,
因此,
如果 $\|\boldsymbol{y}\| \le r/2$,则 $\|\phi_{\boldsymbol{y}}(\boldsymbol{x})\| \le r$,即 $\phi_{\boldsymbol{y}}$ 将 $\overline{B}(\boldsymbol{0}, r)$ 映到自身。因此,令
对任意 $\boldsymbol{y} \in V$(此时 $\|\boldsymbol{y}\| < r/2 \le r/2$,条件满足),以及任意 $\boldsymbol{x}, \boldsymbol{z} \in \overline{B}(\boldsymbol{0}, r)$,
因此,$\phi_{\boldsymbol{y}}$ 是 $\overline{B}(\boldsymbol{0}, r)$ 上的严格压缩映射。
第四步:应用压缩映射原理并验证双射。
闭球 $\overline{B}(\boldsymbol{0}, r)$ 是完备度量空间($\mathbb{R}^n$ 的闭子集)。由压缩映射原理,对每个 $\boldsymbol{y} \in V$,存在唯一的 $\boldsymbol{x} \in \overline{B}(\boldsymbol{0}, r)$ 使得 $\phi_{\boldsymbol{y}}(\boldsymbol{x}) = \boldsymbol{x}$,即 $f(\boldsymbol{x}) = \boldsymbol{y}$。
现在验证 $f: U \to V$ 是双射。令 $U = f^{-1}(V) \cap B(\boldsymbol{0}, r)$。因为 $f$ 连续且 $V$ 是开集,$f^{-1}(V)$ 是开集;$B(\boldsymbol{0}, r)$ 也是开集,故 $U$ 是包含 $\boldsymbol{0}$ 的开集。
- 满射:对任意 $\boldsymbol{y} \in V$,压缩映射原理给出了唯一的 $\boldsymbol{x} \in \overline{B}(\boldsymbol{0}, r)$ 使得 $f(\boldsymbol{x}) = \boldsymbol{y}$。因为 $\boldsymbol{y} \in V$,有 $\boldsymbol{x} \in f^{-1}(V)$。同时,$\boldsymbol{x}$ 必然属于开球 $B(\boldsymbol{0}, r)$:由不动点等式 $\boldsymbol{x} = \phi_{\boldsymbol{y}}(\boldsymbol{x})$ 和估计 $\|\boldsymbol{g}(\boldsymbol{x})\| \le r/2$ 以及 $\|\boldsymbol{y}\| < r/2$(因 $\boldsymbol{y} \in V$),得
$$\|\boldsymbol{x}\| = \|\phi_{\boldsymbol{y}}(\boldsymbol{x})\| \le \|\boldsymbol{g}(\boldsymbol{x})\| + \|\boldsymbol{y}\| < \frac{r}{2} + \frac{r}{2} = r.$$因此 $\boldsymbol{x} \in B(\boldsymbol{0}, r)$,从而 $\boldsymbol{x} \in U$。这表明 $f(U) = V$。
- 单射:若 $\boldsymbol{x}_1, \boldsymbol{x}_2 \in U$ 满足 $f(\boldsymbol{x}_1) = f(\boldsymbol{x}_2) = \boldsymbol{y} \in V$,则 $\boldsymbol{x}_1$ 和 $\boldsymbol{x}_2$ 都是 $\phi_{\boldsymbol{y}}$ 在 $\overline{B}(\boldsymbol{0}, r)$ 中的不动点。由压缩映射原理的唯一性,$\boldsymbol{x}_1 = \boldsymbol{x}_2$。
因此 $f: U \to V$ 是双射。这就完成了结论 1 的证明。
第五步:反函数连续。
对任意 $\boldsymbol{y}_1, \boldsymbol{y}_2 \in V$,令 $\boldsymbol{x}_1 = f^{-1}(\boldsymbol{y}_1), \boldsymbol{x}_2 = f^{-1}(\boldsymbol{y}_2) \in \overline{B}(\boldsymbol{0}, r)$。由 $f(\boldsymbol{x}_i) = \boldsymbol{y}_i$ 即 $\boldsymbol{x}_i = \boldsymbol{g}(\boldsymbol{x}_i) + \boldsymbol{y}_i$,有
移项得 $\frac{1}{2} \|\boldsymbol{x}_1 - \boldsymbol{x}_2\| \le \|\boldsymbol{y}_1 - \boldsymbol{y}_2\|$,即
不等式 $\|f^{-1}(\boldsymbol{y}_1) - f^{-1}(\boldsymbol{y}_2)\| \le 2 \|\boldsymbol{y}_1 - \boldsymbol{y}_2\|$ 说的是:反函数在 $V$ 上是 Lipschitz 连续的,Lipschitz 常数为 $2$。一般而言,设 $f: U \to \mathbb{R}^m$ 是定义在某个集合 $U \subset \mathbb{R}^n$ 上的映射。如果存在一个常数 $L > 0$,使得对 $U$ 中任意两点 $\boldsymbol{x}, \boldsymbol{y}$,都有
则称 $f$ 在 $U$ 上是 Lipschitz 连续的,常数 $L$ 称为它的 Lipschitz 常数。
通俗地说,Lipschitz 连续意味着函数的变化不会"太快"——任意两点之间的输出差异被输入差异的一个固定倍数所控制。这是一致连续的一种更强的形式:在一致连续中,$\delta$ 可以依赖于位置;而在 Lipschitz 连续中,$\delta = \varepsilon/L$ 对所有点都有效。
在一元微积分中,如果函数 $f$ 的导数有界,即 $|f'(x)| \le M$ 对所有 $x$ 成立,那么由中值定理,
所以 $f$ 是 Lipschitz 连续的,Lipschitz 常数就是导数的最大绝对值。多元情形完全类似——偏导数有界蕴含 Lipschitz 连续,这正是我们在 §2.3 中证明的引理 2.3.5。
在本书中,Lipschitz 连续的思想此前已多次出现:§1.2.4 定理 1.2.7 第 4 条中线性映射满足的不等式 $\|T(\boldsymbol{x})\| \le \|T\| \|\boldsymbol{x}\|$ 正是 Lipschitz 连续的形式(Lipschitz 常数即算子范数 $\|T\|$)。这里的常数 $2$ 来源于 $\boldsymbol{g}$ 的压缩系数 $1/2$(通过不等式移项得到)。Lipschitz 连续本质上是一个度量性质,不能像连续性那样用纯开集语言刻画——反函数定理的证明之所以需要这种定量估计,正是因为它要给出反函数的可微性(而不只是连续性)。
这表明 $f^{-1}$ 在 $V$ 上是 Lipschitz 连续的(因而一致连续)。结论 2 的前半部分(反函数连续)得证。
第六步:反函数可微。
设 $\boldsymbol{b} = f(\boldsymbol{a}) = \boldsymbol{0}$(回到一般点时只需平移)。我们要证 $f^{-1}$ 在 $\boldsymbol{0}$ 处可微,且导数为 $I^{-1} = I$。
对 $\boldsymbol{k} \in \mathbb{R}^n$ 充分小,令 $\boldsymbol{h} = f^{-1}(\boldsymbol{k}) - f^{-1}(\boldsymbol{0}) = f^{-1}(\boldsymbol{k})$。则 $\boldsymbol{k} = f(\boldsymbol{h})$。由第二步的定义 $\boldsymbol{g}(\boldsymbol{x}) = \boldsymbol{x} - f(\boldsymbol{x})$,即 $f(\boldsymbol{x}) = \boldsymbol{x} - \boldsymbol{g}(\boldsymbol{x})$,代入得
由 $f$ 在 $\boldsymbol{0}$ 处的可微性($Df(\boldsymbol{0}) = I$),有
即 $f(\boldsymbol{h}) - \boldsymbol{h} = o(\|\boldsymbol{h}\|)$。由于 $\boldsymbol{g}(\boldsymbol{h}) = \boldsymbol{h} - f(\boldsymbol{h}) = -(f(\boldsymbol{h}) - \boldsymbol{h})$,而小o乘以常数因子 $-1$ 仍为同阶小o($\lim_{\boldsymbol{h} \to \boldsymbol{0}} \frac{\|-\boldsymbol{g}(\boldsymbol{h})\|}{\|\boldsymbol{h}\|} = \lim_{\boldsymbol{h} \to \boldsymbol{0}} \frac{\|\boldsymbol{g}(\boldsymbol{h})\|}{\|\boldsymbol{h}\|} = 0$),故
将 (5) 代入 (4),得 $\boldsymbol{k} = \boldsymbol{h} - o(\|\boldsymbol{h}\|)$,移项即
于是 $\boldsymbol{h} - \boldsymbol{k} = o(\|\boldsymbol{h}\|)$。但我们需要 $o(\|\boldsymbol{k}\|)$——误差的无穷小必须是关于自变量 $\boldsymbol{k}$ 的无穷小。这里需要一个桥梁将两者联系起来:第五步的 Lipschitz 估计恰好提供了这个桥梁。
具体来说,第五步证明的 $\|f^{-1}(\boldsymbol{y})\| \le 2 \|\boldsymbol{y}\|$ 中取 $\boldsymbol{y} = \boldsymbol{k}$,得 $\|\boldsymbol{h}\| = \|f^{-1}(\boldsymbol{k})\| \le 2 \|\boldsymbol{k}\|$。因此
因为当 $\boldsymbol{k} \to \boldsymbol{0}$ 时 $\boldsymbol{h} = f^{-1}(\boldsymbol{k}) \to f^{-1}(\boldsymbol{0}) = \boldsymbol{0}$($f^{-1}$ 连续),而 $\|\boldsymbol{g}(\boldsymbol{h})\|/\|\boldsymbol{h}\| \to 0$ 由 (5) 保证。这恰好说明
即 $D(f^{-1})(\boldsymbol{0}) = I = [Df(\boldsymbol{0})]^{-1}$。
对于一般点 $\boldsymbol{y} \in V$,设 $\boldsymbol{x} = f^{-1}(\boldsymbol{y})$。在 $\boldsymbol{x}$ 处应用上述结论(将 $f$ 平移,使得 $\boldsymbol{x}$ 对应原点),得到 $f^{-1}$ 在 $\boldsymbol{y}$ 处可微,且导数为 $[f'(\boldsymbol{x})]^{-1}$。又因为 $(f^{-1})'(\boldsymbol{y}) = [f'(\boldsymbol{x})]^{-1} = [f'(f^{-1}(\boldsymbol{y}))]^{-1}$,而 $f'$ 连续($f$ 是 $C^1$ 的),逆矩阵运算也连续,故 $(f^{-1})'$ 连续,即 $f^{-1}$ 是 $C^1$ 的。 ∎
这个证明展示了"等价变换归约 + 线性近似主导 + 非线性扰动压缩"的标准模式。第一步通过微分同胚(平移和可逆线性映射)将问题化为标准情形(导数 = 恒等映射),这不改变"局部可逆性"的本质。第二步将导数条件转化为不动点方程:定义 $\boldsymbol{g}$ 来衡量 $f$ 与恒等映射的偏差,方程 $f(\boldsymbol{x}) = \boldsymbol{y}$ 等价于 $\boldsymbol{x} = \boldsymbol{g}(\boldsymbol{x}) + \boldsymbol{y}$。这里"导数等于恒等映射"和"$\boldsymbol{g}$ 度量偏差"是同一个事实的两种等价表述——前者提供直觉($f \approx I$),后者提供操作手段(不动点方程)。因为 $\boldsymbol{g}$ 在局部是压缩的(由 $C^1$ 条件保证),压缩映射原理给出对每个足够小的 $\boldsymbol{y}$ 的唯一不动点,即反函数值。最后,通过链式法则和逆矩阵运算,将标准情形的结论"拉回"到原映射 $f$,完成整个证明。这种"线性近似 + 压缩扰动"的论证模式,在隐函数定理的证明中将再次出现。
2.4.4 反函数定理的矩阵形式与几何意义
结论 3 的矩阵形式是实际计算中最常用的版本:对 $\boldsymbol{y} = f(\boldsymbol{x})$,
这意味着:反函数的雅可比矩阵是原函数雅可比矩阵的逆矩阵。在一元情形,这退化为 $(f^{-1})'(f(x)) = 1/f'(x)$。
从几何上看,$f'(\boldsymbol{x})$ 将定义域中的微小变化 $\boldsymbol{h}$ 映射为值域中的微小变化 $\boldsymbol{k} = f'(\boldsymbol{x})\boldsymbol{h}$。反函数的雅可比矩阵 $[f'(\boldsymbol{x})]^{-1}$ 则执行反向映射。这正是"局部线性化"的完美体现:在足够小的范围内,$f$ 和 $f^{-1}$ 的作用分别由互逆的线性映射近似。
在 §2.4.2 中,我们引入了微分同胚的概念来统领整个证明。用这一概念可以更简洁地陈述反函数定理的本质:若 $f$ 在 $\boldsymbol{a}$ 处导数可逆,则 $f$ 在 $\boldsymbol{a}$ 附近是一个局部微分同胚。在第 5 章中,我们会看到,流形正是通过局部微分同胚与 $\mathbb{R}^n$ 的开集建立联系的——反函数定理为流形的定义提供了分析学基础。
如果 $\det f'(\boldsymbol{a}) = 0$,则 $Df(\boldsymbol{a})$ 不可逆(它将某个非零向量映为零)。此时 $f$ 在 $\boldsymbol{a}$ 附近可能没有局部反函数,也可能有但反函数不可微。例如 $f(x) = x^3$ 在 $0$ 处 $f'(0)=0$,反函数 $f^{-1}(y) = \sqrt[3]{y}$ 存在但不可微。因此,条件 $\det f'(\boldsymbol{a}) \neq 0$ 是反函数可微的充分必要条件,但不是反函数存在的必要条件。
极坐标映射 $f: (0,\infty) \times (0,2\pi) \to \mathbb{R}^2$ 定义为
其雅可比矩阵为
行列式为 $\det f'(r,\theta) = r > 0$。由反函数定理,在每点 $(r,\theta)$ 的某个开邻域内,$f$ 有局部可微反函数——这正是极坐标变换中"局部可以反解出 $(r,\theta)$"的数学依据。但值得注意的是,$f$ 在整体上不是单射($(r,\theta)$ 和 $(r,\theta+2\pi)$ 映到同一点),反函数定理只保证局部的可逆性。
考虑 $f: \mathbb{R}^2 \to \mathbb{R}^2$,$f(x,y) = (e^x \cos y, e^x \sin y)$(复指数函数的实形式)。雅可比行列式为
因此每点附近都有局部反函数。但 $f$ 在整体上不是单射——$(x,y)$ 和 $(x,y+2\pi)$ 映到同一点。这再次说明,反函数定理只保证局部可逆性。
练习 2.4
- 设 $f: \mathbb{R}^2 \to \mathbb{R}^2$,$f(x,y) = (x^3 - 3xy^2, \, 3x^2 y - y^3)$(复映射 $z \mapsto z^3$ 的实形式)。
- (a) 计算 $f'(x,y)$ 和 $\det f'(x,y)$。
- (b) 在哪些点附近 $f$ 有局部可微反函数?
- (c) 验证 $(f^{-1})'(f(1,0)) = [f'(1,0)]^{-1}$。
- 设 $f: \mathbb{R}^2 \to \mathbb{R}^2$,$f(x,y) = (x+y^2, \, y - x^2)$。计算 $f'(0,0)$,判断 $\det f'(0,0)$ 是否非零,并说明 $f$ 在原点附近是否有局部可微反函数。
- 直接验证例 2.4.3 中的映射 $f(x,y) = (e^x \cos y, e^x \sin y)$ 在任意点附近有局部反函数,但整体上不是单射。具体写出在某点 $(a,b)$ 附近的局部反函数的表达式(可利用复对数)。
- 判断下列命题的真伪,并给出理由或反例:
- (a) 若 $f: \mathbb{R}^n \to \mathbb{R}^n$ 在 $\boldsymbol{a}$ 处可微且 $\det f'(\boldsymbol{a}) \neq 0$,则 $f$ 在 $\boldsymbol{a}$ 的某邻域内是单射。
- (b) 若 $f: \mathbb{R}^n \to \mathbb{R}^n$ 在开集 $U$ 上是 $C^1$ 的,且对所有 $\boldsymbol{x} \in U$ 有 $\det f'(\boldsymbol{x}) \neq 0$,则 $f$ 在 $U$ 上是单射。
- (c) 若 $f: \mathbb{R}^n \to \mathbb{R}^n$ 是 $C^1$ 的且在 $\boldsymbol{a}$ 处 $\det f'(\boldsymbol{a}) \neq 0$,则存在 $\boldsymbol{a}$ 的邻域,使得 $f$ 在其上是开映射(即将开集映为开集)。
- 定理 2.4.1 要求 $f$ 是 $C^1$ 的。仅假设 $f$ 在 $\boldsymbol{a}$ 处可微(偏导数不必连续)且 $\det f'(\boldsymbol{a}) \neq 0$,结论还成立吗?如果成立,给出证明或参考文献;如果不成立,构造反例。
- 设 $f: \mathbb{R}^n \to \mathbb{R}^n$ 是 $C^1$ 的,且存在常数 $c > 0$ 使得对所有 $\boldsymbol{x}$,$\|f'(\boldsymbol{x})^{-1}\| \le c$(即雅可比矩阵的逆矩阵的算子范数一致有界)。证明 $f$ 是整体单射。提示:考虑连接两点的线段,利用中值定理的积分形式或逐段估计。
- 补全定理 2.4.1 证明中遗留的细节:证明 $V = f(U)$ 是开集。提示:在 $V$ 中任取一点 $\boldsymbol{b} = f(\boldsymbol{a})$,证明 $\boldsymbol{b}$ 是 $V$ 的内点——利用已证的局部双射性质,对 $\boldsymbol{b}$ 附近每一点 $\boldsymbol{y}$,可以找到 $\boldsymbol{x}$ 使得 $f(\boldsymbol{x}) = \boldsymbol{y}$。