附录 A:ELBO 的严密推导与 EM 算法单调性证明
为了深刻理解隐变量模型与变分推断,本附录从两个不同的数学视角对证据下界(ELBO)进行严密推导,并在此基础上给出 EM 算法单调性的严格证明。
A.1 基于 Jensen 不等式的推导
设 $\mathbf{X}$ 为观测数据集,$\mathbf{Z}$ 为不可观测的隐变量,$\theta$ 为模型参数。观测数据的对数边缘似然为:
$$
\mathcal{L}(\theta) = \log p(\mathbf{X} \mid \theta) = \log \int p(\mathbf{X}, \mathbf{Z} \mid \theta) \, d\mathbf{Z}
$$
引入任意一个关于隐变量 $\mathbf{Z}$ 的概率密度函数 $q(\mathbf{Z})$,满足 $q(\mathbf{Z}) \ge 0$ 且 $\int q(\mathbf{Z}) \, d\mathbf{Z} = 1$。将被积函数改写为 $p(\mathbf{X}, \mathbf{Z} \mid \theta) = \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{q(\mathbf{Z})} q(\mathbf{Z})$,代入对数似然中:
$$
\log p(\mathbf{X} \mid \theta) = \log \int \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{q(\mathbf{Z})} q(\mathbf{Z}) \, d\mathbf{Z} \tag{A.1}
$$
式 (A.1) 右侧的积分可以视作随机变量 $Y = \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{q(\mathbf{Z})}$ 在分布 $q(\mathbf{Z})$ 下的期望 $\mathbb{E}_{q(\mathbf{Z})}[Y]$。
由于对数函数 $f(y) = \log(y)$ 是严格凹函数(其二阶导数 $f''(y) = -1/y^2 \lt 0$),根据 Jensen 不等式,对于任意随机变量 $Y$ 有 $\mathbb{E}[f(Y)] \le f(\mathbb{E}[Y])$。应用得:
$$
\log p(\mathbf{X} \mid \theta) = \log \left( \mathbb{E}_{q(\mathbf{Z})} \left[ \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{q(\mathbf{Z})} \right] \right) \ge \mathbb{E}_{q(\mathbf{Z})} \left[ \log \left( \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{q(\mathbf{Z})} \right) \right] \tag{A.2}
$$
不等式右侧即定义为证据下界:
$$
\text{ELBO}(q, \theta) := \mathbb{E}_{q(\mathbf{Z})} \left[ \log p(\mathbf{X}, \mathbf{Z} \mid \theta) - \log q(\mathbf{Z}) \right] \tag{A.3}
$$
由此证明了 $\log p(\mathbf{X} \mid \theta) \ge \text{ELBO}(q, \theta)$。
A.2 ELBO 与 KL 散度的等价关系
我们从 KL 散度出发,揭示下界与真实似然之间的差距。计算近似分布 $q(\mathbf{Z})$ 与真实后验分布 $p(\mathbf{Z} \mid \mathbf{X}, \theta)$ 之间的 KL 散度:
$$
\text{KL}\bigl(q(\mathbf{Z}) \,\|\, p(\mathbf{Z} \mid \mathbf{X}, \theta)\bigr) = \int q(\mathbf{Z}) \log \left( \frac{q(\mathbf{Z})}{p(\mathbf{Z} \mid \mathbf{X}, \theta)} \right) d\mathbf{Z} \tag{A.4}
$$
将贝叶斯公式 $p(\mathbf{Z} \mid \mathbf{X}, \theta) = \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{p(\mathbf{X} \mid \theta)}$ 代入式 (A.4) 中的分母:
$$
\text{KL}(q \,\|\, p) = \int q(\mathbf{Z}) \log \left( \frac{q(\mathbf{Z}) \cdot p(\mathbf{X} \mid \theta)}{p(\mathbf{X}, \mathbf{Z} \mid \theta)} \right) d\mathbf{Z} \tag{A.5}
$$
利用对数的性质 $\log(ab) = \log a + \log b$ 将式 (A.5) 拆开:
$$
\begin{aligned}
\text{KL}(q \,\|\, p) &= \int q(\mathbf{Z}) \log q(\mathbf{Z}) \, d\mathbf{Z} \\
&\quad - \int q(\mathbf{Z}) \log p(\mathbf{X}, \mathbf{Z} \mid \theta) \, d\mathbf{Z} \\
&\quad + \int q(\mathbf{Z}) \log p(\mathbf{X} \mid \theta) \, d\mathbf{Z}
\end{aligned} \tag{A.6}
$$
注意到 $\log p(\mathbf{X} \mid \theta)$ 不依赖于隐变量 $\mathbf{Z}$,因此对于概率分布 $q(\mathbf{Z})$,其期望为自身:$\int q(\mathbf{Z}) \log p(\mathbf{X} \mid \theta) \, d\mathbf{Z} = \log p(\mathbf{X} \mid \theta)$。将此项提出,并把前两项用期望符号重写:
$$
\text{KL}(q \,\|\, p) = \mathbb{E}_{q(\mathbf{Z})}[\log q(\mathbf{Z})] - \mathbb{E}_{q(\mathbf{Z})}[\log p(\mathbf{X}, \mathbf{Z} \mid \theta)] + \log p(\mathbf{X} \mid \theta) \tag{A.7}
$$
将 $\log p(\mathbf{X} \mid \theta)$ 移到等式左侧,其余项移到右侧:
$$
\begin{aligned}
\log p(\mathbf{X} \mid \theta)
&= \underbrace{\mathbb{E}_{q(\mathbf{Z})}[\log p(\mathbf{X}, \mathbf{Z} \mid \theta)] - \mathbb{E}_{q(\mathbf{Z})}[\log q(\mathbf{Z})]}_{\text{ELBO}(q, \theta)} \\
&\quad - \text{KL}\bigl(q(\mathbf{Z}) \,\|\, p(\mathbf{Z} \mid \mathbf{X}, \theta)\bigr)
\end{aligned} \tag{A.8}
$$
这就得到了经典的恒等式:
$$
\log p(\mathbf{X} \mid \theta) = \text{ELBO}(q, \theta) + \text{KL}\bigl(q(\mathbf{Z}) \,\|\, p(\mathbf{Z} \mid \mathbf{X}, \theta)\bigr) \tag{A.9}
$$
根据 Gibbs 不等式,KL 散度恒非负,即 $\text{KL}(q \,\|\, p) \ge 0$。因此,最大化 ELBO 等价于最小化近似后验 $q(\mathbf{Z})$ 与真实后验 $p(\mathbf{Z} \mid \mathbf{X}, \theta)$ 之间的 KL 散度。当 $q(\mathbf{Z})$ 完美逼近真实后验时,KL 散度为 0,ELBO 严格等于对数似然。
A.3 ELBO 的物理意义分解
将 ELBO 的定义式 (A.3) 稍作变形,利用联合分布的分解 $p(\mathbf{X}, \mathbf{Z} \mid \theta) = p(\mathbf{X} \mid \mathbf{Z}, \theta) p(\mathbf{Z} \mid \theta)$,可以得到:
$$
\begin{aligned}
\text{ELBO}(q, \theta)
&= \mathbb{E}_{q(\mathbf{Z})}[\log p(\mathbf{X} \mid \mathbf{Z}, \theta)] \\
&\quad - \mathbb{E}_{q(\mathbf{Z})} \left[ \log \frac{q(\mathbf{Z})}{p(\mathbf{Z} \mid \theta)} \right]
\end{aligned} \tag{A.10}
$$
这揭示了 ELBO 内部两项的物理意义:
- 第一项 $\mathbb{E}_{q(\mathbf{Z})}[\log p(\mathbf{X} \mid \mathbf{Z}, \theta)]$:称为重构对数似然。它要求在采样出的隐变量 $\mathbf{Z}$ 下,模型生成的数据 $\mathbf{X}$ 的概率要尽可能大。
- 第二项 $-\text{KL}(q(\mathbf{Z}) \,\|\, p(\mathbf{Z} \mid \theta))$:称为先验正则化项。它惩罚近似后验 $q(\mathbf{Z})$ 偏离模型预设的先验分布 $p(\mathbf{Z} \mid \theta)$。
这种分解形式构成了变分自编码器(VAE)损失函数的基础:最大化 ELBO,就是要在"数据重构能力"与"隐变量分布贴近先验"之间寻找最优平衡。
A.4 EM 算法单调性的严格证明
基于式 (A.9) 的恒等式,我们可以极其清晰地证明 EM 算法的单调性,即每次迭代后对数似然不降。设在第 $t$ 次迭代,当前参数为 $\theta^{(t)}$。
E 步:固定参数 $\theta = \theta^{(t)}$,寻找使 ELBO 最大的分布 $q$。根据式 (A.9):
$$
\log p(\mathbf{X} \mid \theta^{(t)}) = \text{ELBO}(q, \theta^{(t)}) + \text{KL}\bigl(q(\mathbf{Z}) \,\|\, p(\mathbf{Z} \mid \mathbf{X}, \theta^{(t)})\bigr)
$$
因为等式左侧的对数似然此时是一个常数,所以最大化 ELBO 等价于最小化 KL 散度。由于 $q(\mathbf{Z})$ 可以取任意分布,KL 散度的最小值为 0,当且仅当 $q^{(t+1)}(\mathbf{Z}) = p(\mathbf{Z} \mid \mathbf{X}, \theta^{(t)})$。此时,下界被"拉紧":
$$
\text{ELBO}(q^{(t+1)}, \theta^{(t)}) = \log p(\mathbf{X} \mid \theta^{(t)}) \tag{A.11}
$$
M 步:固定分布 $q = q^{(t+1)}$,寻找使 ELBO 最大的参数 $\theta$。由于 $q^{(t+1)}$ 已经固定,式 (A.9) 中的 KL 散度项将随 $\theta$ 变化而变化。但根据 KL 散度的非负性,始终有:
$$
\log p(\mathbf{X} \mid \theta) \ge \text{ELBO}(q^{(t+1)}, \theta)
$$
我们通过更新参数来最大化 ELBO:$\theta^{(t+1)} = \arg\max_{\theta} \text{ELBO}(q^{(t+1)}, \theta)$。这意味着必有:
$$
\text{ELBO}(q^{(t+1)}, \theta^{(t+1)}) \ge \text{ELBO}(q^{(t+1)}, \theta^{(t)}) \tag{A.12}
$$
结合式 (A.11) 和 (A.12),以及对数似然始终大于等于 ELBO 的性质,我们得到不等式链:
$$
\begin{aligned}
\log p(\mathbf{X} \mid \theta^{(t+1)}) &\ge \text{ELBO}(q^{(t+1)}, \theta^{(t+1)}) \\
&\ge \text{ELBO}(q^{(t+1)}, \theta^{(t)}) \\
&= \log p(\mathbf{X} \mid \theta^{(t)})
\end{aligned} \tag{A.13}
$$
这就严格证明了 $\mathcal{L}(\theta^{(t+1)}) \ge \mathcal{L}(\theta^{(t)})$,即 EM 算法在每次迭代后,观测数据的对数似然必然单调不降。