附录 A:ELBO 的严密推导与 EM 算法单调性证明

为了深刻理解隐变量模型与变分推断,本附录从两个不同的数学视角对证据下界(ELBO)进行严密推导,并在此基础上给出 EM 算法单调性的严格证明。

A.1 基于 Jensen 不等式的推导

设 $\mathbf{X}$ 为观测数据集,$\mathbf{Z}$ 为不可观测的隐变量,$\theta$ 为模型参数。观测数据的对数边缘似然为:

$$ \mathcal{L}(\theta) = \log p(\mathbf{X} \mid \theta) = \log \int p(\mathbf{X}, \mathbf{Z} \mid \theta) \, d\mathbf{Z} $$

引入任意一个关于隐变量 $\mathbf{Z}$ 的概率密度函数 $q(\mathbf{Z})$,满足 $q(\mathbf{Z}) \ge 0$ 且 $\int q(\mathbf{Z}) \, d\mathbf{Z} = 1$。将被积函数改写为 $p(\mathbf{X}, \mathbf{Z} \mid \theta) = \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{q(\mathbf{Z})} q(\mathbf{Z})$,代入对数似然中:

$$ \log p(\mathbf{X} \mid \theta) = \log \int \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{q(\mathbf{Z})} q(\mathbf{Z}) \, d\mathbf{Z} \tag{A.1} $$

式 (A.1) 右侧的积分可以视作随机变量 $Y = \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{q(\mathbf{Z})}$ 在分布 $q(\mathbf{Z})$ 下的期望 $\mathbb{E}_{q(\mathbf{Z})}[Y]$。

由于对数函数 $f(y) = \log(y)$ 是严格凹函数(其二阶导数 $f''(y) = -1/y^2 \lt 0$),根据 Jensen 不等式,对于任意随机变量 $Y$ 有 $\mathbb{E}[f(Y)] \le f(\mathbb{E}[Y])$。应用得:

$$ \log p(\mathbf{X} \mid \theta) = \log \left( \mathbb{E}_{q(\mathbf{Z})} \left[ \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{q(\mathbf{Z})} \right] \right) \ge \mathbb{E}_{q(\mathbf{Z})} \left[ \log \left( \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{q(\mathbf{Z})} \right) \right] \tag{A.2} $$

不等式右侧即定义为证据下界:

$$ \text{ELBO}(q, \theta) := \mathbb{E}_{q(\mathbf{Z})} \left[ \log p(\mathbf{X}, \mathbf{Z} \mid \theta) - \log q(\mathbf{Z}) \right] \tag{A.3} $$

由此证明了 $\log p(\mathbf{X} \mid \theta) \ge \text{ELBO}(q, \theta)$。

A.2 ELBO 与 KL 散度的等价关系

我们从 KL 散度出发,揭示下界与真实似然之间的差距。计算近似分布 $q(\mathbf{Z})$ 与真实后验分布 $p(\mathbf{Z} \mid \mathbf{X}, \theta)$ 之间的 KL 散度:

$$ \text{KL}\bigl(q(\mathbf{Z}) \,\|\, p(\mathbf{Z} \mid \mathbf{X}, \theta)\bigr) = \int q(\mathbf{Z}) \log \left( \frac{q(\mathbf{Z})}{p(\mathbf{Z} \mid \mathbf{X}, \theta)} \right) d\mathbf{Z} \tag{A.4} $$

将贝叶斯公式 $p(\mathbf{Z} \mid \mathbf{X}, \theta) = \frac{p(\mathbf{X}, \mathbf{Z} \mid \theta)}{p(\mathbf{X} \mid \theta)}$ 代入式 (A.4) 中的分母:

$$ \text{KL}(q \,\|\, p) = \int q(\mathbf{Z}) \log \left( \frac{q(\mathbf{Z}) \cdot p(\mathbf{X} \mid \theta)}{p(\mathbf{X}, \mathbf{Z} \mid \theta)} \right) d\mathbf{Z} \tag{A.5} $$

利用对数的性质 $\log(ab) = \log a + \log b$ 将式 (A.5) 拆开:

$$ \begin{aligned} \text{KL}(q \,\|\, p) &= \int q(\mathbf{Z}) \log q(\mathbf{Z}) \, d\mathbf{Z} \\ &\quad - \int q(\mathbf{Z}) \log p(\mathbf{X}, \mathbf{Z} \mid \theta) \, d\mathbf{Z} \\ &\quad + \int q(\mathbf{Z}) \log p(\mathbf{X} \mid \theta) \, d\mathbf{Z} \end{aligned} \tag{A.6} $$

注意到 $\log p(\mathbf{X} \mid \theta)$ 不依赖于隐变量 $\mathbf{Z}$,因此对于概率分布 $q(\mathbf{Z})$,其期望为自身:$\int q(\mathbf{Z}) \log p(\mathbf{X} \mid \theta) \, d\mathbf{Z} = \log p(\mathbf{X} \mid \theta)$。将此项提出,并把前两项用期望符号重写:

$$ \text{KL}(q \,\|\, p) = \mathbb{E}_{q(\mathbf{Z})}[\log q(\mathbf{Z})] - \mathbb{E}_{q(\mathbf{Z})}[\log p(\mathbf{X}, \mathbf{Z} \mid \theta)] + \log p(\mathbf{X} \mid \theta) \tag{A.7} $$

将 $\log p(\mathbf{X} \mid \theta)$ 移到等式左侧,其余项移到右侧:

$$ \begin{aligned} \log p(\mathbf{X} \mid \theta) &= \underbrace{\mathbb{E}_{q(\mathbf{Z})}[\log p(\mathbf{X}, \mathbf{Z} \mid \theta)] - \mathbb{E}_{q(\mathbf{Z})}[\log q(\mathbf{Z})]}_{\text{ELBO}(q, \theta)} \\ &\quad - \text{KL}\bigl(q(\mathbf{Z}) \,\|\, p(\mathbf{Z} \mid \mathbf{X}, \theta)\bigr) \end{aligned} \tag{A.8} $$

这就得到了经典的恒等式:

$$ \log p(\mathbf{X} \mid \theta) = \text{ELBO}(q, \theta) + \text{KL}\bigl(q(\mathbf{Z}) \,\|\, p(\mathbf{Z} \mid \mathbf{X}, \theta)\bigr) \tag{A.9} $$

根据 Gibbs 不等式,KL 散度恒非负,即 $\text{KL}(q \,\|\, p) \ge 0$。因此,最大化 ELBO 等价于最小化近似后验 $q(\mathbf{Z})$ 与真实后验 $p(\mathbf{Z} \mid \mathbf{X}, \theta)$ 之间的 KL 散度。当 $q(\mathbf{Z})$ 完美逼近真实后验时,KL 散度为 0,ELBO 严格等于对数似然。

A.3 ELBO 的物理意义分解

将 ELBO 的定义式 (A.3) 稍作变形,利用联合分布的分解 $p(\mathbf{X}, \mathbf{Z} \mid \theta) = p(\mathbf{X} \mid \mathbf{Z}, \theta) p(\mathbf{Z} \mid \theta)$,可以得到:

$$ \begin{aligned} \text{ELBO}(q, \theta) &= \mathbb{E}_{q(\mathbf{Z})}[\log p(\mathbf{X} \mid \mathbf{Z}, \theta)] \\ &\quad - \mathbb{E}_{q(\mathbf{Z})} \left[ \log \frac{q(\mathbf{Z})}{p(\mathbf{Z} \mid \theta)} \right] \end{aligned} \tag{A.10} $$

这揭示了 ELBO 内部两项的物理意义:

这种分解形式构成了变分自编码器(VAE)损失函数的基础:最大化 ELBO,就是要在"数据重构能力"与"隐变量分布贴近先验"之间寻找最优平衡。

A.4 EM 算法单调性的严格证明

基于式 (A.9) 的恒等式,我们可以极其清晰地证明 EM 算法的单调性,即每次迭代后对数似然不降。设在第 $t$ 次迭代,当前参数为 $\theta^{(t)}$。

E 步:固定参数 $\theta = \theta^{(t)}$,寻找使 ELBO 最大的分布 $q$。根据式 (A.9):

$$ \log p(\mathbf{X} \mid \theta^{(t)}) = \text{ELBO}(q, \theta^{(t)}) + \text{KL}\bigl(q(\mathbf{Z}) \,\|\, p(\mathbf{Z} \mid \mathbf{X}, \theta^{(t)})\bigr) $$

因为等式左侧的对数似然此时是一个常数,所以最大化 ELBO 等价于最小化 KL 散度。由于 $q(\mathbf{Z})$ 可以取任意分布,KL 散度的最小值为 0,当且仅当 $q^{(t+1)}(\mathbf{Z}) = p(\mathbf{Z} \mid \mathbf{X}, \theta^{(t)})$。此时,下界被"拉紧":

$$ \text{ELBO}(q^{(t+1)}, \theta^{(t)}) = \log p(\mathbf{X} \mid \theta^{(t)}) \tag{A.11} $$

M 步:固定分布 $q = q^{(t+1)}$,寻找使 ELBO 最大的参数 $\theta$。由于 $q^{(t+1)}$ 已经固定,式 (A.9) 中的 KL 散度项将随 $\theta$ 变化而变化。但根据 KL 散度的非负性,始终有:

$$ \log p(\mathbf{X} \mid \theta) \ge \text{ELBO}(q^{(t+1)}, \theta) $$

我们通过更新参数来最大化 ELBO:$\theta^{(t+1)} = \arg\max_{\theta} \text{ELBO}(q^{(t+1)}, \theta)$。这意味着必有:

$$ \text{ELBO}(q^{(t+1)}, \theta^{(t+1)}) \ge \text{ELBO}(q^{(t+1)}, \theta^{(t)}) \tag{A.12} $$

结合式 (A.11) 和 (A.12),以及对数似然始终大于等于 ELBO 的性质,我们得到不等式链:

$$ \begin{aligned} \log p(\mathbf{X} \mid \theta^{(t+1)}) &\ge \text{ELBO}(q^{(t+1)}, \theta^{(t+1)}) \\ &\ge \text{ELBO}(q^{(t+1)}, \theta^{(t)}) \\ &= \log p(\mathbf{X} \mid \theta^{(t)}) \end{aligned} \tag{A.13} $$

这就严格证明了 $\mathcal{L}(\theta^{(t+1)}) \ge \mathcal{L}(\theta^{(t)})$,即 EM 算法在每次迭代后,观测数据的对数似然必然单调不降。