模块四:神经参数化与生成模型
4.1 从变分 EM 到变分自编码器(VAE)
在复杂观测数据(如图像、语音)场景下,不仅 M 步没有解析解,E 步所需的真实后验 $p(\mathbf{Z} \mid \mathbf{X}, \theta)$ 也变得不可计算。变分 EM 通过引入一个参数化的近似后验 $q_\phi(\mathbf{Z} \mid \mathbf{X})$ 来避开这一困难,并直接最大化 ELBO:
当 $\phi$ 和 $\theta$ 均为神经网络参数时,直接使用蒙特卡洛采样法估计上述期望的梯度会遇到困难:采样过程依赖于 $\phi$,导致梯度无法直接通过采样节点反向传播。
重参数化技巧是解决这一问题的关键。假设近似后验选用高斯分布 $q_\phi(\mathbf{z} \mid \mathbf{x}) = \mathcal{N}(\boldsymbol{\mu}_\phi(\mathbf{x}), \operatorname{diag}(\boldsymbol{\sigma}_\phi^2(\mathbf{x})))$。我们将采样过程重写为无梯度的噪声源与有梯度的仿射变换的组合:
此时 $\mathbf{z}$ 被表示为噪声 $\boldsymbol{\epsilon}$ 的确定性可微函数,而 $\boldsymbol{\epsilon}$ 的分布与 $\phi$ 无关。现在梯度算子可以安全地移入期望内部,得到无偏估计。这一技巧使得整个模型可以端到端地用反向传播训练,标志着变分自编码器(VAE)的诞生。
4.2 深度马尔可夫模型(DMM)
将 HMM 的离散隐状态推广为连续随机向量,并令转移和发射函数由神经网络参数化,便得到深度马尔可夫模型。其生成过程为:
由于模型的后验 $p(\mathbf{z}_{1:T} \mid \mathbf{x}_{1:T})$ 极为复杂,需引入结构化推断网络 $q_\phi(\mathbf{z}_{1:T} \mid \mathbf{x}_{1:T})$ 结合重参数化采样进行训练。深度马尔可夫模型实现了序列概率模型与深度学习的深度融合,但通常假设隐状态在欧氏空间 $\mathbb{R}^d$ 中演化,这在面对具有特定拓扑结构的真实数据时会暴露出局限性,这为后续引入流形几何埋下了伏笔。