对比散度是一种用于能量基模型参数估计的近似方法,特别是在受限玻尔兹曼机中,通过对数据分布和模型分布之间的差异来近似对数似然的梯度。
形式上,参数更新基于梯度
\[ \nabla_\theta \log p(x; \theta) = -\mathbb{E}_{p(h|x)}\left[\nabla_\theta E(x,h;\theta)\right] + \mathbb{E}_{p(x,h)}\left[\nabla_\theta E(x,h;\theta)\right] \]
通过用从数据点开始的 k 步短 Gibbs 采样链(CD-k)替代第二个期望来近似:
\[ \Delta \theta \propto -\left( \mathbb{E}_{p(h|x)}\left[\nabla_\theta E(x,h;\theta)\right] - \mathbb{E}_{p(h|\tilde{x})}\left[\nabla_\theta E(\tilde{x},h;\theta)\right] \right) \]
其中 \( \tilde{x} \) 是通过 Gibbs 采样生成的样本。
该方法实现了高效训练,因为只需少量采样步骤即可获得良好的近似。
然而,该近似会引入偏差,但在实际中是可容忍的,并且可以通过如持久对比散度(PCD)等变体加以改进。
定义:
“对比散度是一种近似学习方法,用于能量基模型中高效估计模型参数,通过对数据分布和模型分布之间的差异来近似对数似然的梯度,其中模型分布通过短的 Gibbs 采样链进行近似。”
来源:
Hinton, G. E. (2002). Training products of experts by minimizing contrastive divergence. Neural Computation, 14(8), 1771–1800.