Kontrastive Divergenz ist ein approximatives Verfahren zur Parameterschätzung in Energy-Based Models, insbesondere in Restricted Boltzmann Machines, das den Gradienten der Log-Likelihood durch Differenzbildung zwischen Daten- und Modellverteilung approximiert.
Formal wird die Parameteraktualisierung anhand des Gradienten
\[ \nabla_\theta \log p(x; \theta) = -\mathbb{E}_{p(h|x)}\left[\nabla_\theta E(x,h;\theta)\right] + \mathbb{E}_{p(x,h)}\left[\nabla_\theta E(x,h;\theta)\right] \]
approximiert, indem die zweite Erwartung durch eine kurze Gibbs-Sampling-Kette mit k Schritten ersetzt wird, die von den Datenpunkten startet (CD-k):
\[ \Delta \theta \propto -\left( \mathbb{E}_{p(h|x)}\left[\nabla_\theta E(x,h;\theta)\right] - \mathbb{E}_{p(h|\tilde{x})}\left[\nabla_\theta E(\tilde{x},h;\theta)\right] \right) \]
mit \( \tilde{x} \) als den durch Gibbs-Sampling generierten Beispielen.
Diese Methode ermöglicht effizientes Training, da nur wenige Sampling-Schritte notwendig sind, um gute Approximationen zu erhalten.
Allerdings führt die Approximation zu einem Bias, der in der Praxis tolerierbar ist und durch Varianten wie Persistent Contrastive Divergence (PCD) verbessert werden kann.
Definition:
„Kontrastive Divergenz ist ein approximatives Lernverfahren zur effizienten Schätzung von Modellparametern in Energy-Based Models, bei dem der Gradient der Log-Likelihood durch Differenzbildung zwischen Daten- und Modellverteilung approximiert wird, wobei die Modellverteilung durch kurze Gibbs-Sampling-Ketten angenähert wird.“
Quelle:
Hinton, G. E. (2002). Training products of experts by minimizing contrastive divergence. Neural Computation, 14(8), 1771–1800.