La divergence contrastive est une méthode approximative d'estimation des paramètres dans les modèles basés sur l'énergie, en particulier dans les machines de Boltzmann restreintes, qui approxime le gradient de la log-vraisemblance par la différence entre la distribution des données et la distribution du modèle.
Formellement, la mise à jour des paramètres est basée sur le gradient
\[ \nabla_\theta \log p(x; \theta) = -\mathbb{E}_{p(h|x)}\left[\nabla_\theta E(x,h;\theta)\right] + \mathbb{E}_{p(x,h)}\left[\nabla_\theta E(x,h;\theta)\right] \]
approximé en remplaçant la seconde espérance par une courte chaîne d'échantillonnage de Gibbs de k étapes, démarrant des points de données (CD-k) :
\[ \Delta \theta \propto -\left( \mathbb{E}_{p(h|x)}\left[\nabla_\theta E(x,h;\theta)\right] - \mathbb{E}_{p(h|\tilde{x})}\left[\nabla_\theta E(\tilde{x},h;\theta)\right] \right) \]
avec \( \tilde{x} \) comme les exemples générés par l'échantillonnage de Gibbs.
Cette méthode permet un entraînement efficace, car seuls quelques pas d'échantillonnage sont nécessaires pour obtenir de bonnes approximations.
Cependant, l'approximation induit un biais, qui est tolérable en pratique et peut être amélioré par des variantes telles que la divergence contrastive persistante (PCD).
Définition :
« La divergence contrastive est une méthode d'apprentissage approximative pour l'estimation efficace des paramètres du modèle dans les modèles basés sur l'énergie, où le gradient de la log-vraisemblance est approximé par la différence entre la distribution des données et la distribution du modèle, cette dernière étant approchée par de courtes chaînes d'échantillonnage de Gibbs. »
Source :
Hinton, G. E. (2002). Training products of experts by minimizing contrastive divergence. Neural Computation, 14(8), 1771–1800.