La divergencia contrastiva (en inglés, Contrastive Divergence, CD) es un método de optimización para la estimación eficiente de parámetros en modelos probabilísticos como las máquinas de Boltzmann.
El método se basa en calcular aproximadamente el gradiente de la función de log-verosimilitud, iniciando una cadena de Markov corta con solo unos pocos pasos desde una distribución de datos, capturando así la diferencia entre la distribución de datos y la distribución del modelo.
Esto reduce considerablemente el esfuerzo en comparación con la estimación exacta de máxima verosimilitud.
La divergencia contrastiva se utiliza frecuentemente en modelos de aprendizaje no supervisado para descubrir estructuras latentes en los datos y acelerar el entrenamiento.
Especialmente en las máquinas de Boltzmann restringidas (RBMs), CD es un método estándar para el aprendizaje eficiente de la matriz de pesos.