Los modelos de difusión son modelos generativos probabilísticos que definen un proceso de difusión estocástico para modelar distribuciones de datos.
El proceso hacia adelante \( q \) es un proceso de Markov que añade sucesivamente ruido gaussiano a los datos:
\[ q(\mathbf{x}_t|\mathbf{x}_{t-1}) = \mathcal{N}(\mathbf{x}_t; \sqrt{1-eta_t}\mathbf{x}_{t-1}, eta_t \mathbf{I}) \]
donde \( eta_t \) son pequeños parámetros de varianza que controlan el grado de ruido.
El proceso inverso es aproximado por una red neuronal \( p_ heta \) que aprende a eliminar el ruido y así generar la distribución de datos:
\[ p_ heta(\mathbf{x}_{t-1}|\mathbf{x}_t) = \mathcal{N}(\mathbf{x}_{t-1}; oldsymbol{\mu}_ heta(\mathbf{x}_t, t), \Sigma_ heta(\mathbf{x}_t, t)) \]
El entrenamiento minimiza una variación del Evidence Lower Bound (ELBO) mediante una pérdida similar a Denoising Score Matching.
Los modelos de difusión se caracterizan por su estabilidad en el entrenamiento y alta calidad de los datos generados, aunque son computacionalmente costosos.
Definición:
«Los modelos de difusión son modelos generativos probabilísticos que modelan datos mediante un proceso estocástico hacia adelante con una función de ruido sucesiva y un proceso inverso entrenado para eliminar el ruido.»
Fuente:
Ho, J., Jain, A., & Abbeel, P. (2020). Denoising Diffusion Probabilistic Models. Advances in Neural Information Processing Systems (NeurIPS).