El aprendizaje auto-supervisado con métodos contrastivos se refiere a una clase de procedimientos de aprendizaje en los que un codificador f_θ se entrena para maximizar la similitud entre representaciones de pares positivos y minimizar la de pares negativos.
Formalmente, se utiliza frecuentemente la pérdida InfoNCE, que para un embedding ancla z_i y su contraparte positiva z_j, así como un conjunto de ejemplos negativos z_k, se define como:
\[ \mathcal{L}_{i,j} = -\log rac{\exp(\mathrm{sim}(z_i, z_j) / au)}{\sum_{k=1}^{N} \exp(\mathrm{sim}(z_i, z_k) / au)} \]
Aquí, τ es la temperatura y “sim” es, por ejemplo, la medida de similitud coseno.
La selección y generación de pares positivos y negativos es crucial para el éxito del aprendizaje.
Métodos más recientes como BYOL o SimSiam incluso prescinden de pares negativos explícitos y utilizan trucos arquitectónicos para evitar soluciones colapsadas.
Los métodos contrastivos de aprendizaje auto-supervisado han demostrado ser muy efectivos para extraer características representativas de datos no etiquetados, lo que se utiliza en áreas como visión por computadora, procesamiento del lenguaje y modelos multimodales.
Definición:
“El aprendizaje auto-supervisado con métodos contrastivos es un paradigma de aprendizaje en el que un modelo aprende representaciones robustas a partir de datos no etiquetados maximizando la similitud entre pares de datos positivos y minimizando la similitud con pares negativos.”
Fuente:
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. In Proceedings of the 37th International Conference on Machine Learning (ICML).