Auto-supervisión contrastiva explicada para expertos


La auto-supervisión contrastiva se refiere a un paradigma de aprendizaje auto-supervisado, en el que un modelo aprende representaciones mediante principios de aprendizaje contrastivo que maximizan la similitud de pares positivos y minimizan la similitud de pares negativos.

Formalmente, se utiliza frecuentemente la pérdida InfoNCE:

\[ \mathcal{L}_{i} = -\log \frac{\exp(\mathrm{sim}(\mathbf{z}_i, \mathbf{z}_i^+)/\tau)}{\sum_{k=1}^{N} \exp(\mathrm{sim}(\mathbf{z}_i, \mathbf{z}_k)/\tau)} \]

donde \( \mathbf{z}_i \) y \( \mathbf{z}_i^+ \) son las representaciones de un par positivo, \( \mathbf{z}_k \) las representaciones de todos los ejemplos en el lote, \( \mathrm{sim} \) una función de similitud (p. ej., similitud coseno) y \( \tau \) un parámetro de temperatura.

A través de este contraste, el modelo aprende un espacio de representaciones estructurado que refleja relaciones semánticas, sin depender de anotaciones manuales.


Definición:
«La auto-supervisión contrastiva es un método de aprendizaje auto-supervisado que, al maximizar la similitud entre diferentes representaciones del mismo punto de datos y minimizar la similitud con otros puntos de datos, aprende representaciones robustas y significativas.»


Fuente:
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. En Proceedings of the 37th International Conference on Machine Learning (ICML).