Méthodes d'apprentissage contrastif expliquées pour les experts


Les méthodes d'apprentissage contrastif sont des méthodes d'apprentissage auto-supervisé qui entraînent une fonction d'encodage f : X → R^d, de sorte que pour un exemple ancre x_i, la représentation f(x_i) soit plus proche de celle des exemples positifs x_j^+ que des exemples négatifs x_k^-.

Cela est souvent formalisé par une perte contrastive telle que la NT-Xent Loss (Normalized Temperature-scaled Cross Entropy Loss), qui maximise ou minimise les similarités pour un lot d'exemples.

La méthode repose sur l'hypothèse que des points de données similaires (par exemple, différentes augmentations d'une même image) devraient posséder des représentations sémantiquement proches, tandis que les exemples dissemblables doivent être distingués.

Des approches modernes comme SimCLR (Chen et al., 2020) utilisent de fortes augmentations de données et de grandes tailles de lot, tandis que des méthodes comme MoCo (He et al., 2020) utilisent une file d'attente pour les exemples négatifs.


Définition :
« Les méthodes d'apprentissage contrastif sont des méthodes d'apprentissage auto-supervisé qui apprennent une représentation significative des données en maximisant la similarité entre paires d'exemples positifs et en minimisant la similarité avec des exemples négatifs. »


Source :
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. In Proceedings of the 37th International Conference on Machine Learning (ICML).