Apprentissage de représentations contrastives expliqué aux experts


L'apprentissage de représentations contrastives est une méthode d'apprentissage auto-supervisé visant à apprendre une fonction d'encodage \( f: \mathcal{X} \to \mathbb{R}^d \) telle que des entrées similaires \( x_i, x_j \) soient proches dans l'espace des caractéristiques, tandis que des entrées dissemblables soient éloignées.

Formellement, la perte InfoNCE est souvent utilisée, définie comme :

\[ L_i = -\log \frac{\exp(\mathrm{sim}(f(x_i), f(x_j^+)) / \tau)}{\sum_{k=1}^{N} \exp(\mathrm{sim}(f(x_i), f(x_k)) / \tau)} \]

où \( x_j^+ \) désigne un exemple positif pour \( x_i \), \( x_k \) des exemples négatifs, \( \mathrm{sim} \) une fonction de similarité (par exemple la similarité cosinus) et \( \tau \) une constante de température.

Le processus d'apprentissage optimise la fonction \( f \) de sorte que les paires positives soient plus proches et les paires négatives plus éloignées.

L'apprentissage contrastif est la base de nombreuses méthodes modernes d'apprentissage auto-supervisé telles que SimCLR, MoCo ou BYOL, qui permettent d'obtenir des représentations performantes sans annotations massives.


Définition :
« L'apprentissage de représentations contrastives est une approche d'apprentissage auto-supervisé qui génère un encodage significatif en maximisant la similarité entre paires de données positives et en minimisant la similarité entre paires négatives. »


Source :
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. Proceedings of the 37th International Conference on Machine Learning (ICML).