Auto-supervision contrastive expliquée pour les experts


L'auto-supervision contrastive désigne un paradigme d'apprentissage auto-supervisé dans lequel un modèle apprend des représentations en utilisant des principes d'apprentissage contrastif, maximisant la similarité des paires positives et minimisant la similarité des paires négatives.

Formellement, la perte InfoNCE est souvent utilisée :

\[ \mathcal{L}_{i} = -\log \frac{\exp(\mathrm{sim}(\mathbf{z}_i, \mathbf{z}_i^+)/\tau)}{\sum_{k=1}^{N} \exp(\mathrm{sim}(\mathbf{z}_i, \mathbf{z}_k)/\tau)} \]

où \( \mathbf{z}_i \) et \( \mathbf{z}_i^+ \) sont les représentations d'une paire positive, \( \mathbf{z}_k \) les représentations de tous les exemples du lot, \( \mathrm{sim} \) une fonction de similarité (par ex. similarité cosinus) et \( \tau \) un paramètre de température.

Par ce contraste, le modèle apprend un espace de représentation structuré qui reflète les relations sémantiques, sans dépendre d'annotations manuelles.


Définition :
« L'auto-supervision contrastive est une méthode d'apprentissage auto-supervisé qui, en maximisant la similarité entre différentes représentations d'un même point de données et en minimisant la similarité avec d'autres points de données, apprend des représentations robustes et significatives. »


Source :
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. In Proceedings of the 37th International Conference on Machine Learning (ICML).