Apprentissage auto-supervisé avec des méthodes contrastives expliqué pour les experts


L'apprentissage auto-supervisé avec des méthodes contrastives désigne une classe de procédures d'apprentissage dans lesquelles un encodeur f_θ est entraîné à maximiser la similarité entre les représentations de paires positives et à minimiser celle des paires négatives.

Formellement, on utilise souvent la perte InfoNCE, définie pour un embedding ancre z_i et son pendant positif z_j ainsi qu'un ensemble d'exemples négatifs z_k :

\[ \mathcal{L}_{i,j} = -\log rac{\exp(\mathrm{sim}(z_i, z_j) / au)}{\sum_{k=1}^{N} \exp(\mathrm{sim}(z_i, z_k) / au)} \]

τ est la température et « sim » est par exemple la mesure de similarité cosinus.

La sélection et la génération des paires positives et négatives sont cruciales pour le succès de l'apprentissage.

Des méthodes récentes comme BYOL ou SimSiam se passent même de paires négatives explicites et utilisent des astuces d'architecture pour éviter les solutions effondrées.

Les méthodes d'apprentissage auto-supervisé contrastif se sont révélées très efficaces pour extraire des caractéristiques représentatives à partir de données non étiquetées, ce qui est exploité dans des domaines tels que la vision par ordinateur, le traitement du langage et les modèles multimodaux.


Définition :
« L'apprentissage auto-supervisé avec des méthodes contrastives est un paradigme d'apprentissage dans lequel un modèle apprend des représentations robustes à partir de données non étiquetées en maximisant la similarité entre paires de données positives et en minimisant la similarité avec des paires négatives. »


Source :
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. In Proceedings of the 37th International Conference on Machine Learning (ICML).