Apprentissage auto-supervisé avec augmentation de données expliqué pour les experts


L'apprentissage auto-supervisé avec augmentation de données désigne une classe de méthodes d'apprentissage dans lesquelles un modèle apprend, à partir de variations artificiellement générées des données d'entrée, à former des représentations robustes et généralisables.

Formellement, une donnée d'entrée \( x \) est transformée par une fonction d'augmentation stochastique \( t \sim \mathcal{T} \), de sorte que \( \tilde{x} = t(x) \) en résulte.

L'objectif est d'entraîner une fonction d'encodage \( f_\theta \) qui produit des représentations similaires pour deux augmentations du même original, c'est-à-dire \( f_\theta(\tilde{x}_i) \approx f_\theta(\tilde{x}_j) \), tout en distinguant les représentations de points de données différents.

Cela est souvent réalisé par des pertes contrastives (par exemple InfoNCE) ou d'autres métriques de distance.

Les augmentations de données sont cruciales car elles simulent la variance des données et obligent le modèle à se concentrer sur des caractéristiques pertinentes.


Définition :
« L'apprentissage auto-supervisé avec augmentation de données est un paradigme d'apprentissage dans lequel un modèle apprend des représentations robustes à partir de variations artificiellement générées des données d'entrée, en produisant des représentations similaires pour différentes augmentations du même original. »


Source :
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. Proceedings of the 37th International Conference on Machine Learning (ICML).