L'apprentissage auto-supervisé avec masquage repose sur le fait que des parties des données d'entrée sont délibérément masquées (cachées) et que le modèle apprend à reconstruire ces informations manquantes.
Dans le domaine du traitement du langage naturel, le Masked Language Modeling (MLM) est un exemple connu, où des mots individuels dans une phrase sont retirés au hasard et remplacés par un masque.
Le modèle est entraîné à prédire les mots masqués à partir du reste du contexte, ce qui lui permet d'apprendre des représentations linguistiques profondes.
Dans le domaine du traitement d'images, il existe des approches similaires où des zones d'image sont masquées et le modèle apprend à reconstruire ou à classifier ces pixels.
Cette méthode permet d'utiliser efficacement de grandes quantités de données non étiquetées et d'apprendre des représentations de caractéristiques robustes qui peuvent être utilisées pour de nombreuses tâches.