Apprentissage auto-supervisé avec masquage expliqué pour les experts


L'apprentissage auto-supervisé avec masquage désigne un paradigme d'entraînement dans lequel un modèle f_θ est entraîné à prédire les parties masquées des données d'entrée x_{mask} à partir du contexte non masqué x_{context}.

Formellement, cela peut être décrit comme la minimisation d'une perte de reconstruction :

\[ \mathcal{L}(\theta) = \mathbb{E}_{x \sim D} \left[ \ell (f_\theta(x_{context}), x_{mask}) \right] \]

où \( \ell \) est une fonction de perte appropriée, par exemple l'entropie croisée pour des tokens discrets ou l'erreur quadratique moyenne (MSE) pour des données continues.

Des modèles connus en NLP sont par exemple BERT (Devlin et al., 2019), qui utilise le Masked Language Modeling pour les représentations contextuelles.

Dans le domaine de la vision par ordinateur, le concept a été étendu par les Masked Autoencoders (MAE), qui masquent de larges zones d'images et les font reconstruire par le modèle.

Ces approches sont efficaces pour apprendre des représentations auto-supervisées qui peuvent être utilisées dans des tâches en aval avec peu d'entraînement supplémentaire.


Définition :
« L'apprentissage auto-supervisé avec masquage est un paradigme d'apprentissage dans lequel un modèle est entraîné à reconstruire spécifiquement les parties masquées des données d'entrée à partir du contexte non masqué, afin d'apprendre des représentations robustes et généralisables. »


Source :
Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT : Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.