Selbstüberwachtes Lernen mit Maskierung bezeichnet ein Trainingsparadigma, bei dem ein Modell f_θ darauf trainiert wird, maskierte Teile der Eingabedaten x_{mask} anhand des unmaskierten Kontextes x_{context} vorherzusagen.
Formal lässt sich dies als Minimierung eines Rekonstruktionsverlusts beschreiben:
\[ \mathcal{L}(\theta) = \mathbb{E}_{x \sim D} \left[ \ell (f_\theta(x_{context}), x_{mask}) \right] \]
wobei \( \ell \) eine geeignete Verlustfunktion ist, z. B. Kreuzentropie bei diskreten Token oder MSE bei kontinuierlichen Daten.
Bekannte Modelle im NLP sind z.B. BERT (Devlin et al., 2019), das Masked Language Modeling für Kontextrepräsentationen nutzt.
Im Bereich der Computer Vision wurde das Konzept durch Masked Autoencoders (MAE) erweitert, die große Bildbereiche maskieren und durch das Modell rekonstruieren lassen.
Diese Ansätze sind effektiv, um selbstüberwachte Repräsentationen zu erlernen, die in downstream Aufgaben mit wenig zusätzlichem Training eingesetzt werden können.
Definition:
„Selbstüberwachtes Lernen mit Maskierung ist ein Lernparadigma, bei dem ein Modell trainiert wird, gezielt maskierte Teile der Eingabedaten anhand des unmaskierten Kontextes zu rekonstruieren, um robuste und generalisierbare Repräsentationen zu lernen.“
Quelle:
Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.