Selbstüberwachtes Lernen mit Datenaugmentation bezeichnet eine Klasse von Lernverfahren, bei denen ein Modell durch künstlich erzeugte Variationen der Eingabedaten lernt, robuste und generalisierbare Repräsentationen zu bilden.
Formal wird ein Eingabedatum \( x \) durch eine stochastische Augmentationsfunktion \( t \sim \mathcal{T} \) transformiert, sodass \( ilde{x} = t(x) \) entsteht.
Das Ziel ist es, eine Einbettungsfunktion \( f_ heta \) zu trainieren, die für zwei Augmentierungen desselben Originals ähnliche Repräsentationen erzeugt, also \( f_ heta( ilde{x}_i) \approx f_ heta( ilde{x}_j) \), während Repräsentationen unterschiedlicher Datenpunkte auseinandergehalten werden.
Dies wird oft durch kontrastive Verluste (z.B. InfoNCE) oder andere Distanzmetriken realisiert.
Datenaugmentationen sind dabei entscheidend, da sie die Varianz der Daten simulieren und das Modell zwingen, auf relevante Merkmale zu fokussieren.
Definition:
„Selbstüberwachtes Lernen mit Datenaugmentation ist ein Lernparadigma, bei dem ein Modell durch künstlich erzeugte Variationen der Eingabedaten robuste Repräsentationen lernt, indem es ähnliche Darstellungen für verschiedene Augmentierungen desselben Originals erzeugt.“
Quelle:
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. Proceedings of the 37th International Conference on Machine Learning (ICML).