Selbstüberwachtes Lernen mit Kontrastiven Methoden erklärt für Experten


Selbstüberwachtes Lernen mit kontrastiven Methoden bezeichnet eine Klasse von Lernverfahren, bei denen ein Encoder f_θ darauf trainiert wird, die Ähnlichkeit zwischen Repräsentationen positiver Paare zu maximieren und die von negativen Paaren zu minimieren.

Formal wird häufig der InfoNCE-Verlust verwendet, der für ein Anker-Embedding z_i und dessen positives Gegenstück z_j sowie eine Menge negativer Beispiele z_k definiert ist:

\[ \mathcal{L}_{i,j} = -\log rac{\exp(\mathrm{sim}(z_i, z_j) / au)}{\sum_{k=1}^{N} \exp(\mathrm{sim}(z_i, z_k) / au)} \]

Hierbei ist τ die Temperatur und „sim“ z.B. der Kosinusähnlichkeitsmaßstab.

Die Auswahl und Generierung der positiven und negativen Paare ist entscheidend für den Lernerfolg.

Neuere Methoden wie BYOL oder SimSiam verzichten sogar auf explizite negative Paare und nutzen Architekturtricks, um kollabierende Lösungen zu vermeiden.

Kontrastive selbstüberwachte Lernverfahren haben sich als sehr effektiv erwiesen, um repräsentative Merkmale aus unlabeled Daten zu extrahieren, was in Bereichen wie Computer Vision, Sprachverarbeitung und multimodalen Modellen genutzt wird.


Definition:
„Selbstüberwachtes Lernen mit kontrastiven Methoden ist ein Lernparadigma, bei dem ein Modell durch Maximierung der Ähnlichkeit zwischen positiven Datenpaaren und Minimierung der Ähnlichkeit zu negativen Paaren robuste Repräsentationen aus unlabeled Daten lernt.“


Quelle:
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. In Proceedings of the 37th International Conference on Machine Learning (ICML).