Kontrastive Repräsentationslernen erklärt für Experten


Kontrastive Repräsentationslernen ist eine Methode des selbstüberwachten Lernens, die darauf abzielt, eine Einbettungsfunktion \( f: \mathcal{X} \to \mathbb{R}^d \) zu lernen, sodass ähnliche Eingaben \( x_i, x_j \) im Merkmalsraum nahe beieinander liegen, während unähnliche Eingaben weiter entfernt sind.

Formal wird häufig der InfoNCE-Loss verwendet, definiert als:

\[ L_i = -\log \frac{\exp(\mathrm{sim}(f(x_i), f(x_j^+)) / \tau)}{\sum_{k=1}^{N} \exp(\mathrm{sim}(f(x_i), f(x_k)) / \tau)} \]

Hierbei bezeichnet \( x_j^+ \) ein positives Beispiel zu \( x_i \), \( x_k \) negative Beispiele, \( \mathrm{sim} \) eine Ähnlichkeitsfunktion (z.B. Cosinus-Ähnlichkeit) und \( \tau \) eine Temperaturkonstante.

Der Lernprozess optimiert die Funktion \( f \), sodass positive Paare näher und negative Paare weiter auseinander liegen.

Kontrastives Lernen ist die Grundlage vieler moderner selbstüberwachter Lernverfahren wie SimCLR, MoCo oder BYOL, die es ermöglichen, leistungsfähige Repräsentationen ohne umfangreiche Beschriftungen zu gewinnen.


Definition:
„Kontrastive Repräsentationslernen ist ein selbstüberwachter Lernansatz, der durch Maximierung der Ähnlichkeit zwischen positiven Datenpaaren und Minimierung der Ähnlichkeit zwischen negativen Paaren eine aussagekräftige Einbettung erzeugt.“


Quelle:
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. Proceedings of the 37th International Conference on Machine Learning (ICML).