Kontrastive Kodierung erklärt für Experten


Kontrastive Kodierung bezeichnet ein Verfahren des Representation Learnings, bei dem eine Einbettungsfunktion \( f_\theta \) so trainiert wird, dass positive Paare von Datenpunkten \( (x_i, x_j^+) \) im latenten Raum näher zusammenliegen als negative Paare \( (x_i, x_k^-) \).

Formal wird häufig der InfoNCE-Verlust verwendet:

\[ \mathcal{L}_i = - \log \frac{\exp(\mathrm{sim}(f_\theta(x_i), f_\theta(x_j^+)) / \tau)}{\sum_{k=0}^K \exp(\mathrm{sim}(f_\theta(x_i), f_\theta(x_k)) / \tau)} \]

wobei \( \mathrm{sim} \) eine Ähnlichkeitsfunktion, z.B. Kosinus-Ähnlichkeit, und \( \tau \) eine Temperaturvariable ist.

Das Ziel ist es, die Repräsentationen so zu strukturieren, dass semantisch ähnliche Instanzen gruppiert und unähnliche separiert werden, was zu einer besseren Generalisierung führt.


Definition:
„Kontrastive Kodierung ist ein selbstüberwachtes Lernverfahren, das durch Maximierung der Ähnlichkeit positiver Paare und Minimierung der Ähnlichkeit negativer Paare robuste und aussagekräftige Repräsentationen erzeugt.“


Quelle:
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. Proceedings of the 37th International Conference on Machine Learning (ICML).