Kontrastive Selbstüberwachung bezeichnet ein Paradigma des selbstüberwachten Lernens, bei dem ein Modell mittels kontrastiver Lernprinzipien Repräsentationen lernt, die die Ähnlichkeit positiver Paare maximieren und die Ähnlichkeit negativer Paare minimieren.
Formell wird häufig der InfoNCE-Verlust verwendet:
\[ \mathcal{L}_{i} = -\log \frac{\exp(\mathrm{sim}(\mathbf{z}_i, \mathbf{z}_i^+)/\tau)}{\sum_{k=1}^{N} \exp(\mathrm{sim}(\mathbf{z}_i, \mathbf{z}_k)/\tau)} \]
wobei \( \mathbf{z}_i \) und \( \mathbf{z}_i^+ \) die Repräsentationen eines positiven Paares sind, \( \mathbf{z}_k \) die Repräsentationen aller Beispiele im Batch, \( \mathrm{sim} \) eine Ähnlichkeitsfunktion (z.B. Kosinus-Ähnlichkeit) und \( \tau \) eine Temperatur-Parameter.
Durch diese Kontrastierung lernt das Modell eine strukturierte Repräsentationsraum, der semantische Beziehungen widerspiegelt, ohne auf manuelle Annotationen angewiesen zu sein.
Definition:
„Kontrastive Selbstüberwachung ist ein selbstüberwachtes Lernverfahren, das durch Maximierung der Ähnlichkeit zwischen verschiedenen Darstellungen desselben Datenpunkts und Minimierung der Ähnlichkeit zu anderen Datenpunkten robuste und aussagekräftige Repräsentationen lernt.“
Quelle:
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. In Proceedings of the 37th International Conference on Machine Learning (ICML).