Selbstaufmerksamkeit erklärt für Experten


Selbstaufmerksamkeit ist ein Mechanismus, bei dem für eine Eingabesequenz X = (x_1, x_2, ..., x_n) für jedes Element x_i eine gewichtete Summe aller Elemente berechnet wird, wobei die Gewichte durch die Kompatibilität von x_i mit jedem x_j bestimmt sind.

Formal wird dies oft durch die Query (Q), Key (K) und Value (V) Matrizen realisiert, wobei die Attention Scores aus dem Skalarprodukt von Q und K normalisiert mittels Softmax berechnet werden:

Attention(Q,K,V) = softmax( (Q K^T) / sqrt(d_k) ) V

Hierbei ist d_k die Dimension der Key-Vektoren, die zur Skalierung dient.

Dieser Mechanismus erlaubt es, kontextuelle Abhängigkeiten flexibel und parallel zu modellieren, was insbesondere in Transformer-Architekturen (Vaswani et al., 2017) genutzt wird.


Definition:
„Selbstaufmerksamkeit ist ein Mechanismus in neuronalen Netzwerken, der durch Berechnung gewichteter Kombinationen der Elemente einer Eingabesequenz deren kontextuelle Beziehungen modelliert, indem jedes Element auf alle anderen Elemente der Sequenz attends.“


Quelle:
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is All You Need. In Advances in Neural Information Processing Systems (NeurIPS).