Transformers erklärt für Experten


Transformers sind Architekturen für sequenzielle Daten, die auf dem Self-Attention-Mechanismus basieren und parallele Verarbeitung ermöglichen.

Die Grundidee ist die Berechnung von Aufmerksamkeitsgewichten, die bestimmen, wie stark ein Eingabeelement andere Elemente berücksichtigt.

Formell wird die Attention als gewichtete Summe von Wertvektoren \( V \) berechnet, wobei die Gewichte aus der Softmax-Funktion über die Skalarprodukte von Abfrage- und Schlüsselvektoren stammen:

\[ \mathrm{Attention}(Q,K,V) = \mathrm{softmax}\left( rac{QK^T}{\sqrt{d_k}} ight) V \]

Hierbei sind \( Q, K, V \) die Matrizen für Abfragen, Schlüssel und Werte, und \( d_k \) die Dimension der Schlüsselvektoren.

Die Transformer-Architektur besteht aus einem Encoder und Decoder, die jeweils aus mehreren Schichten mit Multi-Head-Attention und Feed-Forward-Netzwerken aufgebaut sind.

Diese Struktur ermöglicht das Lernen komplexer Abhängigkeiten in Sequenzen und hat die Verarbeitung natürlicher Sprache revolutioniert.


Definition:
„Transformers sind neuronale Netzarchitekturen, die mittels Self-Attention parallele Verarbeitung von Sequenzen ermöglichen und so lange Abhängigkeiten effizient modellieren.“


Quelle:
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is All You Need. Advances in Neural Information Processing Systems (NeurIPS).