Transformer-Architektur erklärt für Experten


Die Transformer-Architektur (Vaswani et al., 2017) ist ein sequenzbasiertes Modell, das auf einem Self-Attention-Mechanismus basiert, um Eingabesequenzen parallel zu verarbeiten und kontextuelle Abhängigkeiten global zu modellieren.

Formal besteht ein Transformer aus mehreren Encoder- und Decoder-Layern, wobei jeder Encoder-Layer eine Multi-Head Self-Attention (MHSA) Komponente und ein positionelles Feedforward-Netzwerk (FFN) enthält.

Die Self-Attention für eine Eingabesequenz \(X = (x_1, ..., x_n)\) berechnet für jeden Token gewichtete Summen über alle Tokens:

\[ \mathrm{Attention}(Q,K,V) = \mathrm{softmax}\left( rac{QK^T}{\sqrt{d_k}} ight) V \]

Hierbei sind Queries \(Q\), Keys \(K\) und Values \(V\) lineare Projektionen von \(X\), und \(d_k\) die Dimension der Key-Vektoren.

Multi-Head Attention erweitert dies durch parallele Attention-Köpfe, die unterschiedliche Aspekte der Eingabe erfassen.

Positionale Encodierungen werden hinzugefügt, um die Reihenfolge der Tokens zu berücksichtigen, da die Self-Attention selbst positionsunabhängig ist.

Die Transformer-Architektur hat den NLP-Bereich revolutioniert und ist Grundlage für Modelle wie BERT, GPT und T5, die state-of-the-art Leistungen bei zahlreichen Sprachaufgaben erzielen.


Definition:
„Transformer sind neuronale Netzwerkarchitekturen, die auf Self-Attention basieren, um Sequenzen parallel zu verarbeiten und kontextuelle Abhängigkeiten effizient zu modellieren.“


Quelle:
Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. In Advances in Neural Information Processing Systems (NeurIPS).