L'architecture Transformer (Vaswani et al., 2017) est un modèle séquentiel basé sur un mécanisme d'auto-attention pour traiter les séquences d'entrée en parallèle et modéliser globalement les dépendances contextuelles.
Formellement, un Transformer est composé de plusieurs couches d'encodeur et de décodeur, chaque couche d'encodeur contenant une composante Multi-Head Self-Attention (MHSA) et un réseau feedforward positionnel (FFN).
L'auto-attention pour une séquence d'entrée \(X = (x_1, ..., x_n)\) calcule pour chaque token des sommes pondérées sur tous les tokens :
\[ \mathrm{Attention}(Q,K,V) = \mathrm{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V \]
Les requêtes \(Q\), clés \(K\) et valeurs \(V\) sont des projections linéaires de \(X\), et \(d_k\) est la dimension des vecteurs clés.
La Multi-Head Attention étend cela par des têtes d'attention parallèles capturant différents aspects de l'entrée.
Des encodages positionnels sont ajoutés pour prendre en compte l'ordre des tokens, car l'auto-attention est elle-même indépendante de la position.
L'architecture Transformer a révolutionné le domaine du NLP et est à la base de modèles tels que BERT, GPT et T5, qui obtiennent des performances de pointe sur de nombreuses tâches linguistiques.
Définition :
« Les Transformers sont des architectures de réseaux neuronaux basées sur l'auto-attention pour traiter les séquences en parallèle et modéliser efficacement les dépendances contextuelles. »
Source :
Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. In Advances in Neural Information Processing Systems (NeurIPS).