L'architecture Transformer a été présentée en 2017 et repose sur l'idée de l'attention automatique (Self-Attention), qui permet de capturer simultanément les relations entre tous les éléments d'entrée.
Contrairement aux modèles récurrents ou convolutionnels, un Transformer traite des séquences complètes en parallèle, ce qui améliore considérablement la vitesse d'entraînement et la scalabilité.
Un Transformer est composé de couches d'encodeur et de décodeur, chacune comprenant des mécanismes de Multi-Head Self-Attention et des réseaux feedforward.
Le mécanisme de Self-Attention calcule pour chaque mot une combinaison pondérée de tous les mots de la séquence afin de prendre en compte des informations contextuelles importantes.
Cette architecture est la base de nombreux modèles modernes de NLP, utilisés à la fois pour la compréhension du langage et la génération de texte.