L'auto-attention (Self-Attention) est un mécanisme dans les réseaux neuronaux, où chaque élément d'une séquence d'entrée évalue sa relation avec tous les autres éléments de la même séquence.
Cela se fait par le calcul de ce qu'on appelle des scores d'attention, qui indiquent à quel point un mot est pertinent pour un autre.
Les scores sont utilisés pour créer des combinaisons pondérées des éléments d'entrée, ce qui permet de mieux saisir le contexte de chaque élément.
Le mécanisme permet aux modèles d'apprendre des dépendances longues dans les séquences, sans les contraintes des réseaux récurrents.
L'auto-attention est une composante centrale des modèles modernes comme le Transformer, qui sont leaders dans des domaines tels que la traduction automatique et la génération de texte.