La autoatención (Self-Attention) es un mecanismo en redes neuronales donde cada elemento de una secuencia de entrada evalúa su relación con todos los demás elementos de la misma secuencia.
Esto se realiza mediante el cálculo de los llamados puntajes de atención, que indican cuán relevante es una palabra para otra.
Los puntajes se utilizan para generar combinaciones ponderadas de los elementos de entrada, lo que permite capturar mejor el contexto de cada elemento.
El mecanismo permite a los modelos aprender dependencias largas en secuencias, sin las limitaciones de las redes recurrentes.
La autoatención es un componente central de modelos modernos como el Transformer, que lideran en áreas como la traducción automática y la generación de texto.