Arquitectura Transformer explicada para avanzados


La arquitectura Transformer fue presentada en 2017 y se basa en la idea de la autoatención (Self-Attention), que permite capturar relaciones entre todos los elementos de entrada simultáneamente.

A diferencia de los modelos recurrentes o convolucionales, un Transformer procesa secuencias completas en paralelo, lo que mejora significativamente la velocidad de entrenamiento y la escalabilidad.

Un Transformer consta de capas de codificador y decodificador, que a su vez están formadas por mecanismos de autoatención multi-cabeza y redes feedforward.

El mecanismo de autoatención calcula para cada palabra una combinación ponderada de todas las palabras en la secuencia para considerar información contextual importante.

Esta arquitectura es la base de muchos modelos modernos de PLN, que se utilizan tanto para la comprensión del lenguaje como para la generación de texto.