Los transformers son redes neuronales que se utilizan en el ámbito del procesamiento de secuencias, como texto o voz.
A diferencia de modelos anteriores como RNNs o LSTMs, los transformers procesan todos los elementos de entrada simultáneamente y utilizan el llamado mecanismo de atención.
Este mecanismo permite al modelo evaluar la importancia de diferentes partes de la entrada y combinar información relevante de distintas posiciones.
Normalmente, los modelos transformer constan de varias capas de autoatención (Self-Attention) y redes feed-forward, que juntas generan representaciones profundas.
Aplicaciones conocidas son modelos de lenguaje como BERT o GPT, que se basan en arquitecturas transformer.