Архитектура Transformer, объяснённая для экспертов


Архитектура Transformer (Vaswani et al., 2017) — это последовательностная модель, основанная на механизме self-attention, которая позволяет обрабатывать входные последовательности параллельно и моделировать контекстные зависимости глобально.

Формально Transformer состоит из нескольких слоёв энкодера и декодера, при этом каждый слой энкодера содержит компоненту Multi-Head Self-Attention (MHSA) и позиционную сеть прямого распространения (FFN).

Self-Attention для входной последовательности \(X = (x_1, ..., x_n)\) вычисляет для каждого токена взвешенные суммы по всем токенам:

\[ \mathrm{Attention}(Q,K,V) = \mathrm{softmax}\left( rac{QK^T}{\sqrt{d_k}} ight) V \]

Здесь Queries \(Q\), Keys \(K\) и Values \(V\) — это линейные проекции \(X\), а \(d_k\) — размерность векторов ключей.

Multi-Head Attention расширяет это за счёт параллельных голов внимания, которые захватывают разные аспекты входных данных.

Позиционные кодировки добавляются для учёта порядка токенов, поскольку self-attention сам по себе не зависит от позиции.

Архитектура Transformer произвела революцию в области обработки естественного языка и является основой моделей, таких как BERT, GPT и T5, которые достигают передовых результатов во многих языковых задачах.


Определение:
«Transformer — это архитектуры нейронных сетей, основанные на self-attention, которые позволяют обрабатывать последовательности параллельно и эффективно моделировать контекстные зависимости.»


Источник:
Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. В сборнике Advances in Neural Information Processing Systems (NeurIPS).