Трансформеры объяснены для экспертов


Трансформеры — это архитектуры для последовательных данных, основанные на механизме самовнимания и позволяющие параллельную обработку.

Основная идея заключается в вычислении весов внимания, которые определяют, насколько сильно один элемент входных данных учитывает другие элементы.

Формально внимание вычисляется как взвешенная сумма векторов значений \( V \), где веса получаются с помощью функции softmax от скалярных произведений векторов запросов и ключей:

\[ \mathrm{Attention}(Q,K,V) = \mathrm{softmax}\left( rac{QK^T}{\sqrt{d_k}} ight) V \]

Здесь \( Q, K, V \) — матрицы запросов, ключей и значений, а \( d_k \) — размерность векторов ключей.

Архитектура трансформера состоит из энкодера и декодера, каждый из которых построен из нескольких слоёв с многошаговым вниманием (Multi-Head Attention) и полносвязными нейронными сетями (Feed-Forward Networks).

Эта структура позволяет изучать сложные зависимости в последовательностях и произвела революцию в обработке естественного языка.


Определение:
«Трансформеры — это архитектуры нейронных сетей, которые с помощью механизма самовнимания обеспечивают параллельную обработку последовательностей и эффективно моделируют долгосрочные зависимости.»


Источник:
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is All You Need. Advances in Neural Information Processing Systems (NeurIPS).