面向专家的Transformer架构解释


Transformer架构(Vaswani等,2017)是一种基于序列的模型,依赖自注意力机制来并行处理输入序列并全局建模上下文依赖关系。

形式上,Transformer由多个编码器和解码器层组成,每个编码器层包含一个多头自注意力(MHSA)组件和一个位置前馈网络(FFN)。

对于输入序列 \(X = (x_1, ..., x_n)\),自注意力计算每个标记对所有标记的加权和:

\[ \mathrm{Attention}(Q,K,V) = \mathrm{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V \]

其中查询 \(Q\)、键 \(K\) 和值 \(V\) 是 \(X\) 的线性投影,\(d_k\) 是键向量的维度。

多头注意力通过并行的注意力头扩展了这一机制,捕捉输入的不同方面。

位置编码被添加以考虑标记的顺序,因为自注意力本身是位置无关的。

Transformer架构革新了自然语言处理领域,是BERT、GPT和T5等模型的基础,这些模型在众多语言任务中实现了最先进的性能。


定义:
“Transformer是基于自注意力的神经网络架构,用于并行处理序列并高效建模上下文依赖关系。”


来源:
Vaswani, A., Shazeer, N., Parmar, N., 等(2017)。Attention Is All You Need。载于《神经信息处理系统进展》(NeurIPS)。