Transformer是一种基于自注意力机制的序列数据架构,能够实现并行处理。
其基本思想是计算注意力权重,以确定输入元素在多大程度上考虑其他元素。
形式上,注意力被计算为值向量 \( V \) 的加权和,权重来自查询向量和键向量的点积经过Softmax函数的结果:
\[ \mathrm{Attention}(Q,K,V) = \mathrm{softmax}\left( rac{QK^T}{\sqrt{d_k}} ight) V \]
其中 \( Q, K, V \) 分别是查询、键和值的矩阵,\( d_k \) 是键向量的维度。
Transformer架构由编码器和解码器组成,每个部分包含多层多头注意力和前馈神经网络。
这种结构使得学习序列中的复杂依赖关系成为可能,并且彻底改变了自然语言处理。
定义:
“Transformer是一种神经网络架构,通过自注意力实现序列的并行处理,从而高效地建模长距离依赖关系。”
来源:
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is All You Need. Advances in Neural Information Processing Systems (NeurIPS).