面向专家的自注意力解释


自注意力是一种机制,对于输入序列 X = (x_1, x_2, ..., x_n),为每个元素 x_i 计算所有元素的加权和,权重由 x_i 与每个 x_j 的兼容性决定。

形式上,这通常通过查询(Q)、键(K)和值(V)矩阵实现,注意力分数通过 Q 和 K 的点积并经 Softmax 归一化计算得出:

Attention(Q,K,V) = softmax( (Q K^T) / sqrt(d_k) ) V

其中 d_k 是键向量的维度,用于缩放。

该机制允许灵活且并行地建模上下文依赖关系,特别是在 Transformer 架构(Vaswani 等,2017)中得到应用。


定义:
“自注意力是神经网络中的一种机制,通过计算输入序列元素的加权组合来建模其上下文关系,使每个元素关注序列中的所有其他元素。”


来源:
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is All You Need. 载于神经信息处理系统进展(NeurIPS)。