面向专家的注意力机制解释


注意力机制是一种神经网络架构原理,允许自适应地加权相关的上下文信息,以改善数据中依赖关系的建模。

形式上,注意力对查询 q、一组键 k_i 及其对应的值 v_i 计算输出,作为值的加权和:

A(q, K, V) = Σ_i α_i v_i,其中 α_i = softmax(e_i),且 e_i = f(q, k_i) 是一个兼容性函数,例如点积。

该机制允许灵活地将焦点放在输入的相关部分,这在序列处理中特别具有决定性优势。

Transformer 模型(Vaswani 等,2017)利用多头注意力,平行捕捉数据的不同方面并有效整合上下文信息。


定义:
注意力机制是神经网络中的一种方法,通过计算输入元素的加权组合,实现自适应的上下文聚焦。


来源:
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is All You Need. 载于《神经信息处理系统进展》(NeurIPS)。