Los mapas de atención son visualizaciones de los pesos de atención \( \alpha_{ij} \), que se calculan en los mecanismos de atención de redes neuronales para representar la importancia relativa de los elementos de entrada \( j \) en el procesamiento de un elemento objetivo \( i \).
Formalmente, en un mecanismo de atención, las puntuaciones \( e_{ij} \) se calculan mediante una función como
\[ e_{ij} = rac{(Q_i)(K_j)^T}{\sqrt{d_k}} \]
donde \( Q_i \) es el vector de consulta, \( K_j \) el vector clave y \( d_k \) la dimensión de las claves.
Los pesos de atención se obtienen mediante Softmax:
\[ \alpha_{ij} = rac{\exp(e_{ij})}{\sum_{k} \exp(e_{ik})} \]
Estos pesos se visualizan en los mapas de atención como mapas de calor y muestran qué elementos de entrada son dominantes durante el procesamiento.
Los mapas de atención son esenciales para la comprensión y explicabilidad de modelos como el Transformer, ya que proporcionan una visión de la distribución del foco durante la inferencia del modelo.
Definición:
«Los mapas de atención son visualizaciones de los pesos calculados por los mecanismos de atención, que indican cuán fuertemente se consideran los elementos individuales de entrada en el procesamiento de un elemento objetivo.»
Fuente:
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is All You Need. Advances in Neural Information Processing Systems, 30.