Cartes d'attention expliquées pour les experts


Les cartes d'attention sont des visualisations des poids d'attention \( \alpha_{ij} \), calculés dans les mécanismes d'attention des réseaux neuronaux, pour représenter l'importance relative des éléments d'entrée \( j \) dans le traitement d'un élément cible \( i \).

Formellement, dans un mécanisme d'attention, les scores \( e_{ij} \) sont calculés par une fonction telle que

\[ e_{ij} = rac{(Q_i)(K_j)^T}{\sqrt{d_k}} \]

où \( Q_i \) est le vecteur de requête, \( K_j \) le vecteur clé et \( d_k \) la dimension des clés.

Les poids d'attention suivent par Softmax :

\[ \alpha_{ij} = rac{\exp(e_{ij})}{\sum_{k} \exp(e_{ik})} \]

Ces poids sont visualisés dans les cartes d'attention sous forme de cartes thermiques et montrent quels éléments d'entrée sont dominants lors du traitement.

Les cartes d'attention sont essentielles pour la compréhension et l'explicabilité des modèles comme le Transformer, en fournissant un aperçu de la distribution du focus pendant l'inférence du modèle.


Définition :
« Les cartes d'attention sont des visualisations des pondérations calculées par les mécanismes d'attention, indiquant à quel point chaque élément d'entrée est pris en compte lors du traitement d'un élément cible. »


Source :
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is All You Need. Advances in Neural Information Processing Systems, 30.