Ein Attention-Mechanismus ist eine Methode, die es neuronalen Netzen ermöglicht, dynamisch unterschiedliche Teile einer Eingabe zu gewichten.
Dabei werden sogenannte "Attention Scores" berechnet, die anzeigen, wie relevant ein bestimmtes Element im Vergleich zu anderen ist.
Diese Scores werden oft durch eine Softmax-Funktion normalisiert, sodass sie als Wahrscheinlichkeiten interpretiert werden können.
Der Mechanismus wird häufig in Sequenz-zu-Sequenz-Modellen eingesetzt, etwa in der maschinellen Übersetzung, um den Fokus flexibel auf wichtige Wörter zu legen.
Moderne Architekturen wie Transformer basieren vollständig auf Attention, was die parallele Verarbeitung und bessere Kontextberücksichtigung ermöglicht.