Attention (Aufmerksamkeit)
Der Mechanismus, der ein Modell gewichten lässt, wie wichtig jeder Teil der Eingabe für jeden anderen ist; Ähnlichkeitswerte werden per Softmax zu Gewichten.
Attention (Aufmerksamkeit) lässt ein Modell gewichten, wie wichtig jeder Teil der Eingabe für jeden anderen ist. Für jedes Element (etwa ein Token) vergleicht es sich mit allen anderen, verwandelt diese Werte in Gewichte, die sich zu eins summieren (ein Softmax), und baut daraus eine neue Darstellung als gewichtete Mischung.
Eingeführt für die Übersetzung und durch den Transformer 2017 („Attention Is All You Need“) ins Zentrum gerückt, ist Selbst-Attention der Grund, warum ein Wort wie „sie“ auf das Nomen zurückblicken kann, das es meint. Sie ersetzte die schrittweise Rekurrenz früherer neuronaler Netze durch einen parallel laufenden Vergleich aller Paare und liegt praktisch jedem modernen großen Sprachmodell zugrunde.