Attention: sieh zu, wie Wörter entscheiden, wem sie zuhören

Klicke ein Wort an und sieh Bögen zu den anderen auffächern, dicker wo es mehr Aufmerksamkeit schenkt, und stets 100 Prozent zusammen. Zieh Wörter zusammen, damit sie einander beachten. Das ist der Mechanismus hinter jedem modernen LLM.

y26w39

Letzte Woche lernte ein Netz, eine Grenze zu biegen. Diese Woche treffen wir die Idee, die ChatGPT und fast jedes ähnliche Modell antreibt, und sie ist erstaunlich einfach: lass jedes Wort auf jedes andere schauen und entscheiden, wie sehr es ihm zuhört. Das ist Attention, das schlagende Herz des Transformers.

Das Gadget unten ist ein Satz, ein Wort pro Token. Klicke ein Wort an, damit es dasjenige wird, das umherblickt. Bögen fächern zu jedem anderen Wort auf; je dicker der Bogen, desto mehr Aufmerksamkeit schenkt es dort, und die Prozente ergeben stets 100. Dieser letzte Teil ist ein Softmax: ein Haufen roher Werte, zusammengedrückt zu Gewichten, die sich zu eins summieren.

Probier das:

  1. Klicke das Pronomen („sie”) an. Sieh, wo seine Aufmerksamkeit landet. Zieh nun „sie” direkt neben „Katze” und sieh den Bogen zu „Katze” dicker werden: das Pronomen lernt, auf das Ding zurückzublicken, für das es steht. Genau dieser Kniff lässt ein Modell auflösen, was „sie” meint.
  2. Zieh ein Wort allein beiseite. Seine Aufmerksamkeit verteilt sich dünn auf alles. Hol es zurück in die Menge, und die Gewichte schärfen sich wieder.
  3. Schieb den Fokus. Niedriger Fokus verteilt die Aufmerksamkeit gleichmäßig auf alle Wörter; hoher Fokus lässt jedes Wort fast nur seinen nächsten Nachbarn beachten. Echte Transformer justieren dieselbe Schärfe.

Warum das wichtig ist

Jahrzehntelang lasen Modelle Text Schritt für Schritt und reichten eine Zusammenfassung weiter wie bei stiller Post; ferne Wörter gingen leicht verloren. 2017 warf ein Aufsatz mit dem frechen Titel „Attention Is All You Need” den Schritt-für-Schritt-Teil weg und behielt nur die Attention: jedes Token vergleicht sich mit jedem anderen in einem parallelen Durchgang. Diese Architektur, der Transformer, machte Modelle skalierbar genug, um zu den Chatbots und großen Sprachmodellen zu werden, die wir heute nutzen.

Eine ehrliche Anmerkung: ein echter Transformer misst Ähnlichkeit mit einem Skalarprodukt gelernter Vektoren, nicht über Nähe auf einer Leinwand. Wir nehmen hier den Abstand, damit du es von Hand steuern kannst, doch die Form der Idee ist identisch: bewerten, Softmax, mischen. Hinter dem Zauber steckt ein Raum voller Wörter, von denen jedes still entscheidet, wem es zuhört.

Die früheren Ausgaben verpasst? Trainiere ein Perzeptron, sieh einer Markov-Kette beim Plappern zu, verliere gegen unbesiegbares Tic-Tac-Toe, bring einem Filter bei, Kanten zu sehen, sieh einem Agenten zu, wie er aus Belohnung lernt, schau, wie ein Modell Text in Tokens liest, sieh eines bergab lernen, lass eine Maschine von selbst Gruppen finden, oder sieh eine Gerade lernen, sich zu biegen.

Attention ist, wie ein Transformer jedes Wort auf die anderen schauen lässt. Klicke ein Wort an, um es auszuwählen: die Bögen zeigen, wie viel Aufmerksamkeit es jedem anderen Wort schenkt (dicker heißt mehr), und die Prozente ergeben stets 100. Zieh Wörter näher zusammen, damit sie einander beachten, und nutze Fokus, um die Aufmerksamkeit zu schärfen oder zu weichen.