Attention : regarde les mots décider qui écouter
Clique sur un mot et regarde les arcs s’ouvrir vers les autres, plus épais là où il prête plus d’attention, et faisant toujours 100 pour cent. Rapproche les mots pour qu’ils s’attardent l’un sur l’autre. C’est le mécanisme derrière tout LLM moderne.
La semaine dernière, un réseau a appris à courber une frontière. Cette semaine, on rencontre l’idée qui fait tourner ChatGPT et presque tous les modèles de son genre, et elle est étonnamment simple : laisse chaque mot regarder tous les autres et décider combien il les écoute. C’est l’attention, le cœur battant du transformeur.
Le gadget ci-dessous est une phrase, un mot par token. Clique sur un mot pour qu’il devienne celui qui regarde autour de lui. Les arcs s’ouvrent vers chaque autre mot ; plus l’arc est épais, plus il y prête attention, et les pourcentages font toujours 100. Cette dernière partie est un softmax : un tas de scores bruts comprimés en poids dont la somme fait un.
Essaie ceci :
- Clique sur le pronom (« il »). Regarde où atterrit son attention. Traîne maintenant « il » juste à côté de « chat » et regarde l’arc vers « chat » s’épaissir : le pronom apprend à regarder en arrière la chose qu’il représente. C’est exactement l’astuce qui laisse un modèle résoudre ce que « il » désigne.
- Éloigne un mot tout seul. Son attention s’étale finement sur tout. Ramène-le dans la foule et les poids se resserrent.
- Fais glisser Focus. Un focus faible répartit l’attention également sur tous les mots ; un focus fort fait que chaque mot n’attend presque que son plus proche voisin. Les vrais transformeurs règlent cette même netteté.
Pourquoi c’est important
Pendant des décennies, les modèles lisaient le texte pas à pas, passant un résumé comme au téléphone arabe ; les mots lointains se perdaient facilement. En 2017, un article au titre effronté « Attention Is All You Need » a jeté le pas-à-pas et n’a gardé que l’attention : chaque token se compare à tous les autres en une passe parallèle. Cette architecture, le transformeur, a rendu les modèles assez extensibles pour devenir les chatbots et grands modèles de langage que nous utilisons aujourd’hui.
Une note honnête : un vrai transformeur mesure la similarité avec un produit scalaire de vecteurs appris, pas par la proximité sur une toile. On utilise ici la distance pour que tu puisses le piloter à la main, mais la forme de l’idée est identique : scorer, softmax, mélanger. Derrière la magie, il y a une pièce pleine de mots, chacun décidant en silence qui écouter.
Tu as manqué les éditions précédentes ? Entraîne un perceptron, regarde une chaîne de Markov babiller, perds contre le morpion invincible, apprends à un filtre à voir les contours, regarde un agent apprendre par la récompense, découvre comment un modèle lit le texte en tokens, regarde-en un descendre la pente pour apprendre, laisse une machine trouver des groupes seule, ou regarde une droite apprendre à se courber.