Attention
Le mécanisme qui laisse un modèle pondérer l'importance de chaque partie de l'entrée pour chaque autre, transformant des scores de similarité en poids via un softmax.
L’attention permet à un modèle de pondérer l’importance de chaque partie de l’entrée pour chaque autre. Pour chaque élément (un token, par exemple), il se compare à tous les autres, transforme ces scores en poids dont la somme fait un (un softmax) et construit une nouvelle représentation comme un mélange pondéré.
Introduite pour la traduction et placée au centre par le transformeur en 2017 (« Attention Is All You Need »), l’auto-attention explique pourquoi un mot comme « il » peut regarder en arrière le nom auquel il renvoie. Elle a remplacé la récurrence pas à pas des réseaux de neurones antérieurs par une comparaison de toutes les paires qui s’exécute en parallèle, et sous-tend pratiquement tous les grands modèles de langage modernes.