"Attention is all you need" : le Transformer arrive (2017)

Un article de 2017 a remplacé la mécanique séquentielle des réseaux précédents par de la pure attention. Le Transformer est devenu l'architecture derrière presque tous les grands modèles de langage depuis.

En juin 2017, une équipe de Google a publié un article au titre d’une assurance inhabituelle : « Attention Is All You Need ». Il présentait le Transformer, qui s’est révélé l’une des architectures les plus déterminantes de l’histoire de l’IA.

Le problème qu’il a résolu

Avant le Transformer, les principaux modèles de langage lisaient le texte comme on lit une phrase à voix haute : un mot après l’autre, dans l’ordre. Ce traitement séquentiel les rendait lents à entraîner et enclins à « oublier » l’information du début d’un long passage.

Le Transformer a jeté cette mécanique. À la place, il a employé un mécanisme appelé auto-attention, qui permet à chaque mot d’une phrase de regarder directement tous les autres et de décider lesquels comptent. Comme ces comparaisons peuvent se faire toutes en même temps plutôt qu’une à une, les Transformers s’entraînent bien plus efficacement sur le matériel moderne et gèrent bien mieux les liens à longue portée dans le texte.

Pourquoi il a tout changé

L’article d’origine portait sur la traduction automatique, un but assez étroit. Mais l’architecture s’est généralisée de manière presque gênante. En quelques années, elle soutenait les modèles qui allaient définir l’ère suivante du traitement automatique des langues :

  • Les Transformers de type encodeur ont porté les tâches de compréhension comme la recherche et la classification.
  • Les Transformers de type décodeur ont porté la génération, la famille qui mène directement aux grands modèles de langage modernes.

Point crucial : les Transformers passent à l’échelle. Agrandissez le réseau de neurones, nourrissez-le de plus de texte, donnez-lui plus de calcul, et il continue de s’améliorer de façon assez prévisible. Cette propriété a rendu viable la stratégie du « il suffit de le grossir » des années 2020.

Pourquoi c’est important

Le Transformer est la charnière entre les percées de l’apprentissage profond du début des années 2010 et l’essor des modèles de langage qui a suivi. Presque tout système qu’on appelle aujourd’hui « une IA », y compris le modèle derrière GPT-3 et ses successeurs, est au fond un Transformer.

Il est rare qu’une seule architecture domine un domaine pendant des années. Le Transformer l’a fait, et la phrase de son titre est devenue l’une des plus citées de la discipline.

#transformeur #traitement-automatique-langues