Rétropropagation : comment les réseaux de neurones ont appris de leurs erreurs (1986)
En 1986, David Rumelhart, Geoffrey Hinton et Ronald Williams ont montré que des réseaux de neurones multicouches entraînés par rétropropagation apprennent leurs propres représentations internes. La méthode reste la norme pour entraîner la plupart des réseaux de neurones.
Le 9 octobre 1986, un article de quatre pages paraît dans Nature (volume 323) signé par David Rumelhart et Ronald Williams (Institute for Cognitive Science, University of California, San Diego) et Geoffrey Hinton (Carnegie Mellon University). Il décrit un procédé d’apprentissage nommé rétropropagation, dans lequel des unités internes « cachées », qui ne sont ni entrées ni sorties, apprennent à représenter des caractéristiques importantes de la tâche. L’algorithme ajuste les poids de façon répétée pour réduire l’écart entre la sortie réelle et la sortie souhaitée, ce qui permet aux réseaux de neurones d’apprendre leurs propres représentations internes.
Le problème des couches cachées
Le perceptron de Rosenblatt (article) apprenait en ajustant les poids à partir des erreurs. En 1969, Minsky et Papert ont montré dans Perceptrons que les perceptrons à une seule couche ne pouvaient pas représenter certaines fonctions (dont XOR), ce qui a contribué au premier hiver de l’IA (article). Les réseaux multicouches pouvaient en principe dépasser ces limites, mais il manquait un moyen pratique d’entraîner les unités intermédiaires. Les auteurs de l’article de Nature soulignent que le procédé de convergence du perceptron simple ne peut pas créer de nouvelles caractéristiques à lui seul.
Propager l’erreur vers l’arrière
La méthode combine un passage avant, une comparaison avec la sortie cible et un passage arrière utilisant la règle de la chaîne. La mesure d’erreur est la moitié de la somme des écarts au carré ; les poids changent en proportion du gradient, c’est la descente de gradient. Vous pouvez explorer l’idée dans Geek de la semaine : descente de gradient et voir la profondeur en action dans Geek de la semaine : réseau de neurones.
Dans un exemple, le réseau a appris la symétrie miroir avec seulement deux unités cachées après 1 425 passages sur les 64 vecteurs d’entrée possibles. Dans un autre, deux arbres généalogiques isomorphes (noms anglais et italiens) ont été entraînés sur 100 des 104 triplets possibles (personne, relation, personne). Les auteurs signalent un inconvénient évident : la surface d’erreur peut contenir des minima locaux, donc la descente de gradient ne garantit pas un minimum global. Ils écrivent aussi : « The learning procedure, in its current form, is not a plausible model of learning in brains. » (Le procédé d’apprentissage, dans sa forme actuelle, n’est pas un modèle plausible de l’apprentissage dans le cerveau.)
Pas la première, mais la plus influente
D’autres avaient développé des idées proches avant. Seppo Linnainmaa a publié en 1970 le « reverse mode » de la différenciation automatique (mémoire de maîtrise, Helsinki). Paul Werbos a décrit l’entraînement de réseaux de neurones par rétropropagation dans sa thèse de 1974 (Harvard) et l’a appliqué aux réseaux multicouches en 1982. Les auteurs de Nature citent David Parker et Yann LeCun comme découvreurs indépendants de variantes. Le document de contexte scientifique du Nobel de physique 2024 note que Rumelhart, Hinton et Williams ont « réinventé » un schéma que d’autres avaient déjà employé ; l’essentiel fut de prouver que des réseaux avec couche cachée apprennent des tâches impossibles sans elle.
Une version plus longue est parue la même année dans Parallel Distributed Processing (MIT Press, 1986). Yann LeCun et ses collègues ont ensuite entraîné des réseaux convolutifs avec rétropropagation sur des codes postaux manuscrits (1989) ; à partir du milieu des années 1990, plusieurs banques américaines ont utilisé de tels réseaux pour lire les chiffres sur les chèques (article).
Pourquoi c’est important
La citation du prix Turing 2018 de l’ACM affirme que la rétropropagation est aujourd’hui la norme dans la plupart des réseaux de neurones. AlexNet a été entraîné par descente de gradient stochastique. Hinton a partagé le prix Nobel de physique 2024 avec John Hopfield. L’idée centrale de 1986, mesurer l’erreur et pousser chaque poids d’un petit pas vers le bas, soutient encore l’entraînement de la plupart des modèles d’apprentissage automatique fondés sur des réseaux de neurones.