AlexNet : la nuit où l'apprentissage profond est revenu (2012)
Un réseau de neurones profond entraîné sur deux GPU de jeu a écrasé la référence ImageNet et mis fin, presque du jour au lendemain, à un long hiver des réseaux de neurones.
En 2012, la compétition ImageNet avait un classement clair et un plafond tenace. Les meilleurs systèmes, bâtis sur des caractéristiques conçues à la main, tournaient autour d’un taux d’erreur top-5 de 26 pour cent. Puis une seule participation l’a ramené à environ 15 pour cent, un écart si grand qu’il ressemblait à une erreur. Ce n’en était pas une.
Le système était AlexNet, conçu par Alex Krizhevsky, Ilya Sutskever et Geoffrey Hinton à l’Université de Toronto. C’était un réseau de neurones profond, et sa victoire est le moment que la plupart désignent pour dater l’ère moderne de l’apprentissage profond.
Ce qui était différent
Les réseaux de neurones n’étaient pas nouveaux en 2012. Les idées remontaient à des décennies et, après le premier hiver de l’IA, beaucoup de chercheurs les avaient abandonnées. AlexNet a marché parce que plusieurs choses se sont enfin alignées :
- Un grand jeu de données étiqueté. ImageNet a donné au réseau plus d’un million d’images d’entraînement, assez pour apprendre des caractéristiques visuelles riches plutôt que de mémoriser.
- Des GPU. L’équipe a entraîné le modèle sur deux cartes graphiques grand public, exploitant du matériel conçu pour les jeux vidéo pour l’énorme calcul matriciel qu’exige un réseau profond.
- Des astuces pratiques. La fonction d’activation ReLU a accéléré l’entraînement, et une technique appelée dropout a réduit le surapprentissage.
Aucun de ces points n’était à lui seul la percée. Ensemble, ils ont transformé une idée vieille de décennies en un système qui a battu tout le reste sur une référence sérieuse.
Les suites
Le résultat a voyagé vite. En quelques années, les réseaux convolutifs profonds étaient la norme en vision par ordinateur, et la même philosophie, laisser le modèle apprendre ses propres caractéristiques, s’est étendue à la parole et au langage. Hinton, Krizhevsky et Sutskever ont vite rejoint l’industrie, un schéma qui se répétera à mesure que le domaine se commercialisait.
Tout aussi important : AlexNet a réinitialisé les attentes autour de l’échelle. La leçon selon laquelle plus de données plus plus de calcul plus un réseau profond pouvaient battre l’ingénierie manuelle soignée est devenue l’hypothèse de travail de la décennie suivante, jusqu’au Transformer et aux grands modèles de langage bâtis sur lui.
Pourquoi c’est important
Deep Blue avait gagné par la recherche ; AlexNet a gagné par l’apprentissage. Ce fut la preuve précoce la plus claire que des représentations apprises, avec assez de données et de calcul, peuvent surpasser des caractéristiques conçues à la main. Ce basculement est le fil conducteur qui relie presque tout ce qui a suivi, de la reconnaissance d’images aux modèles généralistes d’aujourd’hui.