Machines de Boltzmann : quand les réseaux de neurones ont emprunté la physique statistique (1985)
En 1985 David Ackley, Geoffrey Hinton et Terrence Sejnowski ont publié un algorithme d'apprentissage pour les machines de Boltzmann : unités binaires stochastiques, fonction d'énergie issue de la physique et échantillonnage lent que des méthodes ultérieures ont cherché à éviter.
En 1985, David Ackley, Geoffrey Hinton et Terrence Sejnowski ont publié A Learning Algorithm for Boltzmann Machines dans Cognitive Science (volume 9, numéro 1). Ils ont décrit une machine de Boltzmann : un réseau de neurones d’unités binaires stochastiques dont l’état collectif suit une fonction d’énergie empruntée à la physique statistique, avec des probabilités données par la distribution de Boltzmann. Le réseau pouvait apprendre des représentations cachées, mais l’entraînement reposait sur un échantillonnage lent par chaînes de Markov, un coût que les réseaux antagonistes génératifs ultérieurs ont voulu éviter.
Des réseaux de Hopfield à la structure cachée
Le travail s’appuyait sur les réseaux de mémoire associative de John Hopfield (1982), qui stockent et retrouvent des motifs via un paysage d’énergie. Hinton et Sejnowski avaient déjà relié l’inférence perceptuelle à ces idées en 1983. L’algorithme de 1985 ajoutait des unités cachées pour que le réseau découvre une structure dans les données plutôt que de compléter seulement des motifs partiels. Le comité Nobel a cité la machine de Boltzmann de Hinton en lui décernant le prix Nobel de physique 2024 avec Hopfield.
Unités stochastiques et apprentissage lent
Chaque unité bascule entre activé et inactif avec des probabilités qui dépendent de ses entrées et de l’énergie globale. L’apprentissage ajuste les connexions pour que les motifs d’entraînement deviennent des états probables. En pratique, estimer les statistiques nécessaires exige un long échantillonnage avec MCMC fondé sur les chaînes de Markov : fixer les unités visibles sur les données et laisser le réseau se stabiliser, ce qui rendait les machines de Boltzmann complètes difficiles à faire évoluer.
Machines restreintes et divergence contrastive
Paul Smolensky a décrit en 1986 un harmonium apparenté, ancêtre de la machine de Boltzmann restreinte (RBM), qui interdit les connexions au sein d’une couche pour rendre l’inférence plus tractable. Pendant des années les RBM restèrent difficiles à entraîner jusqu’à ce que Hinton introduise la divergence contrastive en 2002, une approximation plus rapide qui fit des RBM des briques pratiques. Des RBM empilées devinrent ensuite le socle des deep belief networks (article).
Pourquoi c’est important
Les machines de Boltzmann ont montré que l’apprentissage non supervisé peut extraire des caractéristiques via des modèles d’énergie probabilistes, pas seulement via une rétropropagation supervisée. Le goulot d’étranglement de l’échantillonnage a motivé des alternatives comme les réseaux d’inférence déroulés et les GAN. L’idée d’emprunter des formalismes physiques, et de rendre la génération douloureusement lente sans raccourcis, marque encore l’apprentissage profond d’aujourd’hui.