Réseaux de croyances profonds : quand les réseaux profonds sont redevenus entraînables (2006)
En juillet 2006 Geoffrey Hinton et ses collègues ont montré qu'empiler des machines de Boltzmann restreintes couche par couche puis affiner le résultat par rétropropagation permettait d'entraîner des réseaux profonds. Le résultat a aidé à relancer la renaissance de l'apprentissage profond.
En juillet 2006, Geoffrey Hinton, Simon Osindero et Yee-Whye Teh ont publié A Fast Learning Algorithm for Deep Belief Nets dans Neural Computation (volume 18, numéro 7). Le même mois, Hinton et Ruslan Salakhutdinov ont montré dans Science (28 juillet 2006) qu’un autoencodeur profond pouvait compresser des données de haute dimension bien mieux que des méthodes peu profondes. Ensemble ils ont introduit les deep belief networks (DBN) : des réseaux de neurones construits en empilant goulûment des machines de Boltzmann restreintes (RBM) puis affinés par rétropropagation.
Couche par couche, sans gradients qui disparaissent
Entraîner toutes les couches d’un réseau profond d’un coup avait longtemps été difficile. La recette de 2006 entraînait une RBM à la fois : chaque nouvelle couche apprenait à modéliser les motifs produits par celle du dessous. Ce n’est qu’après ce pré-entraînement non supervisé que l’apprentissage supervisé ajustait la pile entière. L’article de Science a démontré le gain sur des patchs d’images et des vecteurs de documents, réduisant la dimensionnalité avec une erreur de reconstruction bien plus faible que l’analyse en composantes principales.
Une renaissance, pas le dernier mot
Les résultats arrivaient alors que ImageNet prenait forme (article) et ont convaincu beaucoup de chercheurs que la profondeur redevenait viable. D’autres groupes, dont Yoshua Bengio et ses collègues, ont exploré un entraînement gourmand couche par couche à la même période. En quelques années le champ a poursuivi sa route : activations ReLU, meilleure initialisation, GPU et grands jeux de données étiquetées ont rendu la rétropropagation de bout en bout suffisante pour des modèles comme AlexNet, vainqueur du défi ImageNet en 2012.
Pourquoi c’est important
Les deep belief networks ont été un pont : ils ont réutilisé des blocs de machines de Boltzmann et des idées de chaînes de Markov des années 1980, puis ont confié une pile entraînée à la même machinerie de descente de gradient qui alimente aujourd’hui la plupart de l’apprentissage profond. La citation du Nobel de Hinton remonte à cette lignée probabiliste. La mode du pré-entraînement s’est estompée, mais la preuve que des réseaux profonds pouvaient s’entraîner a ouvert l’ère que ce site documente à partir d’AlexNet.