Deep Belief Networks: als tiefe Netze wieder trainierbar wurden (2006)

Im Juli 2006 zeigten Geoffrey Hinton und Kollegen, dass sich eingeschränkte Boltzmann-Maschinen schichtweise stapeln und das Ergebnis per Backpropagation feinabstimmen lässt. Das half, die Wiederbelebung des tiefen Lernens einzuleiten.

Ereignisdatum: Veröffentlicht:
GeschichteForschung

Im Juli 2006 veröffentlichten Geoffrey Hinton, Simon Osindero und Yee-Whye Teh A Fast Learning Algorithm for Deep Belief Nets in Neural Computation (Band 18, Heft 7). Im selben Monat zeigten Hinton und Ruslan Salakhutdinov in Science (28. Juli 2006), dass ein tiefer Autoencoder hochdimensionale Daten weit besser komprimieren kann als flache Methoden. Gemeinsam führten sie Deep Belief Networks (DBN) ein: neuronale Netze, die durch gieriges Stapeln von eingeschränkten Boltzmann-Maschinen (RBMs) entstehen und danach per Backpropagation feinabgestimmt werden.

Schicht für Schicht, ohne verschwindende Gradienten

Alle Schichten eines tiefen Netzes gleichzeitig zu trainieren war lange schwierig. Das Rezept von 2006 trainierte jeweils eine RBM: jede neue Schicht lernte die Muster der darunterliegenden Schicht zu modellieren. Erst nach diesem unüberwachten Pretraining passte überwachtes Lernen den gesamten Stapel an. Das Science-Paper zeigte den Nutzen an Bildpatches und Dokumentvektoren: Dimensionsreduktion mit deutlich geringerem Rekonstruktionsfehler als Hauptkomponentenanalyse.

Wiederbelebung, nicht das letzte Wort

Die Ergebnisse kamen, während ImageNet Form annahm (Artikel), und überzeugten viele Forscher, dass Tiefe wieder machbar war. Andere Gruppen, darunter Yoshua Bengio und Kollegen, erforschten um dieselbe Zeit verwandtes gieriges schichtweises Training. Innerhalb weniger Jahre wich das Feld weiter: Aktivierungen mit ReLU, bessere Initialisierung, GPUs und große gelabelte Datensätze machten End-to-End-Backpropagation ausreichend für Modelle wie AlexNet, das 2012 die ImageNet-Challenge gewann.

Warum es wichtig ist

Deep Belief Networks waren eine Brücke: Sie nutzten Boltzmann-Maschinen und Ideen aus Markow-Ketten der 1980er und übergaben einen trainierten Stapel an dieselbe Maschinerie des Gradientenabstiegs, die heute das meiste tiefe Lernen antreibt. Hintons spätere Begründung für den Nobelpreis reicht bis in diese probabilistische Linie zurück. Der Pretraining-Trend verebbte, doch der Beweis, dass tiefe Netze überhaupt trainierbar sind, öffnete die Ära, die diese Seite ab AlexNet dokumentiert.

#neuronales-netz#tiefes-lernen