Backpropagation: wie neuronale Netze aus Fehlern lernten (1986)
1986 zeigten David Rumelhart, Geoffrey Hinton und Ronald Williams, dass mehrschichtige neuronale Netze mit Backpropagation eigene innere Darstellungen lernen. Das Verfahren ist bis heute Standard beim Training der meisten neuronalen Netze.
Am 9. Oktober 1986 erschien in Nature (Band 323) ein vierseitiger Beitrag von David Rumelhart und Ronald Williams (Institute for Cognitive Science, University of California, San Diego) und Geoffrey Hinton (Carnegie Mellon University). Er beschreibt ein Lernverfahren namens Backpropagation, bei dem verborgene Einheiten, die weder Eingabe noch Ausgabe sind, wichtige Merkmale der Aufgabe darstellen lernen. Das Netz passt seine Gewichte wiederholt an, um die Differenz zwischen tatsächlicher und gewünschter Ausgabe zu verringern, sodass neuronale Netze eigene innere Darstellungen lernen.
Das Problem der verborgenen Schichten
Rosenblatts Perzeptron (Artikel) lernte durch Gewichtsanpassung anhand von Fehlern. 1969 zeigten Minsky und Papert in Perceptrons, dass einschichtige Perzeptrons bestimmte Funktionen (u. a. XOR) nicht darstellen können, was zum ersten KI-Winter beitrug (Artikel). Mehrschichtige Netze hätten die Grenzen prinzipiell umgehen können, doch fehlte ein Weg, Einheiten zu trainieren, die weder Eingabe noch Ausgabe sind. Die Autoren des Nature-Textes betonen, dass das einfachere Perzeptron-Konvergenzverfahren keine neuen Merkmale erzeugen kann.
Fehler rückwärts verteilen
Das Verfahren arbeitet mit einem Vorwärtsdurchlauf, einem Vergleich mit der Zielausgabe und einem Rückwärtsdurchlauf mit der Kettenregel. Das Fehlermaß ist die halbe Summe quadrierter Abweichungen; Gewichte ändern sich proportional zum Gradienten, also per Gradientenabstieg (auch Gradientenverfahren genannt). Zum Ausprobieren eignet sich Geek der Woche: Gradientenabstieg; Geek der Woche: Neuronales Netz zeigt Tiefe in Aktion.
In einem Beispiel lernte das Netz Spiegelsymmetrie mit nur zwei Zwischeneinheiten nach 1.425 Durchläufen durch alle 64 Eingabevektoren. In einem anderen wurden zwei isomorphe Stammbäume (englische und italienische Namen) auf 100 von 104 möglichen Tripeln (Person, Beziehung, Person) trainiert. Als offensichtlichen Nachteil nennen die Autoren lokale Minima in der Fehlerfläche, sodass der Gradientenabstieg kein globales Minimum garantiert. Sie schreiben außerdem: „The learning procedure, in its current form, is not a plausible model of learning in brains.” (Das Lernverfahren in seiner jetzigen Form ist kein plausibles Modell des Lernens im Gehirn.)
Nicht die erste, aber die folgenreichste Beschreibung
Vorläufer gab es bereits. Seppo Linnainmaa veröffentlichte 1970 den „reverse mode“ der automatischen Differentiation (Masterarbeit, Helsinki). Paul Werbos beschrieb das Training neuronaler Netze per Backpropagation in seiner Dissertation von 1974 (Harvard) und wandte es 1982 auf mehrschichtige Netze an. Im Nature-Text selbst nennen die Autoren David Parker und Yann LeCun als unabhängige Entdecker von Varianten. Das Nobelkomitee schreibt 2024, Rumelhart, Hinton und Williams hätten das Schema „neu erfunden“; wichtiger war der Nachweis, dass Netze mit verborgener Schicht Aufgaben lernen, die ohne sie unlösbar sind.
Eine ausführliche Fassung erschien im selben Jahr im Sammelband Parallel Distributed Processing (MIT Press, 1986). Yann LeCun und Kollegen trainierten 1989 Faltungsnetze mit Backpropagation auf handgeschriebene Postleitzahlen; ab Mitte der 1990er nutzten mehrere US-Banken solche Netze zum Lesen von Ziffern auf Schecks (Artikel).
Warum es wichtig ist
Die ACM-Begründung zum Turing Award 2018 bezeichnet Backpropagation als heutigen Standard in den meisten neuronalen Netzen. AlexNet wurde mit stochastischem Gradientenabstieg trainiert. Hinton teilte 2024 den Physik-Nobelpreis mit John Hopfield. Der Kern von 1986, Fehler messen und jedes Gewicht ein kleines Stück bergab schieben, trägt noch heute das Training der meisten Modelle des maschinellen Lernens, die auf neuronalen Netzen beruhen (Modelltraining).