Boltzmann-Maschinen: als neuronale Netze die statistische Physik entlehnten (1985)

1985 veröffentlichten David Ackley, Geoffrey Hinton und Terrence Sejnowski einen Lernalgorithmus für Boltzmann-Maschinen: stochastische binäre Einheiten, eine Energiefunktion aus der Physik und langsames Sampling, das spätere Methoden vermeiden wollten.

Ereignisdatum: Veröffentlicht:
GeschichteForschung

1985 veröffentlichten David Ackley, Geoffrey Hinton und Terrence Sejnowski A Learning Algorithm for Boltzmann Machines in Cognitive Science (Band 9, Heft 1). Sie beschrieben eine Boltzmann-Maschine: ein neuronales Netz aus stochastischen binären Einheiten, deren Gesamtzustand einer Energiefunktion aus der statistischen Physik folgt, mit Wahrscheinlichkeiten nach der Boltzmann-Verteilung. Das Netz konnte verborgene Darstellungen lernen, doch das Training stützte sich auf langsames Sampling mit Markow-Ketten, dessen Kosten spätere generative adversariale Netze vermeiden sollten.

Von Hopfield-Netzen zu verborgener Struktur

Die Arbeit baute auf John Hopfields assoziativen Speichernetzwerken von 1982 auf, die Muster über eine Energielandschaft ablegen und abrufen. Hinton und Sejnowski hatten perceptuelle Inferenz schon 1983 mit solchen Ideen verknüpft. Der Algorithmus von 1985 ergänzte verborgene Einheiten, damit das Netz Struktur in Daten entdecken konnte, statt nur unvollständige Muster zu vervollständigen. Das Nobelkomitee nannte Hintons Boltzmann-Maschine, als es ihm 2024 den Physik-Nobelpreis zusammen mit Hopfield verlieh.

Stochastische Einheiten und langsames Lernen

Jede Einheit springt zwischen an und aus mit Wahrscheinlichkeiten, die von ihren Eingaben und der globalen Energie abhängen. Beim Lernen werden Verbindungsstärken so angepasst, dass Trainingsmuster wahrscheinliche Zustände werden. Praktisch erfordert die Schätzung der nötigen Statistiken langes Sampling mit MCMC auf Basis von Markow-Ketten: sichtbare Einheiten an Daten festhalten und das Netz beruhigen lassen, was volle Boltzmann-Maschinen schwer skalierbar machte.

Restricted Machines und Contrastive Divergence

Paul Smolensky beschrieb 1986 ein verwandtes Harmonium-Modell, einen Vorläufer der eingeschränkten Boltzmann-Maschine (RBM), die Verbindungen innerhalb einer Schicht verbietet, damit Inferenz handhabbarer wird. Jahre lang blieben RBMs schwer trainierbar, bis Hinton 2002 Contrastive Divergence einführte, eine schnellere Näherung, die RBMs zu praktischen Bausteinen machte. Gestapelte RBMs wurden später Grundlage der Deep Belief Networks (Artikel).

Warum es wichtig ist

Boltzmann-Maschinen zeigten, dass unüberwachtes Lernen Merkmale über probabilistische Energiemodelle extrahieren kann, nicht nur über überwachte Backpropagation. Der Sampling-Engpass motivierte Alternativen wie entrollte Inferenznetze und GANs. Die Idee, Lernsysteme formal aus der Physik zu entlehnen und Erzeugung ohne Abkürzungen schmerzhaft langsam zu machen, prägt tiefes Lernen bis heute.

#neuronales-netz#tiefes-lernen