Gradientenabstieg: sieh zu, wie ein Modell bergab lernt

Setze eine Kugel auf eine Verlustkurve und sieh zu, wie sie bergab schreitet. Ist die Lernrate zu hoch, fliegt sie davon; eine holprige Landschaft hält sie fest. So wird fast jedes neuronale Netz trainiert.

y26w36

Diese Woche tut die Maschine das, was hinter fast jedem modernen KI-Training steckt: Sie rollt bergab. Das Perzeptron lernte eine Linie, doch wie wird ein Modell überhaupt besser? Es misst, wie falsch es liegt (den Verlust), findet heraus, welche Richtung weniger falsch ist, und macht einen kleinen Schritt dorthin. Wiederhole das ein paar Milliarden Mal, und du hast ein Netz trainiert.

Das Gadget unten ist eine Gradientenabstiegs-Spielwiese. Die Kurve ist eine Verlustlandschaft: tiefe Stellen sind gut (kleiner Fehler), hohe schlecht. Die Kugel ist die aktuelle Einstellung des Modells. Bei jedem Schritt betrachtet sie das Gefälle unter ihren Füßen (den Gradienten) und geht bergab, um einen Betrag, den die Lernrate vorgibt.

Probier das:

  1. Klicke irgendwo auf die Kurve, um die Kugel zu setzen, und drücke Start. Mit kleiner Lernrate gleitet sie in der Schüssel sanft zum Grund.
  2. Dreh nun die Lernrate hoch und starte erneut. Ist der Schritt zu groß, schießt die Kugel über das Tal hinaus, springt jedes Mal höher und divergiert. Das ist der häufigste Grund, warum Training entgleist.
  3. Wechsle zu Hügel und setze die Kugel auf eine Seite. Mit sanfter Rate landet sie oft in der nächsten Mulde, einem lokalen Minimum, nicht dem tiefsten. Ein größerer Schritt kann sie zu einem besseren Tal hinausbefördern.

Warum das (fast) das ganze Training ist

Jedes Gewicht in einem neuronalen Netz ist eine Dimension einer solchen Landschaft, nur hat die echte Millionen oder Milliarden Dimensionen statt einer. Training heißt, das Gefälle in allen zugleich zu messen (genau das leistet die Backpropagation) und einen Schritt bergab zu machen. Die Lernrate, mit der du gerade gespielt hast, ist ein echter, kniffliger Regler, den jeder Fachmann justiert.

Diese eine Idee, mit schneller Hardware und viel Daten hochskaliert, ließ tiefes Lernen funktionieren: Sie trainierte AlexNet zu sehen und den Transformer zu lesen. Hinter dem Zauber stecken eine Kugel, ein Gefälle und ein kleiner Schritt in die richtige Richtung.

Die früheren Ausgaben verpasst? Trainiere ein Perzeptron, sieh einer Markov-Kette beim Plappern zu, verliere gegen unbesiegbares Tic-Tac-Toe, bring einem Filter bei, Kanten zu sehen, sieh einem Agenten zu, wie er aus Belohnung lernt, oder schau, wie ein Modell Text in Tokens liest.

Klicke auf die Kurve, um die Kugel zu setzen, wähle eine Lernrate und drücke Start. Die Kugel folgt dem Gefälle bergab. Ist die Rate zu hoch, schießt sie über und fliegt davon; eine holprige Landschaft kann sie im falschen Tal gefangen halten.