Neuronales Netz: sieh zu, wie eine Gerade lernt, sich zu biegen
Ein Neuron kann nur eine Gerade ziehen und bleibt bei XOR und dem Kreis stecken. Füge eine verborgene Schicht hinzu, drücke Trainieren und sieh zu, wie der Gradientenabstieg die Grenze zu Kurven biegt. Darum braucht tiefes Lernen Tiefe.
Ganz am Anfang, in der ersten Ausgabe, lernte ein einzelnes Perzeptron, zwei Gruppen mit einer Geraden zu trennen. Dann sahen wir dem Gradientenabstieg beim Bergabrollen zu, um Gewichte zu justieren. Diese Woche fügen wir beides zusammen und stoßen an die Wand, die die KI einst fast umbrachte: manches lässt sich mit einer Geraden schlicht nicht trennen.
Das Gadget unten ist ein winziges neuronales Netz. Zwei Punktfarben, eine verborgene Regel, die sie unterscheidet. Du wählst die Daten und das Modell und drückst dann Trainieren. Der farbige Hintergrund ist die aktuelle Entscheidung des Netzes, und er formt sich live um, während der Gradientenabstieg die Gewichte anstupst.
Probier das:
- Lass es auf Kreis mit Verborgene Schicht und drücke Trainieren. Sieh zu, wie sich die Grenze zu einer Schleife krümmt, die die inneren Punkte umschließt. Ein Netz mit verborgener Schicht kann sich biegen.
- Schalte nun das Modell auf Ein Neuron und trainiere erneut. Ein Neuron ist ein Perzeptron: es kann nur eine einzige Gerade ziehen, bleibt daher bei 50 bis 75 Prozent stecken und schließt den Kreis nie.
- Wechsle die Daten zu XOR (gegenüberliegende Ecken teilen eine Farbe). Ein Neuron scheitert auch hier, das Lehrbuchbeispiel. Schalte zurück auf Verborgene Schicht und sieh zu, wie es die Fläche in die richtigen vier Bereiche zerteilt.
Warum das wichtig ist
1969 zeigte ein berühmtes Buch, dass ein einzelnes Perzeptron XOR nicht lernen kann. Diese Grenze, und der Hype, den sie zerstach, half, das Feld in den ersten KI-Winter kippen zu lassen. Die Lösung war kein klügeres einzelnes Neuron, sondern Tiefe: stapelt man eine verborgene Schicht von Neuronen, kann das Netz einfache gerade Schnitte zu gebogenen, nichtlinearen Grenzen kombinieren. Das ist die ganze Idee eines neuronalen Netzes und des tiefen Lernens, sobald man viele Schichten stapelt. Trainierbar wurde diese Tiefe 1986 mit der Backpropagation.
Das Biegen, das du gerade gesehen hast, ist derselbe Trick, mit schneller Hardware und riesigen Datensätzen hochskaliert, mit dem AlexNet Jahrzehnte später Fotos erkannte. Hinter dem Zauber steckt eine Gerade, die lernte, sich zu biegen.
Die früheren Ausgaben verpasst? Trainiere ein Perzeptron, sieh einer Markov-Kette beim Plappern zu, verliere gegen unbesiegbares Tic-Tac-Toe, bring einem Filter bei, Kanten zu sehen, sieh einem Agenten zu, wie er aus Belohnung lernt, schau, wie ein Modell Text in Tokens liest, sieh eines bergab lernen, oder lass eine Maschine von selbst Gruppen finden.