Q-Learning: sieh zu, wie ein Agent aus Belohnung lernt
Setze einen Agenten in ein Raster mit Ziel und Falle. Er weiß am Anfang nichts und lernt durch Versuch und Irrtum, wohin er gehen soll, eine Belohnung nach der anderen. Die Idee hinter AlphaGo und RLHF.
Diese Woche lernt die Maschine auf die harte Tour: durch Versuch, Irrtum und Belohnung. Das Perzeptron justierte eine Linie, die Faltung filterte Pixel, Tic-Tac-Toe schaute voraus. Der heutige Agent bekommt nichts davon. Er wird in eine Welt geworfen, die er nicht versteht, und erfährt nur eines: Manche Ausgänge fühlen sich gut an, andere schlecht.
Das Gadget unten ist eine winzige Rasterwelt. Es gibt einen Start, ein Ziel mit +1 und eine Falle mit -1. Der Agent kann nach oben, unten, links oder rechts gehen. Er hat keine Karte und keine Regeln, nur eine Erinnerung daran, wie lohnend jeder Zug von jedem Feld aus war. Diese Erinnerung ist eine Zahlentabelle namens Q-Tabelle, und das Verfahren, sie zu füllen, heißt Q-Learning.
Probier das:
- Drücke Trainieren. Der Agent spielt hunderte schnelle Episoden und tappt anfangs meist zufällig herum. Sieh zu, wie die Felder aufleuchten: Der Wert breitet sich vom Ziel rückwärts aus, Feld für Feld, wie eine Duftspur.
- Die Pfeile zeigen die aktuell beste Vermutung des Agenten, wohin er von jedem Feld aus soll. Mit fortlaufendem Training reihen sie sich zu einer Route, die das Ziel erreicht und die Falle meidet.
- Drücke Agent laufen lassen und sieh zu, wie er dem Gelernten folgt. Dann Zurücksetzen und erneut trainieren; wegen der zufälligen Erkundung kann der Weg jedes Mal anders ausfallen.
Belohnung ist der einzige Lehrer
Das ist verstärkendes Lernen: keine beschrifteten Beispiele, kein Mensch, der die richtige Antwort zeigt, nur ein Belohnungssignal und viel Übung. Die Update-Regel ist täuschend einfach. Nach jedem Zug schiebt der Agent seine Schätzung für dieses Feld und diese Richtung in Richtung „die gerade erhaltene Belohnung, plus wie gut das nächste Feld aussieht”. Wiederhole das tausendfach, und aus reinem Feedback entsteht eine brauchbare Strategie.
Von der Rasterwelt zu Go und Chatbots
Skaliert man diese Idee, wird daraus einige der bekanntesten KI des Jahrzehnts. AlphaGo erreichte übermenschliches Go, indem es Suche mit verstärkendem Lernen und Selbstspiel verband, die Geschichte steht in AlphaGo gegen Lee Sedol (2016). Dieselbe Methodenfamilie, als RLHF, stimmt Chatbots auf Hilfsbereitschaft ab und trainiert Reasoning-Modelle wie DeepSeek-R1, vor der Antwort nachzudenken. Andere Welten, dieselbe Kernschleife: handeln, Belohnung erhalten, aktualisieren.
Dein Rasterwelt-Agent ist die kleinste ehrliche Version dieser Schleife. Er weiß nichts, und allein die Belohnung zeigt ihm den Weg.
Die früheren Ausgaben verpasst? Trainiere ein Perzeptron, sieh einer Markov-Kette beim Plappern zu, verliere gegen unbesiegbares Tic-Tac-Toe oder bring einem Filter bei, Kanten zu sehen.