Multi-Armed Bandit: erkunden oder ausnutzen?
Fünf Spielautomaten verbergen unterschiedliche Auszahlungsraten. Ziehe selbst oder schiebe Erkunden und sieh epsilon-greedy lernen, welcher Arm am besten zahlt. Das klassische RL-Dilemma in einer Reihe Hebel.
Letzte Woche lernten Wörter, wem sie zuhören. Diese Woche steht die Maschine vor einem Problem, das jeder Recommender, jedes Anzeigensystem und jeder RL-Agent kennt: du hast mehrere Optionen, weißt nicht, welche die beste ist, und jeder Versuch kostet etwas. Den falschen Hebel ziehen heißt verpassen. Nie neue Hebel probieren heißt, vielleicht nie das Optimum finden. Diese Spannung heißt Erkunden vs. Ausnutzen (explore vs. exploit).
Das Gadget unten ist eine Reihe von fünf Einarmigen Banditen, klassische Spielautomaten. Jeder zahlt nach einem versteckten Schema aus. Manche Arme sind Flops; einer zahlt besser als der Rest. Du kannst von Hand ziehen und deine eigene Neugier spüren, oder Erkunden schieben und epsilon-greedy automatisch spielen lassen: mit Wahrscheinlichkeit ε probiert es einen zufälligen Arm (erkunden), sonst bleibt es beim Arm mit dem besten Durchschnitt bisher (ausnutzen).
Probier das:
- Ziehe jeden Arm ein paar Mal von Hand. Die Balken zeigen deine laufende Trefferquote; die Zahlen darunter, wie oft du gezogen hast. Welcher Arm wirkt nach zehn Zügen am besten? Bist du sicher?
- Stelle Erkunden auf 80 % und drücke Auto ×10. Sieh zu, wie der Agent zufällig hin und her springt, kaum festlegt. Dann Erkunden auf 5 % und wieder auto-spielen: er hämmert auf den aktuellen Favoriten, vielleicht den falschen.
- Drücke Quoten zeigen, um blasse Geisterbalken zu sehen, die echten Auszahlungsraten. Wie viel Belohnung hast du auf dem Tisch gelassen, weil du zu lange erkundet oder zu früh ausgenutzt hast? Diese Lücke ist Regret, die Währung der Bandit-Algorithmen.
Warum das wichtig ist
Der Multi-Armed Bandit ist das klarste Bild von verstärkendem Lernen, wenn es keine Karte zu lernen gibt, nur Entscheidungen und Feedback. Newsfeeds, A/B-Tests, klinische Studien und spielende KIs stehen vor derselben Frage: Traffic auf Bewährtes legen oder auf Unbekanntes setzen, das besser sein könnte?
Echte Systeme nutzen cleverere Regeln als epsilon-greedy (UCB, Thompson Sampling), aber der Trade-off ist identisch. AlphaGo erkundete neue Züge im Selbstspiel; RLHF, das ChatGPT verfeinerte, erkundet Formulierungen, die Menschen bevorzugen könnten. Deine Reihe von fünf Hebeln ist dieselbe Schleife im Spielzeugmaßstab: handeln, Belohnung beobachten, Überzeugungen updaten, neu entscheiden.
Die früheren Editionen verpasst? Trainiere ein Perzeptron, lass eine Markov-Kette plappern, verliere gegen unschlagbares Tic-Tac-Toe, bringe einem Filter bei, Kanten zu sehen, sieh einem Agenten beim Lernen aus Belohnung zu, sieh, wie ein Modell Text in Tokens liest, lass eine Kugel bergab rollen zum Lernen, lass eine Maschine Gruppen selbst finden, sieh einer Linie beim Biegen zu, oder sieh zu, wie Wörter entscheiden, wem sie zuhören.