TD-Gammon: Backgammon lernen durch Selbstspiel (1992)

Gerald Tesauro bei IBM baute TD-Gammon, ein neuronales Netz, das sich Backgammon durch Temporal-Difference-Lernen und Selbstspiel selbst beibrachte und damit nahezu Expertenniveau erreichte.

Ereignisdatum: Veröffentlicht:
GeschichteForschung

Anfang der 1990er baute Gerald Tesauro bei IBM TD-Gammon, ein neuronales Netz, das sich Backgammon durch verstärkendes Lernen und Selbstspiel selbst beibrachte und damit nahezu das Niveau der besten menschlichen Spieler erreichte. Das Programm nutzte Temporal-Difference-Lernen, um seine Bewertung von Brettstellungen nach jedem Zug zu aktualisieren, ohne gelabelte Expertenzüge für jeden Zustand. Tesauro beschrieb praktische Trainingsfragen in einem 1992-Paper in Machine Learning und stellte die vollständige TD-Gammon-Geschichte im März 1995 in Communications of the ACM vor.

Lernen aus eigenen Partien

Anders als überwachtes Lernen mit einem festen Datensatz erzeugte TD-Gammon Trainingssignal, indem es Partien gegen sich selbst spielte. Nach jedem Zug stieß Temporal-Difference-Lernen das Netz in Richtung Bewertungen, die das Endergebnis besser vorhersagten. Der Ansatz skalierte auf den enormen Zustandsraum von Backgammon, den handkodierte Regeln während des zweiten KI-Winter schwer erreichen konnten (Artikel).

Eine Brücke zur modernen Spiel-KI

TD-Gammon war nicht das erste Programm, das ein Brettspiel lernte, aber ein eindrückliches öffentliches Beispiel, dass neuronale Netze plus Lernen durch Versuch und Irrtum hohe Spielstärke erreichen können. Dieselbe Methodenfamilie trieb später AlphaGo (Artikel) an, das verstärkendes Lernen und Selbstspiel in viel größerem Maßstab kombinierte. Moderne Feinabstimmung von LLMs per RLHF optimiert ebenfalls Verhalten aus Feedback, obwohl sich das Setup vom Brettspiel-Selbstspiel unterscheidet.

Warum es wichtig ist

TD-Gammon zeigte, dass Lernsysteme sich durch Interaktion verbessern können, statt nur aus statischen Labels, eine Lehre, die den Boom der symbolischen Expertensysteme überdauerte. Es bleibt ein Bezugspunkt, wenn erklärt wird, wie maschinelles Lernen den Abschwung 1987–1993 neben LeCuns konvolutionellen Netzen überlebte (Artikel).

#neuronales-netz#verstaerkendes-lernen