Selbstspiel (Self-play)
Trainingsregime, in dem ein Agent gegen Kopien oder frühere Versionen seiner selbst antritt und so vielfältige Erfahrung ohne menschliche Expertenlabels erzeugt.
Selbstspiel ist eine Trainingsstrategie im verstärkenden Lernen, bei der ein Agent gegen sich selbst oder gegen frühere Versionen seiner eigenen Policy spielt. Jede Partie erzeugt neue Zustände und Ergebnisse, die als Trainingsdaten dienen, sodass das System ohne festen Datensatz von Expertenzügen besser werden kann. Weil beide Seiten gemeinsam stärker werden, kann Selbstspiel Strategien erkunden, die menschliche Lehrer nie zeigen würden, und es skaliert auf Domänen mit enormen Zustandsräumen.
Gerald Tesauros TD-Gammon nutzte Selbstspiel mit Temporal-Difference-Lernen, um in den frühen 1990er-Jahren nahezu Expertenniveau im Backgammon zu erreichen. Jahrzehnte später kombinierte AlphaGo Selbstspiel in viel größerem Maßstab mit tiefen neuronalen Netzen und Baumsuche, um Go zu meistern. Siehe den TD-Gammon-Artikel und den AlphaGo-Artikel.