Auto-apprentissage (Self-play)
Régime d'entraînement dans lequel un agent s'améliore en affrontant des copies ou des versions antérieures de lui-même, générant une expérience variée sans étiquettes d'expert humain.
L’auto-apprentissage est une stratégie d’entraînement en apprentissage par renforcement où un agent joue contre lui-même ou contre des instantanés antérieurs de sa propre politique. Chaque partie produit de nouveaux états et résultats qui servent de données d’entraînement, de sorte que le système peut progresser sans jeu de données fixe de coups d’expert. Comme les deux camps deviennent plus forts ensemble, l’auto-apprentissage peut explorer des stratégies que des enseignants humains ne montreraient jamais et passer à l’échelle sur des domaines à espace d’états énorme.
TD-Gammon de Gerald Tesauro a utilisé l’auto-apprentissage avec l’apprentissage à différence temporelle pour atteindre un niveau de backgammon proche de l’expert au début des années 1990. Des décennies plus tard, AlphaGo a combiné l’auto-apprentissage à bien plus grande échelle avec des réseaux de neurones profonds et une recherche arborescente pour maîtriser le go. Voir l’article TD-Gammon et l’article AlphaGo.