TD-Gammon : apprendre le backgammon en jouant contre soi (1992)

Gerald Tesauro chez IBM a construit TD-Gammon, un réseau de neurones qui a appris un backgammon solide par apprentissage par renforcement à différence temporelle et auto-apprentissage, atteignant un niveau proche de l'expert.

Date de l'événement: Publié:
HistoireRecherche

Au début des années 1990, Gerald Tesauro chez IBM a construit TD-Gammon, un réseau de neurones qui a appris à jouer au backgammon à un niveau amateur fort et proche de l’expert par apprentissage par renforcement et auto-apprentissage. Le programme utilisait l’apprentissage à différence temporelle pour mettre à jour son évaluation des positions après chaque coup, sans coups d’expert étiquetés pour chaque état. Tesauro a décrit les questions pratiques d’entraînement dans un article de 1992 dans Machine Learning et a présenté l’histoire complète de TD-Gammon dans Communications of the ACM en mars 1995.

Apprendre de ses propres parties

Contrairement à l’apprentissage supervisé sur un jeu de données fixe, TD-Gammon générait un signal d’entraînement en jouant contre lui-même. Après chaque coup, l’apprentissage à différence temporelle poussait le réseau vers des évaluations qui prédisaient mieux le résultat final. L’approche passait à l’échelle sur l’immense espace d’états du backgammon d’une manière que les règles codées à la main peinaient à égaler pendant le second hiver de l’IA (article).

Un pont vers l’IA de jeu moderne

TD-Gammon n’était pas le premier programme à apprendre un jeu de plateau, mais il fut un exemple public saisissant que les réseaux de neurones plus l’apprentissage par essais et erreurs pouvaient atteindre un haut niveau. La même famille de méthodes a ensuite alimenté AlphaGo (article), qui combinait apprentissage par renforcement et auto-apprentissage à bien plus grande échelle. L’ajustement moderne des LLM par RLHF optimise aussi le comportement à partir de retours, bien que la configuration diffère de l’auto-apprentissage sur un jeu de plateau.

Pourquoi c’est important

TD-Gammon a montré que les systèmes d’apprentissage pouvaient progresser par interaction plutôt que seulement à partir d’étiquettes statiques, une leçon qui a survécu au boom des systèmes experts symboliques. Il reste un point de repère pour expliquer comment l’apprentissage automatique a survécu au creux de 1987 à 1993 aux côtés des réseaux convolutifs de Yann LeCun (article).

#reseau-neuronal#apprentissage-renforcement