Apprentissage à différence temporelle (Temporal-difference learning, TD learning)
Méthode d'apprentissage par renforcement qui met à jour les estimations de valeur à partir de la différence entre prédictions successives, en s'appuyant sur l'expérience sans attendre une récompense finale.
L’apprentissage à différence temporelle (TD learning) est une famille d’algorithmes d’apprentissage par renforcement qui améliorent les prédictions en comparant des estimations successives de récompense future. Plutôt que d’attendre la fin d’une partie ou d’un épisode, l’apprenant met à jour la valeur de l’état courant à partir de la différence temporelle entre ce qu’il attendait ensuite et ce qu’il a réellement observé. Ce bootstrapping permet d’apprendre à partir d’expériences partielles dans de grands espaces d’états où un étiquetage exhaustif est impossible.
Richard Sutton a formalisé l’approche dans les années 1980, et Gerald Tesauro l’a appliquée au backgammon dans TD-Gammon, un réseau de neurones qui a atteint un niveau solide grâce à un signal d’entraînement auto-généré. Les méthodes TD restent centrales dans les systèmes de jeu modernes et le RL basé sur la valeur. Voir l’article TD-Gammon et l’entrée de chronologie.