Gerald Tesauro
Chercheur IBM qui a construit TD-Gammon en 1992, un réseau neuronal apprenant le backgammon par auto-jeu.
TD-Gammon de Tesauro utilisait l’apprentissage par différences temporelles en apprentissage par renforcement pour atteindre un fort niveau au backgammon sans règles conçues à la main. Il a montré que les réseaux neuronaux pouvaient progresser par l’expérience dans les années calmes après le second hiver de l’IA.