Aprendizaje de diferencia temporal (TD learning)
Método de aprendizaje por refuerzo que actualiza estimaciones de valor a partir de la diferencia entre predicciones sucesivas, arrancando de la experiencia sin esperar a la recompensa final.
El aprendizaje de diferencia temporal (TD learning) es una familia de algoritmos de aprendizaje por refuerzo que mejoran las predicciones comparando estimaciones sucesivas de recompensa futura. En lugar de esperar al final de una partida o episodio, el agente actualiza el valor del estado actual a partir de la diferencia temporal entre lo que esperaba a continuación y lo que observó realmente. Este arranque permite aprender de experiencia parcial en espacios de estados enormes donde el etiquetado exhaustivo es imposible.
Richard Sutton formalizó el enfoque en los años ochenta, y Gerald Tesauro lo aplicó al backgammon en TD-Gammon, una red neuronal que alcanzó un juego fuerte mediante señal de entrenamiento generada por sí misma. Los métodos TD siguen siendo centrales en los sistemas modernos de juegos y en el RL basado en valor. Véase el artículo y la entrada de la cronología.