TD-Gammon: aprender backgammon jugando contra sí mismo (1992)
Gerald Tesauro en IBM construyó TD-Gammon, una red neuronal que aprendió backgammon de alto nivel mediante aprendizaje por refuerzo de diferencia temporal y autojuego, alcanzando un juego cercano al nivel experto.
A principios de los años noventa, Gerald Tesauro en IBM construyó TD-Gammon, una red neuronal que aprendió a jugar backgammon a nivel de aficionado fuerte y casi experto mediante aprendizaje por refuerzo y autojuego. El programa usó aprendizaje de diferencia temporal para actualizar su evaluación de posiciones del tablero tras cada jugada, sin movimientos de experto etiquetados para cada estado. Tesauro describió cuestiones prácticas de entrenamiento en un artículo de 1992 en Machine Learning y presentó la historia completa de TD-Gammon en Communications of the ACM en marzo de 1995.
Aprender de sus propias partidas
A diferencia del aprendizaje supervisado sobre un conjunto de datos fijo, TD-Gammon generaba señal de entrenamiento jugando partidas contra sí mismo. Tras cada jugada, el aprendizaje de diferencia temporal empujaba la red hacia valoraciones que predecían mejor el resultado final. El enfoque escalaba al enorme espacio de estados del backgammon de formas que las reglas codificadas a mano difícilmente igualaban durante el segundo invierno de la IA (artículo).
Un puente hacia la IA de juegos moderna
TD-Gammon no fue el primer programa en aprender un juego de mesa, pero fue un ejemplo público y vívido de que las redes neuronales más el aprendizaje por ensayo y error podían alcanzar un nivel alto. La misma familia amplia de métodos impulsó después AlphaGo (artículo), que combinó aprendizaje por refuerzo y autojuego a una escala mucho mayor. El ajuste moderno de LLM mediante RLHF también optimiza el comportamiento a partir de retroalimentación, aunque la configuración difiere del autojuego en juegos de mesa.
Por qué importa
TD-Gammon demostró que los sistemas de aprendizaje podían mejorar mediante interacción y no solo a partir de etiquetas estáticas, una lección que sobrevivió al auge de los sistemas expertos simbólicos. Sigue siendo un punto de referencia al explicar cómo el aprendizaje automático sobrevivió al declive de 1987-1993 junto a las redes convolucionales de Yann LeCun (artículo).