Temporal-Difference-Lernen (Temporal-difference learning, TD learning)

Verstärkungslernmethode, die Wertschätzungen aus der Differenz aufeinanderfolgender Vorhersagen aktualisiert und aus Erfahrung bootstrapped, ohne auf eine Endbelohnung zu warten.

Temporal-Difference-Lernen (TD-Lernen) ist eine Familie von Algorithmen im verstärkenden Lernen, die Vorhersagen verbessern, indem sie aufeinanderfolgende Schätzungen zukünftiger Belohnung vergleichen. Statt bis zum Ende einer Partie oder Episode zu warten, aktualisiert der Lernende den Wert des aktuellen Zustands aus der Temporal Difference zwischen dem erwarteten und dem tatsächlich beobachteten Folgezustand. Dieses Bootstrapping ermöglicht Lernen aus Teilerfahrung in großen Zustandsräumen, in denen exhaustive Beschriftung unmöglich ist.

Richard Sutton formalisierte den Ansatz in den 1980er-Jahren, und Gerald Tesauro wandte ihn auf Backgammon in TD-Gammon an, einem neuronalen Netz, das durch selbst erzeugtes Trainingssignal starkes Spiel erreichte. TD-Methoden bleiben zentral für moderne Spielsysteme und wertbasiertes RL. Siehe den TD-Gammon-Artikel und den Zeitleisten-Eintrag.