Tag: #verstaerkendes-lernen
-
TD-Gammon: Backgammon lernen durch Selbstspiel (1992)
Gerald Tesauro bei IBM baute TD-Gammon, ein neuronales Netz, das sich Backgammon durch Temporal-Difference-Lernen und Selbstspiel selbst beibrachte und damit nahezu Expertenniveau erreichte.
-
KI erreicht Gold bei der Internationalen Mathematik-Olympiade (2025)
Im Juli 2025 lösen Sprachmodelle von Google DeepMind und OpenAI fünf von sechs IMO-Aufgaben und erreichen mit 35 von 42 Punkten Goldniveau, in natürlicher Sprache und innerhalb der Prüfungszeit.
-
DeepSeek-R1 und der Effizienzschock (2025)
Ein chinesisches Start-up veröffentlichte ein Reasoning-Modell mit offenen Gewichten, das den Besten ebenbürtig war, zu einem Bruchteil der angegebenen Kosten, und ließ am 27. Januar 2025 einen Rekordbetrag von Nvidias Wert verschwinden.
-
AlphaGo gegen Lee Sedol: die Maschine, die spielen lernte (2016)
DeepMinds AlphaGo schlug einen der größten Go-Spieler 4:1, und zwar nicht durch Brute-Force-Suche wie Deep Blue, sondern durch aus Daten und Selbstspiel gelernte Intuition.