Tag: #apprentissage-renforcement
-
TD-Gammon : apprendre le backgammon en jouant contre soi (1992)
Gerald Tesauro chez IBM a construit TD-Gammon, un réseau de neurones qui a appris un backgammon solide par apprentissage par renforcement à différence temporelle et auto-apprentissage, atteignant un niveau proche de l'expert.
-
L'IA atteint l'or à l'Olympiade internationale de mathématiques (2025)
En juillet 2025, des modèles de langage de Google DeepMind et d'OpenAI résolvent cinq des six problèmes de l'IMO et atteignent 35 points sur 42, niveau or, en rédigeant des preuves en langage naturel dans le temps d'examen.
-
DeepSeek-R1 et le choc d'efficacité (2025)
Une start-up chinoise a publié un modèle de raisonnement à poids ouverts rivalisant avec les meilleurs pour une fraction du coût annoncé, et le 27 janvier 2025 il a effacé une somme record de la valeur de Nvidia.
-
AlphaGo contre Lee Sedol : la machine qui a appris à jouer (2016)
AlphaGo de DeepMind a battu 4–1 l'un des plus grands joueurs de Go, non par recherche en force brute comme Deep Blue, mais par une intuition apprise des données et du jeu contre lui-même.