Tag: #apprentissage-renforcement
-
DeepSeek-R1 et le choc d'efficacité (2025)
Une start-up chinoise a publié un modèle de raisonnement à poids ouverts rivalisant avec les meilleurs pour une fraction du coût annoncé, et le 27 janvier 2025 il a effacé une somme record de la valeur de Nvidia.
-
AlphaGo contre Lee Sedol : la machine qui a appris à jouer (2016)
AlphaGo de DeepMind a battu 4–1 l'un des plus grands joueurs de Go, non par recherche en force brute comme Deep Blue, mais par une intuition apprise des données et du jeu contre lui-même.