Tag: #aprendizaje-refuerzo
-
DeepSeek-R1 y el shock de eficiencia (2025)
Una startup china lanzó un modelo de razonamiento de pesos abiertos que rivalizaba con los mejores a una fracción del coste declarado, y el 27 de enero de 2025 borró una cifra récord del valor de Nvidia.
-
AlphaGo contra Lee Sedol: la máquina que aprendió a jugar (2016)
AlphaGo de DeepMind venció 4–1 a uno de los mayores jugadores de Go, no por búsqueda de fuerza bruta como Deep Blue, sino por una intuición aprendida de datos y del juego contra sí misma.