Tag: #aprendizaje-refuerzo
-
TD-Gammon: aprender backgammon jugando contra sí mismo (1992)
Gerald Tesauro en IBM construyó TD-Gammon, una red neuronal que aprendió backgammon de alto nivel mediante aprendizaje por refuerzo de diferencia temporal y autojuego, alcanzando un juego cercano al nivel experto.
-
La IA alcanza el oro en la Olimpiada Internacional de Matemáticas (2025)
En julio de 2025, modelos de lenguaje de Google DeepMind y OpenAI resuelven cinco de seis problemas de la IMO y alcanzan 35 de 42 puntos, nivel de oro, escribiendo demostraciones en lenguaje natural dentro del tiempo de examen.
-
DeepSeek-R1 y el shock de eficiencia (2025)
Una startup china lanzó un modelo de razonamiento de pesos abiertos que rivalizaba con los mejores a una fracción del coste declarado, y el 27 de enero de 2025 borró una cifra récord del valor de Nvidia.
-
AlphaGo contra Lee Sedol: la máquina que aprendió a jugar (2016)
AlphaGo de DeepMind venció 4–1 a uno de los mayores jugadores de Go, no por búsqueda de fuerza bruta como Deep Blue, sino por una intuición aprendida de datos y del juego contra sí misma.