La IA alcanza el oro en la Olimpiada Internacional de Matemáticas (2025)
En julio de 2025, modelos de lenguaje de Google DeepMind y OpenAI resuelven cinco de seis problemas de la IMO y alcanzan 35 de 42 puntos, nivel de oro, escribiendo demostraciones en lenguaje natural dentro del tiempo de examen.
En julio de 2025, la Olimpiada Internacional de Matemáticas se celebró en la Sunshine Coast de Australia. En tres días, dos laboratorios anunciaron que sus modelos de lenguaje habían alcanzado nivel de oro en los mismos seis problemas: 35 de 42 puntos, cinco tareas resueltas, demostraciones en lenguaje natural bajo las mismas reglas de tiempo que los concursantes humanos.
Qué hace tan difícil la IMO
La IMO no es una competición de calculadora. Cada año, aproximadamente el 8 por ciento superior obtiene oro en seis problemas de álgebra, combinatoria, geometría y teoría de números. Los concursantes realizan dos exámenes de 4,5 horas cada uno y deben producir demostraciones completas y creativas, no solo números.
Eso sitúa la IMO más cerca de lo que llamamos «pensar» que juegos acotados como el ajedrez o el Go. Deep Blue (1997) y AlphaGo (2016) ganaron en mundos cerrados con reglas fijas. La IMO exige razonamiento abierto en palabras.
De plata en Lean a oro en lenguaje
En 2024, AlphaProof y AlphaGeometry 2 de Google DeepMind alcanzaron plata con 28 puntos, cuatro problemas resueltos. Los expertos tradujeron primero las tareas al lenguaje formal Lean; la ejecución tardó dos o tres días.
En 2025, ambos sistemas líderes trabajaron de extremo a extremo en lenguaje natural dentro del límite de 4,5 horas, sin herramientas ni internet. DeepMind describió Gemini Deep Think con «pensamiento paralelo» (varios caminos de solución a la vez en lugar de una cadena de pensamiento lineal), nuevas técnicas de aprendizaje por refuerzo y entrenamiento curado en soluciones de alta calidad. Es la misma receta amplia detrás de o1 y DeepSeek-R1: más cómputo en tiempo de inferencia en el momento de la pregunta.
Dos caminos hacia el oro
El 19 de julio, el investigador de OpenAI Alexander Wei informó en X de que un modelo experimental de razonamiento (no GPT-5) había obtenido 35/42 en las condiciones oficiales. Tres antiguos medallistas de la IMO calificaron cada demostración por consenso; los resultados se publicaron en GitHub. OpenAI dijo que no planeaba lanzar un modelo público con ese nivel matemático durante varios meses.
El 21 de julio, Google DeepMind anunció el mismo resultado para Gemini Deep Think. El presidente de la IMO Gregor Dolinar confirmó que DeepMind había obtenido 35 de 42 puntos posibles, puntuación de oro, con calificación de coordinadores de la IMO según los mismos criterios que para los estudiantes. DeepMind también señaló un límite: la IMO confirmó la corrección de las soluciones pero no validó el sistema, el proceso ni el modelo.
Ars Technica subrayó la diferencia: OpenAI no participó en la calificación oficial, mientras DeepMind esperó la confirmación de los coordinadores.
Por qué importa
El resultado extiende la línea desde AlphaFold en ciencia hasta las matemáticas de competición, y llega en pleno auge del razonamiento que o1 abrió y DeepSeek-R1 amplió. También revive la pregunta de evaluación del artículo sobre o1: ¿qué cuenta como «resolver» cuando una puntuación está certificada oficialmente y otra se revisa fuera del concurso?
Las matemáticas de competición no son matemáticas de investigación. El oro en la IMO es un hito, no una prueba de dominio de problemas abiertos. Aun así, cruzar el mismo umbral que los mejores jóvenes matemáticos, en lenguaje y no en una tubería formal a medida, mostró cuán lejos había avanzado el razonamiento de propósito general en un solo año.