L'IA atteint l'or à l'Olympiade internationale de mathématiques (2025)
En juillet 2025, des modèles de langage de Google DeepMind et d'OpenAI résolvent cinq des six problèmes de l'IMO et atteignent 35 points sur 42, niveau or, en rédigeant des preuves en langage naturel dans le temps d'examen.
En juillet 2025, l’Olympiade internationale de mathématiques s’est tenue sur la Sunshine Coast en Australie. En trois jours, deux laboratoires ont annoncé que leurs grands modèles de langage avaient atteint le niveau or sur les six mêmes problèmes : 35 points sur 42, cinq tâches résolues, preuves en langage naturel sous les mêmes règles de temps que les concurrents humains.
Ce qui rend l’IMO si difficile
L’IMO n’est pas un concours de calculatrice. Chaque année, environ les 8 pour cent meilleurs obtiennent l’or sur six problèmes d’algèbre, combinatoire, géométrie et théorie des nombres. Les candidats passent deux examens de 4,5 heures chacun et doivent produire des preuves complètes et créatives, pas seulement des nombres.
Cela rapproche l’IMO de ce que nous appelons « penser » davantage que des jeux bornés comme les échecs ou le Go. Deep Blue (1997) et AlphaGo (2016) ont gagné dans des mondes fermés à règles fixes. L’IMO exige un raisonnement ouvert en mots.
De l’argent en Lean à l’or en langage
En 2024, AlphaProof et AlphaGeometry 2 de Google DeepMind ont atteint l’argent avec 28 points, quatre problèmes résolus. Des experts ont d’abord traduit les énoncés dans le langage formel Lean ; l’exécution a pris deux à trois jours.
En 2025, les deux systèmes de tête ont travaillé de bout en bout en langage naturel dans la limite de 4,5 heures, sans outils ni internet. DeepMind a décrit Gemini Deep Think avec un « parallel thinking » (plusieurs chemins de solution à la fois plutôt qu’une chaîne de pensée linéaire), de nouvelles techniques d’apprentissage par renforcement et un entraînement curaté sur des solutions de haute qualité. C’est la même recette large que o1 et DeepSeek-R1 : plus de calcul au moment de l’inférence au moment de la question.
Deux chemins vers l’or
Le 19 juillet, le chercheur d’OpenAI Alexander Wei a rapporté sur X qu’un modèle expérimental de raisonnement (pas GPT-5) avait obtenu 35/42 dans les conditions officielles. Trois anciens médaillés de l’IMO ont noté chaque preuve par consensus ; les résultats ont été publiés sur GitHub. OpenAI a dit ne pas prévoir de modèle public à ce niveau mathématique pendant plusieurs mois.
Le 21 juillet, Google DeepMind a annoncé le même score pour Gemini Deep Think. Le président de l’IMO Gregor Dolinar a confirmé que DeepMind avait obtenu 35 des 42 points possibles, un score d’or, noté par les coordinateurs de l’IMO selon les mêmes critères que pour les élèves. DeepMind a aussi signalé une limite : l’IMO a confirmé l’exactitude des solutions mais n’a pas validé le système, le processus ou le modèle.
Ars Technica a souligné la différence : OpenAI n’a pas participé à la notation officielle, tandis que DeepMind a attendu la confirmation des coordinateurs.
Pourquoi c’est important
Le résultat prolonge la ligne d’AlphaFold en science vers les mathématiques de concours, et arrive au cœur de l’essor du raisonnement ouvert par o1 et élargi par DeepSeek-R1. Il ravive aussi la question d’évaluation de l’article sur o1 : que signifie « résoudre » quand un score est certifié officiellement et un autre examiné hors concours ?
Les maths de concours ne sont pas les maths de recherche. L’or à l’IMO est une étape, pas une preuve de maîtrise des problèmes ouverts. Pourtant, franchir le même seuil que les meilleurs jeunes mathématiciens, en langage plutôt que dans un pipeline formel sur mesure, a montré jusqu’où le raisonnement généraliste avait progressé en un an.
#raisonnement#grand-modele-langage#apprentissage-renforcement