KI erreicht Gold bei der Internationalen Mathematik-Olympiade (2025)
Im Juli 2025 lösen Sprachmodelle von Google DeepMind und OpenAI fünf von sechs IMO-Aufgaben und erreichen mit 35 von 42 Punkten Goldniveau, in natürlicher Sprache und innerhalb der Prüfungszeit.
Im Juli 2025 fand die Internationale Mathematik-Olympiade an der Sunshine Coast in Australien statt. Innerhalb von drei Tagen meldeten zwei Labore, dass ihre Sprachmodelle auf denselben sechs Aufgaben Goldniveau erreicht hatten: 35 von 42 Punkten, fünf Aufgaben gelöst, Beweise in natürlicher Sprache unter denselben Zeitregeln wie die menschlichen Teilnehmer.
Was die IMO so schwer macht
Die IMO ist kein Taschenrechnerwettbewerb. Jedes Jahr erreichen etwa die besten 8 Prozent Gold auf sechs Aufgaben aus Algebra, Kombinatorik, Geometrie und Zahlentheorie. Die Teilnehmer absolvieren zwei Prüfungen à 4,5 Stunden und müssen vollständige, kreative Beweise liefern, nicht nur Zahlen.
Damit liegt die IMO näher an dem, was wir „Denken” nennen, als abgegrenzte Spiele wie Schach oder Go. Deep Blue (1997) und AlphaGo (2016) siegten in geschlossenen Welten mit festen Regeln. Die IMO verlangt offenes Schlussfolgern in Worten.
Von Silber in Lean zu Gold in Sprache
2024 erreichten AlphaProof und AlphaGeometry 2 von Google DeepMind Silber mit 28 Punkten, vier Aufgaben gelöst. Experten übersetzten die Aufgaben erst in die formale Sprache Lean; der Lauf dauerte zwei bis drei Tage.
2025 arbeiteten beide führenden Systeme end-to-end in natürlicher Sprache innerhalb der 4,5-Stunden-Frist, ohne Werkzeuge und ohne Internet. DeepMind beschrieb Gemini Deep Think mit „Parallel Thinking” (mehrere Lösungswege gleichzeitig statt einer linearen Gedankenkette), neuen Techniken des verstärkenden Lernens und kuratiertem Training auf hochwertigen Lösungen. Das ist dieselbe grobe Rezeptur wie bei o1 und DeepSeek-R1: mehr Test-Time Compute im Moment der Frage.
Zwei Wege zum Gold
Am 19. Juli meldete OpenAI-Forscher Alexander Wei auf X, ein experimentelles Reasoning-Modell (nicht GPT-5) habe unter denselben Bedingungen 35/42 erreicht. Jeder Beweis wurde von drei ehemaligen IMO-Medaillengewinnern bewertet, die sich einigen mussten; die Ergebnisse standen auf GitHub. OpenAI sagte, es plane keine Veröffentlichung auf diesem Mathe-Niveau für mehrere Monate.
Am 21. Juli gab Google DeepMind denselben Wert für Gemini Deep Think bekannt. IMO-Präsident Gregor Dolinar bestätigte, dass DeepMind 35 von 42 möglichen Punkten erreicht hatte, ein Goldresultat, bewertet von IMO-Koordinatoren nach denselben Kriterien wie bei Schülern. DeepMind wies auch auf eine Grenze hin: Die IMO bestätigte die Richtigkeit der Lösungen, validierte aber nicht System, Prozess oder Modell.
Ars Technica betonte den Unterschied: OpenAI nahm nicht am offiziellen Bewertungsverfahren teil, DeepMind wartete die Bestätigung der Koordinatoren ab.
Warum es wichtig ist
Das Ergebnis verlängert die Linie vom Chemie-Nobelpreis für AlphaFold in der Wissenschaft zur Wettbewerbsmathematik und trifft mitten in den Boom beim Reasoning, den o1 eröffnete und DeepSeek-R1 verbreiterte. Es belebt auch die Bewertungsfrage aus dem o1-Artikel: Was gilt als „Lösen”, wenn ein Wert offiziell zertifiziert ist und ein anderer außerhalb des Wettbewerbs begutachtet wird?
Wettbewerbsmathe ist nicht Forschungsmathe. Gold bei der IMO ist ein Meilenstein, kein Beweis, dass Maschinen offene Probleme beherrschen. Dennoch zeigte das Überschreiten derselben Schwelle wie die weltbesten jungen Mathematiker, in Sprache statt in einer formalen Spezialpipeline, wie weit allgemeines Schlussfolgern in einem Jahr gekommen war.
#schlussfolgerung#grosses-sprachmodell#verstaerkendes-lernen