| Jahr | KI-System | Punktzahl / 42 | Medaillen-Niveau | Anmerkungen |
|---|---|---|---|---|
| 2024 | Google DeepMind AlphaProof / AlphaGeometry | 28 | Silber | Löste 4 von 6 Aufgaben; ein Punkt unter Gold |
| 2025 | Google DeepMind Gemini Deep Think | 35 | Gold | Erste KI-Goldmedaille; löste 5 von 6 Aufgaben |
| 2025 | OpenAI experimentelles Reasoning-Modell | 35 | Gold | Ebenfalls Gold-Niveau im Jahr 2025 |
| 2026 | RedNote dots-note-3.0 | 42 | Gold (perfekt) | Erste perfekte Punktzahl in der IMO-Geschichte |
| 2026 | Huawei KI-Modell | 42 | Gold (perfekt) | Ebenfalls 100% bei denselben Aufgaben gemeldet |
Wichtige Unterschiede:
Ein entscheidender Vorbehalt: dots-note-3.0 nahm nicht am offiziellen IMO-Wettbewerb neben den 666 menschlichen Teilnehmern teil . Die Allgemeinen Regeln der IMO beschränken die Teilnahme auf eingeladene Länder und menschliche Teilnehmer unter 20 Jahren . Stattdessen erhalten Technologieunternehmen die gleichen Aufgaben, nachdem die menschlichen Teilnehmer die Prüfung abgeschlossen haben, und ihre Lösungen werden von IMO-Korrektoren bewertet .
Im Jahr 2025 legte das IMO-Komitee keine formellen Regeln für die KI-Teilnahme fest, was es den Unternehmen ermöglichte, ihre eigenen Testbedingungen zu definieren – führende Mathematiker stellten fest, dass dies den Unternehmen erlaubte, „sowohl ihre eigenen Hausaufgaben zu stellen als auch zu benoten" . Derselbe informelle Prozess gilt für 2026. Wie eine Analyse feststellte, trat dots-note-3.0 „nicht im traditionellen Sinne in den Wettbewerb ein" – es löste die Aufgaben nachträglich unter unternehmenseigenen Testprotokollen .
RedNote gab an, dass die Lösungen seines Modells zur offiziellen IMO-Bewertung eingereicht wurden und von denselben Juroren, die auch die menschlichen Teilnehmer bewerten, die volle Punktzahl erhielten . Dies verleiht dem Ergebnis eine gewisse Glaubwürdigkeit, da die Korrektoren unabhängig sind und die Lösungen nach demselben Bewertungsschema beurteilt wurden.
Die Leistung ist insofern echt, als das Modell korrekte, von der IMO bewertete Lösungen für alle sechs Aufgaben lieferte. Es handelt sich jedoch nicht um eine offizielle IMO-Medaille – die IMO vergibt keine Medaillen an KI-Systeme. Der Vergleich mit früheren KI-Ergebnissen ist fair, da auch diese Systeme dieselben Aufgaben nachträglich unter ähnlichen Bedingungen lösten, aber alle „KI-Goldmedaillen" bei der IMO sollten als inoffizielle, retrospektiv bewertete Benchmarks verstanden werden, nicht als direkte Siege in einem Live-Wettbewerb. Das Ergebnis von dots-note-3.0 ist dennoch ein bedeutender Meilenstein als erste perfekte Punktzahl einer KI bei einem vollständigen IMO-Aufgabensatz.