| År | AI-system | Score / 42 | Medaljeniveau | Bemærkninger |
|---|---|---|---|---|
| 2024 | Google DeepMind AlphaProof / AlphaGeometry | 28 | Sølv | Løste 4 af 6 opgaver; ét point fra guld |
| 2025 | Google DeepMind Gemini Deep Think | 35 | Guld | Første AI-guldmedalje; løste 5 af 6 opgaver |
| 2025 | OpenAI eksperimentel ræsonneringsmodel | 35 | Guld | Også opnået guldmedaljeniveau i 2025 |
| 2026 | RedNote dots-note-3.0 | 42 | Guld (perfekt) | Første perfekte score i IMO-historien |
| 2026 | Huawei AI-model | 42 | Guld (perfekt) | Også rapporteret 100 % på de samme opgaver |
Vigtige forskelle:
En vigtig pointe: dots-note-3.0 deltog ikke i den officielle IMO-konkurrence sammen med de 666 menneskelige deltagere . IMO's generelle regler begrænser deltagelse til inviterede lande og menneskelige deltagere under 20 år . I stedet får teknologivirksomheder de samme opgaver, efter at de menneskelige deltagere har gennemført eksamen, og deres løsninger bedømmes af IMO-dommere .
I 2025 valgte IMO-komiteen ikke at skrive formelle regler for AI-deltagelse, hvilket betød, at hver virksomhed kunne definere sine egne testbetingelser – hvilket fik matematikere til at påpege, at det gav virksomhederne mulighed for at "både sætte og bedømme deres egen lektie" . Den samme uformelle proces gælder i 2026. Som en analyse påpegede, deltog dots-note-3.0 "ikke i konkurrencen i traditionel forstand" – den løste opgaverne bagefter under virksomhedsdefinerede testprotokoller .
RedNote oplyste, at modellens løsninger blev indsendt til officiel IMO-bedømmelse og tildelt fulde point af de samme dommere, der scorer menneskelige deltagere . Huaweis model blev tilsvarende verificeret. Dette giver et meningsfuldt lag af troværdighed, da dommerne er uafhængige, og løsningerne blev bedømt efter den samme rubrik.
Præstationen er ægte i den forstand, at modellen producerede korrekte, IMO-bedømte løsninger til alle seks opgaver. Men det er ikke en officiel IMO-medalje – IMO tildeler ikke formelt medaljer til AI-systemer. Sammenligningen med tidligere AI-resultater er rimelig, fordi disse systemer også løste de samme opgaver bagefter under lignende betingelser, men alle "AI-guldmedaljer" bør forstås som uofficielle, retrospektivt bedømte benchmarks snarere end direkte sejre i en live-konkurrence. Alligevel er dots-note-3.0-resultatet en betydelig milepæl som det første eksempel på, at AI har nået en perfekt score på et fuldt IMO-opgavesæt.