| År | AI-system | Poengsum / 42 | Medaljenivå | Notater |
|---|---|---|---|---|
| 2024 | Google DeepMind AlphaProof / AlphaGeometry | 28 | Sølv | Løste 4 av 6 oppgaver; ett poeng unna gull |
| 2025 | Google DeepMind Gemini Deep Think | 35 | Gull | Første AI-gull; løste 5 av 6 oppgaver |
| 2025 | OpenAI eksperimentell resonneringsmodell | 35 | Gull | Også oppnådd gullnivå i 2025 |
| 2026 | RedNote dots-note-3.0 | 42 | Gull (perfekt) | Første perfekte poengsum i IMO-historien |
| 2026 | Huaweis AI-modell | 42 | Gull (perfekt) | Også rapportert 100 % på de samme oppgavene |
Viktige forskjeller:
En viktig forbehold: dots-note-3.0 deltok ikke i den offisielle IMO-konkurransen sammen med de 666 menneskelige deltakerne . IMOs generelle regler begrenser deltakelse til inviterte land og menneskelige deltakere under 20 år . I stedet får teknologiselskapene de samme oppgavene etter at de menneskelige deltakerne har gjennomført eksamen, og løsningene deres blir vurdert av IMO-sensorer .
I 2025 valgte IMO-komiteen å ikke skrive formelle regler for AI-deltakelse, noe som betydde at hvert selskap kunne definere sine egne testforhold – noe som fikk matematikere til å påpeke at dette gjorde det mulig for selskaper å «både sette og rette sin egen lekse» . Den samme uformelle prosessen gjelder i 2026. Som en analyse uttrykte det, «deltok dots-note-3.0 ikke i konkurransen i tradisjonell forstand» – den løste oppgavene i ettertid under selskapets egne testprotokoller .
RedNote uttalte at modellens løsninger ble sendt inn til offisiell IMO-vurdering og tildelt full poengsum av de samme dommerne som vurderer menneskelige deltakere . Huaweis modell ble tilsvarende verifisert. Dette gir et meningsfullt lag av troverdighet, siden sensorene er uavhengige og løsningene ble vurdert etter samme rubrikk.
Prestasjonen er ekte i den forstand at modellen produserte korrekte, IMO-vurderte løsninger på alle seks oppgavene. Men det er ikke en offisiell IMO-medalje – IMO tildeler ikke formelt medaljer til AI-systemer. Sammenligningen med tidligere AI-resultater er rettferdig fordi disse systemene også løste de samme oppgavene i ettertid under lignende forhold, men alle «AI-gullmedaljer» i IMO bør forstås som uoffisielle, retrospektivt bedømte benchmark-tester snarere enn direkte seire i en levende konkurranse. Resultatet fra dots-note-3.0 er likevel en betydelig milepæl som første gang noen AI har nådd en perfekt poengsum på et komplett IMO-oppgavesett.