Differenze chiave:
Una precisazione fondamentale: dots-note-3.0 non ha partecipato alla competizione ufficiale dell'IMO insieme ai 666 concorrenti umani . Il regolamento generale dell'IMO limita la partecipazione a paesi invitati e a concorrenti umani di età inferiore ai 20 anni
. Invece, le aziende tecnologiche ricevono gli stessi problemi dopo che i concorrenti umani hanno completato l'esame, e le loro soluzioni vengono valutate dai correttori dell'IMO
.
Nel 2025, il comitato dell'IMO non ha stabilito regole formali per la partecipazione dell'IA, il che ha permesso a ciascuna azienda di definire le proprie condizioni di test — portando i matematici a notare che questo consentiva alle aziende di "sia impostare che valutare i propri compiti" . Lo stesso processo informale si applica nel 2026. Come ha osservato un'analisi, dots-note-3.0 "non è entrato in competizione nel senso tradizionale" — ha risolto i problemi dopo i fatti secondo protocolli di test definiti dall'azienda
.
RedNote ha dichiarato che le soluzioni del suo modello sono state sottoposte alla valutazione ufficiale dell'IMO e hanno ricevuto il punteggio massimo dagli stessi giudici che valutano i concorrenti umani . Anche il modello di Huawei è stato verificato in modo simile. Questo fornisce un livello significativo di credibilità, poiché i correttori sono indipendenti e le soluzioni sono state giudicate secondo gli stessi criteri.
Il risultato è genuino nel senso che il modello ha prodotto soluzioni corrette, valutate dall'IMO, per tutti e sei i problemi. Ma non è una medaglia ufficiale dell'IMO — l'IMO non assegna formalmente medaglie ai sistemi di IA. Il confronto con i risultati precedenti dell'IA è corretto perché anche quei sistemi hanno risolto gli stessi problemi dopo i fatti in condizioni simili, ma tutte le "medaglie d'oro dell'IA" dovrebbero essere intese come parametri di riferimento non ufficiali e valutati retrospettivamente, piuttosto che vittorie dirette in una competizione dal vivo. Il risultato di dots-note-3.0 è comunque una tappa significativa, essendo la prima volta che un'IA raggiunge un punteggio perfetto su un set completo di problemi dell'IMO.