Co więcej, w tym samym roku Huawei również zgłosił 100% skuteczność na tych samych zadaniach – to pierwszy raz, gdy dwa systemy AI uzyskały perfekcyjne wyniki .
| Rok | System AI | Wynik / 42 | Poziom medalu | Uwagi |
|---|---|---|---|---|
| 2024 | Google DeepMind AlphaProof / AlphaGeometry | 28 | Srebrny | Rozwiązał 4 z 6 zadań; zabrakło 1 punktu do złota |
| 2025 | Google DeepMind Gemini Deep Think | 35 | Złoty | Pierwsze złoto AI; rozwiązał 5 z 6 zadań |
| 2025 | OpenAI (eksperymentalny model) | 35 | Złoty | Również osiągnął poziom złota w 2025 roku |
| 2026 | RedNote dots-note-3.0 | 42 | Złoty (perfekcyjny) | Pierwszy perfekcyjny wynik w historii IMO |
| 2026 | Huawei (model AI) | 42 | Złoty (perfekcyjny) | Również zgłoszono 100% na tych samych zadaniach |
Kluczowe różnice:
Zasadnicze zastrzeżenie: dots-note-3.0 nie startował w oficjalnych zawodach IMO razem z 666 ludzkimi uczestnikami . Regulamin IMO ogranicza udział wyłącznie do zaproszonych krajów i uczestników poniżej 20. roku życia . Zamiast tego, firmy technologiczne otrzymują te same zadania po zakończeniu egzaminu przez ludzkich uczestników, a ich rozwiązania są oceniane przez jurorów IMO .
W 2025 roku komitet IMO nie ustalił formalnych zasad dla udziału AI, co oznaczało, że każda firma mogła zdefiniować własne warunki testowania – matematycy zwracali uwagę, że umożliwiło to firmom „ustalanie i ocenianie własnych zadań domowych” . Ta nieformalna procedura obowiązywała również w 2026 roku. Jak ujmuje to jedna z analiz: dots-note-3.0 „nie wziął udziału w zawodach w tradycyjnym sensie” – rozwiązał zadania po fakcie, według zasad ustalonych przez firmę .
RedNote podkreśla, że rozwiązania modelu zostały przedstawione do oficjalnej oceny IMO i otrzymały pełną punktację od tych samych sędziów, którzy oceniają ludzkich uczestników . Podobnie przebiegała weryfikacja modelu Huawei. To dodaje wiarygodności, ponieważ sędziowie są niezależni, a rozwiązania oceniano według tych samych kryteriów.
Osiągnięcie jest autentyczne w tym sensie, że model wygenerował poprawne, ocenione przez IMO rozwiązania wszystkich sześciu zadań. Nie jest to jednak oficjalny medal IMO – IMO nie przyznaje oficjalnych medali systemom AI. Porównanie z wcześniejszymi wynikami AI jest uczciwe, ponieważ te systemy również rozwiązywały te same zadania po fakcie w podobnych warunkach, ale wszystkie „złote medale AI” należy traktować jako nieoficjalne, retrospektywne benchmarki, a nie bezpośrednie zwycięstwa w żywych zawodach. Mimo to wynik dots-note-3.0 stanowi znaczący kamień milowy jako pierwszy perfekcyjny wynik AI na pełnym zestawie zadań IMO.