| 연도 | AI 시스템 | 점수 / 42 | 메달 수준 | 비고 |
|---|---|---|---|---|
| 2024 | 구글 딥마인드 AlphaProof / AlphaGeometry | 28 | 은메달 | 6문제 중 4문제 해결, 금메달에 1점 부족 |
| 2025 | 구글 딥마인드 Gemini Deep Think | 35 | 금메달 | AI 최초 금메달, 6문제 중 5문제 해결 |
| 2025 | 오픈AI 실험적 추론 모델 | 35 | 금메달 | 2025년에도 금메달 수준 점수 달성 |
| 2026 | 레드노트 dots-note-3.0 | 42 | 금메달(만점) | IMO 역사상 최초 만점 |
| 2026 | 화웨이 AI 모델 | 42 | 금메달(만점) | 같은 문제에서 100% 정답률 보고 |
핵심 차이점:
중요한 점은 dots-note-3.0이 666명의 인간 참가자와 함께 공식 IMO 대회에 참가한 것이 아니라는 것입니다. IMO 일반 규정은 초청된 국가와 20세 미만의 인간 참가자만 대회 참가 자격을 제한합니다. 대신, 기술 기업들은 인간 참가자가 시험을 마친 후 동일한 문제를 제공받고, 그 해결책을 IMO 채점관이 평가하는 방식으로 진행됩니다.
2025년에 IMO 위원회는 AI 참가에 대한 공식 규칙을 마련하지 않아, 각 기업이 자체 테스트 조건을 정의할 수 있었습니다. 이에 대해 수학자들은 기업들이 '자신의 숙제를 스스로 내고 채점하는 것'을 가능하게 했다고 지적했습니다. 2026년에도 동일한 비공식 절차가 적용되었습니다. 한 분석에 따르면, dots-note-3.0은 전통적인 의미에서 대회에 참가한 것은 아니며, 회사가 정의한 테스트 프로토콜에 따라 사후에 문제를 해결한 것입니다.
레드노트는 자사 모델의 해결책이 공식 IMO 채점에 제출되어 인간 참가자와 동일한 채점관으로부터 만점을 받았다고 밝혔습니다. 화웨이의 모델도 유사하게 검증되었습니다. 채점관은 독립적이며, 해결책은 동일한 평가 기준에 따라 평가되었기 때문에, 이는 의미 있는 신뢰성 계층을 제공합니다.
모델이 6개 문제 모두에 대해 정확하고 IMO가 채점한 해결책을 제시했다는 점에서, 이번 성과는 진정한 의미를 갖습니다. 그러나 이는 공식 IMO 메달이 아닙니다. IMO는 AI 시스템에 공식적으로 메달을 수여하지 않습니다. 이전 AI 결과와의 비교는 해당 시스템들도 유사한 조건에서 같은 문제를 사후에 해결했기 때문에 공정하지만, 모든 'AI IMO 금메달'은 비공식적이고 회고적으로 판단된 벤치마크로 이해되어야 하며, 실시간 경쟁에서의 직접적인 우승이 아닙니다. 그럼에도 불구하고, dots-note-3.0의 결과는 AI가 전체 IMO 문제 세트에서 만점에 도달한 최초의 사례라는 점에서 중요한 이정표입니다.