| 年份 | AI 系統 | 分數 / 42 | 獎牌等級 | 備註 |
|---|---|---|---|---|
| 2024 | Google DeepMind AlphaProof / AlphaGeometry | 28 | 銀牌 | 解答4/6題;離金牌差1分 |
| 2025 | Google DeepMind Gemini Deep Think | 35 | 金牌 | 首個AI金牌;解答5/6題 |
| 2025 | OpenAI 實驗推理模型 | 35 | 金牌 | 同樣在2025年獲得金牌等級 |
| 2026 | 小紅書 dots-note-3.0 | 42 | 金牌(完美) | IMO史上首個完美分數 |
| 2026 | 華為 AI 模型 | 42 | 金牌(完美) | 同樣宣稱在相同題目上獲得100% |
關鍵差異:
一個關鍵前提:dots-note-3.0並未與666名人類參賽者一起參加正式IMO競賽。IMO的總則限制僅邀請國家及20歲以下人類參賽者參加 。科技公司是在人類參賽者完成考試後,獲得 相同的題目,其解答由IMO評分員進行評分 。
2025年,IMO委員會並未制定AI參賽的正式規則,這使得每家企業可以自行定義測試條件——數學家指出這讓企業能夠「既出題又改自己的作業」。同樣的非正式流程也適用於2026年。有分析指出,dots-note-3.0「並未以傳統意義參賽」——它是在賽後、在公司自行定義的測試協議下解答題目 。
小紅書表示,其模型的解答已 提交給官方IMO進行評分,並由評分人類參賽者的同一批評審給予滿分 。華為的模型也經過類似驗證。這提供了有意義的可信度,因為評分員是獨立的,且解答是依據相同評分標準進行評分。
這項成就的真實性在於,該模型確實產生了正確且經IMO評分的六道題解答。但這 並非正式的IMO獎牌——IMO不會向AI系統正式頒發獎牌。與先前AI結果的比較是合理的,因為那些系統也在類似條件下賽後解答相同題目,但所有「IMO AI金牌」都應理解為 非官方、回溯性評分的基準測試,而非現場競賽中的直接勝利。dots-note-3.0的結果仍然是重要的里程碑,因為這是AI首次在完整的IMO題目上達成完美分數。