| 年份 | AI系統 | 分數(/42) | 獎牌級別 | 備註 |
|---|---|---|---|---|
| 2024 | Google DeepMind AlphaProof / AlphaGeometry | 28 | 銀牌 | 答對4/6題,同金牌只差1分 |
| 2025 | Google DeepMind Gemini Deep Think | 35 | 金牌 | 首個AI金牌;答對5/6題 |
| 2025 | OpenAI實驗性推理模型 | 35 | 金牌 | 同樣達到金牌水平 |
| 2026 | 小紅書 dots-note-3.0 | 42 | 金牌(完美) | 史上首個AI完美得分 |
| 2026 | Huawei AI模型 | 42 | 金牌(完美) | 同上屆取得100%分數 |
主要分別:
一個重大嘅但要留意嘅係:dots-note-3.0 冇同666位人類參賽者一齊坐低考IMO。IMO嘅規則限制參賽者係獲邀國家嘅人類學生,而且未夠20歲。科技公司係喺 人類參賽者考完之後,先攞到同一批題目,然後由IMO評分員評改。
喺2025年,IMO委員會冇為AI參加比賽寫低正式規則,所以每間公司可以自己定義測試條件——數學家指出咁樣令到公司可以「自己出題、自己評分」。2026年嘅情況都係差唔多。有分析話,dots-note-3.0「冇傳統意義上參加比賽」——佢只係喺公司自訂嘅測試條件下賽後解題。
小紅書話佢哋嘅模型嘅答案 提交畀官方IMO評分,並且由評分人類參賽者嘅同一班評分員畀滿分。Huawei嘅模型都係咁樣驗證。呢個提供咗一定嘅可信度,因為評分員係獨立嘅,而答案係用同一個評分標準去評。
呢個成就係真確嘅——模型確實產生咗正確嘅、經IMO評分嘅答案畀晒全部六條題目。但 呢個唔係官方IMO獎牌 ——IMO唔會正式頒獎牌畀AI系統。同以往AI結果嘅比較係合理嘅,因為呢啲系統都係喺賽後類似條件下解題,但所有「AI金牌」都應該理解為 非官方、賽後回顧性質嘅基準測試,而唔係喺現場比賽入面贏返嚟嘅。不過,dots-note-3.0 嘅結果仍然係一個重要里程碑,係首次有AI喺完整嘅IMO題目中取得完美得分。