| 年份 | AI 系统 | 得分 / 42 | 奖牌等级 | 备注 |
|---|---|---|---|---|
| 2024 | Google DeepMind AlphaProof / AlphaGeometry | 28 | 银牌 | 解答了 6 题中的 4 题;与金牌差 1 分 |
| 2025 | Google DeepMind Gemini Deep Think | 35 | 金牌 | 首个 AI 金牌;解答了 6 题中的 5 题 |
| 2025 | OpenAI 实验性推理模型 | 35 | 金牌 | 同样在 2025 年取得金牌水平 |
| 2026 | RedNote dots-note-3.0 | 42 | 金牌(满分) | IMO 历史上首个满分成绩 |
| 2026 | 华为 AI 模型 | 42 | 金牌(满分) | 同样声称在同一套题目上取得满分 |
关键差异:
一个关键前提:dots-note-3.0 并未作为正式选手参加 IMO 竞赛,与 666 名人类参赛者同场竞技 。IMO 的《通则》规定,参赛仅限于受邀国家且参赛者年龄须在 20 岁以下 。相反,科技公司在 人类参赛者完成考试后 获得同样的题目,其解答由 IMO 阅卷人评分 。
2025 年,IMO 委员会并未为 AI 参赛制定正式规则,这意味着每家公司可以自行定义测试条件——数学家指出,这实际上让公司“既当运动员又当裁判” 。2026 年也沿用了同样的非正式流程。正如一篇分析文章所言,dots-note-3.0 “并没有在传统意义上参加比赛”——它是在比赛结束后根据公司自行定义的测试协议解答题目 。
RedNote 声称,其模型的解答 提交给了 IMO 官方阅卷,并由与人类参赛者相同的评委授予满分 。华为的模型也得到了类似的验证。这提供了一定程度的可信度,因为阅卷人是独立的,且解答是根据相同的评分标准进行评分的。
这一成就是真实的,因为该模型确实产生了正确且经 IMO 阅卷评分的全部六道题解答。但 这并非正式的 IMO 奖牌——IMO 并不正式向 AI 系统颁发奖牌。与历年 AI 成绩的比较是公平的,因为那些系统也是在类似条件下对同一套题目进行赛后解答,但所有 IMO 的“AI 金牌”都应理解为 非官方的、事后评判的基准,而非在真实比赛中的直接获胜。尽管如此,dots-note-3.0 的成绩仍然是一个重要里程碑,因为这是 AI 首次在完整的 IMO 题目集上取得满分。