| ปี | ระบบ AI | คะแนน / 42 | ระดับเหรียญ | หมายเหตุ |
|---|---|---|---|---|
| 2024 | Google DeepMind AlphaProof / AlphaGeometry | 28 | เงิน | แก้โจทย์ได้ 4 จาก 6 ข้อ; ขาดอีก 1 คะแนนถึงเหรียญทอง |
| 2025 | Google DeepMind Gemini Deep Think | 35 | ทอง | เหรียญทองครั้งแรกของ AI; แก้โจทย์ได้ 5 จาก 6 ข้อ |
| 2025 | OpenAI experimental reasoning model | 35 | ทอง | ได้คะแนนระดับเหรียญทองเช่นกันในปี 2025 |
| 2026 | RedNote dots-note-3.0 | 42 | ทอง (สมบูรณ์แบบ) | คะแนนสมบูรณ์แบบครั้งแรกในประวัติศาสตร์ IMO |
| 2026 | Huawei AI model | 42 | ทอง (สมบูรณ์แบบ) | รายงานว่าทำคะแนน 100% ในข้อสอบชุดเดียวกัน |
ความแตกต่างที่สำคัญ:
ข้อควรระวังที่สำคัญ: dots-note-3.0 ไม่ได้เข้าสอบ IMO อย่างเป็นทางการ ร่วมกับผู้เข้าแข่งขันที่เป็นมนุษย์ 666 คน ข้อบังคับทั่วไปของ IMO จำกัดการเข้าร่วมเฉพาะประเทศที่ได้รับเชิญและผู้เข้าแข่งขันที่เป็นมนุษย์ที่มีอายุต่ำกว่า 20 ปี วิธีปฏิบัติคือ บริษัทเทคโนโลยีจะได้รับ โจทย์เดียวกันหลังจากที่ผู้เข้าแข่งขันที่เป็นมนุษย์สอบเสร็จ และคำตอบของพวกเขาจะถูกตรวจโดยกรรมการ IMO
ในปี 2025 คณะกรรมการ IMO ไม่ได้เขียนกฎอย่างเป็นทางการสำหรับการเข้าร่วมของ AI ซึ่งหมายความว่าแต่ละบริษัทสามารถกำหนดเงื่อนไขการทดสอบของตนเองได้ — นักคณิตศาสตร์ชั้นนำชี้ให้เห็นว่าสิ่งนี้ทำให้บริษัทต่างๆ สามารถ "กำหนดและตรวจการบ้านของตนเองได้" กระบวนการที่ไม่เป็นทางการเดียวกันนี้ใช้ในปี 2026 ตามการวิเคราะห์ชิ้นหนึ่ง dots-note-3.0 "ไม่ได้เข้าร่วมการแข่งขันในความหมายดั้งเดิม" — มันแก้โจทย์ภายหลังภายใต้โปรโตคอลการทดสอบที่บริษัทกำหนด
RedNote ระบุว่าคำตอบของโมเดลของตน ถูกส่งไปเพื่อการตรวจให้คะแนนอย่างเป็นทางการของ IMO และได้รับคะแนนเต็มจากกรรมการคนเดียวกับที่ให้คะแนนผู้เข้าแข่งขันที่เป็นมนุษย์ โมเดลของหัวเว่ยก็ได้รับการตรวจสอบในลักษณะเดียวกัน สิ่งนี้ให้ความน่าเชื่อถือในระดับที่มีความหมาย เนื่องจากกรรมการเป็นอิสระ และคำตอบถูกตัดสินโดยใช้เกณฑ์การให้คะแนนเดียวกัน
ความสำเร็จนี้เป็นของจริงในแง่ที่ว่าโมเดลสร้างคำตอบที่ถูกต้อง ซึ่งได้รับการตรวจสอบโดย IMO สำหรับโจทย์ทั้งหกข้อ แต่มัน ไม่ใช่เหรียญ IMO อย่างเป็นทางการ — IMO ไม่ได้มอบเหรียญรางวัลให้กับระบบ AI อย่างเป็นทางการ การเปรียบเทียบกับผลลัพธ์ AI ก่อนหน้านั้นยุติธรรมเพราะระบบเหล่านั้นก็แก้โจทย์ชุดเดียวกันภายหลังภายใต้เงื่อนไขที่คล้ายคลึงกัน แต่ "เหรียญทอง AI" ทั้งหมดควรถูกตีความว่าเป็น เกณฑ์มาตรฐานที่ไม่เป็นทางการซึ่งถูกตัดสินย้อนหลัง มากกว่าชัยชนะโดยตรงในการแข่งขันสด ถึงกระนั้น ผลลัพธ์ของ dots-note-3.0 ก็เป็นก้าวสำคัญในฐานะครั้งแรกที่ AI ทำคะแนนสมบูรณ์แบบในชุดโจทย์ IMO ครบชุด