อย่างไรก็ตาม AIME เป็นเพียงโจทย์คณิตประเภทหนึ่ง ไม่ได้แปลว่าโมเดลเดียวกันจะดีที่สุดเสมอสำหรับการสอนแบบทีละขั้น การพิสูจน์ยาว ๆ การคำนวณเชิงสัญลักษณ์ หรือการทำงานร่วมกับโค้ดและข้อมูลจริง
ภาพรวมของตลาดตอนนี้คือ โมเดลระดับ frontier หลายตัวขึ้นมาอยู่หัวตารางพร้อมกัน คะแนนจึงเบียดกันมาก
ตัวอย่างเช่น Vals AI จัดให้ Gemini 3.1 Pro Preview เป็นอันดับหนึ่งบน AIME ขณะที่ LLM Stats แสดง GPT-5.2 Pro และ GPT-5.2 อยู่ในรายการอันดับ 1 บนลีดเดอร์บอร์ด AIME 2025
BenchLM ยังรายงานว่าโมเดลอันดับต้น ๆ ทำคะแนนได้สูงกว่า 95% บน AIME 2025 และสูงกว่า 90% บน HMMT 2025 เมื่อคะแนนเข้าใกล้เพดานแบบนี้ ความต่างเล็ก ๆ บนตารางอาจสำคัญน้อยกว่าสิ่งที่ผู้ใช้เจอจริง เช่น
AIME มีประโยชน์มากในฐานะสัญญาณวัดความสามารถ แต่ไม่ใช่ข้อพิสูจน์สมบูรณ์ว่าโมเดล “คิดสด” ได้ดีเสมอไป
Vals AI ระบุว่าโจทย์และคำตอบของ AIME เป็นข้อมูลสาธารณะ จึงมีความเสี่ยงที่โมเดลอาจเคยพบข้อมูลเหล่านี้ระหว่างการ pretraining นอกจากนี้ Vals AI ยังรายงานว่าโมเดลมักทำผลงานกับโจทย์เก่าปี 2024 ได้ดีกว่าชุดใหม่ปี 2025 ซึ่งทำให้เกิดคำถามเรื่อง data contamination และความสามารถในการ generalize กับโจทย์ใหม่จริง ๆ
แปลเป็นภาษาคนใช้: คะแนน AIME ที่สูงมากบอกว่าโมเดลเก่งบนสนามนี้ แต่ยังไม่ควรสรุปทันทีว่าจะเชื่อถือได้เท่ากันกับโจทย์ใหม่ โจทย์เฉพาะทาง หรือโจทย์ที่ไม่เคยเผยแพร่
| ถ้าคุณต้องการ... | วิธีเลือกที่เหมาะกว่า |
|---|---|
| ตัวเลือกที่ชัดที่สุดจาก AIME ในแหล่งข้อมูลนี้ | เริ่มจาก Gemini 3.1 Pro Preview เพราะ Vals AI ระบุว่าเป็นอันดับหนึ่งบน AIME ที่ 98.13% accuracy |
| ฝึกโจทย์แข่งขันคณิต | ดูผลทั้ง AIME และ HMMT เพราะ BenchLM รายงานว่าโมเดลหัวตารางสูงกว่า 95% บน AIME 2025 และสูงกว่า 90% บน HMMT 2025 |
| จัดอันดับความสามารถเชิงคณิตและเหตุผลเชิงปริมาณแบบกว้างขึ้น | ดูลีดเดอร์บอร์ดรวม เช่น LLMBase ระบุว่า ranking ด้านคณิตของตนใช้ Artificial Analysis math index ซึ่งรวม AIME และ MATH 500 |
| ทดสอบโจทย์คณิตขั้นสูงในรูปแบบอื่น | พิจารณา benchmark แบบ FrontierMath โดย Epoch AI ระบุว่า FrontierMath Tier 4 ให้โมเดลส่งฟังก์ชัน Python answer() สำหรับแต่ละคำถาม |
| ความน่าเชื่อถือกับงานจริง | สร้างชุดทดสอบส่วนตัว เพราะโจทย์ AIME เป็นสาธารณะและอาจอยู่ในข้อมูลฝึกของโมเดล |
หากคุณจะใช้ AI กับการเรียน การติวสอบ หรือระบบงานจริง อย่าเลือกจากอันดับอย่างเดียว ให้ใช้ benchmark เพื่อคัดรายชื่อก่อน แล้วทดสอบต่อด้วยโจทย์ของคุณเอง
ลองทำตามขั้นตอนนี้:
เหตุผลสำคัญคือ AI ที่เก่งโจทย์แข่งขันคำตอบสั้น อาจไม่ได้เหมาะที่สุดสำหรับการสอนเด็กให้เข้าใจทีละขั้น หรือการทำงานเชิงปริมาณที่ต้องใช้โค้ด ตารางข้อมูล และการตรวจสอบซ้ำหลายรอบ
ถ้าถามแบบแคบว่า AI ตัวไหนนำบน benchmark AIME ของ Vals AI คำตอบคือ Gemini 3.1 Pro Preview ด้วยความแม่นยำ 98.13%
แต่ถ้าถามว่า AI ตัวไหนเก่งคณิตที่สุดโดยรวม หลักฐานยังไม่สนับสนุนผู้ชนะเพียงรายเดียว โมเดลหัวตารางหลายตัวทำคะแนนใกล้กันมาก อันดับเปลี่ยนได้ตามลีดเดอร์บอร์ด และโจทย์ AIME เป็นข้อมูลสาธารณะที่มีความเสี่ยงเรื่องข้อมูลปนเปื้อน
ดังนั้นคำตอบที่ใช้งานได้จริงที่สุดคือ: ใช้ leaderboard เพื่อคัดตัวเต็ง แล้วทดสอบด้วยโจทย์ใหม่ในรูปแบบที่คุณต้องใช้จริง ก่อนตัดสินใจว่าโมเดลไหน “เก่งคณิต” สำหรับคุณ