Gemini 3.1 Pro سجل 77.1%، وهي درجة رائدة في هذا المعيار الذي يختبر حل المشكلات الحقيقي الذي لا يمكن للنماذج حفظ طريقه خلاله .
Claude Sonnet حصل على 9.8/10 في اختبار يضم 125 مهمة واقعية لتقييم الجودة والأسلوب البشري، مما يجعله النموذج الأفضل استخدامًا للمحادثات العامة والكتابة .
الفجوة بين النماذج الحدودية (GPT-5, Claude Opus 4.x, Gemini 3.x, Grok 4) أصبحت ضيقة الآن — غالبًا ما تكون بفارق نقاط مئوية قليلة فقط . وجد تقرير مؤشر الذكاء الاصطناعي لعام 2026 من جامعة ستانفورد أن أداء أفضل 15 نموذجًا يفصل بينه 3 نقاط مئوية فقط في كل معيار
.
تعتمد "الدقة" بشكل كبير على المهمة: أفضل نموذج للبرمجة ليس بالضرورة أفضل نموذج للاستدلال، والنموذج الأكثر دقة في المعايير قد لا يكون الأفضل لسير عملك الخاص. الاختيار الصحيح يعتمد كليًا على حالة الاستخدام الأساسية لديك .