ولا يقتصر تفوق Fable 5 على Android Bench؛ فالتقارير المستقلة تشير إلى أنه يتصدر أيضًا معايير برمجية أوسع: 95% على معيار SWE-bench Verified و80% على SWE-bench Pro، متقدمًا بفارق كبير على النماذج السابقة WLM. كما سجل 84.3% على Terminal-Bench 2.0، وهو معيار للبرمجة الذكية WB. وتضعه لوحات صدارة متعددة كأفضل نموذج ذكاء اصطناعي شامل حتى يوليو 2026 BB.
أُعيد تقييم جميع النماذج التي كانت مُدرجة سابقًا ضمن المنهجية الجديدة المعتمدة على Harbor DA. الترتيب العشرة الأوائل وفقًا لـ Android Bench:
| الترتيب | النموذج | الدقة | متوسط زمن الاستجابة (ثانية) | متوسط التكلفة ($/1K مهمة) |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Anthropic) | 84.5 | 8.0 | $133.20 |
| 2 | GPT 5.5 (OpenAI) | 80.2 | 15.7 | $138.30 |
| 3 | Claude Sonnet 5 (Anthropic) | 76.2 | 12.3 | $99.90 |
| 4 | GPT 5.4 (OpenAI) | 74.1 | 8.4 | $83.40 |
| 5 | Gemini 3.1 Pro Preview (Google) | 73.7 | 10.6 | $87.40 |
| 6 | Claude Opus 4.8 (Anthropic) | 72.4 | 6.7 | $88.00 |
| 7 | GLM 5.2 | 72.2 | 38.9 | $117.00 |
| 8 | Gemini 3.5 Flash (Google) | 71.1 | 28.3 | $165.60 |
| 9 | Kimi K2.7 Code | 70.4 | 31.8 | $48.10 |
المصدر: تقرير 9to5Google عن تصنيفات Android Bench المحدَّثة A.
ملاحظات رئيسية من الترتيب الجديد:
قامت غوغل بتوحيد Android Bench على إطار Harbor، وهو نظام تقييم مفتوح المصدر طوره معهد Laude، الفريق الذي يقف وراء Terminal-Bench DATG. كان Android Bench سابقًا يعتمد على أداة تقييم مخصصة (mini-swe-agent v1). يوفر Harbor خط أنابيب تقييم موحدًا قائمًا على الحاويات (containers)، يدعم النشر السحابي، وإرسال المهام المجتمعية، وتجارب التعلم المعزز ATQ.
نظرًا لهذا الانتقال، فإن جميع نتائج النماذج السابقة لم تعد قابلة للمقارنة مع النتائج الجديدة 9A. وأوضحت غوغل أن هذه الخطوة ضرورية لمواكبة التطور السريع في قدرات نماذج اللغات الكبيرة D.
وصفت غوغل هذه الخطوة بأنها استجابة لطلب المطورين "لطريقة لتقديم ملاحظات على مجموعة البيانات لدينا"، واتجاه نحو تعاون أعمق مع مجتمع مطوري أندرويد 9.
تكشف لوحة الصدارة الجديدة عن سوق يشهد فجوة كبيرة بين قادة التكلفة وقادة الدقة A:
يُعزز تحديث يوليو 2026 سباقًا ثلاثيًا بين Anthropic وOpenAI وGoogle A:
هذه هي المرة الأولى التي يتصدر فيها نموذج من Anthropic معيار غوغل الرسمي لتطوير أندرويد، وهو تحول رمزي في سوق المساعد الذكي للهواتف المحمولة.