Fable 5 ने इंडस्ट्री-वाइड कोडिंग बेंचमार्क में भी शीर्ष प्रदर्शन किया है। स्वतंत्र रिपोर्टों के अनुसार, इसने SWE-bench Verified पर 95.0% और SWE-bench Pro पर 80.0% स्कोर किया, जो पिछली पीढ़ी के मॉडलों से काफी आगे है WLM। एजेंटिक कोडिंग बेंचमार्क Terminal-Bench 2.0 पर Fable 5 ने 84.3% सटीकता दर्ज की WB। जुलाई 2026 तक कई स्वतंत्र लीडरबोर्ड Fable 5 को सबसे अच्छा AI मॉडल मानते हैं BB।
सभी पहले रैंक किए गए मॉडलों का Harbor-आधारित नई पद्धति के तहत पुनर्मूल्यांकन किया गया, जिससे एक नई लीडरबोर्ड तैयार हुई DA। Android Bench के अनुसार शीर्ष दस मॉडल:
| रैंक | मॉडल | स्कोर | औसत लेटेंसी (सेकंड) | औसत लागत ($/1K टास्क) |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Anthropic) | 84.5 | 8.0 | $133.20 |
| 2 | GPT 5.5 (OpenAI) | 80.2 | 15.7 | $138.30 |
| 3 | Claude Sonnet 5 (Anthropic) | 76.2 | 12.3 | $99.90 |
| 4 | GPT 5.4 (OpenAI) | 74.1 | 8.4 | $83.40 |
| 5 | Gemini 3.1 Pro Preview (Google) | 73.7 | 10.6 | $87.40 |
| 6 | Claude Opus 4.8 (Anthropic) | 72.4 | 6.7 | $88.00 |
| 7 | GLM 5.2 | 72.2 | 38.9 | $117.00 |
| 8 | Gemini 3.5 Flash (Google) | 71.1 | 28.3 | $165.60 |
| 9 | Kimi K2.7 Code | 70.4 | 31.8 | $48.10 |
| 10 | — | — | — | — |
स्रोत: 9to5Google की Android Bench की नई रैंकिंग पर रिपोर्ट A
अपडेटेड स्टैंडिंग से महत्वपूर्ण निष्कर्ष:
Google ने Android Bench को Harbor फ्रेमवर्क पर मानकीकृत किया है, जो Laude Institute (Terminal-Bench के पीछे की टीम) द्वारा विकसित एक ओपन-सोर्स इवैलुएशन इकोसिस्टम है DATG। पहले Android Bench कस्टम mini-swe-agent v1 हार्नेस का उपयोग करता था। Harbor एक मानकीकृत, कंटेनर-आधारित इवैलुएशन पाइपलाइन प्रदान करता है जो क्लाउड डिप्लॉयमेंट, कम्युनिटी टास्क सबमिशन और रीइन्फोर्समेंट लर्निंग रोलआउट को सपोर्ट करता है ATQ।
इस माइग्रेशन का मतलब है कि पिछले सभी मॉडल स्कोर अब तुलनीय नहीं हैं — ऊपर दिए गए सभी स्कोर Harbor पद्धति के तहत ताजा मूल्यांकन हैं 9A। Google ने कहा कि यह कदम LLMs के तेजी से सुधार के बीच इवैलुएशन मानकों को अत्याधुनिक बनाए रखने के लिए जरूरी था D।
Google ने इसे डेवलपर्स की "हमारे डेटासेट पर फीडबैक प्रदान करने का तरीका" की मांग के जवाब और Android डेवलपमेंट समुदाय के साथ गहरे सहयोग की दिशा में एक कदम बताया 9।
नई लीडरबोर्ड एक बाजार दिखाती है जहां लागत में अग्रणी और सटीकता में अग्रणी के बीच बड़ा अंतर है A:
जुलाई 2026 का अपडेट Anthropic, OpenAI और Google के बीच त्रिपक्षीय दौड़ को मजबूत करता है A:
यह पहला Android Bench अपडेट है जहां एक Anthropic मॉडल Google के अपने बेंचमार्क में Android कोडिंग के लिए आगे है, जो मोबाइल AI असिस्टेंट मार्केट में एक प्रतीकात्मक बदलाव है।