Fable 5 domine également les benchmarks de codage plus larges. Des rapports indépendants lui attribuent un score de 95,0 % sur SWE-bench Verified et de 80,0 % sur SWE-bench Pro, loin devant les modèles de la génération précédente WLM. Sur le benchmark de codage agentique Terminal-Bench 2.0, Fable 5 a enregistré une précision de 84,3 % WB. Plusieurs classements indépendants placent désormais Fable 5 comme le meilleur modèle d'IA global en juillet 2026 BB.
Tous les modèles précédemment classés ont été réévalués selon la nouvelle méthodologie basée sur Harbor, produisant un classement largement renouvelé DA. Voici le top 10 selon Android Bench :
| Rang | Modèle | Score | Latence moyenne (s) | Coût moyen ($/1K tâches) |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Anthropic) | 84,5 | 8,0 | 133,20 $ |
| 2 | GPT 5.5 (OpenAI) | 80,2 | 15,7 | 138,30 $ |
| 3 | Claude Sonnet 5 (Anthropic) | 76,2 | 12,3 | 99,90 $ |
| 4 | GPT 5.4 (OpenAI) | 74,1 | 8,4 | 83,40 $ |
| 5 | Gemini 3.1 Pro Preview (Google) | 73,7 | 10,6 | 87,40 $ |
| 6 | Claude Opus 4.8 (Anthropic) | 72,4 | 6,7 | 88,00 $ |
| 7 | GLM 5.2 | 72,2 | 38,9 | 117,00 $ |
| 8 | Gemini 3.5 Flash (Google) | 71,1 | 28,3 | 165,60 $ |
| 9 | Kimi K2.7 Code | 70,4 | 31,8 | 48,10 $ |
Source : rapport de 9to5Google à partir des classements actualisés d'Android Bench A.
Observations clés du classement mis à jour :
Google a standardisé Android Bench sur le framework Harbor, un écosystème d'évaluation open-source développé par le Laude Institute, l'équipe à l'origine de Terminal-Bench DATG. Auparavant, Android Bench utilisait un harnais personnalisé mini-swe-agent v1. Harbor fournit un pipeline d'évaluation standardisé basé sur des conteneurs, prenant en charge le déploiement dans le cloud, la soumission de tâches par la communauté et les déploiements d'apprentissage par renforcement ATQ.
Cette migration signifie que tous les scores des modèles précédents ne sont pas comparables — chaque score listé ci-dessus est une évaluation fraîche selon la méthodologie Harbor 9A. Google a déclaré que cette décision était nécessaire pour maintenir les normes d'évaluation à la pointe de la technologie, les LLM s'améliorant rapidement D.
Pour la première fois, Google a ouvert Android Bench aux contributions de la communauté 9A. Les développeurs peuvent désormais :
Google a présenté cette initiative comme une réponse à la demande des développeurs qui souhaitaient "un moyen de fournir des commentaires sur notre ensemble de données" et comme une étape vers une collaboration plus approfondie avec la communauté des développeurs Android 9.
Le classement actualisé révèle un marché avec un écart significatif entre les leaders en termes de coût et ceux en termes de précision A :
La mise à jour de juillet 2026 renforce une course à trois entre Anthropic, OpenAI et Google A :
Il s'agit de la première mise à jour d'Android Bench où un modèle d'Anthropic devance le propre benchmark de Google pour le codage Android, un changement symbolique sur le marché des assistants IA mobiles.