Fable 5 führt auch in breiteren Codierungs-Benchmarks der Branche. Unabhängige Berichte zeigen, dass es 95,0 % im SWE-bench Verified und 80,0 % im SWE-bench Pro erreicht und damit frühere Modelle deutlich hinter sich lässt WLM. Im agentischen Codierungs-Benchmark Terminal-Bench 2.0 erzielte Fable 5 eine Genauigkeit von 84,3 % WB. Mehrere unabhängige Bestenlisten führen Fable 5 seit Juli 2026 als das insgesamt beste KI-Modell BB.
Alle zuvor gelisteten Modelle wurden mit der neuen Harbor-Methodik neu bewertet, was zu einer deutlich veränderten Rangliste führte DA. Die Top Ten laut Android Bench:
| Rang | Modell | Punkte | Durchschn. Latenz (s) | Durchschn. Kosten ($/1.000 Aufgaben) |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Anthropic) | 84,5 | 8,0 | 133,20 $ |
| 2 | GPT 5.5 (OpenAI) | 80,2 | 15,7 | 138,30 $ |
| 3 | Claude Sonnet 5 (Anthropic) | 76,2 | 12,3 | 99,90 $ |
| 4 | GPT 5.4 (OpenAI) | 74,1 | 8,4 | 83,40 $ |
| 5 | Gemini 3.1 Pro Preview (Google) | 73,7 | 10,6 | 87,40 $ |
| 6 | Claude Opus 4.8 (Anthropic) | 72,4 | 6,7 | 88,00 $ |
| 7 | GLM 5.2 | 72,2 | 38,9 | 117,00 $ |
| 8 | Gemini 3.5 Flash (Google) | 71,1 | 28,3 | 165,60 $ |
| 9 | Kimi K2.7 Code | 70,4 | 31,8 | 48,10 $ |
Quelle: Berichterstattung von 9to5Google über die aktualisierte Android-Bench-Rangliste A.
Wichtige Erkenntnisse aus den aktualisierten Platzierungen:
Google hat Android Bench auf das Harbor-Framework standardisiert – ein quelloffenes Auswertungs-Ökosystem, das vom Laude Institute entwickelt wurde, dem Team hinter Terminal-Bench DATG. Zuvor nutzte Android Bench eine eigene mini-swe-agent v1-Testumgebung. Harbor bietet eine standardisierte, containerbasierte Auswertungspipeline, die Cloud-Bereitstellung, die Einreichung von Community-Aufgaben und Reinforcement-Learning-Rollouts unterstützt ATQ.
Die Umstellung bedeutet, dass alle bisherigen Modellbewertungen nicht mehr vergleichbar sind – jede oben aufgeführte Punktzahl ist eine frische Bewertung nach der Harbor-Methodik 9A. Google begründete den Schritt mit der Notwendigkeit, die Bewertungsstandards angesichts der rasanten Verbesserungen bei LLMs auf dem neuesten Stand zu halten D.
Google beschrieb dies als Reaktion auf den Wunsch der Entwickler nach „einer Möglichkeit, Feedback zu unserem Datensatz zu geben“ und als einen Schritt hin zu einer engeren Zusammenarbeit mit der Android-Entwickler-Community 9.
Die aktualisierte Rangliste zeigt einen Markt mit erheblichen Unterschieden zwischen Kostenvorteilen und Genauigkeit A:
Das Update vom Juli 2026 unterstreicht ein Dreikampf zwischen Anthropic, OpenAI und Google A:
Dies ist das erste Android-Bench-Update, bei dem ein Anthropic-Modell Googles eigenen Benchmark für Android-Codierung anführt – ein symbolträchtiger Wandel im Markt für mobile KI-Assistenten.