Fable 5 przewodzi również w szerszych benchmarkach kodowania. Niezależne raporty wskazują na 95,0% w SWE-bench Verified i 80,0% w SWE-bench Pro, co znacznie przewyższa modele poprzedniej generacji WLM. W agentycznym benchmarku Terminal-Bench 2.0 Fable 5 osiągnął 84,3% dokładności WB. Według wielu niezależnych rankingów, od lipca 2026 r. Fable 5 jest najlepszym ogólnym modelem AI BB.
Wszystkie wcześniej sklasyfikowane modele zostały ponownie ocenione według nowej metodologii Harbor, co dało w pełni odświeżoną tabelę liderów DA. Oto pierwsza dziesiątka według Android Bench:
| Miejsce | Model | Wynik | Średnie opóźnienie (s) | Średni koszt ($/1 tys. zadań) |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Anthropic) | 84,5 | 8,0 | 133,20 USD |
| 2 | GPT 5.5 (OpenAI) | 80,2 | 15,7 | 138,30 USD |
| 3 | Claude Sonnet 5 (Anthropic) | 76,2 | 12,3 | 99,90 USD |
| 4 | GPT 5.4 (OpenAI) | 74,1 | 8,4 | 83,40 USD |
| 5 | Gemini 3.1 Pro Preview (Google) | 73,7 | 10,6 | 87,40 USD |
| 6 | Claude Opus 4.8 (Anthropic) | 72,4 | 6,7 | 88,00 USD |
| 7 | GLM 5.2 | 72,2 | 38,9 | 117,00 USD |
| 8 | Gemini 3.5 Flash (Google) | 71,1 | 28,3 | 165,60 USD |
| 9 | Kimi K2.7 Code | 70,4 | 31,8 | 48,10 USD |
Źródło: raport 9to5Google na podstawie odświeżonego rankingu Android Bench A.
Kluczowe spostrzeżenia z aktualnego zestawienia:
Google ujednoliciło Android Bench w oparciu o framework Harbor – otwarty ekosystem ewaluacyjny stworzony przez Laude Institute, zespół stojący za Terminal-Bench DATG. Wcześniej Android Bench korzystał z autorskiego narzędzia mini-swe-agent v1. Harbor zapewnia znormalizowany, kontenerowy potok ewaluacyjny, który obsługuje wdrożenia w chmurze, zgłaszanie zadań przez społeczność oraz wdrażanie uczenia przez wzmacnianie ATQ.
Migracja sprawia, że wszystkie wcześniejsze wyniki modeli nie są porównywalne – każdy wynik powyżej jest świeżą oceną według metodologii Harbor 9A. Google stwierdziło, że zmiana była konieczna, aby standardy ewaluacji nadążały za szybkim rozwojem LLM D.
Google określiło to jako odpowiedź na zapotrzebowanie deweloperów na „sposób przekazywania opinii na temat naszego zbioru danych” i krok w kierunku głębszej współpracy ze społecznością programistów Androida 9.
Odświeżona tabela liderów ujawnia rynek ze znacznym rozstrzałem między liderami kosztów a liderami dokładności A:
Aktualizacja z lipca 2026 r. umacnia trójstronny wyścig między Anthropic, OpenAI i Google A:
To pierwsza aktualizacja Android Bench, w której model Anthropic przewodzi na własnym benchmarku Google dla kodowania na Androida – symboliczna zmiana na rynku mobilnych asystentów AI.