Fable 5 rovněž vede v širších kódovacích benchmarkech napříč odvětvím. Nezávislá hodnocení ukazují, že dosahuje 95,0 % na SWE-bench Verified a 80,0 % na SWE-bench Pro, což je výrazně více než u předchozí generace modelů WLM. Na agentním kódovacím benchmarku Terminal-Bench 2.0 zaznamenal Fable 5 přesnost 84,3 % WB. K červenci 2026 je Fable 5 na řadě nezávislých žebříčků hodnocen jako nejlepší AI model celkově BB.
Všechny dříve hodnocené modely byly přehodnoceny podle nové metodiky založené na Harboru, což vedlo k podstatně obnovenému žebříčku DA. Nejlepší desítka podle Android Bench vypadá takto:
| Pořadí | Model | Skóre | Prům. latence (s) | Prům. cena ($/1K úloh) |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Anthropic) | 84,5 | 8,0 | 133,20 $ |
| 2 | GPT 5.5 (OpenAI) | 80,2 | 15,7 | 138,30 $ |
| 3 | Claude Sonnet 5 (Anthropic) | 76,2 | 12,3 | 99,90 $ |
| 4 | GPT 5.4 (OpenAI) | 74,1 | 8,4 | 83,40 $ |
| 5 | Gemini 3.1 Pro Preview (Google) | 73,7 | 10,6 | 87,40 $ |
| 6 | Claude Opus 4.8 (Anthropic) | 72,4 | 6,7 | 88,00 $ |
| 7 | GLM 5.2 | 72,2 | 38,9 | 117,00 $ |
| 8 | Gemini 3.5 Flash (Google) | 71,1 | 28,3 | 165,60 $ |
| 9 | Kimi K2.7 Code | 70,4 | 31,8 | 48,10 $ |
Zdroj: Reportáž 9to5Google z obnoveného žebříčku Android Bench A.
Klíčová pozorování z aktualizovaného pořadí:
Google standardizoval Android Bench na framework Harbor, otevřený evaluační ekosystém vyvinutý institutem Laude, týmem stojícím za Terminal-Bench DATG. Dříve Android Bench používal vlastní harness mini-swe-agent v1. Harbor poskytuje standardizované, kontejnerové vyhodnocovací prostředí, které podporuje nasazení v cloudu, komunitní zadávání úloh a nasazení pro posilované učení ATQ.
Tato migrace znamená, že všechna dřívější skóre modelů nejsou srovnatelná – každé výše uvedené skóre je čerstvým hodnocením podle metodiky Harboru 9A. Google uvedl, že tento krok byl nezbytný k udržení evaluačních standardů na špičkové úrovni, protože LLM se rychle zlepšují D.
Google popsal tento krok jako reakci na poptávku vývojářů po "způsobu, jak poskytnout zpětnou vazbu k naší datové sadě" a jako posun směrem k hlubší spolupráci s komunitou Android vývojářů 9.
Obnovený žebříček odhaluje trh s výraznými rozdíly mezi cenovými a přesnostními lídry A:
Aktualizace z července 2026 potvrzuje třícestný souboj mezi Anthropicem, OpenAI a Googlem A:
Jedná se o první aktualizaci Android Bench, kde model Anthropicu vede vlastní benchmark Googlu pro kódování na Androidu, což je symbolický posun na trhu mobilních AI asistentů.