Fable 5 також лідирує в ширших галузевих бенчмарках кодування. Незалежні звіти показують 95,0% на SWE-bench Verified та 80,0% на SWE-bench Pro, що значно випереджає моделі попередніх поколінь WLM. На агентному бенчмарку кодування Terminal-Bench 2.0 Fable 5 показав точність 84,3% WB. Станом на липень 2026 року кілька незалежних рейтингів визнають Fable 5 найкращою моделлю ШІ загалом BB.
Усі раніше рейтинговані моделі були переоцінені за новою методологією на основі Harbor, що призвело до суттєво оновленої таблиці лідерів DA. Топ-10 згідно з Android Bench:
| Місце | Модель | Оцінка | Середня затримка (с) | Середня вартість ($/1K завдань) |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Anthropic) | 84,5 | 8,0 | $133,20 |
| 2 | GPT 5.5 (OpenAI) | 80,2 | 15,7 | $138,30 |
| 3 | Claude Sonnet 5 (Anthropic) | 76,2 | 12,3 | $99,90 |
| 4 | GPT 5.4 (OpenAI) | 74,1 | 8,4 | $83,40 |
| 5 | Gemini 3.1 Pro Preview (Google) | 73,7 | 10,6 | $87,40 |
| 6 | Claude Opus 4.8 (Anthropic) | 72,4 | 6,7 | $88,00 |
| 7 | GLM 5.2 | 72,2 | 38,9 | $117,00 |
| 8 | Gemini 3.5 Flash (Google) | 71,1 | 28,3 | $165,60 |
| 9 | Kimi K2.7 Code | 70,4 | 31,8 | $48,10 |
Джерело: звіт 9to5Google за оновленими даними Android Bench A.
Ключові спостереження з оновленого рейтингу:
Google стандартизував Android Bench на фреймворку Harbor, відкритій екосистемі оцінки, розробленій Інститутом Лауда, командою, що стоїть за Terminal-Bench DATG. Раніше Android Bench використовував власний тестовий механізм mini-swe-agent v1. Harbor забезпечує стандартизований конвеєр оцінки на основі контейнерів, який підтримує хмарне розгортання, подання завдань спільнотою та розгортання навчання з підкріпленням ATQ.
Міграція означає, що всі попередні оцінки моделей є непорівнянними — кожен показник, зазначений вище, є новою оцінкою за методологією Harbor 9A. Google заявив, що цей крок був необхідний для підтримки стандартів оцінки на сучасному рівні, оскільки LLM швидко вдосконалюються D.
Google описав це як відповідь на запит розробників щодо "способу надання зворотного зв'язку щодо нашого набору даних" та крок до глибшої співпраці зі спільнотою Android-розробників 9.
Оновлений рейтинг демонструє ринок із значним розривом між лідерами за вартістю та лідерами за точністю A:
Оновлення липня 2026 року підкреслює тристоронню боротьбу між Anthropic, OpenAI та Google A:
Це перше оновлення Android Bench, коли модель Anthropic очолює власний бенчмарк Google для кодування Android — символічний зсув на ринку мобільних AI-асистентів.