Fable 5 также лидирует в более широких бенчмарках по программированию. Независимые отчёты показывают результат 95,0% на SWE-bench Verified и 80,0% на SWE-bench Pro, что значительно опережает модели предыдущего поколения WLM. На агентивном бенчмарке Terminal-Bench 2.0 Fable 5 показала точность 84,3% WB. По состоянию на июль 2026 года несколько независимых рейтингов ставят Fable 5 на первое место среди всех моделей ИИ BB.
Все ранее ранжированные модели были переоценены по новой методологии на основе Harbor, что привело к существенно обновлённой таблице лидеров DA. Десять лучших моделей по версии Android Bench:
| Место | Модель | Результат | Средняя задержка (с) | Средняя стоимость ($/1K задач) |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Anthropic) | 84,5 | 8,0 | 133,20 долл. |
| 2 | GPT 5.5 (OpenAI) | 80,2 | 15,7 | 138,30 долл. |
| 3 | Claude Sonnet 5 (Anthropic) | 76,2 | 12,3 | 99,90 долл. |
| 4 | GPT 5.4 (OpenAI) | 74,1 | 8,4 | 83,40 долл. |
| 5 | Gemini 3.1 Pro Preview (Google) | 73,7 | 10,6 | 87,40 долл. |
| 6 | Claude Opus 4.8 (Anthropic) | 72,4 | 6,7 | 88,00 долл. |
| 7 | GLM 5.2 | 72,2 | 38,9 | 117,00 долл. |
| 8 | Gemini 3.5 Flash (Google) | 71,1 | 28,3 | 165,60 долл. |
| 9 | Kimi K2.7 Code | 70,4 | 31,8 | 48,10 долл. |
Источник: отчёт 9to5Google на основе обновлённого рейтинга Android Bench A.
Ключевые наблюдения из обновлённой таблицы:
Google стандартизировал Android Bench на фреймворке Harbor — открытой экосистеме оценки, разработанной институтом Laude, создателями Terminal-Bench DATG. Ранее Android Bench использовал собственный инструментарий mini-swe-agent v1. Harbor предоставляет стандартизированный конвейер оценки на основе контейнеров, поддерживающий облачное развёртывание, отправку задач сообществом и развёртывание обучения с подкреплением ATQ.
Миграция означает, что все предыдущие результаты моделей несопоставимы — каждый указанный выше результат является свежей оценкой по методологии Harbor 9A. Google заявил, что этот шаг был необходим для поддержания стандартов оценки на современном уровне по мере быстрого совершенствования LLM D.
Google описал это как ответ на запрос разработчиков о "способе предоставлять обратную связь по нашему набору данных" и шаг к более глубокому сотрудничеству с сообществом Android-разработчиков 9.
Обновлённая таблица лидеров выявляет рынок со значительным разбросом между лидерами по стоимости и лидерами по точности A:
Обновление июля 2026 года укрепляет трёхстороннюю конкуренцию между Anthropic, OpenAI и Google A:
Это первое обновление Android Bench, в котором модель Anthropic возглавляет собственный бенчмарк Google для программирования под Android, что является символическим сдвигом на рынке мобильных ИИ-ассистентов.