Fable 5 también lidera benchmarks de codificación más amplios en toda la industria. Reportes independientes muestran que obtiene un 95.0% en SWE-bench Verified y un 80.0% en SWE-bench Pro, muy por delante de modelos de generaciones anteriores WLM. En el benchmark de codificación agéntica Terminal-Bench 2.0, Fable 5 registró un 84.3% de precisión WB. Múltiples rankings independientes ahora clasifican a Fable 5 como el mejor modelo general de IA a julio de 2026 BB.
Todos los modelos previamente clasificados fueron reevaluados bajo la nueva metodología basada en Harbor, produciendo un ranking sustancialmente renovado DA. El top 10 según Android Bench:
| Posición | Modelo | Puntuación | Latencia Promedio (s) | Costo Promedio ($/1K tareas) |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Anthropic) | 84.5 | 8.0 | $133.20 |
| 2 | GPT 5.5 (OpenAI) | 80.2 | 15.7 | $138.30 |
| 3 | Claude Sonnet 5 (Anthropic) | 76.2 | 12.3 | $99.90 |
| 4 | GPT 5.4 (OpenAI) | 74.1 | 8.4 | $83.40 |
| 5 | Gemini 3.1 Pro Preview (Google) | 73.7 | 10.6 | $87.40 |
| 6 | Claude Opus 4.8 (Anthropic) | 72.4 | 6.7 | $88.00 |
| 7 | GLM 5.2 | 72.2 | 38.9 | $117.00 |
| 8 | Gemini 3.5 Flash (Google) | 71.1 | 28.3 | $165.60 |
| 9 | Kimi K2.7 Code | 70.4 | 31.8 | $48.10 |
Fuente: Reporte de 9to5Google a partir del ranking actualizado de Android Bench A.
Observaciones clave de las posiciones actualizadas:
Google estandarizó Android Bench en el framework Harbor, un ecosistema de evaluación de código abierto desarrollado por el Instituto Laude, el equipo detrás de Terminal-Bench DATG. Anteriormente, Android Bench usaba un arnés personalizado mini-swe-agent v1. Harbor proporciona un pipeline de evaluación estandarizado y basado en contenedores que admite implementación en la nube, envío comunitario de tareas y despliegues de aprendizaje por refuerzo ATQ.
La migración significa que todas las puntuaciones de modelos anteriores no son comparables — cada puntuación listada arriba es una evaluación nueva bajo la metodología Harbor 9A. Google declaró que el movimiento era necesario para mantener los estándares de evaluación a la vanguardia a medida que los LLMs mejoran rápidamente D.
Por primera vez, Google ha abierto Android Bench a contribuciones de la comunidad 9A. Los desarrolladores ahora pueden:
Google describió esto como una respuesta a la demanda de los desarrolladores de "una forma de proporcionar retroalimentación sobre nuestro conjunto de datos" y un paso hacia una colaboración más profunda con la comunidad de desarrolladores Android 9.
El ranking renovado revela un mercado con una dispersión significativa entre los líderes en costo y los líderes en precisión A:
La actualización de julio de 2026 refuerza una carrera de tres bandos entre Anthropic, OpenAI y Google A:
Esta es la primera actualización de Android Bench donde un modelo de Anthropic lidera el propio benchmark de Google para codificación Android, un cambio simbólico en el mercado de asistentes de IA para móviles.