Fable 5 juga memimpin benchmark coding yang lebih luas di industri. Laporan independen menunjukkan skor 95,0% di SWE-bench Verified dan 80,0% di SWE-bench Pro, jauh di atas model generasi sebelumnya WLM. Pada benchmark coding agen Terminal-Bench 2.0, Fable 5 mencatat akurasi 84,3% WB. Beberapa papan peringkat independen kini menempatkan Fable 5 sebagai model AI terbaik secara keseluruhan per Juli 2026 BB.
Semua model yang sebelumnya diperingkatkan dievaluasi ulang dengan metodologi berbasis Harbor yang baru, menghasilkan papan peringkat yang sangat berbeda DA. Berikut sepuluh besar menurut Android Bench:
| Peringkat | Model | Skor | Rata-rata Latensi (detik) | Rata-rata Biaya ($/1.000 tugas) |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Anthropic) | 84,5 | 8,0 | $133,20 |
| 2 | GPT 5.5 (OpenAI) | 80,2 | 15,7 | $138,30 |
| 3 | Claude Sonnet 5 (Anthropic) | 76,2 | 12,3 | $99,90 |
| 4 | GPT 5.4 (OpenAI) | 74,1 | 8,4 | $83,40 |
| 5 | Gemini 3.1 Pro Preview (Google) | 73,7 | 10,6 | $87,40 |
| 6 | Claude Opus 4.8 (Anthropic) | 72,4 | 6,7 | $88,00 |
| 7 | GLM 5.2 | 72,2 | 38,9 | $117,00 |
| 8 | Gemini 3.5 Flash (Google) | 71,1 | 28,3 | $165,60 |
| 9 | Kimi K2.7 Code | 70,4 | 31,8 | $48,10 |
Sumber: Laporan 9to5Google dari peringkat Android Bench yang disegarkan A.
Temuan utama dari papan peringkat yang diperbarui:
Google menstandarisasi Android Bench pada framework Harbor, sebuah ekosistem evaluasi open-source yang dikembangkan oleh Laude Institute, tim di balik Terminal-Bench DATG. Sebelumnya, Android Bench menggunakan harness mini-swe-agent v1 khusus. Harbor menyediakan pipeline evaluasi berbasis kontainer yang terstandarisasi, mendukung deployment cloud, pengiriman tugas komunitas, dan peluncuran reinforcement learning ATQ.
Migrasi ini berarti semua skor model sebelumnya tidak dapat dibandingkan — setiap skor yang tercantum di atas adalah evaluasi baru di bawah metodologi Harbor 9A. Google menyatakan langkah ini diperlukan untuk menjaga standar evaluasi tetap mutakhir seiring dengan pesatnya peningkatan LLM D.
Untuk pertama kalinya, Google membuka Android Bench untuk kontribusi komunitas 9A. Kini developer dapat:
Google menggambarkan ini sebagai respons terhadap permintaan developer akan "cara untuk memberikan umpan balik pada kumpulan data kami" dan langkah menuju kolaborasi yang lebih dalam dengan komunitas pengembangan Android 9.
Papan peringkat yang disegarkan mengungkapkan pasar dengan kesenjangan signifikan antara pemimpin biaya dan pemimpin akurasi A:
Pembaruan Juli 2026 memperkuat persaingan tiga arah antara Anthropic, OpenAI, dan Google A:
Ini adalah pembaruan Android Bench pertama di mana model Anthropic memimpin benchmark milik Google sendiri untuk coding Android, sebuah pergeseran simbolis di pasar asisten AI seluler.