
Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What does Google's July 8, 2026 update to Android Bench reveal about the new top-ranked AI model. Article summary: On **July 8, 2026**, Google issued a major update to **Android Bench** — its official leaderboard for evaluating LLMs on real-world Android development tasks. The update includes a new #1 ranked model, a switch to the op. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Pada 8 Julai 2026, Google mengeluarkan kemas kini besar kepada Android Bench — papan pendahulu rasmi untuk menilai model bahasa besar (LLM) pada tugas pembangunan Android sebenar D9. Kemas kini ini memperkenalkan model ranking teratas baharu, migrasi penuh ke framework penilaian sumber terbuka Harbor, sistem sumbangan komuniti, dan papan pendahulu yang disegarkan yang mendedahkan pertukaran kos-berbanding-ketepatan yang ketara DA.
Claude Fable 5 kini menduduki puncak Android Bench dengan skor 84.5, mendahului lebih daripada 4 mata berbanding pesaing seterusnya DA. Skor ini mencerminkan ketepatan model pada suite 100 tugas pengekodan Android sebenar yang diambil daripada kira-kira 39,000 permintaan tarik (pull request) sumber terbuka DG.
Fable 5 juga mendahului penanda aras pengekodan yang lebih luas di seluruh industri. Laporan bebas menunjukkan ia mendapat 95.0% pada SWE-bench Verified dan 80.0% pada SWE-bench Pro, jauh mendahului model generasi sebelumnya WLM. Pada penanda aras pengekodan ejen Terminal-Bench 2.0, Fable 5 mencatatkan ketepatan 84.3% WB. Pelbagai papan pendahulu bebas kini meletakkan Fable 5 sebagai model AI keseluruhan terbaik setakat Julai 2026 .
Semua model yang sebelumnya disenaraikan telah dinilai semula di bawah metodologi berasaskan Harbor yang baharu, menghasilkan papan pendahulu yang banyak disegarkan DA. Sepuluh teratas menurut Android Bench:
| Ranking | Model | Skor | Purata Latensi (s) | Purata Kos ($/1K tugas) |
|---|---|---|---|---|
| 1 | Claude Fable 5 (Anthropic) | 84.5 | 8.0 | $133.20 |
| 2 | GPT 5.5 (OpenAI) | 80.2 | 15.7 | $138.30 |
| 3 | Claude Sonnet 5 (Anthropic) | 76.2 | 12.3 | $99.90 |
| 4 | GPT 5.4 (OpenAI) | 74.1 | 8.4 | $83.40 |
| 5 | Gemini 3.1 Pro Preview (Google) | 73.7 | 10.6 | $87.40 |
| 6 | Claude Opus 4.8 (Anthropic) | 72.4 | 6.7 | $88.00 |
| 7 | GLM 5.2 | 72.2 | 38.9 | $117.00 |
| 8 | Gemini 3.5 Flash (Google) | 71.1 | 28.3 | $165.60 |
| 9 | Kimi K2.7 Code | 70.4 | 31.8 | $48.10 |
Sumber: Laporan 9to5Google daripada ranking disegarkan Android Bench A.
Pemerhatian utama daripada kedudukan terkini:
Google menyeragamkan Android Bench pada framework Harbor, ekosistem penilaian sumber terbuka yang dibangunkan oleh Laude Institute, pasukan di sebalik Terminal-Bench DATG. Sebelum ini, Android Bench menggunakan abah-abah mini-swe-agent v1 tersuai. Harbor menyediakan saluran paip penilaian berasaskan kontena yang diseragamkan yang menyokong penggunaan awan, penyerahan tugas komuniti, dan pelancaran pembelajaran pengukuhan AT.
Migrasi ini bermakna semua skor model sebelumnya tidak setanding — setiap skor yang disenaraikan di atas adalah penilaian baharu di bawah metodologi Harbor 9A. Google menyatakan langkah ini perlu untuk memastikan piawaian penilaian kekal terkini seiring dengan peningkatan pesat LLM D.
Buat pertama kalinya, Google membuka Android Bench kepada sumbangan komuniti 9A. Pembangun kini boleh:
Google menyifatkan ini sebagai respons kepada permintaan pembangun untuk "cara untuk memberikan maklum balas pada set data kami" dan langkah ke arah kerjasama yang lebih mendalam dengan komuniti pembangunan Android 9.
Papan pendahulu yang disegarkan mendedahkan pasaran dengan jurang ketara antara pemimpin kos dan pemimpin ketepatan A:
Kemas kini Julai 2026 mengukuhkan perlumbaan tiga penjuru antara Anthropic, OpenAI, dan Google A:
Ini adalah kemas kini Android Bench pertama di mana model Anthropic mendahului penanda aras Google sendiri untuk pengekodan Android, peralihan simbolik dalam pasaran pembantu AI mudah alih.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pada 8 Julai 2026, Google mengemas kini Android Bench dengan model nombor 1 baharu — Claude Fable 5 Anthropic pada ketepatan 84.5% — dan beralih kepada framework penilaian Harbor sumber terbuka, menjadikan semua skor...
Pada 8 Julai 2026, Google mengemas kini Android Bench dengan model nombor 1 baharu — Claude Fable 5 Anthropic pada ketepatan 84.5% — dan beralih kepada framework penilaian Harbor sumber terbuka, menjadikan semua skor... Kemas kini ini memperkenalkan sumbangan komuniti buat pertama kali, menjemput pembangun untuk menghantar tugas pembangunan Android sebenar dan berkongsi penilaian penanda aras mereka sendiri menggunakan alat Harbor ba...
Analisis kos mendedahkan pertukaran yang ketara: model teratas (Claude Fable 5) berharga $133.20 setiap 1K tugas, manakala pilihan termurah dalam 10 teratas (Kimi K2.7 Code pada $48.10) menjaringkan 14.1 mata lebih re...