ב 8 ביולי 2026, גוגל עדכנה את Android Bench עם מודל חדש במקום הראשון — קלוד פייבל 5 של Anthropic עם 84.5% דיוק — ועברה למסגרת ההערכה הפתוחה Harbor, מה שהופך את כל הציונים הקודמים לבלתי ניתנים להשוואה. העדכון מציג לראשונה מערכת תרומות קהילתית: מפתחים יכולים לשלוח משימות פיתוח אנדרואיד אמיתיות ולשתף הערכות משלהם באמצע...
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What does Google's July 8, 2026 update to Android Bench reveal about the new top-ranked AI model. Article summary: On **July 8, 2026**, Google issued a major update to **Android Bench** — its official leaderboard for evaluating LLMs on real-world Android development tasks. The update includes a new #1 ranked model, a switch to the op. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
ב-8 ביולי 2026, גוגל פרסמה עדכון משמעותי ל-Android Bench — לוח המחוונים הרשמי שלה להערכת מודלי שפה גדולים (LLMs) במשימות פיתוח אנדרואיד אמיתיות D9. העדכון מביא מודל חדש בראש הטבלה, מעבר מלא למסגרת ההערכה הפתוחה Harbor, מערכת תרומות קהילתית, ולוח מחוונים רענן שחושף את יחסי העלות-דיוק החדים DA.
קלוד פייבל 5 נמצא כעת בראש Android Bench עם ציון 84.5, יתרון של יותר מ-4 נקודות על המתחרה הבא DA. הציון משקף את דיוק המודל במבחן של 100 משימות קוד אנדרואיד אמיתיות שנלקחו ממאגר של כ-39,000 בקשות משיכה (pull requests) מקוד פתוח DG.
פייבל 5 מוביל גם במבחני קידוד רחבים יותר בתעשייה. דיווחים עצמאיים מראים ציון של 95.0% ב-SWE-bench Verified ו-80.0% ב-SWE-bench Pro, הרבה מעבר למודלים מהדור הקודם WLM. במבחן הקידוד האוטונומי Terminal-Bench 2.0, פייבל 5 רשם דיוק של 84.3% WB. לוחות מחוונים עצמאיים מרובים מדרגים כעת את פייבל 5 כמודל הבינה המלאכותי הטוב ביותר נכון ליולי 2026 BB.
כל המודלים שדורגו בעבר הוערכו מחדש תחת המתודולוגיה החדשה של Harbor, מה שיצר לוח מחוונים מחודש משמעותית DA. עשרת המובילים לפי Android Bench:
| מקום | מודל | ציון | זמן השהיה ממוצע (שניות) | עלות ממוצעת ($/1,000 משימות) |
|---|---|---|---|---|
| 1 | קלוד פייבל 5 (Anthropic) | 84.5 | 8.0 | $133.20 |
| 2 | GPT 5.5 (OpenAI) | 80.2 | 15.7 | $138.30 |
| 3 | קלוד סונט 5 (Anthropic) | 76.2 | 12.3 | $99.90 |
| 4 | GPT 5.4 (OpenAI) | 74.1 | 8.4 | $83.40 |
| 5 | Gemini 3.1 Pro Preview (גוגל) | 73.7 | 10.6 | $87.40 |
| 6 | קלוד אופוס 4.8 (Anthropic) | 72.4 | 6.7 | $88.00 |
| 7 | GLM 5.2 | 72.2 | 38.9 | $117.00 |
| 8 | Gemini 3.5 Flash (גוגל) | 71.1 | 28.3 | $165.60 |
| 9 | Kimi K2.7 Code | 70.4 | 31.8 | $48.10 |
מקור: דיווח של 9to5Google על הדירוגים המעודכנים של Android Bench A.
תצפיות מרכזיות מהדירוג המעודכן:
גוגל סטנדרטה את Android Bench על מסגרת Harbor, מערכת אקולוגית להערכה בקוד פתוח שפותחה על ידי מכון לודה (Laude Institute), הצוות מאחורי Terminal-Bench DATG. בעבר, Android Bench השתמש בהרצת מבחנים מותאמת אישית בשם mini-swe-agent v1. Harbor מספקת צינור הערכה סטנדרטי מבוסס קונטיינרים התומך בפריסה בענן, הגשת משימות קהילתית והטמעות של למידת חיזוק ATQ.
המשמעות: כל הציונים הקודמים אינם ניתנים להשוואה — כל ציון ברשימה לעיל הוא הערכה חדשה תחת מתודולוגיית Harbor 9A. גוגל מסרה כי המהלך נחוץ כדי לשמור על תקני הערכה עדכניים ככל שה-LLMs משתפרים במהירות D.
לראשונה, גוגל פתחה את Android Bench לתרומות קהילתיות 9A. מפתחים יכולים כעת:
גוגל תיארה את המהלך כתגובה לבקשות מפתחים ל"דרך לספק משוב על מערך הנתונים שלנו" וצעד לקראת שיתוף פעולה עמוק יותר עם קהילת מפתחי האנדרואיד 9.
לוח המחוונים הרענן חושף שוק עם פערים משמעותיים בין מובילי העלות למובילי הדיוק A:
עדכון יולי 2026 מחזק מרוץ תלת-כיווני בין Anthropic, OpenAI וגוגל A:
זהו עדכון Android Bench הראשון שבו מודל של Anthropic מוביל את המבחן של גוגל עצמה לקידוד אנדרואיד — מעבר סמלי בשוק הסייעות הניידות מבוססות בינה מלאכותית.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ב 8 ביולי 2026, גוגל עדכנה את Android Bench עם מודל חדש במקום הראשון — קלוד פייבל 5 של Anthropic עם 84.5% דיוק — ועברה למסגרת ההערכה הפתוחה Harbor, מה שהופך את כל הציונים הקודמים לבלתי ניתנים להשוואה.
ב 8 ביולי 2026, גוגל עדכנה את Android Bench עם מודל חדש במקום הראשון — קלוד פייבל 5 של Anthropic עם 84.5% דיוק — ועברה למסגרת ההערכה הפתוחה Harbor, מה שהופך את כל הציונים הקודמים לבלתי ניתנים להשוואה. העדכון מציג לראשונה מערכת תרומות קהילתית: מפתחים יכולים לשלוח משימות פיתוח אנדרואיד אמיתיות ולשתף הערכות משלהם באמצעות כלי Harbor.
ניתוח עלויות מגלה פערים חדים: המודל המוביל (קלוד פייבל 5) עולה 133.20 דולר ל 1,000 משימות, בעוד האופציה הזולה בעשירייה הראשונה (Kimi K2.7 Code, 48.10 דולר) מקבלת ציון נמוך ב 14.1 נקודות.