Claude 3.5 Sonnet המשודרג הגיע ל־49% ב־SWE bench Verified בתחילת 2025; בהמשך דווח על 72.5% ל־Opus 4, 72.7% ל־Sonnet 4 ו־97.0% ל־Opus 5 בדירוג של Vals AI. SWE bench Verified כולל 500 משימות פומביות, בעיקר ממאגרי Python; SWE bench Pro רחב וקשה יותר, עם 1,865 משימות מ־41 מאגרים וב־123 שפות.
פורסם על ידינערך באמצעות GPT-5.6 Terraהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: As of September 2026, how do Anthropic’s Claude models perform across the major SWE-bench coding benchmarks—including the definitions, probl. Article summary: As of September 2026, Claude appears to lead the reported SWE-bench results, but the evidence supports a narrower conclusion than “Anthropic is unambiguously best at software engineering.” SWE-bench Verified is close to . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
מסלול ההתקדמות המדווח של Claude בבנצ'מרקי קוד בולט מאוד: Claude 3.5 Sonnet המשודרג הגיע ל־49% ב־SWE-bench Verified בתחילת 2025; דגמי Claude 4 הגיעו כעבור כמה חודשים לכ־72.5%–72.7%; ובהמשך הופיעו בדירוגים ציונים הקרובים לתקרת הבנצ'מרק. 23
24
9
המסקנה הנכונה אינה ש־Claude "פתר" את הנדסת התוכנה. המסקנה היא שהוא הפך לסוכן קוד תחרותי מאוד, ולעיתים מוביל, בהערכות פומביות של סוכני תכנות. כשמדד פומבי וסופי מתקרב ל־100%, השאלה החשובה יותר היא: איזו הערכה תנבא טוב יותר ביצועים במאגרי הקוד, בכלי הפיתוח ובתהליך הסקירה של הארגון שלכם?
| בנצ'מרק | מה הסוכן נדרש לעשות | היקף ואופן ניקוד | למה זה חשוב |
|---|---|---|---|
| SWE-bench Verified | מקבל תקלה אמיתית מ־GitHub ומצב נתון של מאגר קוד, ואז מייצר תיקון. | קבוצה מסוננת בידי בני אדם של 500 משימות SWE-bench, בעיקר ממאגרי Python פופולריים בקוד פתוח. משימה נחשבת פתורה אם התיקון עובר את בדיקות הבנצ'מרק בסביבת ההערכה. |
מדד מוכר ליכולת לפתור תקלות במאגרי קוד אמיתיים. |
| SWE-bench Pro | פותר משימות מורכבות יותר ורחבות יותר לאורך זמן, תחת מעטפת סוכן אחידה. | לפי הדיווחים: 1,865 משימות מ־41 מאגרים וב־123 שפות תכנות; המדד המקובל הוא Pass@1 — האם הניסיון הראשון הצליח. |
נועד להרחיב מעבר למשימות ה־Python הפומביות של Verified ולהקטין את סיכון החשיפה המוקדמת לנתונים. |
| Terminal-Bench 4.0 | מבצע עבודה טכנית מקצה לקצה בסביבת שורת פקודה. | משימות שכוללות חקירה, הרצת פקודות, עריכת קבצים, בדיקות והתאוששות מכישלונות — ולא רק תיקון של בעיית GitHub. |
בוחן שימוש בכלים ותהליך עבודה תפעולי, הקרובים יותר לאופן שבו סוכן פיתוח עשוי לעבוד בפועל. |
Anthropic דיווחה כי Claude 3.5 Sonnet המשודרג השיג 49.0% ב־SWE-bench Verified — מעל השיא המדווח הקודם, 45%. באותה עת ציינה החברה שאף מודל עדיין לא עבר את רף 50 האחוזים במדד. 23
37
במאי 2025 דיווחה Anthropic על 72.5% ל־Claude Opus 4 ועל 72.7% ל־Claude Sonnet 4 ב־SWE-bench Verified. הציונים הללו דווחו ללא "חשיבה מורחבת". 24
עד 2026 התמונה בדירוגים השתנתה דרמטית. Vals AI מדווחת על 97.0% ל־Claude Opus 5; שבעה מודלים שנבדקו קיבלו 95% ומעלה, ו־DeepSeek V4 Pro 0813 קיבל 96.4%. 9 לכן, התיאור "Opus 5 ב־96%" סביר כקיצור לציון מדווח גבוה מאוד — אבל אינו מספר יחיד ומוחלט: התוצאה תלויה בגרסת המודל, במעטפת הסוכן, בתקציב החישוב ובפרטי ההערכה.
במדגם של 500 משימות, 97% משאירים מעט מאוד מרחב שמאפשר להבחין באופן משמעותי בין מערכות קצה. חשוב עוד יותר: Verified מורכב ממשימות פומביות וסופיות ממאגרי קוד פומביים. הנחיות בתחום הבנצ'מרקים מגדירות אותו כבעל סיכון גבוה לזיהום נתונים ולרוויה. 3
אין פירוש הדבר שהציון חסר משמעות. הוא כן מעיד שסוכן מסוגל לפתור היטב סוג מסוים של תקלה מוגדרת היטב, שניתן לאמת באמצעות בדיקות. אבל הוא פחות מתאים כתחזית מלאה ליכולת להתמודד עם עבודה חדשה במאגר פרטי שמשתנה כל הזמן.
SWE-bench Pro ממותג כחלופה קשה יותר ועמידה יותר לחשיפה מוקדמת לנתונים. היקפו המדווח הוא 1,865 משימות על פני 41 מאגרים ו־123 שפות תכנות, לעומת 500 משימות מסוננות ב־Verified, המתמקדות בעיקר ב־Python. 12
16
דירוגים מצרפיים שפורסמו בספטמבר 2026 מציגים את Claude Fable 5.1 עם 81.2%, לפני Claude Mythos 5 עם 80.3% ו־Claude Fable 5 עם 80.0%. 53 באותו דירוג, שלושת המקומות הראשונים שייכים ל־Claude.
עם זאת, לא כל מספרי Pro ניתנים להשוואה ישירה. מקור אחד מבדיל בין ציון מוביל של 59.1% במערך הציבורי האחיד של Scale לבין נתונים מצרפיים גבוהים יותר שמדווחים ספקים — המחשה למידת ההשפעה של מעטפת הסוכן ושל שיטת הדיווח. 13 מקור אחר מזהיר במפורש שהנתון של 81.2% ל־Fable 5.1 אינו מגובה בבירור בתוצאה שפורסמה ישירות עבור המודל המסוים, וייתכן שמדובר בבעיית שיוך גרסה או באגרגציה.
55
המשמעות המעשית: יש להתייחס ל־81.2% כערך מדווח בדירוג, ולא כעובדה סופית ששוכפלה באופן בלתי תלוי לגבי מודל הבסיס לבדו.
Terminal-Bench בודק עבודה טכנית של סוכנים בתוך סביבת שורת פקודה — למשל בניית תוכנה או אימון מודל למידת מכונה. בניגוד למתכונת "בעיה ותיקון" של SWE-bench Verified, הוא בוחן זרימת עבודה תפעולית יותר. 38
בהשוואה המצוטטת, Claude Fable 5.1 קיבל 55.8% לעומת 37.3% ל־GPT-5.6 Sol — פער של 18.5 נקודות אחוז. 44 זו עדות משמעותית לכך שתצורת ה־Claude שנבדקה הצליחה יותר באותה הערכה.
אולם זו אינה הוכחה לדירוג כללי של Anthropic מול OpenAI, Google, Cognition או AWS. טענה כזו הייתה מחייבת מודלים מותאמים, אותה מעטפת סוכן בדיוק, תקציבי זמן וטוקנים מקבילים, ותוצאות בכמה מערכי משימות עצמאיים. החומרים שסופקו אינם מציגים השוואה כזאת.
שלוש טענות מדודות נתמכות בנתונים הזמינים:
הן אינן מוכיחות ש־Claude ישלים לבדו פרויקטים בני שבועות, יבין באופן עקבי מערכות פנימיות לא מתועדות, יקבל החלטות ארכיטקטורה נכונות או ישחרר קוד לייצור בבטחה ללא סקירה אנושית. משימות SWE-bench מגיעות עם תוצאת בדיקה ניתנת לאימות; הנדסת תוכנה אמיתית כוללת גם גילוי דרישות, פשרות, אינטגרציה, אבטחה, פריסה ושיתוף פעולה.
SWE-bench Verified היה חשוב משום שעבר מעבר לחידות קוד קצרות: הסוכן עובד עם מאגרי קוד אמיתיים ותיאורי תקלות, והתיקון נבדק באמצעות מבחנים. 1
38 אבל לפי דיונה של Anthropic בהערכות סוכנים, מודלים קפצו מכ־40% ליותר מ־80% במדד זה בתוך שנה.
38
בשלב הנוכחי, מערך הערכה שימושי צריך לכלול:
Anthropic מתארת את SWE-bench Verified ואת Terminal-Bench כדוגמאות להערכות סוכנים, וכן הדגישה יכולת עבודה מתמשכת במשימות ארוכות עבור Claude 4. 38
42 עם זאת, הראיות שסופקו אינן מספיקות כדי לקבוע שהחברה ביצעה מעבר רשמי מ־SWE-bench להערכות ארוכות־טווח. זו טענה חזקה יותר שנותרה בלתי מוכחת כאן.
ביצועי הבנצ'מרק המדווחים של Claude מציבים אותו כאחת האפשרויות החזקות ביותר לבחינה בתחום סוכני הקוד, נכון לספטמבר 2026. אבן הדרך הבולטת היא המעבר מ־49% ב־SWE-bench Verified בתחילת 2025 ל־97.0% בדירוג עבור Opus 5, לצד הובלה מדווחת של 81.2% ב־SWE-bench Pro. 23
9
53
אבל בבחירת כלי, לא כדאי להסתפק בכותרת ובמספר יחיד. השתמשו בציונים כדי לבנות רשימת מועמדים, ואז הפעילו הערכה מבוקרת על משימות מייצגות מתוך המאגרים שלכם. בנצ'מרקים פומביים שכמעט הגיעו לרוויה מראים שמודלים מסוגלים לתקן תקלות רבות בתבנית מוכרת; הם לבדם אינם מוכיחים יכולת אמינה להנדסת תוכנה אוטונומית בארגון יצרני.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Claude 3.5 Sonnet המשודרג הגיע ל־49% ב־SWE bench Verified בתחילת 2025; בהמשך דווח על 72.5% ל־Opus 4, 72.7% ל־Sonnet 4 ו־97.0% ל־Opus 5 בדירוג של Vals AI.
Claude 3.5 Sonnet המשודרג הגיע ל־49% ב־SWE bench Verified בתחילת 2025; בהמשך דווח על 72.5% ל־Opus 4, 72.7% ל־Sonnet 4 ו־97.0% ל־Opus 5 בדירוג של Vals AI. SWE bench Verified כולל 500 משימות פומביות, בעיקר ממאגרי Python; SWE bench Pro רחב וקשה יותר, עם 1,865 משימות מ־41 מאגרים וב־123 שפות.
ההשוואה המצוטטת ב־Terminal Bench 4.0 מעמידה את Claude Fable 5.1 על 55.8% מול 37.3% ל־GPT 5.6 Sol — יתרון באותה תצורת הערכה, לא דירוג כולל של כל החברות.