המסקנה של אופן AI הייתה חד-משמעית: "שיפורים ב- SWE-bench Verified אינם משקפים עוד שיפורים משמעותיים ביכולות פיתוח התוכנה האמיתיות של מודלים. הם משקפים יותר ויותר את מידת החשיפה של המודל למדד בזמן האימון" .
אופן AI המליצה במפורש על SWE-bench Pro — מדד גדול יותר שנבנה על ידי Scale AI ממאגרי קוד פרטיים ובעלי רישיון copyleft — כמחליף .
ב-8 ביולי 2026, אופן AI דיווחה על תוצאות ביקורת מפורטת של SWE-bench Pro — אותו מדד שהיא עצמה קידמה זה עתה כחזק יותר. הממצאים היו הרסניים :
הנסיגה הכפולה של אופן AI אינה תקלה מבודדת. היא חלק ממשבר מערכתי באופן שבו תעשיית הבינה המלאכותית מעריכה יכולת קידוד:
הנסיגה הכפולה של אופן AI — תחילה נטישת המדד שלה, ואז התנערות מהמחליף — הותירה את נוף הערכת הקידוד של AI ללא מנהיג מהימן. הקהילה מכירה יותר ויותר בכך שציוני מדד גבוהים אינם מנבאים עוד באופן אמין אם סוכן קידוד AI יכול להתמודד עם משימות הנדסת תוכנה בעולם האמיתי . מתודולוגיות הערכה חדשות — כגון מדדים ספציפיים למשימה, יריביים או מתעדכנים באופן רציף — נחוצות בדחיפות אך עדיין אינן בשלות
.
לעת עתה, כל מי שמנסה להעריך סוכן קידוד AI אין לו סטנדרט אחד לסמוך עליו. קריסת SWE-bench Verified ו- SWE-bench Pro אינה רק סיפור על שתי בדיקות פגומות. זהו סיפור על תעשייה שבנתה מהר יותר ממה שהיא יכלה למדוד.