Claude Opus 4.7 של Anthropic, לעומת זאת, בולט במיוחד במבחני הנדסת תוכנה בעולם האמיתי. Anthropic מדווחת על 64.3% ב-SWE-Bench Pro ו-87.6% ב-SWE-Bench Verified, מדדים שבודקים האם מודל יכול לתקן באגים אמיתיים במאגרי קוד פתוח.
Gemini 3.5 Flash של גוגל ראוי לציון מיוחד משום שהוא מתקרב לביצועי דגמי הדגל הרבה יותר ממה שמצופה ממודל "מהיר" (Flash). בטבלת ההשוואה של גוגל, הוא משיג 76.2% ב-Terminal-Bench 2.1, לעומת 78.2% ל-GPT-5.5 ו-66.1% ל-Claude Opus 4.7 באותה גרסת מדד.
Grok 4.3 ו-DeepSeek V4 קשים יותר לדירוג מדויק בשל הבדלים בשקיפות ובדרכי ההערכה.
ביצועי הקידוד הם אחד מתחומי ההבחנה הברורים ביותר. Claude Opus 4.7 מוביל כאן עם 64.3% ב-SWE-Bench Pro, עלייה משמעותית לעומת דורות קודמים . GPT-5.5 משיג תוצאה נמוכה יותר באותו מבחן (58.6%), אך מצטיין במשימות הנדסה רחבות יותר כמו אוטומציה של שורת פקודה, שם הוא מוביל עם 82.7% ב-Terminal-Bench 2.0 . Gemini 3.5 Flash מגיע ל-55.1% ב-SWE-Bench Pro, תוצאה צנועה יחסית לעומת Opus 4.7, אך ראויה לציון עבור מודל מהיר .
מבחני הקידוד הציבוריים עבור Grok 4.3 פחות סטנדרטיים: הדיווחים כוללים 81% ב-IFBench ו-98% במשימות τ²-Bench, אך מדדים אלו מודדים יכולות צרות יותר ואינם ניתנים להשוואה ישירה. עבור DeepSeek V4, מבחני קידוד מאומתים בציבור נותרו מוגבלים.
Google מדווחת שGemini 3.5 Flash מוביל בכמה מבחני שימוש בכלים, כולל 83.6% ב-MCP Atlas ו-56.5% ב-Toolathlon, שמעריכים תזמור רב-כלי ועבודות עולם אמיתי. GPT-5.5 של OpenAI מתפקד היטב בתחומים דומים עם 84.9% ב-GDPval.
Grok 4.3 שם דגש על עיבוד הקשר ארוך ועלות-תועלת, עם חלון הקשר של מיליון טוקנים ומחירים של 1.25$ למיליון טוקני קלט ו-2.50$ למיליון טוקני פלט . Gemini 3.5 Flash מתוכנן כמודל מהיר במיוחד, ומתואר כפי 4 מהר יותר ממודלי דגל . מודלי DeepSeek מתמקדים לרוב בפריסה חסכונית.
לפי תוכנית CAISI של המכון הלאומי לתקנים וטכנולוגיה (NIST), DeepSeek V4 הוא המודל הסיני המסוגל ביותר שנבדק בתחומי הנדסת תוכנה, סייבר ומתמטיקה, אך הוא מפגר בכ-8 חודשים אחרי המודלים המובילים ביכולת . הדו"ח מציין כי תוצאות המודל הפנימיות של DeepSeek חזקות יותר מהמדידות העצמאיות של CAISI.
בפועל, ה"מודל הטוב ביותר" תלוי במשימה הספציפית: סוכני קידוד, עוזרי מחקר, ניתוח הקשר ארוך או עלות הסקה נמוכה יכולים להעדיף מודלים שונים, למרות כותרות דומות במדדים.