המודל גם מתפקד חזק בביצ'מרקים של עבודת ידע: GDPval מעריך משימות על פני תריסרי מקצועות כולל משפטים, פיננסים וניהול מוצר, שם GPT‑5.5 משתווה לאיש מקצוע או מנצח אותו בכ-84.9% מההשוואות.
יחד, מספרים אלה מצביעים על כך ש-GPT‑5.5 חזק במיוחד במשימות אוטונומיות ורבות-שלבים ובזרימות עבודה סוכניות.
Claude Opus 4.7 של Anthropic נחשב לאחד המודלים החזקים ביותר למשימות הנדסת תוכנה.
תוצאות הביצ'מרקים הבולטות שלו כוללות:
SWE‑bench בודק האם מודל יכול לתקן באגים אמיתיים במאגרי קוד פתוח. פתרון 87.6% ממשימות SWE‑bench Verified על ידי Opus 4.7 מייצג שיפור משמעותי לעומת קודמו ומציב אותו בין המודלים הטובים ביותר לסוכני קידוד.
למרות שהציון שלו ב-Terminal‑Bench נופל מזה של GPT‑5.5, ביצ'מרקי הקידוד הממוקדים שלו נותרו בין החזקים ביותר המדווחים בהשוואות ציבוריות.
Gemini 3.5 Flash של גוגל יוצא דופן מכיוון שהוא ממוצב כמודל מהיר וחסכוני ולא כדגל — ובכל זאת הוא מציג תוצאות תחרותיות במספר ביצ'מרקים סוכניים.
tתוצאות מדווחות כוללות:
גוגל טוענת שהמודל פועל בערך פי ארבעה מהר יותר ממודלי חזית דומים תוך שהוא עולה על Gemini 3.1 Pro הקודם במספר ביצ'מרקים סוכניים וקידוד.
בפועל, החוזק העיקרי של Gemini 3.5 Flash הוא איזון המהירות-ליכולת: הוא מספק תוצאות ביצ'מרקים קרובות לדגל תוך מיקוד בזמן השהייה נמוך ועומסי ייצור.
DeepSeek V4 בולט מכיוון שהוא אחד ממודלי החזית הפתוחים-משקל החזקים ביותר ששוחררו עד כה.
משפחת המודלים כוללת שתי גרסאות:
על פי הדיווח הטכני של המודל וסיכומי הביצ'מרקים שלו, V4‑Pro במצב חשיבה מקסימלי משיג:
תוצאות אלה מציבות אותו קרוב למודלים קנייניים מובילים בביצ'מרקי קידוד מסוימים.
עם זאת, הערכה עצמאית של תוכנית CAISI של המכון הלאומי לתקנים וטכנולוגיה של ארה"ב (NIST) מצאה שיכולות המודל מפגרות אחרי החזית בשמונה חודשים בערך, מה שמדגיש פער בין תוצאות המדווחות על ידי החברה עצמה לבין תוצאות עצמאיות.
Grok 4.3 של xAI מייצג שיפור גדול לעומת מודלי Grok קודמים, במיוחד בביצ'מרקים של משימות סוכניות.
נתונים שפורסמו כוללים:
הקפיצה של יותר מ-300 נקודות Elo ב-GDPval‑AA לעומת גרסאות Grok קודמות מצביעה על התקדמות משמעותית באוטומציה של משימות בעולם האמיתי.
ובכל זאת, ניתוחים של צד שלישי בדרך כלל ממקמים את המודל מתחת למערכות החדשות ביותר של OpenAI ו-Anthropic בביצ'מרקים כלליים של יכולת.
במבט על פני הערכות אלה, עולה דפוס עקבי:
עם זאת, יש להתייחס למסקנות אלה ככיווניות ולא כמוחלטות, מכיוון שכל ספק מדגיש סוויטות הערכה שונות.
השוואות ביצ'מרקים בבינה מלאכותית מודרנית הופכות מורכבות יותר ויותר מכמה סיבות:
בגלל גורמים אלה, הדירוג היחסי האמיתי של מודלי החזית מתברר לעתים קרובות רק לאחר חודשים של בדיקות עצמאיות.
הראיות העדכניות ביותר מביצ'מרקים אינן מראות מודל בודד ששולט בכל תחום.
במקום זאת, החזית הנוכחית נראית מתמחה:
ככל שביצ'מרקים עצמאיים יתכנסו ויופיעו בדיקות 'תפוחים לתפוחים' נוספות, הסדר המדויק של מערכות אלה ימשיך ככל הנראה להתפתח.