Модель також сильна в знаннєвих бенчмарках: GDPval оцінює завдання з десятків професій, включаючи юриспруденцію, фінанси та управління продуктами. GPT‑5.5 зрівнюється або перевершує професіоналів приблизно в 84.9% порівнянь.
Разом ці цифри свідчать, що GPT‑5.5 особливо сильний в автономних багатокрокових завданнях та агентних робочих процесах.
Claude Opus 4.7 від Anthropic вважається однією з найсильніших моделей для завдань з програмної інженерії.
Найвідоміші результати бенчмарків:
SWE‑bench оцінює, чи може модель виправити реальні помилки у відкритих репозиторіях. Результат Opus 4.7 у 87.6% на SWE‑bench Verified представляє значне покращення порівняно з попередником і ставить її серед найкращих моделей для агентів кодування.
Хоча її результат на Terminal‑Bench поступається GPT‑5.5, її бенчмарки, орієнтовані на кодування, залишаються одними з найсильніших серед опублікованих порівнянь.
Gemini 3.5 Flash від Google є незвичайною моделлю, оскільки вона позиціонується як швидка, економічно ефективна модель, а не флагман — але все одно демонструє конкурентоспроможні результати на кількох агентних бенчмарках.
Звітні результати:
Google стверджує, що модель працює приблизно в чотири рази швидше, ніж аналогічні фронтирні моделі, перевершуючи попередню Gemini 3.1 Pro на кількох агентних бенчмарках.
На практиці головною перевагою Gemini 3.5 Flash є компроміс між швидкістю та можливостями: вона забезпечує майже флагманські результати бенчмарків, орієнтуючись на низьку затримку та виробничі навантаження.
DeepSeek V4 примітний тим, що це одна з найпотужніших моделей з відкритою вагою, випущених на сьогодні.
Сімейство моделей включає два варіанти:
Згідно з технічним звітом моделі та підсумками її бенчмарків, V4‑Pro в режимі максимальних міркувань досягає:
Ці результати ставлять її близько до провідних пропрієтарних моделей у деяких бенчмарках кодування.
Однак незалежна оцінка програми CAISI Національного інституту стандартів і технологій США (NIST) показала, що можливості моделі відстають від фронтиру приблизно на вісім місяців, що підкреслює розрив між самостійно звітованими та незалежними результатами.
Grok 4.3 від xAI демонструє значне покращення порівняно з попередніми версіями, особливо в бенчмарках агентних завдань.
Опубліковані показники:
Стрибок більш ніж на 300 Elo на GDPval‑AA порівняно з попередніми версіями Grok свідчить про суттєвий прогрес в автоматизації реальних завдань.
Тим не менш, сторонні аналізи зазвичай ставлять цю модель нижче за найновіші системи OpenAI та Anthropic за загальними показниками можливостей.
Розглянувши ці оцінки, можна побачити послідовну картину:
Однак до цих висновків слід ставитися як до орієнтовних, а не остаточних, оскільки кожен розробник виділяє різні набори оцінок.
Порівняння бенчмарків у сучасному ШІ стає все більш складним з кількох причин:
Через ці фактори справжнє відносне ранжування фронтирних моделей часто стає зрозумілим лише після місяців незалежного тестування.
Найновіші дані бенчмарків не показують однієї моделі, яка б домінувала у всіх сферах.
Натомість поточний фронтир виглядає спеціалізованим:
Оскільки незалежні бенчмарки сходяться та з'являється більше прямих порівнянь, точне впорядкування цих систем, ймовірно, продовжить змінюватися.