| GPT-5.5 (Pro) | $30.00 | $180.00 | — | 1 млн |
| Qwen3.7-Max | $2.50 | $7.50 | $0.25 (знижка 90%) | 1 млн |
| Kimi K2.6 | $0.60–$0.95 | $3.00–$4.00 | $0.10 | 262 тис. |
| Gemini 3.5 Flash | $1.50 | $9.00 | $0.15 | 1 млн |
| Grok 4.3 | $1.25 | $2.50 | $0.30 | 1 млн |
| DeepSeek V4-Flash | $0.14 | $0.28 | $0.0028 | 1 млн |
| DeepSeek V4-Pro | $0.435 (постійна знижка) | $0.87 (постійна знижка) | $0.0036 | 1 млн |
Ключові висновки щодо цін:
Бенчмарки корисні лише в контексті. Ми організували результати за тим, що вони насправді вимірюють — загальний інтелект, здатність до кодингу та агентну продуктивність, — а не за єдиним, часто оманливим, сукупним балом.
Ця категорія вимірює базові знання, математику та наукове міркування.
| Бенчмарк | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| AA Intelligence Index | 61.4 | 60.2 | ~55 | 56.6 | 53 | ~52 |
| GPQA Diamond | 93.6% | — | 90.1% | 92.4% | ||
| AIME / USAMO 2026 (Математика) | 96.7% | 95.2% | ||||
| HLE (з інструментами) | 57.9% | — | 37.7% | — | — | — |
Claude Opus 4.8 відкрив невеликий, але значний відрив від GPT-5.5 у загальному інтелекті, підкріплений величезним стрибком у математичній продуктивності на 27.4 пункти порівняно з попередником . Qwen3.7-Max виділяється як найкраща китайська модель, майже зрівнявшись із лідерами в науковому міркуванні рівня аспірантури (GPQA Diamond) .
Найбільш релевантні бенчмарки для розробників.
| Бенчмарк | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 80.2% | 88.7% | 88.6% | 72.5% |
| SWE-bench Pro | ~58% | 58.6% | 58.6% | 69.2% | |
| LiveCodeBench v6 | 93.5% | 89.6% |
Продуктивність кодингу створює чітку сегментацію. Claude Opus 4.8 та GPT-5.5 йдуть нога в ногу на самій вершині для загального виправлення помилок (SWE-bench Verified), але Claude отримує значну перевагу в понад 10 пунктів на набагато складнішому наборі Pro . Для чистої ефективності кодингу на долар, DeepSeek V4-Pro не має рівних, пропонуючи продуктивність кодингу рівня GPT-5.4 зі знижкою в 30 разів .
Здатність моделі діяти незалежно в реальному середовищі.
| Бенчмарк | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | 82.7% | 76.2% | |||
| τ²-Bench (Виконання інструкцій) | — | — | — | — | 98% |
GPT-5.5 утримує корону як найсильніша модель для відкритих агентних завдань у терміналі, але вищий рейтинг Claude Opus 4.8 у реальних завданнях (GDPval-AA Elo) вказує на більш надійного, готового до бізнесу агентного партнера . Grok 4.3 пропонує переконливий бюджетний варіант для великих обсягів завдань з виконання інструкцій .
Вперше китайські моделі конкурують не лише за ціною, а й за можливостями. Qwen3.7-Max лідирує серед усіх моделей в агентному бенчмарку кодингу SWE-bench Pro з результатом 60.6% . Kimi K2.6 відповідає продуктивності GPT-5.5 в цьому ж тесті та лідирує серед усіх інших моделей на «Останньому іспиті людства» (HLE) з інструментами з результатом 54.0% , кидаючи виклик американським лідерам у ключових завданнях на міркування, водночас значно виграючи в ціні.
Пряме, повне порівняння всіх семи моделей наразі неможливе через вибіркове звітування бенчмарків постачальниками . Кілька ключових факторів підривають вибір, що ґрунтується виключно на цифрах:
Ваш пріоритет має визначати ваш вибір:
Для будь-якого критичного розгортання проводьте тести на власних робочих навантаженнях. Бенчмарки, про які повідомляють постачальники, є корисною відправною точкою, а не остаточною відповіддю.
| — |
| 92.6% |
| — |
| — |
| — |
| — |
| 60.6% |
| — |
| — |
| — |
| 74.6% |
| 69.7% |
| — |