Gemini 3.1 Pro показав 77,1% — найкращий результат на цьому тесті, який перевіряє справжнє вирішення проблем, не допускаючи простого запам'ятовування .
Claude Sonnet отримав 9,8/10 у тесті зі 125 реальних завдань, який оцінював якість і природність відповідей — це робить його найкращим для загального спілкування та написання текстів .
Розрив між найкращими моделями (GPT-5, Claude Opus 4.x, Gemini 3.x, Grok 4) є дуже незначним — часто всього кілька відсоткових пунктів . Звіт Стенфорда AI Index Report 2026 виявив, що продуктивність топ-15 моделей відрізняється лише на 3 відсоткові пункти в кожному тесті
.
«Точність» дуже залежить від завдання: найкраща модель для програмування не є найкращою для міркувань, і найточніша модель на бенчмарках може не підходити для вашого конкретного робочого процесу. Правильний вибір залежить від ваших основних потреб .