Ця дата важлива для планування виробничих систем. Проєкт, який здається надзвичайно дешевим під час промоційного періоду, потрібно перерахувати за тарифами 2027 року ще до того, як команда прив’яже до нього довгострокову архітектуру.
Водночас ціна токенів — лише частина реальних витрат на AI-агента. На підсумковий рахунок впливають розмір контексту, кількість викликів інструментів, повторні спроби, кешування вхідних даних, рівень міркування та обсяг відповіді. Вартість окремого бенчмаркового завдання не є гарантованою ціною повного робочого процесу у продакшені.
За незалежними даними Artificial Analysis, Gemini 3.7 Flash отримала 56 балів у Intelligence Index. Це трохи вище за Claude Sonnet 5 із 55 балами, але нижче за GPT-5.6 Terra, яка набрала 57.
Найпомітніша відмінність Flash — швидкість. Artificial Analysis виміряла приблизно 340 вихідних токенів за секунду та середній показник часу на завдання 1,7. За цим вимірюванням Flash приблизно на 40% швидша за GPT-5.6 Terra на максимальному рівні міркування.
Це показники вимірювань моделі або конкретного провайдера, а не гарантія однакової швидкодії в кожному застосунку. На час відповіді також впливають мережа, маршрутизація запиту, розмір промпту, затримка інструментів і налаштування міркування.
Google повідомляє про суттєве покращення Gemini 3.7 Flash порівняно з Gemini 3.6 Flash у програмній інженерії, налагодженні, виправленні проблем, веброзробці та агентних робочих процесах. Серед наведених результатів:
Результати свідчать, що це сильна модель для коду та термінальних агентів, але не беззаперечний лідер. У наведеному тесті Terminal-Bench попереду залишається GPT-5.6 Terra, тоді як перевага Flash — у швидкості та нижчій вступній ціні.
На високому рівні зусиль міркування Gemini 3.7 Flash показала такі результати в тестах ARC Prize:
Це сильні показники, особливо з огляду на заявлену вартість одного завдання. Проте ARC-AGI — це сигнал про можливості моделі в конкретному бенчмарку, а не прямий прогноз надійності програмного агента. У реальному продукті агент може зробити кілька викликів моделі, використати зовнішні інструменти, повторити невдалу дію та обробити значно більший контекст.
Ця таблиця не є універсальним рейтингом. Моделі тестувалися в різних оцінюваннях, а джерела не підтверджують проведення єдиного контрольованого тесту для всіх систем. Крім того, ціни можуть стосуватися різних умов хостингу, знижок або доступності.
Наведені порівняння вказують на свідомий вибір позиціонування. Gemini 3.7 Flash близька до передових моделей за Intelligence Index, але не має найвищого результату: GPT-5.6 Terra трохи попереду з 57 балами й також лідирує в цитованому порівнянні Terminal-Bench.
Натомість Google підкреслює баланс між інтелектом, затримкою та вартістю. Модель, яка достатньо швидка для інтерактивної розробки й достатньо дешева для численних повторних викликів, може бути кориснішою для платформи агентів, ніж повільніша та дорожча система, що виграє вузький бенчмарк.
Це особливо важливо для помічників програмістів, автоматичного виправлення помилок, агентів веброзробки та процесів, де модель багато разів читає контекст, викликає інструменти, аналізує результат і повторює дію.
На тлі хвилі релізів у серпні 2026 року така ставка стає ще помітнішою. Qwen3.8-Max посилює конкуренцію в агентних і програмістських завданнях, GLM-5.3 та Nemotron 3.5 Lightning тиснуть на ціни й ефективність, а Claude Opus 5 і GPT-5.6 націлені на вищий рівень можливостей.
Gemini 3.7 Flash найкраще сприймати як швидку робочу модель із високою пропускною здатністю, а не як беззаперечно найрозумнішу систему. Її найсильніший аргумент — поєднання 56 балів у Intelligence Index, генерації приблизно 340 токенів за секунду, хороших результатів у програмуванні та агентних тестах і незвично низької вступної ціни.
Для розробників головне застереження має фінансовий характер: тарифи $0,75/$3,75 діють лише до 31 грудня 2026 року, а з наступного дня почнуть діяти стандартні $1,50/$7,50.
Твердження Google про рекордне зростання ще може підтвердитися, але наразі надані дані доводять передусім інше: компанія прагне зробити швидкий і доступний inference стандартом для масштабних розробницьких та агентних процесів, а не обов’язково перемагати в кожному тесті на максимальний інтелект.