| GPT-5.6 Terra — збалансований рівень | $2,00 | $12,00 | −20%: було $2,50/$15 |
| GPT-5.6 Sol — флагманський рівень | $5,00 | $30,00 | Ціна без змін; додано режим Fast |
Сумарна ціна мільйона вхідних і вихідних токенів для Luna тепер становить $1,40. Це робить модель однією з найдешевших у класі передових ШІ-моделей . Для Terra відповідний показник — $14.
Для Sol OpenAI запустила режим Fast: він забезпечує швидкість до 2,5 раза вищу за стандартну, коштуючи вдвічі дорожче. Компанія заявляє, що інтелектуальні можливості моделі при цьому не змінюються .
Найцікавіша частина історії — не сама знижка, а спосіб, у який OpenAI пояснює її появу. 29 липня компанія повідомила, що GPT-5.6 Sol автономно переписувала й оптимізувала виробничі GPU-ядра — низькорівневий код, який безпосередньо забезпечує роботу моделей на графічних процесорах .
Через середовище розробки Codex модель підключалася до внутрішньої інфраструктури OpenAI, проєктувала та запускала сотні архітектурних експериментів, контролювала розгортання і повторювала цикл оптимізації на основі результатів . Також вона вивчила синтаксис Triton і Gluon — мов, які використовуються у стеку GPU-ядер OpenAI .
За даними OpenAI, результатом стали:
Спекулятивне декодування — це метод прискорення відповідей, за якого менша «чернеткова» модель заздалегідь прогнозує наступні токени, а основна модель перевіряє ці прогнози.
OpenAI також оптимізувала інші частини інфраструктури. Йдеться про перебудову балансування навантаження, яке розподіляє запити з урахуванням географії, типу прискорювача та доступності кешу . Окремо важливу роль відіграє кешування запитів: збережені в кеші вхідні дані можуть коштувати на 90% дешевше за нові, а час їхнього зберігання становить приблизно 30 хвилин .
Інакше кажучи, OpenAI отримала змогу знизити ціну не лише завдяки маркетинговому рішенню, а й завдяки ефективнішій роботі власного обчислювального стека.
Зниження на 80% невдовзі після запуску навряд чи можна розглядати у відриві від ринку. За кілька тижнів конкурентне середовище помітно змінилося.
17 липня китайський стартап Moonshot AI представив Kimi K3 — open-weight-модель із 2,8 трильйона параметрів. Компанія позиціонує її як найбільшу модель такого типу у світі .
На таблиці лідерів Arena для фронтенд-кодування Kimi K3 набрала 1 679 балів, випередивши GPT-5.6 Sol та Fable 5 . Незалежне тестування Startrise AI Labs, опубліковане 30 липня, показало, що Kimi K3 фактично зрівнялася з Claude Opus 5 у тесті фронтенд-інженерії, але повний набір завдань коштував $7,17 проти $21,17 у Opus 5 .
Microsoft, за повідомленнями, розглядала можливість протестувати Kimi K3 у Copilot. Потенційна заміна моделі могла б заощадити компанії до $600 млн, або близько 60% витрат на токени .
Anthropic 24 липня випустила Claude Opus 5 із ціною $5 за мільйон вхідних токенів — удвічі дешевше за Fable 5. На кількох бенчмарках нова модель також перевершила Fable 5 . Це посилило тиск саме у преміальному сегменті, де конкурує GPT-5.6 Sol.
Google і Microsoft у липні також представили кілька моделей із нижчою собівартістю, посиливши конкуренцію у середньому та бюджетному сегментах .
У такій ситуації OpenAI фактично розділила позиціонування сімейства: Luna має залучати великі обсяги чутливих до ціни запитів, тоді як Sol залишається преміальним варіантом для складних завдань і міркувань .
Цінова війна розгортається одночасно зі зміною підходу компаній до закупівлі ШІ. Бізнеси дедалі частіше вимагають чітких бюджетів і обмежень, подібних до тих, що вже давно застосовуються для хмарних сервісів.
22 липня OpenAI додала до API-платформи жорсткі місячні ліміти витрат . На відміну від попередніх м’яких обмежень у ChatGPT Enterprise, які переважно слугували інструментами спостереження, новий режим фактично зупиняє запити після вичерпання бюджету. API повертає помилку HTTP 429; ліміти можна встановлювати на рівні всієї організації або окремого проєкту, а їхнє поновлення відбувається на початку нового платіжного циклу .
Це важливо для систем із ШІ-агентами: автономний агент може виконати значно більше операцій, ніж очікував користувач, і швидко збільшити рахунок. Жорсткий ліміт стає своєрідним запобіжником.
Reuters повідомляє, що компанії, зокрема Amazon, також запроваджують внутрішні або клієнтські обмеження на витрати на ШІ, оскільки дедалі прискіпливіше оцінюють окупність таких проєктів . Закупівлі тепер дедалі більше нагадують роботу з хмарною інфраструктурою: окремі бюджети, обмежені квоти та погодження великих розгортань на рівні CIO .
Для користувачів API наслідки найближчим часом переважно позитивні:
Головний висновок ширший за одну зміну тарифів. Вартість ШІ знижується під тиском одразу двох факторів: конкуренції та інженерної ефективності. Причому в цьому випадку OpenAI посилається на незвичний сценарій, коли сама модель допомогла оптимізувати виробничий код і зменшити витрати на її обслуговування.
Для бізнесу це означає, що ціни, ймовірно, залишатимуться під тиском, але контроль бюджету стане не менш важливим, ніж вибір самої моделі.