| GPT-5.6 Terra — сбалансированный уровень | $2 | $12 | −20%, ранее $2,50 и $15 |
| GPT-5.6 Sol — флагман | $5 | $30 | Без изменений |
Суммарная стоимость входных и выходных токенов для Luna теперь составляет $1,40 за 1 млн токенов, что делает модель одной из самых доступных среди систем frontier-класса . Для Terra аналогичный показатель равен $14.
Sol сохранила базовый тариф, но получила режим Fast. По данным OpenAI, он обеспечивает скорость до 2,5 раза выше стандартной, стоит вдвое дороже стандартной обработки и не снижает уровень интеллекта модели .
Самая необычная часть этой истории связана не с маркетингом, а с инженерией. 29 июля OpenAI сообщила, что GPT-5.6 Sol автономно переписала и оптимизировала производственные GPU-ядра — низкоуровневый код, который запускает модели непосредственно на оборудовании .
Работа выполнялась через среду разработки Codex. Модель подключалась к внутренней инфраструктуре OpenAI, проектировала и проводила сотни архитектурных экспериментов, запускала и отслеживала развёртывания, а затем дорабатывала решения по результатам тестов . Для этого GPT-5.6 Sol освоила синтаксис Triton и Gluon — языков, используемых в стеке ядер OpenAI .
Компания заявила о двух ключевых результатах:
Оптимизация затронула и другие уровни инфраструктуры. В частности, сообщается о переработке балансировки нагрузки: запросы стали динамически распределяться с учётом географии, типа ускорителя и доступности кэша .
Важную роль играет и кэширование промптов. При времени жизни кэша около 30 минут повторно используемый входной контекст обходится на 90% дешевле свежего . Это особенно выгодно для задач, где система регулярно работает с одним и тем же кодом, документами или длинной историей диалога.
Техническая экономия — лишь одна сторона решения. Вторая — давление со стороны конкурентов, которые за несколько недель заметно изменили ожидания рынка.
17 июля китайская Moonshot AI представила Kimi K3 — open-weight-модель с 2,8 трлн параметров. Компания позиционировала её как крупнейшую открытую модель такого типа . На отдельных тестах фронтенд-разработки Kimi K3 сравнялась с ведущими американскими системами или превзошла их. В рейтинге Arena Frontend Code модель набрала 1 679 баллов, опередив GPT-5.6 Sol и Fable 5 .
Независимое исследование Startrise AI Labs, опубликованное 30 июля, зафиксировало сопоставимый результат Kimi K3 и Claude Opus 5 на тесте фронтенд-инженерии, но при существенно меньшей стоимости полного прогона: $7,17 против $21,17 у Opus 5 .
На этом фоне особенно важен не только уровень качества, но и возможность использовать открытую модель в собственной инфраструктуре. По сообщениям СМИ, Microsoft рассматривала тестирование Kimi K3 в Copilot; потенциальная экономия могла достигать $600 млн, или 60% стоимости токена .
Anthropic выпустила Claude Opus 5 24 июля с ценой $5 за 1 млн входных токенов — вдвое ниже тарифа Fable 5. Новая модель также опередила Fable 5 на нескольких бенчмарках . Это усилило давление именно в премиальном сегменте, где конкурирует GPT-5.6 Sol.
Google и Microsoft в июле также представили несколько более доступных моделей, усилив конкуренцию в среднем и бюджетном диапазонах . В результате OpenAI фактически разделила стратегию линейки: Luna должна привлекать высокими объёмами и низкой ценой, а Sol — оставаться премиальным вариантом для сложного рассуждения и агентных задач .
Снижение цен происходит в момент, когда компании начинают относиться к ИИ примерно так же, как к облачным вычислениям: заранее планировать расходы, устанавливать лимиты и требовать подтверждения крупных внедрений .
22 июля OpenAI добавила в API-платформу жёсткие месячные лимиты расходов . Администратор может установить бюджет на уровне организации или отдельного проекта. После его исчерпания новые API-запросы перестают выполняться и возвращают ошибку HTTP 429 до начала следующего расчётного периода .
Это отличается от простых уведомлений или «мягких» лимитов, которые лишь показывают расход в панели управления, но не останавливают трафик. Жёсткий предел служит защитой от неконтролируемых счетов — особенно в проектах с автономными ИИ-агентами, способными генерировать большое количество запросов.
Reuters сообщает, что компании всё чаще вводят отдельные бюджеты на ИИ, ограничивают распределение средств и передают одобрение масштабных внедрений на уровень ИТ-директоров . Amazon и другие крупные предприятия также, по данным источников, усиливают внутренние и клиентские ограничения на расходы, поскольку проверяют реальную отдачу от ИИ-инструментов .
Для разработчиков и корпоративных клиентов краткосрочный эффект выглядит благоприятно:
Главный вывод шире, чем один новый прайс-лист. Стоимость ИИ теперь определяется не только архитектурой модели и объёмом вычислений, но и эффективностью всего стека — от GPU-ядер и маршрутизации запросов до speculative decoding и кэширования.
Если эти методы самооптимизации будут масштабироваться, цены могут продолжить снижаться. Но одновременно корпоративный рынок уже движется к более строгой модели потребления: ИИ остаётся важным инструментом, однако эпоха неограниченных бюджетов на эксперименты, похоже, заканчивается.