OpenAI позиционирует GPT-5.6 Sol как новый рубеж в трех ключевых областях: кодинг, биология и кибербезопасность .
Terminal-Bench 2.1 тестирует рабочие процессы в командной строке, требующие многоэтапного планирования, координации инструментов и итераций . Бенчмарк включает 89 сложных задач по программированию
. Результаты:
| Модель | Результат |
|---|---|
| GPT-5.6 Sol Ultra | 91,9% |
| GPT-5.6 Sol (max) | 88,8% |
| Claude Mythos 5 | 88,0% |
| GPT-5.6 Terra | 84,3% |
| Claude Fable 5 | 84,3% |
| GPT-5.5 | 83,4% |
| GPT-5.6 Luna | 82,5% |
GPT-5.6 Sol Ultra установил новый рекорд (state of the art) — 91,9% . Стандартный результат Sol — 88,8% — обходит ограниченную флагманскую модель Anthropic Claude Mythos 5 (88,0%) почти на целый пункт
.
На GeneBench v1 — бенчмарке, оценивающем задачи долгосрочного геномного анализа и количественной биологии, — OpenAI сообщает, что Sol достигла более высоких результатов, чем GPT-5.5, используя при этом меньше выходных токенов . Это означает значительное повышение эффективности для научно-исследовательских рабочих процессов.
На ExploitBench — бенчмарке для исследований в области кибербезопасности — GPT-5.6 Sol почти сравнялась с производительностью Anthropic Mythos Preview, используя примерно треть выходных токенов .
На ExploitGym — бенчмарке, созданном исследователями Калифорнийского университета в Беркли в сотрудничестве с OpenAI и другими передовыми лабораториями ИИ, — все три модели GPT-5.6 показали улучшенные возможности в области кибербезопасности по мере увеличения уровня рассуждений .
Важно отметить, что OpenAI заявляет, что GPT-5.6 Sol не пересекает критический порог Cyber Critical в соответствии со своей системой оценки готовности (Preparedness Framework) . В ходе оценки с участием Chromium и Firefox модель выявляла ошибки и примитивы эксплуатации — строительные блоки эксплойта, — но не смогла автономно создать полноценный функциональный эксплойт в протестированных условиях
. Все три модели семейства GPT-5.6 были внутренне оценены как имеющие «высокий» риск (в отношении кибербезопасности и биооружия), но не самый высокий «критический» уровень
.
OpenAI заявляет, что GPT-5.6 Sol запускается с «самым надежным стеком безопасности на сегодняшний день» . Подход к безопасности включает:
В ходе предварительного просмотра некоторые запросы могут быть замедлены или заблокированы для дополнительной проверки, пока OpenAI настраивает частоту ложных срабатываний и пропусков .
Развертывание GPT-5.6 не похоже ни на один предыдущий релиз OpenAI. По запросу правительства США OpenAI изначально ограничивает доступ небольшой группой доверенных партнеров и организаций — по данным Axios, в предварительный просмотр включено около 20 одобренных компаний, — пока модель проходит дополнительные проверки национальной безопасности .
Предварительный просмотр не является широкой программой самообслуживания. В этот период GPT-5.6 Sol, Terra и Luna доступны только через OpenAI API и Codex для этой ограниченной группы . Модели недоступны в ChatGPT во время предварительного просмотра
. OpenAI планирует сделать их широко доступными в ChatGPT, Codex и API «в ближайшие недели»
.
OpenAI четко заявила, что рассматривает подход с контролем со стороны правительства как временную меру: «Мы верим в широкий доступ, и этот процесс не должен стать долгосрочным стандартом» . Во внутренней служебной записке генеральный директор Сэм Альтман сообщил сотрудникам, что правительство будет «одобрять доступ для каждого клиента в течение этого предварительного периода», а более широкий релиз ожидается через пару недель
.
Это стало результатом переговоров с Управлением национального директора по кибербезопасности и Управлением научно-технической политики , отражая новую систему регулирования передовых моделей, тестируемую администрацией Трампа
.
| Модель | Ввод / 1 млн токенов | Вывод / 1 млн токенов |
|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 |
| GPT-5.6 Terra | $2.50 | $15.00 |
| GPT-5.6 Luna | $1.00 | $6.00 |
Цена Sol соответствует цене GPT-5.5, а Terra примерно в 2 раза дешевле GPT-5.5 . Для контекста: Sol стоит ближе к Claude Opus 4.8 ($5/$25), чем к ограниченной модели Mythos 5 от Anthropic ($10/$50)
.
OpenAI также объявила, что GPT-5.6 Sol будет развернута на оборудовании Cerebras в июле со скоростью вывода до 750 токенов в секунду
.
Семейство GPT-5.6 знаменует собой значительный отход от предыдущих запусков OpenAI. Трехуровневая упаковка (Sol, Terra, Luna) вводит долгосрочный брендинг, который отделяет серию моделей от уровней возможностей. Результаты бенчмарков — особенно рекордный показатель Sol в кодинге на Terminal-Bench 2.1 и повышение эффективности на ExploitBench — демонстрируют значительные достижения, особенно в кибербезопасности и биологии. Но самой определяющей особенностью этого запуска могут стать ограничения доступа, введенные правительством, которые представляют собой новую парадигму развертывания передовых моделей ИИ.