По оценкам сообщества, возможное окно релиза — с 15 июня по 5 июля 2026 года, но эти сроки — чистая экстраполяция на основе находок в логах, не имеющая официального подтверждения . Никаких конкретных цифр по ценам, токен-эффективности или подтверждённых мультимодальных способностей для гипотетической GPT‑5.6 не появилось; ожидания по улучшенной экономической эффективности и способности генерировать изображения по тексту — это лишь предположения, основанные на траектории развития семейства 5.x, а не задокументированная спецификация .
Суть: GPT‑5.6 — это заслуживающая доверия утечка, а не продукт. Индустрия следит за поведением бэкенда, но даты запуска или официальных технических спецификаций от OpenAI пока нет .
Фраза «Mythos Benchmark» встречается в нескольких разных контекстах, что может сбивать с толку:
Утечка модели Claude Mythos от Anthropic (26 марта 2026 года): Ошибка в конфигурации системы управления контентом Anthropic случайно открыла доступ примерно к 3000 внутренних документов, включая черновик поста о модели следующего поколения под кодовым именем «Capybara» и официальным названием Claude Mythos . Утёкшие внутренние бенчмарки показали, что Mythos достигает 93,9% на SWE‑bench Verified и 77,8% на SWE‑bench Pro, лидируя на тот момент во всех основных бенчмарках кодинга . 7 апреля 2026 года Anthropic официально анонсировала Claude Mythos Preview, но одновременно объявила, что публика не может её использовать . Модель также отметилась исключительными способностями в области кибербезопасности, включая обнаружение 27-летней ошибки в OpenBSD .
Бенчмарк безопасности Университета Карнеги-Меллона (май 2026 года): Исследователи CMU создали отдельную评估ку, которая проверяет, могут ли ИИ-модели автономно разрабатывать реальные эксплойты для браузера, нацеленные на движок Google V8. Оказалось, что и Claude Mythos, и GPT‑5.5 способны находить и превращать в оружие настоящие уязвимости без вмешательства человека, причём Mythos значительно превосходит GPT‑5.5, но обходится при этом примерно в двенадцать раз дороже .
Бенчмарк уязвимостей Mythos от SecureAI (январь 2026 года): Набор бенчмарков, ориентированных на кибербезопасность и покрывающих CVE с 2023 по 2026 год. Предназначен для оценки детекторов ИИ-уязвимостей и использует большие модели вроде Llama‑3.1‑405B в качестве базового уровня .
Когда кто-то упоминает «утечку бенчмарка Mythos», обычно имеется в виду именно утечка модели Anthropic. Бенчмарки CMU и SecureAI — это отдельные проекты, которые лишь по совпадению используют метку «Mythos».
2 июня 2026 года на мероприятии «Intelligence at Work» компания OpenAI анонсировала структурное расширение Codex — от агента по написанию кода до более широкой корпоративной платформы для работы . Три подтверждённых столпа этого анонса:
OpenAI также подтвердила, что число активных пользователей Codex в неделю превысило 5 миллионов . Это расширение представляет собой явный стратегический шаг по привлечению нетехнических работников умственного труда внутри предприятий. Многие независимые аналитики видят в этом направлении прямую конкурентную ось против инструментов, которые ранее фокусировались почти исключительно на командах разработчиков .
На своей ежегодной конференции Build в Сан-Франциско 2 июня 2026 года Microsoft представила семейство из семи собственных ИИ-моделей под единым брендом MAI (Microsoft AI), а также новое аппаратное обеспечение .
Центральным элементом стала MAI‑Thinking‑1 — первая модель компании со способностью к рассуждению:
Остальные шесть моделей дополняют мультимодальную экосистему:
Среди аппаратных анонсов был Surface RTX Spark Dev Box — компактная машина для ИИ-разработки, способная выдавать до одного петафлопса вычислительной мощности ИИ со 128 ГБ унифицированной памяти и рассчитанная на локальный запуск моделей с параметрами до 120 миллиардов . Microsoft также представила квантовый чип Majorana 2, что сигнализирует об ускорении её аппаратных амбиций за пределами классических ИИ-вычислений .
Семейство из семи моделей MAI широко интерпретируется как шаг к снижению зависимости от моделей OpenAI и предложению корпоративным клиентам собственных альтернатив с чистыми коммерческими лицензиями .
«Vibe coding» — практика создания целых приложений с помощью диалоговых промптов вместо написания синтаксиса — породила новое поколение бенчмарков, которые пытаются измерить способности полного цикла, а не изолированные задачи по кодингу:
Все три платформы преследуют общую цель — вывести оценку ИИ-кодинга за рамки бенчмарков с долей успешных проходов, таких как SWE‑bench, в сторону целостных измерений удобства использования, скорости, стоимости и безопасности.
2 июня 2026 года компания Nous Research выпустила Hermes Desktop в виде публичного превью в комплекте с Hermes Agent v0.15.2 под лицензией MIT для macOS 12+, Windows 10/11 и Linux .
Ранее доступ к Hermes можно было получить только через интерфейс командной строки или мессенджеры. Десктопное приложение представляет собой нативный графический интерфейс, который использует то же агентское ядро, ключи API, сессии, навыки и память, что и CLI. Таким образом, это альтернативная среда, а не форк .
Nous Research описывает Hermes как «самосовершенствующегося агента, а не второго пилота для кодинга» . С момента запуска агент вырос примерно до 180 000 звёзд на GitHub за три месяца, что делает его одним из самых быстрорастущих опенсорсных агентских проектов в экосистеме .
Примерно 1–2 июня 2026 года Alibaba запустила Qwen 3.7 Plus. Это мультимодальная модель-агент, обрабатывающая текст, изображения и видео с помощью раннего слияния (early‑fusion) и обладающая контекстным окном в 1 миллион токенов .
Цена установлена на уровне примерно одной шестой от стоимости за токен у текст-ориентированной Alibaba Qwen 3.7 Max, что делает её одним из самых агрессивно оценённых мультимодальных агентов на рынке . В бенчмарках агентской производительности Qwen 3.7 Plus превосходит Claude Opus 4.6 на Terminal‑Bench 2.0 и способна к распознаванию и автоматизации UI, генерации кода из изображений и ответам на визуальные вопросы .
Claude Code — это агентный инструмент для кодинга от Anthropic, который работает прямо в терминале, выполняя команды оболочки и редактируя файлы на машине разработчика. Команда /fork создаёт новую сессию, ответвляющуюся от существующей. Она сохраняется в commands/branch/, позволяя разработчикам исследовать другое направление, не теряя контекст исходной сессии .
Claude Code стал одним из самых распространённых ИИ-инструментов для разработчиков. Одно только упоминание в npm-пакете набрало более 1100 звёзд и 1900 форков за один день .
Ряд тем из новостной повестки не имеет прямого подтверждения в источниках на начало июня 2026 года:
Доминирующие темы первой недели июня 2026 года — это корпоративные инструменты (плагины Codex и Sites), собственные семейства моделей (линейка MAI от Microsoft, Qwen от Alibaba), зрелость опенсорсных агентов (Hermes Desktop) и надвигающееся следующее поколение, которое ещё не стало публичным (GPT‑5.6, Claude Mythos). Индустрия движется быстро, но грань между подтверждёнными продуктами и неподтверждёнными слухами часто оказывается более чёткой, чем это преподносят заголовки.