Если под «всемодальной» моделью понимать один официальный ИИ, который нативно работает с текстом, картинками, голосом и видео, то GPT-5.5 Spud нельзя описывать как выпущенную или подтверждённую модель. Корректнее формулировать так: у OpenAI уже есть публичные мультимодальные возможности, но доказательства относятся к другим продуктам и документам.
| Проверяемый пункт | Что можно утверждать | Чего это не доказывает |
|---|---|---|
| Название Spud и релиз | Упоминания Spud встречаются в неофициальной статье, Threads, Reddit, YouTube, X и LinkedIn; часть таких сообщений прямо подаёт тему как rumors или unconfirmed leaks. | Этого недостаточно, чтобы считать GPT-5.5 Spud официально выпущенной моделью OpenAI. |
| Omni/мультимодальная модель | GPT-4o System Card называет GPT-4o autoregressive omni model и указывает, что он принимает на вход любую комбинацию текста, аудио, изображений и видео. | Это официальное подтверждение для GPT-4o, а не для Spud. |
| Генерация изображений | В описании 4o Image Generation OpenAI связывает генерацию изображений с natively multimodal model и пишет, что генерация картинок должна быть одной из ключевых возможностей языковых моделей. | Из этого не следует, что Spud уже получил или объединяет эту функцию. |
| Голос и взаимодействие в реальном времени | Realtime API предназначен для низколатентных мультимодальных сценариев; обновление gpt-realtime говорит о более продвинутой speech-to-speech модели и поддержке image input. | Это не доказывает, что голосовые функции собраны внутри Spud. |
| Генерация видео | Официальные материалы OpenAI по видео сейчас явно указывают на Sora, Sora API и демоприложение Sora. | |
| Понимание видео | В материале о GPT-4.1 API OpenAI упоминает Video-MME как бенчмарк multimodal long context understanding и приводит результат 72,0% в категории long, no subtitles — на 6,7 процентного пункта выше GPT-4o. | Бенчмарк по пониманию видео не является объявлением GPT-5.5 Spud. |
Слух цепляет не на пустом месте. OpenAI сама использует лексику omni и natively multimodal в официальных материалах: GPT-4o описан как omni-модель, 4o Image Generation — как генерация изображений на базе нативно мультимодальной модели, а Realtime API развивает голосовое и мультимодальное взаимодействие с низкой задержкой.
С видео похожая ситуация. Страница Sora говорит о превращении идей в видео с движением и звуком; документация OpenAI API описывает Video generation with Sora; а Sora sample app позволяет генерировать и remix короткие ролики из текстовых подсказок и референсных изображений. Всё это подтверждает, что у OpenAI есть видеонаправление. Но это всё ещё не подтверждает, что видеовозможности перешли в некую модель GPT-5.5 Spud.
Иными словами, предположение о дальнейшем сближении модальностей выглядит логичным. Но приписывать GPT-4o, Realtime API и Sora одному неподтверждённому Spud — это уже скачок от фактов к догадке.
Самая близкая к «всемодальности» формулировка сейчас находится не вокруг Spud, а вокруг GPT-4o. В GPT-4o System Card OpenAI называет модель autoregressive omni model и пишет, что она принимает текст, аудио, изображения и видео. Это сильное доказательство того, что OpenAI движется в сторону объединения модальностей. Но оно не является доказательством существования GPT-5.5 Spud.
OpenAI отдельно описывает 4o Image Generation как полезную генерацию изображений, связанную с нативно мультимодальной моделью, и подчёркивает, что генерация картинок должна быть важной способностью языковых моделей. Это официальная опора для разговора о картинках — но не релиз Spud.
По официальным материалам, Realtime API позволяет разработчикам строить низколатентные мультимодальные сценарии, а обновление gpt-realtime добавляет более продвинутую speech-to-speech модель, image input и другие возможности для продакшен-голосовых агентов. Поэтому голос и живое взаимодействие — подтверждённое направление OpenAI. Но привязка этих возможностей к Spud пока не подтверждена.
Если вопрос звучит так: «Есть ли у OpenAI генерация видео?» — ответ да. Официальные документы и страницы указывают на Sora, Sora API и Sora sample app. Если вопрос другой — «передана ли генерация видео в GPT-5.5 Spud?» — для этого сейчас нет достаточной официальной базы.
Если вы планируете продукт, не стоит закладывать GPT-5.5 Spud как уже доступную или гарантированную зависимость. Более надёжная схема — проектировать под опубликованные продукты: текст и изображения смотреть через GPT-4o и 4o Image Generation, голосовых агентов и живой диалог — через Realtime API/gpt-realtime, видео и remix — через Sora и Sora API.
Если Spud когда-нибудь станет официальной моделью, проверяемыми сигналами будут не посты в соцсетях, а страница релиза OpenAI, system card или model card, формальный идентификатор модели в API-документации и описание возможностей, ограничений и безопасности. Именно поэтому GPT-4o, Realtime API и Sora сейчас можно обсуждать предметно: для них есть официальные страницы, system card или документация для разработчиков.
Итог простой: у OpenAI есть подтверждённая мультимодальная стратегия и отдельные продукты для текста, изображений, голоса и видео. У GPT-5.5 Spud как официально подтверждённой «всемодальной» модели — пока нет такой доказательной базы.
| Нельзя делать вывод, что Spud заменил или поглотил Sora. |