一方で、それらの能力がGPT-5.5「Spud」という単一の正式モデルに統合された、というOpenAI公式の根拠は、提供された確認可能なソースの範囲では見当たりません。Spud関連の主張は、非公式記事やThreads、Reddit、YouTube、X、LinkedInなどの投稿が中心です。
ここでいう全モーダルとは、ひとつの正式モデルがテキスト、画像、音声、動画をネイティブに扱う状態を指します。この意味でGPT-5.5「Spud」を語るなら、現段階で「発表済み」「確認済み」とは書けません。より正確には、OpenAIは複数の公式製品・モデルで多モーダル能力を公開しているが、それはSpudの公式発表ではない、という整理になります。
| 確認ポイント | いま言えること | そこからは言えないこと |
|---|---|---|
| Spudという名称とリリース | Spud関連の主張は、噂記事やSNS・ユーザー投稿で多く見られます。Threads投稿のように未確認リークと断るものもあります。 | OpenAIがGPT-5.5 Spudを正式に公開した証拠にはなりません。 |
| omni/多モーダルモデル | GPT-4o System CardはGPT-4oをautoregressive omni modelとし、テキスト、音声、画像、動画の任意の組み合わせを入力として受け取ると説明しています。 | これはGPT-4oの公式根拠であり、Spudの公式根拠ではありません。 |
| 画像生成 | OpenAIは4o画像生成について、natively multimodal modelに支えられた機能であり、画像生成は言語モデルの主要能力になるべきだと説明しています。 | Spudが画像生成を引き継いだ、または統合したとは言えません。 |
| 音声とリアルタイム対話 | Realtime APIは低遅延の多モーダル体験を作るためのAPIとして紹介され、gpt-realtimeの更新では高度なspeech-to-speechモデルやimage inputが挙げられています。 | Spudが音声対話を単一モデル内で統一した証拠にはなりません。 |
| 動画生成 | OpenAIの公式資料で動画生成として明確に示されているのは、Sora、Sora API、Soraのサンプルアプリです。 | SpudがSoraを置き換えた、またはSoraを統合したとは言えません。 |
| 動画理解 | GPT-4.1のAPI紹介はVideo-MMEをmultimodal long context understandingのベンチマークとして取り上げ、long, no subtitlesカテゴリで72.0%、GPT-4o比で6.7ポイント改善と説明しています。 | 動画理解の評価があることは、Spud発表の証拠ではありません。 |
Spudの噂が広がりやすいのは、OpenAIの公式ロードマップに見える動きと噂の内容が重なっているからです。GPT-4oはすでにomni modelとして説明されていますし、4o画像生成は原生的な多モーダルモデルに支えられた機能として紹介されています。Realtime APIも、音声、画像入力、低遅延の対話体験を正式な製品文脈に入れています。
動画についても同じです。Soraの公式ページは、Sora 2をアイデアからリアルな動きと音を持つ動画を作るものとして紹介しています。OpenAIのAPI文書にはVideo generation with Soraがあり、Soraのサンプルアプリではテキストプロンプトや参照画像を使って短い動画を生成・リミックスできると説明されています。
つまり、OpenAIが複数のモダリティを統合する方向に進んでいる、という見方自体は自然です。ただし、GPT-4o、Realtime API、Soraの能力をすべて未確認のSpudに帰属させるのは、証拠として一段飛躍しています。
GPT-4oは、現在の全モーダル議論で最も重要な公式根拠のひとつです。OpenAIのGPT-4o System Cardは、GPT-4oをautoregressive omni modelと呼び、テキスト、音声、画像、動画の組み合わせを入力として受け取れると説明しています。 これはOpenAIがomni方向のモデル能力を持つことを示しますが、GPT-5.5 Spudの存在を示すものではありません。
OpenAIは4o画像生成について、精密で写実的な出力を可能にするnatively multimodal modelによる画像生成として説明しています。また、画像生成は言語モデルの主要能力のひとつになるべきだとも述べています。 これは画像生成能力の公式根拠ですが、Spudの発表根拠ではありません。
OpenAIのRealtime APIは、開発者が低遅延の多モーダル体験を作れるものとして導入されました。さらにgpt-realtimeの更新では、より高度なspeech-to-speechモデル、image inputなどが説明されています。 音声対話やリアルタイム応答はすでにOpenAIの製品能力に含まれますが、それをSpudの内蔵機能と断定する根拠はありません。
OpenAIに動画生成能力があるか、という問いなら答えはイエスです。公式ページと開発者向け文書は、動画生成の文脈でSora、Sora API、Soraのサンプルアプリを示しています。 しかし、動画生成がGPT-5.5 Spudに移管された、またはSpudがSoraを吸収した、という公式根拠は確認できません。
プロダクト計画やPoCで、GPT-5.5 Spudを利用可能な前提に置くのは危険です。実装や予算、納期を考えるなら、まず公開済みの公式ラインに分けて考えるのが現実的です。テキストと画像はGPT-4oや4o画像生成、音声エージェントやリアルタイム音声対話はRealtime API/gpt-realtime、動画生成やリミックスはSora/Sora APIを基準に検討するのが安全です。
もし将来Spudが正式モデルになるなら、信頼できるシグナルはOpenAIの公式発表ページ、システムカードまたはモデルカード、API文書上の正式なモデルID、能力と安全性に関する明確な説明です。GPT-4o、Realtime API、Soraを検証できるのは、まさに公式ページやシステムカード、開発者向け文書が存在するからです。
要するに、OpenAIの多モーダル路線には公式根拠があります。しかし、GPT-5.5「Spud」が全モーダルモデルとして公開・確認されたという根拠は、現時点ではありません。OpenAIが正式に発表するまでは、Spudは製品判断の土台ではなく、未確認の噂として扱うべきです。