現状では、GPT Image 2について「任意サイズをより広く受け付ける」「選べるアスペクト比が増えた」「参照画像をより多く使える」といった表現は、少なくとも本稿で参照した資料だけでは裏づけが足りません。
OpenAIの資料にはGPT Image 1.5のモデルページとGPT Image 2のモデルページがあり、Images APIには画像生成と画像編集に関するリファレンスがあります。 ただし、そこから次の項目を世代別に比較できるわけではありません。
size、または幅・高さ指定で受け付ける値したがって安全な言い方は、GPT Image 2というモデルページは確認できるが、サイズ・比率・参照画像入力の自由度がGPT Image 1.5よりどれだけ上がったかは、現時点の資料では量的に確認できない、です。
OpenAIのGPT Image 1.5モデルページでは、GPT Image 1.5は画像生成モデルとして説明され、instruction followingやprompt adherenceが改善されたモデルとされています。 また、OpenAI APIにはGPT Image 2のモデルページも存在します。
Images APIのリファレンスでは、Generate an ImageとEdit an Imageに対応するエンドポイントが確認できます。 Python版とTypeScript版のImagesリファレンスにも、GPT image modelsに関する記述があり、生成画像のsize、background、output format、qualityなどの項目が示されています。
ここまでで確認できるのは、「画像生成」「画像編集」「サイズなどの項目」がAPI資料に存在することです。一方で、GPT Image 1.5とGPT Image 2がそれぞれどのサイズを受け付けるのか、任意の比率に対応するのか、参照画像入力の制限が変わったのかまでは、この資料だけでは判断できません。
| 確認項目 | 現在確認できる情報 | GPT Image 2のほうが自由と証明できるか |
|---|---|---|
| カスタムサイズ | OpenAIのImagesリファレンスには生成画像のsizeが出てきます。第三者のGPT Image 1.5関連資料にも、width、height、image_size、編集時のsizeなどの例があります。 | 証明できません。 GPT Image 1.5とGPT Image 2のそれぞれについて、対応サイズの完全な一覧、最小・最大値、任意サイズ対応の有無が示されていません。 |
| アスペクト比 | HiggsfieldのGPT Image 1.5向けガイドには、1:1、2:3、3:2などの比率選択例があります。 | 証明できません。 これは第三者UIの例であり、OpenAI公式の世代別アスペクト比比較ではありません。GPT Image 2で比率が増えた根拠にもなりません。 |
| 参照画像入力 | OpenAI APIには画像編集エンドポイントがあります。第三者資料にはimage_reference、編集時のsize、input_fidelityなどの項目例もあります。 |
Leonardo.AIのGPT Image-1.5向けREST API例には、width、height、seed、guidances.image_referenceが登場します。falの資料にはimage_size、background、qualityがあり、WaveSpeedAIの編集API資料にはsize、quality、input_fidelity、output_formatが示されています。Higgsfieldのガイドには、1:1、2:3、3:2などの比率選択例があります。
これらは、各プラットフォームがGPT Image 1.5をどう組み込んでいるかを知る手がかりにはなります。ただし、第三者サービスは独自のパラメータ名、初期値、UI上の選択肢、内部的な制限を設けている可能性があります。そのため、あるサービスでwidthやheightが指定できるからといって、それをOpenAIネイティブAPIの全能力とみなすことはできません。
同じ理由で、第三者UIに表示されたアスペクト比の選択肢を、GPT Image 2との公式な差分として扱うこともできません。
この主張をきちんと検証するには、少なくとも次のような情報が必要です。
sizeの受け付け値、固定サイズ一覧、最小値・最大値が示されていることこれらがない段階では、「GPT Image 2のほうが自由」という表現は、確認済みの事実ではなく未検証の仮説として扱うべきです。
GPT Image 1.5からGPT Image 2へ移行するかを検討する場合、サイズやアスペクト比の自由度だけを判断材料にするのはおすすめできません。画質、プロンプト追従性、生成速度、コスト、API制限を分けて評価し、API制限については公式ドキュメントと実際のエラー挙動を確認するのが堅実です。
実務上は、同じプロンプトと同じ入力素材を使い、サイズ、縦横比、参照画像枚数、ファイル形式を1つずつ変えるテスト表を作ると判断しやすくなります。成功、拒否、エラーメッセージを記録し、公式パラメータ表または再現可能なテスト結果で差分が見えたときに初めて、「GPT Image 2はより多くのサイズに対応する」「参照画像の制限が緩和された」といった表現を使うべきです。
現時点で最も安全な書き方は、次のようなものです。
OpenAIのAPI資料ではGPT Image 1.5とGPT Image 2のモデルページ、画像生成・画像編集エンドポイント、
sizeやqualityなどの関連項目は確認できる。ただし、参照した資料の範囲では、両モデルのカスタムサイズ、アスペクト比、参照画像入力制限を比較する完全な公式情報は見当たらない。そのため、GPT Image 2がGPT Image 1.5よりこれらの点でどれだけ自由になったかは、現時点では確認できない。
つまり、今の段階で言えるのは「より自由になった」と断定することではなく、「公式の比較情報が不足しているため、自由度の差はまだ確認できない」ということです。
| 数値化できません。 参照画像の枚数、入力形式、多画像入力のルールについて、GPT Image 1.5とGPT Image 2を公式に比較する情報が不足しています。 |