這不等於 GPT Image 2 一定沒有進步;而是目前沒有足夠公開證據,支持「提升 X%」、「準確率增加多少」這類定量說法。
可引用的官方基準線是 GPT Image 1.5。OpenAI API 的 GPT Image 1.5 模型頁將它描述為圖像生成模型,並稱它有更好的 instruction following 與對 prompts 的 adherence,也就是更能遵循使用者指令與提示內容。
至於 GPT Image 1,OpenAI API 模型頁稱它是上一代圖像生成模型,並說它可接受文字與圖像輸入、產生圖像輸出。
這裡還有一個評估時很容易被忽略的差異:OpenAI 的圖像生成文件把工作流分為 Generations 與 Edits。前者是根據文字 prompt 從零生成圖像;後者是修改既有圖像。 因此,「從文字生成一張複雜構圖」和「在既有圖像中準確加入、移動或保留物件」不應混在一起評分。
在可核查的 OpenAI API changelog、Models 與 All models 來源摘錄中,未見官方公布 GPT Image 2 vs GPT Image 1.5 的 complex composition、spatial accuracy 或 object-placement 量化比較。 換句話說,目前最多能穩健地說:GPT Image 1.5 有官方模型頁與官方能力描述;但不能進一步推論 GPT Image 2 的擺位準確率提升了多少。
GPT Image 2 的問題不是完全沒有人討論,而是公開來源之間並不一致。
Mew Design 的整理採取較保守的說法:GPT Image 2 看起來像是在測試中,但尚未作為具名 OpenAI 模型正式公開。 getimg.ai 也稱 OpenAI 尚未宣布 GPT Image 2,公開 lineup 停在 gpt-image-1.5。
但另一篇第三方文章則聲稱,OpenAI 在 2026 年 4 月 21 日推出 ChatGPT Images 2.0 / gpt-image-2,並提到 Arena score 1512。 這類說法可以作為「市場上有 GPT Image 2 相關傳聞或第三方報導」的線索,但不能自動等同於官方、可重現、專項的擺位 benchmark。
第三方評測也有類似限制。RenovateQR 的文章摘錄稱作者在 GPT Image 2 發布後,用一組標準 prompts 測試產品攝影、UI mockup、多語 signage、肖像與品牌內容等任務。 不過,在可見摘錄中,沒有看到可重現的多物件擺放成功率、左右/前後關係準確率,或與 GPT Image 1.5 的完整逐項對照表。
所以,較穩妥的表述是:有第三方來源聲稱 GPT Image 2 存在、正在測試或已推出;但就複雜構圖與物件擺放準確度提升多少而言,現有資料不足以給出官方、可重現、專項量化答案。
有第三方頁面列出 GPT Image 2 分數為 1,512,GPT Image 1.5 分數為 1,241,相差 271 分。 這最多只能說明:有來源聲稱 GPT Image 2 的某個整體分數高於 GPT Image 1.5。
但這不能改寫成「擺位準確度提升 271 分」,更不能換算成「物件擺放準確率提升多少百分比」。原因有三個:
如果要寫在產品頁、提案或銷售簡報裡,較準確的說法是:「有第三方頁面列出 GPT Image 2 的整體分數高於 GPT Image 1.5。」不應寫成「官方證明 GPT Image 2 擺位準確度提升 X%」。
要回答 GPT Image 2 是否真的比 GPT Image 1.5 更擅長複雜構圖,測試不能只靠「看起來比較漂亮」。至少需要:
沒有這些條件,單張示例圖、社群截圖或一個總分,都不足以回答「擺位到底準了多少」。
在沒有官方或可重現第三方 benchmark 前,不建議把「GPT Image 2 擺位更準」當成已量化事實。比較安全的做法是:
現有來源支持的最強結論是:GPT Image 1.5 有可引用的 OpenAI API 模型頁,且被描述為有更好的 prompt adherence;GPT Image 1 則是上一代圖像生成模型。
但 GPT Image 2 相對 GPT Image 1.5 在複雜構圖與物件擺放方面究竟準確多少,暫時沒有足夠可核查公開數據。第三方來源對 GPT Image 2 的狀態與分數說法不一,而 1,512 vs 1,241 這類總分也不能直接當成 spatial accuracy 或 object-placement accuracy。