關鍵缺口是直接且可重現的比較:同一組提示詞、可比的設定、多張輸出、盲測評審,以及專門評估攝影真實感的評分方法。OpenAI 的既有文件能說明 GPT Image 1.5 與 API 工作流,但沒有提供官方 GPT Image 2 寫實度對照測試。
OpenAI 的影像生成指南列出兩種核心流程:依文字提示從零生成影像,以及編輯既有影像。 API 參考文件也描述影像編輯輸入與參數,例如模型、生成張數、品質與輸出格式等 GPT 影像模型工作流會用到的設定。
OpenAI 的 cookbook 與提示指南則涵蓋實務工作流,包括遮罩編輯與 GPT Image 1.5 的提示範例。
這些資料能建立 GPT Image 1.5 的產品能力基線;但它們不能證明 GPT Image 2 比 GPT Image 1.5 更寫實,因為其中沒有 GPT Image 2 的官方模型頁、官方 GPT Image 2 基準測試,或兩者並排的寫實度研究。
本文檢視到的 GPT Image 2 頁面,沒有提供足以驗證寫實度升級的證據。
其中一篇以洩漏與工作流建議來包裝 GPT Image 2。 另一篇討論可期待的升級,包括文字渲染與相機控制改進。
MindStudio 的文章表示,GPT Image 2 在文字渲染上的改進看起來讓它在該維度領先;但文字渲染只是特定能力,不等同於整體攝影寫實度。
JXP 的文章提出更強的說法,包括 99%+ 文字準確率、預期原生 4K 輸出,以及攝影寫實度大幅躍升;但提供的片段沒有包含可重現的評估方法,也沒有直接與 GPT Image 1.5 對比。
Higgsfield 的頁面則以商業影像生成與完美文字為主要賣點來行銷 GPT Image 2。
這點很重要:文字渲染、提示詞服從度、解析度與商業可用性,都不等於攝影寫實度。模型可以在排版或遵循指令方面更好,卻未必在光影、材質、鏡頭感或物理一致性上更像真照片。本文檢視的 GPT Image 2 資料,沒有提供提示詞集合、樣本數、生成設定、盲測方法,或針對 GPT Image 1.5 的寫實度專項分數。
本文資料中最像基準排行的來源是 Artificial Analysis。其 Text to Image Arena 片段顯示,GPT Image 1.5 (high) 目前以 Elo 1274 領先;該排行榜根據盲測使用者投票形成排名,Elo 較高代表模型更常被使用者偏好。
這對理解整體使用者偏好有參考價值。可是,這仍不能證明 GPT Image 2 的攝影寫實度更強。因為提供的 Artificial Analysis 片段是整體文字生成影像偏好排行榜,不是只評估攝影寫實度的 GPT Image 2 對 GPT Image 1.5 測試。
一個足以支撐決策的 GPT Image 2 對 GPT Image 1.5 測試,應該把攝影寫實度與其他能力分開。至少需要:
如果你正在為產品、品牌素材或內容流程評估影像模型,應先把 GPT Image 2 寫實度升級視為待驗證假設。OpenAI 的資料提供了 GPT Image 1.5 的官方基線,也說明了生成與編輯工作流;但它們沒有證明 GPT Image 2 的寫實度升級。
若兩個模型能在同一工作流中取得,內部測試應使用自己的提示詞、相同條件與盲測評分。若要遷移正式生產流程,不宜只因第三方頁面宣稱寫實度大躍進就切換。若要撰寫行銷文案,也應避免直接說 GPT Image 2 更寫實,除非你手上有透明且可重現的基準測試支持這個說法。
GPT Image 2 未來可能證明更強;但依本文檢視的資料,尚不能驗證它比 GPT Image 1.5 更具攝影寫實度。最穩妥的說法是:GPT Image 1.5 已有 OpenAI 官方文件;Artificial Analysis 將 GPT Image 1.5 (high) 列為盲測 Text to Image Arena 第一名,Elo 1274;而目前檢視到的來源,沒有證明 GPT Image 2 在攝影寫實度上優於 GPT Image 1.5。