問題係 —— Wang 完全冇講係用邊個 benchmark 嚟比較 。唔知佢係指編碼測試(之前 Meta Muse Spark 喺 Terminal-Bench 只得 59.0,GPT-5.4 有 75.1),定係博士級推理測試 GPQA Diamond(Muse Spark 有 89.5%),定係普通語言理解。呢個比較基本上係冇得 verify 嘅
。
OpenAI 喺 2026年4月23日推出 GPT-5.5,一出就登上 Artificial Analysis Intelligence Index 榜首 。但到咗 Wang 發言嘅時候,OpenAI 已經喺 6月26日推出咗 GPT-5.6 系列 —— 分為 Sol、Terra、Luna 三個型號,旗艦 Sol 喺 Terminal-Bench 2.1 創下 88.8% 嘅新紀錄(Ultra 配置更達 91.9%)
。
換句話講,Watermelon 追緊嘅係一個已經唔係最尖端嘅模型。OpenAI 嘅發布節奏 —— GPT-5.4 喺 3月5日、GPT-5.5 喺 4月23日、GPT-5.6 喺 6月26日 —— 大約係六星期一個新版本 。等到 Watermelon 正式出街,OpenAI 可能已經去到 GPT-5.7 或者更後嘅版本。
Watermelon 嘅進取 claim 背後係 Meta 之前嘅挫折。Avocado —— Meta 重組超級智能實驗室後嘅第一個大型模型 —— 由 2026年3月延遲到至少5月,因為內部測試顯示佢喺推理、編碼同寫作方面落後 Google Gemini 3.0、OpenAI GPT-5.4 同 Anthropic 嘅最新模型 。有報道仲話 Meta 考慮過暫時向 Google 申請授權用 Gemini 嚟頂住先
。
Avocado 最終以 Muse Spark 嘅名義推出,但喺 Artificial Analysis Intelligence Index 只排第四,落後 Gemini 3.1 Pro、GPT-5.4 同 Claude Opus 4.6,得分 52 。佢喺醫學同科學測試表現出色(HealthBench Hard 42.8%,業界最佳),但編碼(Terminal-Bench 59.0)同抽象推理(ARC AGI 2 42.5)就唔掂
。
朱克伯格押重注喺 AI 基建。Meta 超級智能實驗室第一個大型模型 Muse Spark 據報用咗 143億美金 。Wang 話 Watermelon 用嘅算力比 Avocado「多一個數量級」
,反映 Meta 願意掟極大量資源去追落後
。
OpenAI 嘅 GPT-5.6 Sol 目前只係「有限預覽」階段,只畀美國政府批准嘅指定合作夥伴使用 。即係話佢嘅完整能力未必會快速商業化 —— 但佢已經設定咗比 GPT-5.5 更高嘅標準
。Sol 喺 Terminal-Bench 2.1 嘅 88.8%(Ultra 91.9%)同 GPT-5.5 嘅 83.4% 比,係一個有意義嘅能力跳升
。
Wang 話 Watermelon 追到 GPT-5.5,喺某啲 benchmark 上好大機會係真嘅,但呢個只係一個向後望嘅目標。等到 Watermelon 正式出街,OpenAI 可能已經去到 GPT-5.7 或者更新。加上 Meta 之前嘅執行延遲(Avocado)同巨額資本開支,單靠堆算力係咪真係追到對手六星期一個新模型嘅迭代速度,仍然係一個大問號。