Het probleem? Wang maakte niet bekend welke benchmarks werden gebruikt, waardoor de bewering niet te verifiëren is . Zonder te weten of Watermelon GPT-5.5 evenaarde op codeerbenchmarks (waar Meta's Muse Spark slechts 59,0 scoorde op Terminal-Bench tegenover GPT-5.4's 75,1), PhD-niveau redeneertests zoals GPQA Diamond (waar Muse Spark 89,5% scoorde), of algemeen taalbegrip, is de vergelijking onvolledig
.
OpenAI bracht GPT-5.5 uit op 23 april 2026, waarna het meteen de top van de Artificial Analysis Intelligence Index bereikte . Maar tegen de tijd dat Wang zijn uitspraak deed, had OpenAI op 26 juni 2026 al GPT-5.6 gelanceerd — een familie van drie modellen (Sol, Terra, Luna) waarbij het vlaggenschip Sol een nieuwe state of the art neerzette op Terminal-Bench 2.1 met 88,8% (en 91,9% in de Ultra-configuratie)
.
Dit betekent dat Watermelon mikte op een model dat niet langer de frontier is. OpenAI's cadans — GPT-5.4 op 5 maart, GPT-5.5 op 23 april, GPT-5.6 op 26 juni — suggereert een iteratiecyclus van ongeveer zes weken . Tegen de tijd dat Watermelon uitkomt, is OpenAI mogelijk al bij GPT-5.7 of verder.
Watermelon's optimistische claim komt tegen de achtergrond van Meta's worstelingen met zijn voorganger. Avocado — Meta's eerste grote model van het gereorganiseerde Superintelligence Lab — werd vertraagd van maart 2026 tot ten minste mei 2026 nadat interne tests uitwezen dat het achterbleef bij Google's Gemini 3.0, OpenAI's GPT-5.4 en de nieuwste modellen van Anthropic op het gebied van redeneren, coderen en schrijven . Een rapport gaf zelfs aan dat Meta overwoog om tijdelijk Google's Gemini in te licentiëren als back-up
.
Muse Spark (Avocado's openbare naam) werd uiteindelijk gelanceerd, maar eindigde op de vierde plaats wereldwijd achter Gemini 3.1 Pro, GPT-5.4 en Claude Opus 4.6 op de Artificial Analysis Intelligence Index, met een score van 52 uit 100 . Het excelleerde op medische en wetenschappelijke benchmarks (42,8% op HealthBench Hard, beste in zijn klasse) maar worstelde met coderen (59,0 op Terminal-Bench) en abstract redeneren (42,5 op ARC AGI 2)
.
Zuckerberg heeft zwaar ingezet op AI-infrastructuur. Meta's Superintelligence Lab zou naar verluidt 14,3 miljard dollar hebben uitgegeven aan zijn eerste grote model (Muse Spark) . Wangs opmerking dat Watermelon 'een orde van grootte meer rekenkracht' gebruikt dan Avocado
suggereert dat Meta bereid is enorme middelen in te zetten om de achterstand in te halen
.
Echter, op dezelfde dag dat Wangs optimistische bewering naar buiten kwam, uitte Mark Zuckerberg naar verluidt zijn bezorgdheid dat de AI-vooruitgang vertraagde, wat een gemengd intern signaal geeft over Meta's koers . De spanning tussen Wangs optimisme en Zuckerbergs voorzichtigheid benadrukt de onzekerheid over of alleen het opschalen van rekenkracht de kloof met OpenAI's snellere iteratietempo zal dichten.
OpenAI's GPT-5.6 Sol is momenteel alleen beschikbaar als een 'beperkte preview' voor geselecteerde partners onder Amerikaanse overheidsrichtlijnen . Dit betekent dat de volledige mogelijkheden misschien niet snel worden gecommercialiseerd, maar het stelt wel een hogere prestatielat dan GPT-5.5
. Sol's Terminal-Bench 2.1-score van 88,8% (91,9% Ultra) versus GPT-5.5's 83,4% vertegenwoordigt een significante capaciteitssprong
.
Wangs bewering dat Watermelon GPT-5.5 evenaart, is waarschijnlijk waar op sommige benchmarks, maar het vertegenwoordigt een achteruitkijkspiegel-doelwit. Tegen de tijd dat Watermelon uitkomt, is OpenAI mogelijk al bij GPT-5.7 of verder, en Meta's staat van dienst op het gebied van uitvoeringsvertragingen (Avocado), gecombineerd met enorme kapitaaluitgaven, zorgt voor echte onzekerheid over of alleen het opschalen van rekenkracht de kloof met OpenAI's iteratietempo zal dichten. De echte vraag is niet of Watermelon GPT-5.5 evenaart — het is of Meta de infrastructuurinvestering kan volhouden om gelijke tred te houden met een concurrent die elke zes weken een nieuw frontiermodel uitbrengt.