De aangekondigde specificaties waren opvallend ruim voor een gratis preview:
Ook OpenCode bood toegang via zijn gratis abonnement. In de aankondiging sprak de dienst over ruime limieten en „bijna onbeperkt gebruik”, met een geclaimde capaciteit van 100 biljoen tokens per dag. Dat is een bewering van de exploitant en geen onafhankelijk gecontroleerde meting van de verwerkingscapaciteit.
Ontwikkelaar Ben Davis testte Ox Alpha op 10 taken uit de DeepSWE-benchmark voor software-engineering. Volgens de resultaten slaagde het model voor acht taken, goed voor ongeveer 80%. In dezelfde beperkte vergelijking kwam Claude Fable 5 uit op 65% en GPT-5.6 Sol op 52%.
Dat resultaat trekt begrijpelijkerwijs de aandacht, maar het mag niet worden gepresenteerd als een officiële DeepSWE-overwinning. DeepSWE v1.1 bestaat uit 113 originele, langdurige software-engineeringtaken verspreid over 91 repositories. De test van 10 taken besloeg dus maar een klein deel van de volledige benchmark.
Er waren bovendien belangrijke methodologische beperkingen:
In de openbare momentopname van het leaderboard stond Claude Opus 5 op de eerste plaats met 73,6%, gevolgd door GPT-5.6 Sol met 72,7% en Claude Fable 5 met 69,7%. De zorgvuldige conclusie is daarom beperkter: Ox Alpha maakte een sterke indruk in Davis’ test met 10 taken, maar daarmee is niet bewezen dat het de beste algemene programmeerassistent was.
De belangrijkste theorie is dat Ox Alpha afkomstig is van Zhipu AI, het bedrijf achter Z.ai en de GLM-modellen. Die theorie is gebaseerd op gedragsanalyse en technische vingerafdrukken, niet op een verklaring van het bedrijf zelf.
Bij een gerapporteerde test werden de tokenisatiepatronen van Ox Alpha en GLM-5.3 vergeleken aan de hand van 25 prompts. De onderliggende aantallen kwamen naar verluidt overeen nadat rekening was gehouden met een vaste wrapper van 75 tokens. Afzonderlijke videotests zouden bovendien vergelijkbaar gedrag hebben laten zien bij het verwerken van visuele tokens, waaronder overeenkomsten in beeldselectie, schaling op basis van de videoduur en de omgang met resoluties.
Andere gemelde overeenkomsten hebben betrekking op de schrijfstijl van antwoorden, API-gedrag en de manier waarop het model omgaat met audio-invoer. Elk afzonderlijk signaal kan ook worden verklaard door een gedeelde wrapper, gemeenschappelijke infrastructuur of imitatie. Volgens analisten vormt de combinatie echter een sterker patroon dat past bij Zhipu’s multimodale GLM-lijn.
Dat Zhipu eerder anonieme of stealth-achtige releases gebruikte, waaronder de naam Pony Alpha, geeft de theorie extra context. Het bewijst niet dat Zhipu Ox Alpha heeft gemaakt.
In de periode waarop de berichten betrekking hebben, had geen enkel bedrijf publiekelijk het eigendom van Ox Alpha opgeëist. Ook Zhipu had de toeschrijving niet bevestigd. Er is gespeculeerd over specifieke GLM-varianten, maar de beschikbare informatie maakt niet duidelijk of Ox Alpha een nog niet uitgebracht model, een productievariant, een fijn-afgesteld systeem of een zelfstandig geëxploiteerd model met vergelijkbare infrastructuur is.
De verdedigbare omschrijving luidt daarom: Ox Alpha is waarschijnlijk gebaseerd op GLM en kan verbonden zijn met Zhipu, maar de maker en de exacte modelidentiteit waren niet geverifieerd. Percentages die individuele analisten aan hun inschatting koppelden, moeten niet worden opgevat als een officiële identificatie.
De privacyvoorwaarden van Ox Alpha zijn voor ontwikkelaars misschien wel belangrijker dan de opvallende benchmarkscore. Op de OpenRouter-pagina stond dat prompts en antwoorden door de onderliggende provider worden bewaard, maar niet voor training worden gebruikt.
Dat is iets anders dan het algemene beleid van OpenRouter. Volgens dat beleid bewaart OpenRouter zelf geen prompts of antwoorden, tenzij gebruikers vrijwillig invoer- en uitvoerlogboeken inschakelen. OpenRouter documenteert het beleid van afzonderlijke providers apart. De routeringslaag en de aanbieder van het model kunnen dus verschillende regels voor gegevensretentie hanteren.
OpenCode adverteerde Ox Alpha ondertussen met „zero data retention”, oftewel nul gegevensretentie. Die belofte kan betrekking hebben op de eigen verwerking door OpenCode, maar heft de verklaring over retentie door de provider achter de OpenRouter-route niet automatisch op. Anders gezegd: „OpenCode bewaart geen gegevens” en „de onderliggende modelprovider bewaart prompts en antwoorden” kunnen betrekking hebben op verschillende stappen in dezelfde aanvraagroute.
Zolang de providers geen één, contractueel helder beleid voor gegevensverwerking publiceren, is het verstandig ervan uit te gaan dat de modelprovider ingestuurde inhoud kan bewaren. Stuur daarom niet zomaar bedrijfseigen broncode, wachtwoorden, persoonsgegevens of gereguleerde informatie naar een dienst alleen omdat die gratis is of zegt prompts niet voor training te gebruiken.
Ox Alpha viel om drie redenen op: een gratis preview voor korte tijd, een uitzonderlijk groot contextvenster met multimodale mogelijkheden en een opvallend vroege score bij programmeertaken. Toch rechtvaardigt het beschikbare bewijs geen stellige claim dat een onbekend laboratorium de gevestigde frontiermodellen definitief heeft verslagen.
De DeepSWE-score van 80% kwam uit acht geslaagde taken op een totaal van 10, niet uit de volledige benchmark van 113 taken. Op het openbare leaderboard stond Claude Opus 5 nog bovenaan en Ox Alpha had het officiële evaluatieproces niet doorlopen.
De technische vingerafdrukken maken een verbinding met Zhipu en GLM de meest waarschijnlijke verklaring, maar er is geen openbare bevestiging van het auteurschap. Voor experimenten was Ox Alpha een interessant model om uit te proberen. Voor productiesystemen of gevoelige code waren het anonieme eigenaarschap, de retentieregels van de provider en de onopgeloste identiteit duidelijke redenen om voorzichtig te werk te gaan.
De aangekondigde specificaties waren opvallend ruim voor een gratis preview:
Ook OpenCode bood toegang via zijn gratis abonnement. In de aankondiging sprak de dienst over ruime limieten en „bijna onbeperkt gebruik”, met een geclaimde capaciteit van 100 biljoen tokens per dag. Dat is een bewering van de exploitant en geen onafhankelijk gecontroleerde meting van de verwerkingscapaciteit.
Ontwikkelaar Ben Davis testte Ox Alpha op 10 taken uit de DeepSWE-benchmark voor software-engineering. Volgens de resultaten slaagde het model voor acht taken, goed voor ongeveer 80%. In dezelfde beperkte vergelijking kwam Claude Fable 5 uit op 65% en GPT-5.6 Sol op 52%.
Dat resultaat trekt begrijpelijkerwijs de aandacht, maar het mag niet worden gepresenteerd als een officiële DeepSWE-overwinning. DeepSWE v1.1 bestaat uit 113 originele, langdurige software-engineeringtaken verspreid over 91 repositories. De test van 10 taken besloeg dus maar een klein deel van de volledige benchmark.
Er waren bovendien belangrijke methodologische beperkingen:
In de openbare momentopname van het leaderboard stond Claude Opus 5 op de eerste plaats met 73,6%, gevolgd door GPT-5.6 Sol met 72,7% en Claude Fable 5 met 69,7%. De zorgvuldige conclusie is daarom beperkter: Ox Alpha maakte een sterke indruk in Davis’ test met 10 taken, maar daarmee is niet bewezen dat het de beste algemene programmeerassistent was.
De belangrijkste theorie is dat Ox Alpha afkomstig is van Zhipu AI, het bedrijf achter Z.ai en de GLM-modellen. Die theorie is gebaseerd op gedragsanalyse en technische vingerafdrukken, niet op een verklaring van het bedrijf zelf.
Bij een gerapporteerde test werden de tokenisatiepatronen van Ox Alpha en GLM-5.3 vergeleken aan de hand van 25 prompts. De onderliggende aantallen kwamen naar verluidt overeen nadat rekening was gehouden met een vaste wrapper van 75 tokens. Afzonderlijke videotests zouden bovendien vergelijkbaar gedrag hebben laten zien bij het verwerken van visuele tokens, waaronder overeenkomsten in beeldselectie, schaling op basis van de videoduur en de omgang met resoluties.
Andere gemelde overeenkomsten hebben betrekking op de schrijfstijl van antwoorden, API-gedrag en de manier waarop het model omgaat met audio-invoer. Elk afzonderlijk signaal kan ook worden verklaard door een gedeelde wrapper, gemeenschappelijke infrastructuur of imitatie. Volgens analisten vormt de combinatie echter een sterker patroon dat past bij Zhipu’s multimodale GLM-lijn.
Dat Zhipu eerder anonieme of stealth-achtige releases gebruikte, waaronder de naam Pony Alpha, geeft de theorie extra context. Het bewijst niet dat Zhipu Ox Alpha heeft gemaakt.
In de periode waarop de berichten betrekking hebben, had geen enkel bedrijf publiekelijk het eigendom van Ox Alpha opgeëist. Ook Zhipu had de toeschrijving niet bevestigd. Er is gespeculeerd over specifieke GLM-varianten, maar de beschikbare informatie maakt niet duidelijk of Ox Alpha een nog niet uitgebracht model, een productievariant, een fijn-afgesteld systeem of een zelfstandig geëxploiteerd model met vergelijkbare infrastructuur is.
De verdedigbare omschrijving luidt daarom: Ox Alpha is waarschijnlijk gebaseerd op GLM en kan verbonden zijn met Zhipu, maar de maker en de exacte modelidentiteit waren niet geverifieerd. Percentages die individuele analisten aan hun inschatting koppelden, moeten niet worden opgevat als een officiële identificatie.
De privacyvoorwaarden van Ox Alpha zijn voor ontwikkelaars misschien wel belangrijker dan de opvallende benchmarkscore. Op de OpenRouter-pagina stond dat prompts en antwoorden door de onderliggende provider worden bewaard, maar niet voor training worden gebruikt.
Dat is iets anders dan het algemene beleid van OpenRouter. Volgens dat beleid bewaart OpenRouter zelf geen prompts of antwoorden, tenzij gebruikers vrijwillig invoer- en uitvoerlogboeken inschakelen. OpenRouter documenteert het beleid van afzonderlijke providers apart. De routeringslaag en de aanbieder van het model kunnen dus verschillende regels voor gegevensretentie hanteren.
OpenCode adverteerde Ox Alpha ondertussen met „zero data retention”, oftewel nul gegevensretentie. Die belofte kan betrekking hebben op de eigen verwerking door OpenCode, maar heft de verklaring over retentie door de provider achter de OpenRouter-route niet automatisch op. Anders gezegd: „OpenCode bewaart geen gegevens” en „de onderliggende modelprovider bewaart prompts en antwoorden” kunnen betrekking hebben op verschillende stappen in dezelfde aanvraagroute.
Zolang de providers geen één, contractueel helder beleid voor gegevensverwerking publiceren, is het verstandig ervan uit te gaan dat de modelprovider ingestuurde inhoud kan bewaren. Stuur daarom niet zomaar bedrijfseigen broncode, wachtwoorden, persoonsgegevens of gereguleerde informatie naar een dienst alleen omdat die gratis is of zegt prompts niet voor training te gebruiken.
Ox Alpha viel om drie redenen op: een gratis preview voor korte tijd, een uitzonderlijk groot contextvenster met multimodale mogelijkheden en een opvallend vroege score bij programmeertaken. Toch rechtvaardigt het beschikbare bewijs geen stellige claim dat een onbekend laboratorium de gevestigde frontiermodellen definitief heeft verslagen.
De DeepSWE-score van 80% kwam uit acht geslaagde taken op een totaal van 10, niet uit de volledige benchmark van 113 taken. Op het openbare leaderboard stond Claude Opus 5 nog bovenaan en Ox Alpha had het officiële evaluatieproces niet doorlopen.
De technische vingerafdrukken maken een verbinding met Zhipu en GLM de meest waarschijnlijke verklaring, maar er is geen openbare bevestiging van het auteurschap. Voor experimenten was Ox Alpha een interessant model om uit te proberen. Voor productiesystemen of gevoelige code waren het anonieme eigenaarschap, de retentieregels van de provider en de onopgeloste identiteit duidelijke redenen om voorzichtig te werk te gaan.