Na bezplatný preview byly inzerované parametry poměrně ambiciózní:
Přístup nabízel také OpenCode ve svém bezplatném tarifu. Jeho oznámení slibovalo velkorysé limity a „téměř neomezené používání“ s údajnou kapacitou 100 bilionů tokenů denně. Jde o tvrzení provozovatele, nikoli o nezávisle auditované měření propustnosti.
Vývojář Ben Davis otestoval Ox Alpha na 10 úlohách vybraných z benchmarku DeepSWE pro softwarové inženýrství. Model podle zveřejněných výsledků zvládl osm z nich, což odpovídá přibližně 80 %. Ve stejném omezeném srovnání dosáhl Claude Fable 5 skóre 65 % a GPT-5.6 Sol 52 %.
Výsledek je bezpochyby pozoruhodný, nelze ho ale popisovat jako oficiální vítězství v DeepSWE. Verze DeepSWE v1.1 obsahuje 113 původních úloh s dlouhým řešením napříč 91 repozitáři, takže Davisův experiment pokryl jen malou část benchmarku.
Důležitá jsou i další metodologická omezení:
Ve veřejném výřezu žebříčku dostupném v dané době vedl Claude Opus 5 se 73,6 %, následovaný GPT-5.6 Solem s 72,7 % a Claude Fable 5 se 69,7 %. Opatrný závěr tedy zní: Ox Alpha vypadal v Davisově testu deseti úloh velmi silně, ale výsledek nepotvrzuje, že šlo o nejlepší univerzální model pro programování.
Nejčastější teorie spojuje Ox Alpha se společností Zhipu AI, respektive Z.ai, a její modelovou rodinou GLM. Neopírá se o oznámení firmy, ale o analýzu takzvaných behaviorálních a technických otisků.
V jednom z popisovaných testů se porovnávalo chování tokenizace Ox Alpha a GLM-5.3 na 25 promyšlených zadáních. Po započtení konstantního obalu o 75 tokenech měly být výsledné počty tokenů shodné. Samostatné testy videa údajně odhalily shody v práci s vizuálními tokeny, včetně vzorkování snímků, přepočtu podle délky videa a zpracování rozlišení.
Další uváděné podobnosti se týkají stylu odpovědí, chování API a způsobu, jakým model reaguje na zvukový vstup. Každá z těchto indicií by sama o sobě mohla být vysvětlena společným obalem, stejnou infrastrukturou nebo napodobováním. Podle analytiků však jejich kombinace vytváří přesvědčivější vzorec odpovídající jednotné multimodální řadě GLM od Zhipu.
Do kontextu zapadá také dřívější používání anonymních či stealth vydání společností Zhipu, například pod označením Pony Alpha. Ani to ale nedokazuje, že Ox Alpha vytvořila právě Zhipu.
V období popsaném ve zprávách se k Ox Alpha veřejně nepřihlásila žádná společnost a Zhipu původ modelu nepotvrdila. Spekulovalo se o konkrétních variantách GLM, dostupné důkazy však neříkají, zda jde o dosud nevydaný model, produkční variantu, doladěný systém, nebo samostatně provozovaný model využívající související infrastrukturu.
Obhajitelné označení proto zní: Ox Alpha pravděpodobně vychází z GLM a může být spojeno se Zhipu, jeho tvůrce ani přesná identita modelu však nebyli ověřeni. Procenta důvěry, která zveřejnili jednotliví analytici, nelze zaměňovat za oficiální identifikaci.
Pro vývojáře je jedním z nejdůležitějších praktických detailů politika uchovávání dat. Profil Ox Alpha na OpenRouteru uváděl, že prompty a dokončené odpovědi uchovává poskytovatel modelu, nepoužívá je však k trénování.
To není totéž jako obecná politika OpenRouteru. Ta říká, že OpenRouter sám prompty ani odpovědi neukládá, pokud uživatel výslovně nepovolí logování vstupů a výstupů. OpenRouter zároveň popisuje pravidla jednotlivých poskytovatelů samostatně, takže směrovací vrstva a poskytovatel modelu mohou mít odlišné podmínky uchovávání.
OpenCode mezitím propagoval Ox Alpha jako službu s „nulovým uchováváním dat“. Tento slib může popisovat vlastní zpracování požadavků v OpenCode, automaticky však neruší informaci o uchovávání dat poskytovatelem, který obsluhuje trasu přes OpenRouter. Jinými slovy, tvrzení „OpenCode data neuchovává“ a „poskytovatel modelu prompty a odpovědi uchovává“ mohou popisovat různé části stejného požadavku.
Dokud poskytovatelé nezveřejní jednotnou a smluvně jednoznačnou politiku zpracování dat, je rozumné předpokládat, že poskytovatel modelu může odeslaný obsah uchovávat. Vývojáři by proto neměli do služby posílat proprietární zdrojový kód, přístupové údaje, osobní data ani regulované informace jen proto, že je bezplatná nebo tvrdí, že prompty nepoužívá k trénování.
Ox Alpha zaujalo třemi věcmi: krátkým bezplatným preview, mimořádně velkým kontextem s multimodálními schopnostmi a překvapivě dobrým prvním výsledkem v programování. Dostupné důkazy ale podporují střízlivější výklad než tvrzení, že neznámá laboratoř definitivně porazila zavedené špičkové modely.
Skóre 80 % v DeepSWE vzniklo z osmi úspěšných úloh z deseti, nikoli z celého benchmarku o 113 úlohách. Veřejný žebříček stále uváděl na prvním místě Claude Opus 5 a Ox Alpha neprošel oficiálním evaluačním procesem.
Technické otisky činí ze spojení se Zhipu a rodinou GLM nejpravděpodobnější vysvětlení, veřejné potvrzení autorství však chybělo. Pro experimentování byl Ox Alpha zajímavou novinkou. Pro produkční systémy nebo citlivý kód ale anonymní vlastnictví, uchovávání dat na úrovni poskytovatele a nevyjasněný původ představovaly důvod k opatrnosti.
Na bezplatný preview byly inzerované parametry poměrně ambiciózní:
Přístup nabízel také OpenCode ve svém bezplatném tarifu. Jeho oznámení slibovalo velkorysé limity a „téměř neomezené používání“ s údajnou kapacitou 100 bilionů tokenů denně. Jde o tvrzení provozovatele, nikoli o nezávisle auditované měření propustnosti.
Vývojář Ben Davis otestoval Ox Alpha na 10 úlohách vybraných z benchmarku DeepSWE pro softwarové inženýrství. Model podle zveřejněných výsledků zvládl osm z nich, což odpovídá přibližně 80 %. Ve stejném omezeném srovnání dosáhl Claude Fable 5 skóre 65 % a GPT-5.6 Sol 52 %.
Výsledek je bezpochyby pozoruhodný, nelze ho ale popisovat jako oficiální vítězství v DeepSWE. Verze DeepSWE v1.1 obsahuje 113 původních úloh s dlouhým řešením napříč 91 repozitáři, takže Davisův experiment pokryl jen malou část benchmarku.
Důležitá jsou i další metodologická omezení:
Ve veřejném výřezu žebříčku dostupném v dané době vedl Claude Opus 5 se 73,6 %, následovaný GPT-5.6 Solem s 72,7 % a Claude Fable 5 se 69,7 %. Opatrný závěr tedy zní: Ox Alpha vypadal v Davisově testu deseti úloh velmi silně, ale výsledek nepotvrzuje, že šlo o nejlepší univerzální model pro programování.
Nejčastější teorie spojuje Ox Alpha se společností Zhipu AI, respektive Z.ai, a její modelovou rodinou GLM. Neopírá se o oznámení firmy, ale o analýzu takzvaných behaviorálních a technických otisků.
V jednom z popisovaných testů se porovnávalo chování tokenizace Ox Alpha a GLM-5.3 na 25 promyšlených zadáních. Po započtení konstantního obalu o 75 tokenech měly být výsledné počty tokenů shodné. Samostatné testy videa údajně odhalily shody v práci s vizuálními tokeny, včetně vzorkování snímků, přepočtu podle délky videa a zpracování rozlišení.
Další uváděné podobnosti se týkají stylu odpovědí, chování API a způsobu, jakým model reaguje na zvukový vstup. Každá z těchto indicií by sama o sobě mohla být vysvětlena společným obalem, stejnou infrastrukturou nebo napodobováním. Podle analytiků však jejich kombinace vytváří přesvědčivější vzorec odpovídající jednotné multimodální řadě GLM od Zhipu.
Do kontextu zapadá také dřívější používání anonymních či stealth vydání společností Zhipu, například pod označením Pony Alpha. Ani to ale nedokazuje, že Ox Alpha vytvořila právě Zhipu.
V období popsaném ve zprávách se k Ox Alpha veřejně nepřihlásila žádná společnost a Zhipu původ modelu nepotvrdila. Spekulovalo se o konkrétních variantách GLM, dostupné důkazy však neříkají, zda jde o dosud nevydaný model, produkční variantu, doladěný systém, nebo samostatně provozovaný model využívající související infrastrukturu.
Obhajitelné označení proto zní: Ox Alpha pravděpodobně vychází z GLM a může být spojeno se Zhipu, jeho tvůrce ani přesná identita modelu však nebyli ověřeni. Procenta důvěry, která zveřejnili jednotliví analytici, nelze zaměňovat za oficiální identifikaci.
Pro vývojáře je jedním z nejdůležitějších praktických detailů politika uchovávání dat. Profil Ox Alpha na OpenRouteru uváděl, že prompty a dokončené odpovědi uchovává poskytovatel modelu, nepoužívá je však k trénování.
To není totéž jako obecná politika OpenRouteru. Ta říká, že OpenRouter sám prompty ani odpovědi neukládá, pokud uživatel výslovně nepovolí logování vstupů a výstupů. OpenRouter zároveň popisuje pravidla jednotlivých poskytovatelů samostatně, takže směrovací vrstva a poskytovatel modelu mohou mít odlišné podmínky uchovávání.
OpenCode mezitím propagoval Ox Alpha jako službu s „nulovým uchováváním dat“. Tento slib může popisovat vlastní zpracování požadavků v OpenCode, automaticky však neruší informaci o uchovávání dat poskytovatelem, který obsluhuje trasu přes OpenRouter. Jinými slovy, tvrzení „OpenCode data neuchovává“ a „poskytovatel modelu prompty a odpovědi uchovává“ mohou popisovat různé části stejného požadavku.
Dokud poskytovatelé nezveřejní jednotnou a smluvně jednoznačnou politiku zpracování dat, je rozumné předpokládat, že poskytovatel modelu může odeslaný obsah uchovávat. Vývojáři by proto neměli do služby posílat proprietární zdrojový kód, přístupové údaje, osobní data ani regulované informace jen proto, že je bezplatná nebo tvrdí, že prompty nepoužívá k trénování.
Ox Alpha zaujalo třemi věcmi: krátkým bezplatným preview, mimořádně velkým kontextem s multimodálními schopnostmi a překvapivě dobrým prvním výsledkem v programování. Dostupné důkazy ale podporují střízlivější výklad než tvrzení, že neznámá laboratoř definitivně porazila zavedené špičkové modely.
Skóre 80 % v DeepSWE vzniklo z osmi úspěšných úloh z deseti, nikoli z celého benchmarku o 113 úlohách. Veřejný žebříček stále uváděl na prvním místě Claude Opus 5 a Ox Alpha neprošel oficiálním evaluačním procesem.
Technické otisky činí ze spojení se Zhipu a rodinou GLM nejpravděpodobnější vysvětlení, veřejné potvrzení autorství však chybělo. Pro experimentování byl Ox Alpha zajímavou novinkou. Pro produkční systémy nebo citlivý kód ale anonymní vlastnictví, uchovávání dat na úrovni poskytovatele a nevyjasněný původ představovaly důvod k opatrnosti.