Zhipu AI 26. srpna 2026 potvrdila, že anonymní model Ox Alpha, známý v čínských vývojářských komunitách také jako „Niu Lai“, byl ve skutečnosti GLM 5.3 Flash.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM-5.3-Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM-5.3-Flash: an open-weight, native-multimodal mixture-of-experts model tested anonymously before release. [1][4][6] ## What. Topic tags: general, general web, documentation, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Záhada kolem anonymního modelu Ox Alpha skončila 26. srpna 2026. Zhipu AI, která na mezinárodních trzích vystupuje také pod značkou Z.ai, potvrdila, že Ox Alpha — v čínských vývojářských komunitách známý jako „Niu Lai“ — byl GLM-5.3-Flash, nový otevřený model s dostupnými vahami a nativní multimodální podporou z rodiny GLM. 1
15
Odhalení ale nebylo jen běžným uvedením nového modelu. Zhipu současně zveřejnila tvrzení o rozsáhlém infrastrukturním testu: během anonymního bezplatného provozu na platformách OpenRouter a OpenCode měl systém za pět dní zpracovat více než 50 bilionů tokenů. Veškerou zátěž podle společnosti obsluhoval cluster s více než 100 000 akcelerátory vyrobenými v Číně. 8
15
Ox Alpha se objevil bez loga nebo názvu společnosti. Vývojáři tak model posuzovali především podle kvality odpovědí, rychlosti, dostupnosti a ceny — nikoli podle pověsti jeho tvůrce nebo použitého hardwaru. Model se rychle dostal na přední příčky statistik využití na OpenRouteru i OpenCode.
Pozdější zprávy hovořily o více než 60 bilionech tokenů během šesti dnů. Na OpenRouteru měl Ox Alpha zaznamenat více než dvojnásobné využití oproti srovnatelnému provozu modelů DeepSeek. Čísla se liší podle sledovaného období a metodiky jednotlivých platforem, proto je nejopatrnější závěr tento: test překonal hranici 50 bilionů tokenů a přilákal mimořádně silnou poptávku. 1
3
30
Význam testu spočívá v tom, že šlo o skutečný provoz od globálních vývojářů ještě před odhalením identity modelu. Uživatelé tedy hlasovali svým používáním, ne marketingem Zhipu AI.
Zhipu tvrdí, že online inferenci — tedy samotné generování odpovědí po natrénování modelu — provozovala na více než 100 000 domácích čipech. Díky optimalizaci softwaru se podle společnosti podařilo dostat efektivitu hardwaru i cenu za token na úroveň srovnatelnou s běžně používanými GPU od Nvidie. 15
24
Přesné dodavatele společnost ve zdrojích citovaných v tomto článku neuvedla. V průmyslovém zpravodajství se jako možné účastnící objevily firmy Huawei, Moore Threads a Hygon, jejich zapojení však zůstává neověřené a nelze je vydávat za potvrzení od Zhipu AI. 30
40
Tvrzení je navíc třeba chápat úzce. Neznamená, že čínské čipy obecně dosáhly stejné úrovně jako Nvidia, že vytlačily hardware Nvidie z trénování modelů nebo že oba ekosystémy nabízejí srovnatelné nástroje pro vývojáře. Ukazuje konkrétnější věc: rozsáhlá inferenční služba může fungovat na ne-nvidia domácí infrastruktuře, pokud se model, obslužný software a hardware optimalizují společně.
Kontextové okno o velikosti jednoho milionu tokenů klade vysoké nároky na paměť, propustnost, komunikaci mezi čipy i plánování úloh. Zhipu proto na frameworku SGLang vybudovala specializovaný inferenční engine a použila několik technik:
Zhipu uvedla, že tato řešení zvýšila celkový výkon služby přibližně trojnásobně oproti počáteční základní konfiguraci na stejném hardwaru. 24
26 Pozdější dokumentace SGLang uvádí další zlepšení propustnosti a kapacity cache při použití FP8 ve srovnání s konfigurací BF16. Nejde však o nezávislý audit původního tvrzení Zhipu o trojnásobném zvýšení výkonu.
17
Pro Nvidii z toho plyne především otázka další role CUDA v inferenci, nikoli okamžitý konec jejího širšího náskoku. Specializované kernely, kvantizace, paralelní zpracování a plánování mohou u některých produkčních úloh snížit závislost na CUDA. Ekosystém nástrojů Nvidie, její instalovaná základna, vývojářská komunita a pozice v trénování modelů jsou ale samostatné výhody, které toto uvedení nevyřešilo.
GLM-5.3-Flash je uváděn jako řídký model typu mixture of experts s celkem 320 miliardami parametrů. Při zpracování jednoho tokenu se aktivuje přibližně 18 miliard parametrů, což může snižovat výpočetní náročnost oproti modelu, který by při každém kroku používal celý svůj parametrický objem.
Model podporuje kontext o velikosti 1 048 576 tokenů a nativní multimodální vstup. Je tak zaměřen mimo jiné na dlouhé dokumenty, programování a dlouhodobé úlohy agentů, které musí pracovat s rozsáhlým kontextem. 2
5
7
V indexu Artificial Analysis Intelligence Index získal podle dostupných zpráv skóre 57, stejně jako Claude Opus 4.8. Jde o shodu v jednom souhrnném indexu, nikoli o důkaz shodného výkonu ve všech dílčích benchmarcích, aplikacích nebo agentních úlohách. 9
Zhipu uvádí API cenu 0,15 dolaru za milion vstupních tokenů a 0,50 dolaru za milion výstupních tokenů. 4
29 Současné zprávy model popisovaly jako přibližně desetkrát levnější než GLM-5.3 a zhruba čtyřicetkrát levnější než Claude Opus 4.8. Takové poměry se však mohou měnit podle toho, zda se porovnává vstup, výstup, cenová úroveň nebo konkrétní tarif.
1
4
GLM-5.3-Flash nepředstavuje důkaz, že Zhipu AI vyřešila všechny limity čínského hardwaru nebo že Nvidia přišla o svůj technologický náskok. Jeho význam je praktičtější.
Model spojil řídkou architekturu s relativně nízkou cenou a agresivní optimalizací inferenčního provozu. Anonymní test pak ukázal, že tato kombinace dokáže přitáhnout masivní poptávku ještě předtím, než uživatelé vědí, kdo za ní stojí.
Pro odvětví je to důležitý signál: konkurence se nemusí rozhodovat pouze na úrovni nejvýkonnějšího čipu. Stále větší roli hraje společný návrh modelu, inferenčního enginu a celé hardwarové infrastruktury.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI 26. srpna 2026 potvrdila, že anonymní model Ox Alpha, známý v čínských vývojářských komunitách také jako „Niu Lai“, byl ve skutečnosti GLM 5.3 Flash.
Zhipu AI 26. srpna 2026 potvrdila, že anonymní model Ox Alpha, známý v čínských vývojářských komunitách také jako „Niu Lai“, byl ve skutečnosti GLM 5.3 Flash. GLM 5.3 Flash je řídký model typu mixture of experts s celkem 320 miliardami parametrů, z nichž se při zpracování každého tokenu aktivuje přibližně 18 miliard.
Nejdůležitější není důkaz, že čínské čipy obecně překonaly Nvidia. Významnější je ukázka, že pečlivě optimalizovaný model a inferenční software mohou ve velkém provozu učinit ne nvidia infrastrukturu životaschopnou.