Zhipu AI 26. srpna 2026 potvrdilo, že anonymní model Ox Alpha, známý v čínské komunitě jako Niu Lai, byl GLM 5.3 Flash – otevřený multimodální model typu mixture of experts.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
Zhipu AI, známé také pod mezinárodní značkou Z.ai, 26. srpna 2026 potvrdilo, že anonymní model Ox Alpha – v čínské komunitě přezdívaný Niu Lai – byl ve skutečnosti GLM-5.3-Flash. Jde o otevřený model s nativní multimodalitou a architekturou mixture-of-experts, který firma před oficiálním uvedením záměrně testovala pod anonymním označením. 1
4
6
Tajemný model se objevil na platformách OpenRouter a OpenCode, kde si ho vývojáři mohli vyzkoušet zdarma. Během pěti dnů měl podle zpráv zpracovat více než 50 bilionů tokenů a pozdější údaje hovořily o více než 60 bilionech za šest dní. Ox Alpha se dostal na první místo žebříčků využití na obou platformách a jeho špičková aktivita údajně přesáhla dvojnásobek srovnatelného provozu modelů DeepSeek. 3
Největší pozornost však nepřitáhla jen popularita modelu. Zhipu uvedlo, že celý testovací provoz běžel na clusteru s více než 100 000 čipy vyrobenými v Číně. Firma tvrdí, že díky optimalizacím softwaru dosáhla efektivity hardwaru a nákladů na jeden token srovnatelných s běžnými GPU Nvidia. 3
6
Konkrétní dodavatele Zhipu nejmenovalo. V médiích se jako možné zdroje zmiňují Huawei, Moore Threads a Hygon, tato informace však zůstává nepotvrzenou spekulací, nikoli oficiálním potvrzením společnosti Zhipu. 40
Tvrzení proto nelze vykládat jako důkaz, že čínský hardware obecně dohnal Nvidia GPU nebo že provoz na domácích čipech je vždy stejně levný. Ukazuje ale, že rozsáhlou zátěž z reálného globálního nasazení lze obsloužit na hardwaru mimo ekosystém Nvidie, pokud je infrastruktura výrazně přizpůsobena konkrétnímu modelu. 3
6
Výsledek je zajímavý také kvůli dominantnímu postavení platformy CUDA, tedy softwarového ekosystému Nvidie pro vývoj a provoz aplikací umělé inteligence. Zkušenost Zhipu naznačuje, že specializované softwarové vrstvy a inference enginy mohou u některých produkčních úloh snížit závislost na CUDA.
Neznamená to však, že CUDA ztratila své širší výhody v oblasti nástrojů, podpory vývojářů, ekosystému nebo trénování modelů. Pro takto silný závěr zatím dostupné důkazy nestačí.
Zhipu údajně postavilo obslužný engine na SGLangu a použilo několik technik určených pro práci s dlouhým kontextem:
Cílem bylo zvládnout nároky na paměť, propustnost, komunikaci a plánování při maximální délce kontextu jeden milion tokenů. 4
7
Zhipu podle dostupných zpráv uvedlo, že tyto úpravy přinesly přibližně trojnásobné zlepšení celkového výkonu služby oproti původnímu výchozímu řešení. Pozdější dokumentace SGLangu uvádí také vyšší propustnost a výrazně větší kapacitu FP8 cache než u srovnávací konfigurace BF16. Nejde však o nezávislý audit původního tvrzení Zhipu o trojnásobném zrychlení. 2
GLM-5.3-Flash má celkem 320 miliard parametrů, ale při zpracování jednotlivých tokenů aktivuje zhruba 18 miliard. Tento řídký model mixture-of-experts tak nemusí při každém kroku využívat celou svou kapacitu. Podporuje kontextové okno o velikosti 1 048 576 tokenů. 5
7
Podle Artificial Analysis Intelligence Indexu získal skóre 57, což odpovídá uváděnému výsledku modelu Claude Opus 4.8. To lze chápat jako shodu na konkrétním souhrnném indexu, nikoli jako důkaz stejného výkonu v každém benchmarku nebo při každém praktickém úkolu s autonomními AI agenty. 1
Model je pozicován proti efektivním modelům nejvyšší výkonnostní třídy, například DeepSeek V4 Flash a Pro, a současně slibuje výrazně nižší cenu inference. Dostupné podklady však nestačí k ověření přesných srovnání mezi jednotlivými benchmarky a oběma variantami DeepSeeku.
Zveřejněná cena API byla uváděna na 0,15 dolaru za milion vstupních tokenů a 0,50 dolaru za milion výstupních tokenů. 1
Současné zprávy ji popisovaly jako přibližně desetinu ceny GLM-5.3 a zhruba čtyřicetinu ceny Claude Opus 4.8. Takové poměry ale závisí na tom, zda se porovnává vstup nebo výstup, jaká délka kontextu se účtuje a podle jakého cenového plánu se postupuje. 1
Odhalení Ox Alpha tak nepřineslo jen jméno nového modelu. Ukázalo také, jak může kombinace řídké architektury, dlouhého kontextu, specializovaného inferenčního softwaru a rozsáhlé infrastruktury změnit ekonomiku provozu velkých jazykových modelů – alespoň u konkrétního nasazení, které Zhipu popsalo.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI 26. srpna 2026 potvrdilo, že anonymní model Ox Alpha, známý v čínské komunitě jako Niu Lai, byl GLM 5.3 Flash – otevřený multimodální model typu mixture of experts.
Zhipu AI 26. srpna 2026 potvrdilo, že anonymní model Ox Alpha, známý v čínské komunitě jako Niu Lai, byl GLM 5.3 Flash – otevřený multimodální model typu mixture of experts. Bezplatné anonymní testování na platformách OpenRouter a OpenCode přilákalo podle dostupných zpráv za pět dní více než 50 bilionů tokenů; za šest dní měl objem překročit 60 bilionů.
Zhipu uvedlo, že provoz zajišťoval cluster s více než 100 000 čínskými čipy. Firma tvrdí, že po optimalizaci softwaru se efektivita hardwaru a náklady na token přiblížily úrovni běžných GPU Nvidia.