Ox Alpha byl model GLM 5.3 Flash od společnosti Zhipu AI, což firma potvrdila 26. Model cílí na programování, vizuální práci, dlouhé kontexty a agentní úlohy.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash je model, který se nejprve objevil pod anonymním označením Ox Alpha. Bez uvedení výrobce byl 20. srpna 2026 zpřístupněn na OpenRouteru a v dalších nástrojích pro vývojáře. O šest dní později Zhipu AI, která na mezinárodních trzích používá značku Z.ai, potvrdila, že šlo o její nový model. 3
4
Z týdenní záhady se tak stal významný přírůstek do světa otevřených modelů: systém typu mixture-of-experts (MoE) s celkem 320 miliardami parametrů, z nichž se při zpracování každého tokenu aktivuje 18 miliard. Nabízí přibližně milionový kontext, nativní multimodální vstupy a váhy vydané pod licencí MIT. 3
6
8
Ox Alpha se objevil bez veřejné karty modelu, jména výrobce i podrobné technické dokumentace. Vývojáři dostali k dispozici bezplatný endpoint s dlouhým kontextem a podporou multimodálních vstupů. Brzy jej začali zkoušet při programování a v pracovních postupech s AI agenty. Praktické výsledky vyvolaly spekulace, která laboratoř za modelem stojí. 13
16
Zhipu později uvedla, že anonymita byla záměrná. Firma chtěla, aby vývojáři hodnotili výstupy podle jejich kvality, nikoli podle známého jména, počtu parametrů nebo marketingu kolem uvedení. Provoz v reálných podmínkách jí zároveň poskytl data a zpětnou vazbu z programátorských a agentních úloh ještě před oficiálním představením. 13
15
Během testu se hovořilo o bezplatné kapacitě kolem 100 bilionů tokenů denně. Mezi známé vývojáře, kteří měli model chválit, patřil také spoluzakladatel společnosti Stripe Patrick Collison. Takové reakce pomohly z anonymního endpointu udělat sledované uvedení na trh — veřejné nadšení ale nelze zaměňovat za kontrolované srovnávací testování. 13
14
Zhipu také uvedla, že služba běžela na čínských AI akcelerátorech. South China Morning Post informoval o clusteru 100 000 čipů domácí výroby a o 62 bilionech tokenů zpracovaných před oficiálním vydáním. Čísla se mezi jednotlivými zprávami liší, proto je vhodné chápat je jako údaje uváděné firmou či médii, nikoli jako nezávisle auditovaná měření. 7
13
GLM-5.3-Flash používá architekturu mixture-of-experts, tedy směs expertních podsítí. Celkový počet parametrů činí 320 miliard, ale pro každý token se aktivuje pouze 18 miliard. Cílem je spojit kapacitu velmi rozsáhlého modelu s nižší výpočetní náročností při jednotlivém kroku inference. 3
4
Model má 45 vrstev a Zhipu jej označuje za první nativně multimodální model řady GLM-5. Je navržen pro práci s textem, obrázky, videem, vizuálními dokumenty, soubory i kombinovanými multimodálními vstupy. To je důležité například pro agenta, který musí současně prohlížet rozhraní, vyhodnotit screenshot, číst dokument nebo kontrolovat výsledek spuštěného kódu. 4
11
Výrobce uvádí kontextové okno o velikosti 1 048 576 tokenů, běžně zaokrouhlované na jeden milion tokenů. Taková kapacita se hodí pro rozsáhlé repozitáře, dlouhé relace s agentem, velké soubory dokumentů nebo pracovní postupy kombinující kód s obrazovými a souborovými vstupy. 3
4
Model byl trénován od nového základu s přepracovanou architekturou i tréninkovým postupem. Zhipu uvádí multimodální korpus o velikosti 30 bilionů tokenů. GLM-5.3-Flash tak není prezentován pouze jako zmenšená verze GLM-5.3, ale jako nový model postavený kolem efektivity a multimodálních schopností. 4
16
GLM-5.3-Flash kombinuje lineární a řídkou pozornost. Lineární pozornost má zlevnit zpracování dlouhých sekvencí, zatímco řídká pozornost zachovává přesnější interakce tam, kde jsou nejdůležitější. Výsledkem má být kompromis mezi dlouhým kontextem a zvládnutelnými náklady na inference. 4
16
Zhipu dále popisuje mechanismus IndexPool, který má při dlouhých kontextech snižovat paměťovou a latencí způsobenou indexováním. Architektura využívá také manifold-constrained hyper-connections jako další techniku pro efektivnější škálování. Skutečný přínos těchto metod však závisí na hardwaru, konfiguraci nasazení, délce sekvence i konkrétní pracovní zátěži. 4
16
Ve srovnání s GLM-5.3 Zhipu tvrdí, že GLM-5.3-Flash snižuje výpočetní náročnost pozornosti 3,01krát a využití KV cache 4,44krát, přičemž má zachovat kvalitu práce s dlouhým kontextem. Pro vývojáře jsou to podstatné údaje: právě výpočet pozornosti a paměť pro KV cache často představují úzké hrdlo dlouho běžících agentů. Jde však především o výsledky z technických materiálů výrobce, nikoli o univerzálně ověřené zrychlení. 4
Model míří především na programování, vizuální programování, dlouhé agentní úlohy a práci s nástroji. Nativní vizuální schopnosti mají agentovi umožnit sledovat rozhraní, výsledky vykreslování a zpětnou vazbu z interakcí. Tím vzniká uzavřená smyčka mezi kódem, prohlížečem a grafickým uživatelským rozhraním. 4
Zhipu uvádí tyto výsledky:
Výsledky odpovídají zaměření modelu na softwarové inženýrství a AI agenty. Při srovnávání je ale nutná opatrnost: agentní benchmarky citlivě reagují na použité prompty, nástroje, podpůrný kód, hardware, časové limity i verzi evaluace. Publikovaná čísla je proto nejlepší chápat jako výsledky uváděné společností Zhipu, nikoli jako definitivní žebříček všech konkurenčních modelů. 4
15
Zhipu zveřejnila váhy GLM-5.3-Flash na platformě Hugging Face pod permisivní licencí MIT, včetně vydání ve formátu BF16. Dokumentace uvádí podporu serverovacích frameworků SGLang a vLLM. Organizace tak mají možnost model provozovat lokálně nebo ve vlastní infrastruktuře a nejsou odkázány pouze na hostované API Z.ai. 3
6
8
Otevřenost mění praktické možnosti testování. Vývojáři mohou model zkoušet na vlastních repozitářích, dokumentech, vizuálních rozhraních a agentních prostředích. Týmy spravující infrastrukturu mohou přímo prověřit náklady na provoz i hardwarové nároky.
Celkových 320 miliard parametrů ale stále znamená náročný infrastrukturní projekt. Aktivace 18 miliard parametrů na token snižuje výpočetní práci, neznamená však, že celý checkpoint lze bez dalšího provozovat na běžném počítači. 3
6
Experiment s Ox Alpha nebyl jen marketingový trik. Zhipu si ověřila, zda budou vývojáři model používat i ve chvíli, kdy neznají jeho název, velikost ani původ. Firma tak získala skutečné pracovní zátěže a reakce uživatelů ještě před oficiálním odhalením. 13
15
Test měl zároveň zjevná omezení. Bezplatný přístup mohl přilákat neobvykle velký provoz, veřejná chvála mohla souviset s novinkou a anonymní zkoušení nekontrolovalo prompty ani podmínky porovnání s jinými systémy. Nejstřízlivější závěr tedy zní: GLM-5.3-Flash vyvolal značný zájem vývojářů ještě před odhalením identity a Zhipu tento zájem využila k ověření svého modelu i způsobu jeho uvedení.
GLM-5.3-Flash je odhalenou identitou modelu Ox Alpha — otevřený, nativně multimodální model GLM určený pro efektivní programování a agentní práci. Mezi jeho hlavní parametry patří architektura MoE s celkem 320 miliardami a 18 miliardami aktivních parametrů, 45 vrstev, kontext o velikosti jednoho milionu tokenů, kombinace lineární a řídké pozornosti a váhy pod licencí MIT. 3
4
11
Největší příslib nespočívá pouze v samotném měřítku. Model kombinuje dlouhý kontext, obrazové vstupy, práci s nástroji a výrobcem deklarované nižší náklady na provoz — přitom si jej mohou vývojáři stáhnout a nasadit sami. Anonymní uvedení přineslo cennou zpětnou vazbu z reálného používání, ale k potvrzení toho, jak se technické a benchmarkové sliby projeví v produkci, budou stále potřeba nezávislé a reprodukovatelné testy.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha byl model GLM 5.3 Flash od společnosti Zhipu AI, což firma potvrdila 26.
Ox Alpha byl model GLM 5.3 Flash od společnosti Zhipu AI, což firma potvrdila 26. Model cílí na programování, vizuální práci, dlouhé kontexty a agentní úlohy. Má kontextové okno o velikosti 1 048 576 tokenů, nativní podporu textu, obrázků, videa a souborů a otevřené váhy pod licencí MIT.
Zhipu uvádí, že hybridní architektura lineární a řídké pozornosti oproti GLM 5.3 snižuje výpočetní náročnost pozornosti 3,01krát a využití KV cache 4,44krát.