Ox Alpha byl GLM 5.3 Flash, což Z.ai potvrdilo 26. srpna 2026 po šesti dnech anonymního testování. Model využívá architekturu mixture of experts s 320 miliardami parametrů, z nichž se při každém tokenu aktivuje 18 miliard.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3-Flash, and how did it resolve the week-long mystery surrounding the anonymously released “Ox Alpha” model—covering it. Article summary: GLM-5.3-Flash is Z.ai (Zhipu AI)’s open-weight, natively multimodal GLM-5 model—and the company confirmed on August 26 that it was the previously anonymous “Ox Alpha.” The reveal turned a six-day public stress test into . Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Po šest dní používali vývojáři výkonný model s názvem Ox Alpha, aniž věděli, kdo ho vytvořil. Na OpenRouteru a v OpenCode se objevil 20. srpna 2026 zdarma a bez uvedeného autora. Nabízel kontextové okno o velikosti milionu tokenů a multimodální vstupy. 26. srpna společnost Z.ai – mezinárodní značka firmy Zhipu AI – potvrdila, že Ox Alpha byl ve skutečnosti GLM-5.3-Flash, její první nativně multimodální model z řady GLM-5. 2
5
9
Odhalením se z anonymního veřejného testu stal produktový launch. GLM-5.3-Flash dorazil s otevřenými váhami pod licencí MIT, nízkými avizovanými cenami API a architekturou navrženou tak, aby zlevnila práci s dlouhým kontextem, programováním a autonomními AI agenty. 6
7
9
Ox Alpha se nejprve objevil na OpenRouteru a v OpenCode bez zveřejněného vývojáře. Cena byla nulová, kontextový limit činil 1 048 576 tokenů a model přijímal text, obrázky i video. Vývojáři ho rychle začali zkoušet v programovacích agentech, při práci v terminálu i v úlohách s rozsáhlým kontextem. 4
5
8
Komunita mezitím hledala stopy. Mezi hlášené indicie patřilo chování tokenizéru podobné modelům GLM a charakteristické vzory chyb z API. Tyto signály vedly k úvahám, že za modelem stojí právě Zhipu AI. Spojení nakonec 26. srpna potvrdilo samo Z.ai. Firma uvedla, že anonymní nasazení mělo před oficiálním vydáním přinést zpětnou vazbu z reálného provozu. 5
9
Ukázka zaznamenala mimořádný zájem. Jeden dobový účet uváděl 42 bilionů zpracovaných tokenů během šesti dnů, jiný přibližně 44 bilionu tokenů a 503 000 uživatelů OpenCode. Jde o různé zprávy a různé okamžiky měření, proto není vhodné vydávat tato čísla za jediný nezávisle ověřený údaj. 8
11
16
GLM-5.3-Flash je model s otevřenými váhami určený především pro programování, dlouhé úlohy autonomních agentů a multimodální workflow. Z.ai ho popisuje jako první nativně multimodální model v rodině GLM-5. Podporuje vizuální vstupy a kontext o velikosti jednoho milionu tokenů, takže do jediné úlohy lze zahrnout rozsáhlý zdrojový kód, dokumenty, snímky obrazovky i další podklady. 7
20
Základem je mixture of experts s celkem 320 miliardami parametrů, přičemž na každý token se aktivuje 18 miliard parametrů. Prakticky to znamená, že model má k dispozici rozsáhlou kapacitu, ale každý token zpracovává jen prostřednictvím její části. Z.ai zároveň uvádí kombinaci řídké a lineární attention, která má při inferenci omezovat výpočetní nároky a velikost key-value cache. 6
20
Právě odtud pochází označení „Flash“. Model není malý, ale jeho cílem je nabídnout nižší náklady na provoz než hustý model se stejným celkovým počtem parametrů. Skutečná rychlost a cena však stále závisí na hardwaru, obslužném softwaru, dávkování požadavků i konkrétním typu zátěže.
Z.ai uvádí skóre 63,4 pro GLM-5.3-Flash v testu DeepSWE v1.1, zatímco GLM-5.2 podle firmy dosáhl 46,2. V interním srovnání s modelem Claude Opus 4.8 pak Z.ai uvádí výsledek 29,0 oproti 29,5. 7
8
Tato čísla jsou užitečným signálem, nikoli univerzálním žebříčkem kvality. Výsledek DeepSWE je tvrzení výrobce založené na jeho reportovaném benchmarku a srovnání s Claude je popsáno jako interní evaluace. Výsledky mohou výrazně ovlivnit rozdíly v promptech, používaných nástrojích, agentním prostředí, kontaminaci testovacích dat i způsobu hodnocení. Než bude možné model označit za obecně srovnatelný s uzavřenými špičkovými systémy, jsou zapotřebí nezávislé a reprodukovatelné testy.
Pro vývojáře je konkrétnější otázkou vhodnost pro určité workflow. Model může procházet rozsáhlé repozitáře, pracovat s vizuálním kontextem a pokračovat v dlouhých agentních úlohách, aniž by se historie opakovaně zkracovala. V produkci ale rozhoduje také spolehlivost, práce s nástroji, odezva a schopnost zotavit se z chyb – nejen skóre benchmarku.
Z.ai oznámilo ceníkové sazby API ve výši 0,15 USD za milion vstupních tokenů a 0,50 USD za milion výstupních tokenů. Dokumentace později uváděla dočasnou 50% akci, která ceny snižovala na 0,075, respektive 0,25 USD během uvedeného propagačního období. 2
Váhy modelu byly zveřejněny na Hugging Face pod licencí MIT, která je ve srovnání s čistě hostovaným modelem výrazně otevřenější. Licence MIT obecně umožňuje komerční využití i úpravy, týmy by si však měly ověřit konkrétní licenční podmínky, modelové dodatky, závislosti, hardwarové požadavky a povinnosti spojené s daným způsobem nasazení. 2
9
Dokumentace Z.ai uvádí GLM-5.3-Flash také v ekosystému vývojářských a programovacích plánů. Rozhraní API podporuje multimodální vstupy v chatu i používání nástrojů. 17
20
21
Vydání modelu přineslo ještě druhý příběh. Z.ai uvedlo, že anonymní ukázka Ox Alpha běžela výhradně na AI akcelerátorech vyrobených v Číně a využívala upravený obslužný stack založený na SGLang. Materiály z technického týmu firmy nasazení prezentují jako snahu zvýšit efektivitu inference na domácím hardwaru.
Některé sekundární zprávy opakují tvrzení, že upravený stack ztrojnásobil výkon od začátku do konce. Dostupné zdroje však neposkytují nezávislý audit použité flotily akcelerátorů, přesného srovnání výkonu ani míry, do jaké bylo nasazení skutečně nezávislé na zahraničních komponentách. 10
Rozdíl je důležitý. Pokud by se tvrzení ověřilo, šlo by o strategicky významný krok pro snahu Číny budovat schopné AI služby navzdory americkým omezením vývozu čipů. Zatím je ale přesnější chápat ho jako významné firemní oznámení, nikoli jako definitivní důkaz, že čínský hardware dohnal širší infrastrukturní náskok.
Strategie s Ox Alpha nabídla Z.ai něco, co běžné uvedení produktu často nedokáže: rozsáhlá a neuhlazená data z provozu od vývojářů, kteří neznali identitu modelu. Uživatelé ho nasazovali v programovacích agentech a úlohách s dlouhým kontextem proto, že byl zdarma a působil neobvykle schopně – ne proto, že četli marketingový technický list. Z.ai uvedlo, že cílem bylo získat zpětnou vazbu před oficiálním vydáním. 5
9
Tento postup zapadá i do strategie distribuce otevřených vah. Kombinace permisivní licence, nízkých cen API a širokého přístupu podporuje experimentování, sběr zpětné vazby a budování uživatelské základny mimo běžný model uzavřených předplatných. Dřívější anonymní experimenty, včetně údajně testovaného modelu Pony Alpha, naznačují, že nešlo o úplně izolovaný nápad. Dostupné zdroje o tomto starším projektu však nabízejí jen omezené podrobnosti.
GLM-5.3-Flash sám o sobě nedokazuje, že Z.ai stanovilo nový celkový technologický standard. Nejpevnější obraz zatím tvoří zveřejněné specifikace, mimořádně úspěšná veřejná ukázka a benchmarková i infrastrukturní tvrzení firmy. O skutečném postavení modelu rozhodnou nezávislá hodnocení a dlouhodobé používání v produkci – například při programování, multimodálním uvažování, práci s nástroji, měření odezvy a posuzování spolehlivosti.
Konkurenční signál je přesto zřetelný. Model s kontextem o velikosti milionu tokenů, nativními multimodálními vstupy, otevřenými váhami a cenou API počítanou v centech za milion tokenů vytváří tlak na ekonomiku drahých uzavřených systémů. Zároveň ukazuje, že anonymní ukázka může současně sloužit jako zátěžový test v reálném světě i jako distribuční kanál.
Záhada Ox Alpha je vyřešena: šlo o GLM-5.3-Flash od Z.ai. Další otázka už není detektivní, ale praktická – jak dobře obstojí příslib nízkých nákladů a dlouhého kontextu, až vývojáři přejdou od bezplatné virální ukázky k opakovatelnému provozu v produkci.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha byl GLM 5.3 Flash, což Z.ai potvrdilo 26. srpna 2026 po šesti dnech anonymního testování.
Ox Alpha byl GLM 5.3 Flash, což Z.ai potvrdilo 26. srpna 2026 po šesti dnech anonymního testování. Model využívá architekturu mixture of experts s 320 miliardami parametrů, z nichž se při každém tokenu aktivuje 18 miliard.
Význam testu nespočívá jen v technických parametrech: bezplatná a anonymní ukázka přilákala mimořádné množství vývojářů ještě před oficiálním uvedením produktu.