Z.ai 26. srpna 2026 potvrdila, že anonymní bezplatný náhled Ox Alpha byl ve skutečnosti GLM 5.3 Flash — multimodální model s 320 miliardami parametrů, z nichž se při každém tokenu aktivuje 18 miliard.
PublikovalUpraveno pomocí GPT-5.6 LunaObrázky vytvořeny pomocí GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Záhada skončila 26. srpna 2026. Z.ai potvrdila, že anonymní model Ox Alpha, který se objevil na platformách OpenRouter a OpenCode, byl ve skutečnosti GLM-5.3-Flash. Firma jej představila jako první nativně multimodální model rodiny GLM-5 — s otevřenými vahami, kontextovým oknem kolem jednoho milionu tokenů a zaměřením na programování i dlouhodobě pracující AI agenty. 15
40
Nejde však jen o odhalení názvu. Ox Alpha spojil bezplatný anonymní náhled s reálným používáním vývojáři ve velkém měřítku. Z.ai tak mohla otestovat vlastní infrastrukturu v ostrém provozu, sledovat chování uživatelů a teprve poté z modelu udělat oficiální, pojmenovaný a stáhnutelný produkt.
GLM-5.3-Flash je model typu mixture of experts (MoE) s celkem 320 miliardami parametrů. Při zpracování každého tokenu se aktivuje přibližně 18 miliard parametrů, což pomáhá snižovat výpočetní náklady. Model nativně přijímá text, obrázky i video a jako výstup vytváří text. Uváděná kapacita kontextu je zhruba jeden milion tokenů, přesný limit se však liší podle platformy: dokumentace Z.ai mluví o milionovém kontextu, zatímco OpenRouter uvádí 1 310 720 tokenů. 1
2
3
40
Váhy byly zveřejněny pod licencí MIT, takže model lze nasazovat podstatně volněji než běžné systémy dostupné pouze přes uzavřené API. Po skončení anonymního náhledu se GLM-5.3-Flash objevil pod svým veřejným názvem také na OpenRouteru. 3
4
8
Pozor na podobný název: GLM-5.3-Flash není totožný s větším produktem GLM-5.3, který Z.ai oznámila již dříve v srpnu. Podle dostupných informací jde o samostatný a levnější model s konfigurací 320B-A18B, nikoli o stejnou produktovou variantu jako u větší řady GLM-5.3. 10
Z.ai tvrdí, že GLM-5.3-Flash překonává GLM-5.2 a současně snižuje náklady na provoz. V číslech citovaných při uvedení získal 63,4 bodu v testu DeepSWE v1.1, zatímco GLM-5.2 měl 46,2 bodu. Z.ai dále uvádí 29,0 bodu ve vlastním kódovacím benchmarku, téměř stejně jako 29,5 bodu uváděných u modelu Claude Opus 4.8. 3
16
Tato čísla dobře ukazují, jak chce Z.ai svůj model pozicionovat, sama o sobě ale nepotvrzují rovnocennost s modelem Anthropic. Záleží na definici benchmarku, nastavení testu, použitých promptech i na tom, zda lze výsledky nezávisle zopakovat. Opatrnější závěr proto zní: Z.ai slibuje silný výkon při programování a práci agentů za výrazně nižší cenu. Nejde o důkaz, že GLM-5.3-Flash definitivně překonal uzavřené špičkové modely.
Největším lákadlem Ox Alpha byla možnost vyzkoušet model během anonymního náhledu zdarma. Tato fáze skončila ve chvíli, kdy dostal oficiální jméno. Z.ai uvádí ceníkovou cenu 0,15 dolaru za milion vstupních tokenů a 0,50 dolaru za milion výstupních tokenů. 1
3
OpenRouter kolem uvedení zobrazoval nižší propagační sazbu 0,075 dolaru za milion vstupních a 0,25 dolaru za milion výstupních tokenů. 2 Je proto důležité rozlišovat tři různé podmínky: bezplatný anonymní náhled, standardní ceník Z.ai a časově či platformně omezenou úvodní slevu.
Právě ekonomika může být pro vývojáře stejně důležitá jako samotné skóre v testech. Kódovací agenti spotřebují velké množství kontextu i výstupních tokenů. I relativně malý rozdíl v ceně tak může ovlivnit výběr modelu více než několik bodů v žebříčku.
Z.ai uvedla, že GLM-5.3-Flash běžel výhradně na AI akcelerátorech vyrobených v Číně. 15 Zprávy o obslužném systému popisují upravenou infrastrukturu založenou na SGLangu, která využívá například kvantizaci, tenzorový paralelismus, smíšené formáty cache, dělení vrstev a oddělenou architekturu encode–prefill–decode. Cílem mělo být zlepšit celkový výkon při provozu a současně pracovat v mezích možností domácího hardwaru.
25
Tento příběh navazuje na dřívější komunikaci Z.ai o rodině GLM. Firma uvedla, že modely GLM trénovala na procesorech Huawei Ascend bez použití hardwaru Nvidia. Z.ai je zároveň od ledna 2025 na americkém seznamu Entity List, což omezuje její přístup k akcelerátorům Nvidia H100, H200 a B200. 26
Tvrzení o provozu na čínských čipech má strategický význam, ale je vhodné vnímat je především jako firemní a oborové zprávy, nikoli jako plně auditované srovnání výkonu jednotlivých typů hardwaru. Nejpevnější závěr je, že Z.ai prezentuje svůj technologický stack jako schopný provozovat rozsáhlý multimodální model bez závislosti na nejvýkonnějších datacentrových GPU od Nvidie.
Anonymní vydání působí jako promyšlená strategie: zveřejnit schopný model bez uvedení výrobce, nabídnout jej zdarma prostřednictvím oblíbených nástrojů pro programování, sledovat jeho používání a odhalit značku až poté, co systém nasbírá zkušenosti z reálného provozu. Se Z.ai se už dříve spojoval podobný test označovaný jako „Pony Alpha“. Komunita se mezitím pokoušela Ox Alpha identifikovat podle chování tokenizéru, zpracování videa nebo vzorců v chybových hlášeních API. 7
11
13
Některé zprávy z období uvedení popisovaly mimořádně vysoké počty použití a nadšení vývojářů. Dostupné podklady však nezávisle nepotvrzují každé uvedené číslo ani každý citát. Tyto údaje je proto bezpečnější chápat jako součást reportingu kolem uvedení, nikoli jako auditovaná data o adopci. 14
GLM-5.3-Flash nedokazuje, že Z.ai překonala OpenAI nebo Anthropic ve všech schopnostech špičkových modelů. Ukazuje ale na výrazně konkurenceschopnou kombinaci: multimodální vstup, velmi dlouhý kontext, otevřené váhy pod licencí MIT, zaměření na kódovací agenty a nízkou cenu API v jednom produktu. 15
40
Pro vývojáře to může znamenat nižší náklady na změnu poskytovatele a praktičtější nasazení ve vlastním prostředí nebo u více cloudových služeb. Pro provozovatele uzavřených modelů naopak přichází další tlak na ceny a marže — zejména u programovacích úloh, kde vedle výsledků v benchmarku rozhodují také objem tokenů, latence, kontrola nad nasazením a dostupnost vah.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Z.ai 26. srpna 2026 potvrdila, že anonymní bezplatný náhled Ox Alpha byl ve skutečnosti GLM 5.3 Flash — multimodální model s 320 miliardami parametrů, z nichž se při každém tokenu aktivuje 18 miliard.
Z.ai 26. srpna 2026 potvrdila, že anonymní bezplatný náhled Ox Alpha byl ve skutečnosti GLM 5.3 Flash — multimodální model s 320 miliardami parametrů, z nichž se při každém tokenu aktivuje 18 miliard. Model přijímá text, obrázky a video, zvládá kontext přibližně jednoho milionu tokenů a jeho oficiální cena činí 0,15 dolaru za milion vstupních a 0,50 dolaru za milion výstupních tokenů.
Tajné nasazení umožnilo Z.ai získat provozní zkušenosti s kódovacími agenty ve velkém měřítku ještě před odhalením značky a vydáním vah pod licencí MIT.
Z.ai 26. srpna 2026 potvrdila, že anonymní bezplatný náhled Ox Alpha byl ve skutečnosti GLM 5.3 Flash — multimodální model s 320 miliardami parametrů, z nichž se při každém tokenu aktivuje 18 miliard.
PublikovalUpraveno pomocí GPT-5.6 LunaObrázky vytvořeny pomocí GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Záhada skončila 26. srpna 2026. Z.ai potvrdila, že anonymní model Ox Alpha, který se objevil na platformách OpenRouter a OpenCode, byl ve skutečnosti GLM-5.3-Flash. Firma jej představila jako první nativně multimodální model rodiny GLM-5 — s otevřenými vahami, kontextovým oknem kolem jednoho milionu tokenů a zaměřením na programování i dlouhodobě pracující AI agenty. 15
40
Nejde však jen o odhalení názvu. Ox Alpha spojil bezplatný anonymní náhled s reálným používáním vývojáři ve velkém měřítku. Z.ai tak mohla otestovat vlastní infrastrukturu v ostrém provozu, sledovat chování uživatelů a teprve poté z modelu udělat oficiální, pojmenovaný a stáhnutelný produkt.
GLM-5.3-Flash je model typu mixture of experts (MoE) s celkem 320 miliardami parametrů. Při zpracování každého tokenu se aktivuje přibližně 18 miliard parametrů, což pomáhá snižovat výpočetní náklady. Model nativně přijímá text, obrázky i video a jako výstup vytváří text. Uváděná kapacita kontextu je zhruba jeden milion tokenů, přesný limit se však liší podle platformy: dokumentace Z.ai mluví o milionovém kontextu, zatímco OpenRouter uvádí 1 310 720 tokenů. 1
2
3
40
Váhy byly zveřejněny pod licencí MIT, takže model lze nasazovat podstatně volněji než běžné systémy dostupné pouze přes uzavřené API. Po skončení anonymního náhledu se GLM-5.3-Flash objevil pod svým veřejným názvem také na OpenRouteru. 3
4
8
Pozor na podobný název: GLM-5.3-Flash není totožný s větším produktem GLM-5.3, který Z.ai oznámila již dříve v srpnu. Podle dostupných informací jde o samostatný a levnější model s konfigurací 320B-A18B, nikoli o stejnou produktovou variantu jako u větší řady GLM-5.3. 10
Z.ai tvrdí, že GLM-5.3-Flash překonává GLM-5.2 a současně snižuje náklady na provoz. V číslech citovaných při uvedení získal 63,4 bodu v testu DeepSWE v1.1, zatímco GLM-5.2 měl 46,2 bodu. Z.ai dále uvádí 29,0 bodu ve vlastním kódovacím benchmarku, téměř stejně jako 29,5 bodu uváděných u modelu Claude Opus 4.8. 3
16
Tato čísla dobře ukazují, jak chce Z.ai svůj model pozicionovat, sama o sobě ale nepotvrzují rovnocennost s modelem Anthropic. Záleží na definici benchmarku, nastavení testu, použitých promptech i na tom, zda lze výsledky nezávisle zopakovat. Opatrnější závěr proto zní: Z.ai slibuje silný výkon při programování a práci agentů za výrazně nižší cenu. Nejde o důkaz, že GLM-5.3-Flash definitivně překonal uzavřené špičkové modely.
Největším lákadlem Ox Alpha byla možnost vyzkoušet model během anonymního náhledu zdarma. Tato fáze skončila ve chvíli, kdy dostal oficiální jméno. Z.ai uvádí ceníkovou cenu 0,15 dolaru za milion vstupních tokenů a 0,50 dolaru za milion výstupních tokenů. 1
3
OpenRouter kolem uvedení zobrazoval nižší propagační sazbu 0,075 dolaru za milion vstupních a 0,25 dolaru za milion výstupních tokenů. 2 Je proto důležité rozlišovat tři různé podmínky: bezplatný anonymní náhled, standardní ceník Z.ai a časově či platformně omezenou úvodní slevu.
Právě ekonomika může být pro vývojáře stejně důležitá jako samotné skóre v testech. Kódovací agenti spotřebují velké množství kontextu i výstupních tokenů. I relativně malý rozdíl v ceně tak může ovlivnit výběr modelu více než několik bodů v žebříčku.
Z.ai uvedla, že GLM-5.3-Flash běžel výhradně na AI akcelerátorech vyrobených v Číně. 15 Zprávy o obslužném systému popisují upravenou infrastrukturu založenou na SGLangu, která využívá například kvantizaci, tenzorový paralelismus, smíšené formáty cache, dělení vrstev a oddělenou architekturu encode–prefill–decode. Cílem mělo být zlepšit celkový výkon při provozu a současně pracovat v mezích možností domácího hardwaru.
25
Tento příběh navazuje na dřívější komunikaci Z.ai o rodině GLM. Firma uvedla, že modely GLM trénovala na procesorech Huawei Ascend bez použití hardwaru Nvidia. Z.ai je zároveň od ledna 2025 na americkém seznamu Entity List, což omezuje její přístup k akcelerátorům Nvidia H100, H200 a B200. 26
Tvrzení o provozu na čínských čipech má strategický význam, ale je vhodné vnímat je především jako firemní a oborové zprávy, nikoli jako plně auditované srovnání výkonu jednotlivých typů hardwaru. Nejpevnější závěr je, že Z.ai prezentuje svůj technologický stack jako schopný provozovat rozsáhlý multimodální model bez závislosti na nejvýkonnějších datacentrových GPU od Nvidie.
Anonymní vydání působí jako promyšlená strategie: zveřejnit schopný model bez uvedení výrobce, nabídnout jej zdarma prostřednictvím oblíbených nástrojů pro programování, sledovat jeho používání a odhalit značku až poté, co systém nasbírá zkušenosti z reálného provozu. Se Z.ai se už dříve spojoval podobný test označovaný jako „Pony Alpha“. Komunita se mezitím pokoušela Ox Alpha identifikovat podle chování tokenizéru, zpracování videa nebo vzorců v chybových hlášeních API. 7
11
13
Některé zprávy z období uvedení popisovaly mimořádně vysoké počty použití a nadšení vývojářů. Dostupné podklady však nezávisle nepotvrzují každé uvedené číslo ani každý citát. Tyto údaje je proto bezpečnější chápat jako součást reportingu kolem uvedení, nikoli jako auditovaná data o adopci. 14
GLM-5.3-Flash nedokazuje, že Z.ai překonala OpenAI nebo Anthropic ve všech schopnostech špičkových modelů. Ukazuje ale na výrazně konkurenceschopnou kombinaci: multimodální vstup, velmi dlouhý kontext, otevřené váhy pod licencí MIT, zaměření na kódovací agenty a nízkou cenu API v jednom produktu. 15
40
Pro vývojáře to může znamenat nižší náklady na změnu poskytovatele a praktičtější nasazení ve vlastním prostředí nebo u více cloudových služeb. Pro provozovatele uzavřených modelů naopak přichází další tlak na ceny a marže — zejména u programovacích úloh, kde vedle výsledků v benchmarku rozhodují také objem tokenů, latence, kontrola nad nasazením a dostupnost vah.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Z.ai 26. srpna 2026 potvrdila, že anonymní bezplatný náhled Ox Alpha byl ve skutečnosti GLM 5.3 Flash — multimodální model s 320 miliardami parametrů, z nichž se při každém tokenu aktivuje 18 miliard.
Z.ai 26. srpna 2026 potvrdila, že anonymní bezplatný náhled Ox Alpha byl ve skutečnosti GLM 5.3 Flash — multimodální model s 320 miliardami parametrů, z nichž se při každém tokenu aktivuje 18 miliard. Model přijímá text, obrázky a video, zvládá kontext přibližně jednoho milionu tokenů a jeho oficiální cena činí 0,15 dolaru za milion vstupních a 0,50 dolaru za milion výstupních tokenů.
Tajné nasazení umožnilo Z.ai získat provozní zkušenosti s kódovacími agenty ve velkém měřítku ještě před odhalením značky a vydáním vah pod licencí MIT.