26 sierpnia Zhipu AI potwierdziło, że anonimowy model „Ox Alpha”, nazywany po chińsku „Niu Lai”, to GLM 5.3 Flash — otwarty model multimodalny typu mixture of experts. Darmowe testy na platformach OpenRouter i OpenCode przyciągnęły ponad 50 bilionów tokenów w ciągu pięciu dni, a późniejsze raporty mówiły o ponad 60...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
26 sierpnia 2026 roku Zhipu AI, działające także pod marką Z.ai, ujawniło, że anonimowy model „Ox Alpha” — w chińskiej społeczności znany jako „Niu Lai”, czyli „Przychodzi Wół” — był w rzeczywistości modelem GLM-5.3-Flash. To otwarty model o natywnej obsłudze wielu modalności i architekturze mixture of experts, który przed oficjalną premierą był testowany pod anonimową nazwą. 1
4
6
Model pojawił się bez logo firmy i bez tradycyjnej kampanii premierowej na platformach OpenRouter oraz OpenCode. Użytkownicy mogli korzystać z niego bezpłatnie, co szybko przełożyło się na rekordowe zainteresowanie.
Ujawnienie nie dowodzi, że Chiny ogólnie zrównały się z Nvidią pod względem sprzętu ani że koszty wnioskowania na rodzimych układach są zawsze takie same jak na kartach Nvidii. Pokazuje jednak, że duży, rzeczywisty ruch użytkowników z całego świata można obsłużyć na nie- -Nvidiowym, krajowym stosie sprzętowo-programowym — pod warunkiem zastosowania zaawansowanej inżynierii systemowej. 3
6
To istotne dla przewagi Nvidii związanej z CUDA. Wynik Zhipu sugeruje, że wyspecjalizowane stosy programistyczne i silniki wnioskowania mogą w niektórych zadaniach produkcyjnych ograniczyć zależność od CUDA. Nie oznacza to jednak, że ekosystem CUDA przestał mieć znaczenie: Nvidia nadal korzysta z szerokiego zaplecza narzędzi, społeczności deweloperów oraz przewag w trenowaniu modeli. Dostępne dane nie uzasadniają dalej idącego wniosku.
Według opisów technicznych firma wykorzystała silnik wnioskowania oparty na SGLang. Zastosowano w nim między innymi:
Celem tych technik było ograniczenie problemów z pamięcią, przepustowością, komunikacją i harmonogramowaniem przy kontekście sięgającym miliona tokenów. 4
7
Zhipu miało informować, że optymalizacje poprawiły wydajność kompleksowej obsługi około trzykrotnie względem początkowej konfiguracji bazowej. Późniejsza dokumentacja SGLang wskazywała także na wyższą przepustowość oraz wyraźnie większą pojemność pamięci podręcznej FP8 niż w porównywanej konfiguracji BF16. Nie jest to jednak niezależny audyt pierwotnego twierdzenia Zhipu o trzykrotnym wzroście wydajności. 2
GLM-5.3-Flash to model o łącznej liczbie 320 miliardów parametrów, z czego na każdy token aktywowanych jest około 18 miliardów. Jego okno kontekstowe obejmuje do 1 048 576 tokenów. 5
7
Model otrzymał wynik 57 w zestawieniu Artificial Analysis Intelligence Index — taki sam jak raportowany wynik Claude Opus 4.8. Należy to interpretować jako równowagę w ramach jednego złożonego indeksu, a nie dowód identycznej jakości we wszystkich testach i zadaniach agentowych. 1
GLM-5.3-Flash ma konkurować z wydajnymi modelami klasy frontier, takimi jak DeepSeek V4 Flash i Pro, jednocześnie oferując znacznie niższe ceny wnioskowania. Dostarczone dane nie pozwalają jednak zweryfikować dokładnych porównań test po teście z obiema wersjami DeepSeek.
Opublikowany cennik API wynosi:
Współczesne relacje opisywały te stawki jako mniej więcej dziesięciokrotnie niższe niż cena GLM-5.3 i około czterdziestokrotnie niższe niż cena Claude Opus 4.8. Takie proporcje zależą jednak od kierunku tokenów, długości kontekstu i porównywanego planu cenowego. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
26 sierpnia Zhipu AI potwierdziło, że anonimowy model „Ox Alpha”, nazywany po chińsku „Niu Lai”, to GLM 5.3 Flash — otwarty model multimodalny typu mixture of experts.
26 sierpnia Zhipu AI potwierdziło, że anonimowy model „Ox Alpha”, nazywany po chińsku „Niu Lai”, to GLM 5.3 Flash — otwarty model multimodalny typu mixture of experts. Darmowe testy na platformach OpenRouter i OpenCode przyciągnęły ponad 50 bilionów tokenów w ciągu pięciu dni, a późniejsze raporty mówiły o ponad 60 bilionach w sześć dni.
Zhipu podało, że cały ruch obsłużył klaster ponad 100 tysięcy chińskich układów AI, bez wykorzystania procesorów graficznych Nvidii.