Ox Alpha było anonimowym wdrożeniem GLM 5.3 Flash, co Z.ai potwierdziło 26 sierpnia 2026 roku po sześciu dniach publicznych testów. GLM 5.3 Flash korzysta z architektury mixture of experts: ma 320 mld parametrów, z czego przy każdym tokenie aktywowanych jest 18 mld.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3-Flash, and how did it resolve the week-long mystery surrounding the anonymously released “Ox Alpha” model—covering it. Article summary: GLM-5.3-Flash is Z.ai (Zhipu AI)’s open-weight, natively multimodal GLM-5 model—and the company confirmed on August 26 that it was the previously anonymous “Ox Alpha.” The reveal turned a six-day public stress test into . Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Przez sześć dni programiści korzystali z potężnego modelu AI o nazwie Ox Alpha, nie wiedząc, kto go stworzył. Model pojawił się 20 sierpnia 2026 roku w serwisach OpenRouter i OpenCode — bez wskazanego dostawcy i za darmo. Oferował kontekst obejmujący milion tokenów oraz obsługę wielu formatów danych. 26 sierpnia Z.ai, międzynarodowa marka firmy Zhipu AI, potwierdziło, że Ox Alpha było w rzeczywistości modelem GLM-5.3-Flash, pierwszym natywnie multimodalnym modelem w rodzinie GLM-5. 2
5
9
Ujawnienie zamieniło anonimowy test w premierę produktu. GLM-5.3-Flash trafił do publicznego obiegu z otwartymi wagami na licencji MIT, niskimi deklarowanymi cenami API i architekturą zaprojektowaną z myślą o długich zadaniach programistycznych oraz pracy agentów AI. 6
7
9
Ox Alpha pojawiło się na OpenRouter i OpenCode bez informacji o twórcy, z ceną wynoszącą zero dolarów, limitem kontekstu 1 048 576 tokenów oraz obsługą tekstu, obrazów i wideo. Programiści szybko zaczęli wykorzystywać model w agentach kodujących, zadaniach terminalowych i projektach wymagających pracy na bardzo dużych zbiorach danych. 4
5
8
Społeczność próbowała ustalić pochodzenie modelu. Wśród wskazówek wymieniano zachowanie tokenizera przypominające modele GLM oraz charakterystyczne wzorce komunikatów błędów API. To doprowadziło do spekulacji, że za Ox Alpha stoi Zhipu AI. Ostatecznie Z.ai samo potwierdziło tę informację 26 sierpnia, wyjaśniając, że anonimowe wdrożenie miało zebrać opinie z rzeczywistych zastosowań przed oficjalnym wydaniem. 5
9
Test przyciągnął wyjątkowo duży ruch. Jedna z ówczesnych relacji mówiła o 42 bln przetworzonych tokenów w ciągu sześciu dni, a inna — o około 44 bln tokenów i 503 tys. użytkowników OpenCode. Są to dane z różnych raportów i momentów pomiarowych, dlatego nie należy traktować ich jako jednej, niezależnie potwierdzonej wartości. 8
11
16
GLM-5.3-Flash to model z otwartymi wagami, przeznaczony przede wszystkim do programowania, wieloetapowych zadań agentowych i pracy z treściami multimodalnymi. Z.ai opisuje go jako pierwszy natywnie multimodalny model w rodzinie GLM-5. W dokumentacji wymieniono obsługę danych wizualnych oraz milionowego okna kontekstu, dzięki czemu w jednym zadaniu można zmieścić duże repozytorium kodu, dokumenty, zrzuty ekranu i inne materiały. 7
20
Najważniejszym elementem konstrukcji jest mixture of experts z 320 mld parametrów, przy czym 18 mld parametrów jest aktywowanych dla każdego tokenu. W praktyce model ma bardzo duży zasób wyuczonych możliwości, ale przy generowaniu konkretnej odpowiedzi korzysta tylko z części tego zasobu. Z.ai twierdzi również, że połączyło uwagę rzadką i liniową, aby zmniejszyć wymagania obliczeniowe oraz zapotrzebowanie na pamięć podręczną kluczy i wartości podczas wnioskowania. 6
20
To właśnie tłumaczy dopisek „Flash” w nazwie. Model nie jest mały, ale ma oferować niższy koszt obsługi niż gęsty model o podobnej całkowitej liczbie parametrów. Taka architektura może ograniczyć liczbę obliczeń potrzebnych do wygenerowania każdego tokenu. Rzeczywista szybkość i cena nadal zależą jednak od sprzętu, oprogramowania serwerowego, sposobu grupowania zapytań i konkretnego obciążenia.
Z.ai podaje wynik 63,4 dla GLM-5.3-Flash w teście DeepSWE v1.1, w porównaniu z 46,2 dla GLM-5.2. Firma przedstawiła także wewnętrzne porównanie z Claude Opus 4.8, w którym modele uzyskały odpowiednio 29,0 i 29,5 punktu. 7
8
To przydatne sygnały, ale nie są uniwersalnym rankingiem jakości modeli. Wynik DeepSWE jest deklaracją producenta, a porównanie z Claude Opus 4.8 opisano jako wewnętrzną ewaluację. Na rezultaty mogą istotnie wpływać prompty, dostępne narzędzia, dodatkowe instrukcje dla agenta, zanieczyszczenie zbioru testowego oraz metoda oceniania. Zanim GLM-5.3-Flash będzie można uznać za szeroko równoważny któremukolwiek zamkniętemu modelowi czołowemu, potrzebne są niezależne i powtarzalne testy.
Z perspektywy programisty ważniejsza od pojedynczej liczby może być zgodność z konkretnym przepływem pracy. Model potrafi analizować duże repozytoria, korzystać z kontekstu wizualnego i wykonywać długie zadania agentowe bez ciągłego skracania historii. W środowisku produkcyjnym liczyć się będą jednak także niezawodność, obsługa narzędzi, opóźnienia i sposób odzyskiwania po błędach.
Z.ai ogłosiło ceny katalogowe API na poziomie 0,15 dol. za milion tokenów wejściowych i 0,50 dol. za milion tokenów wyjściowych. W dokumentacji pojawiła się następnie czasowa promocja obniżająca te stawki odpowiednio do 0,075 i 0,25 dol. 2
Wagi modelu opublikowano na Hugging Face na licencji MIT, która jest bardziej liberalna niż model dostępny wyłącznie w chmurze. Licencja MIT co do zasady pozwala na komercyjne wykorzystanie i modyfikację, ale przed wdrożeniem zespoły powinny sprawdzić pełne warunki licencji, wymagania dotyczące modelu, zależności programistyczne, wymagania sprzętowe oraz obowiązki związane z konkretnym sposobem użycia. 2
9
Dokumentacja Z.ai wymienia GLM-5.3-Flash także w ekosystemie planów dla programistów i narzędzi kodujących. Interfejs API obsługuje multimodalne wiadomości oraz korzystanie z narzędzi. 17
20
21
Premiera miała jeszcze drugi, niezależny wymiar. Z.ai poinformowało, że anonimowe wdrożenie Ox Alpha działało w całości na akceleratorach AI wyprodukowanych w Chinach, z wykorzystaniem dostosowanego stosu opartego na SGLang. Materiały inżynieryjne firmy przedstawiają ten sposób obsługi jako próbę zwiększenia wydajności wnioskowania na krajowym sprzęcie.
Niektóre relacje wtórne powtarzają również informację, że zmodyfikowany stos potroił wydajność end-to-end. Flota akceleratorów, dokładny punkt odniesienia dla tego porównania oraz stopień niezależności wdrożenia od zagranicznych komponentów nie zostały jednak niezależnie zbadane w dostępnych źródłach. 10
To ważne rozróżnienie. Gdyby te informacje zostały potwierdzone, wdrożenie miałoby znaczenie strategiczne dla chińskich prób budowania wydajnych usług AI w warunkach amerykańskich ograniczeń eksportowych dotyczących układów scalonych. Na obecnym etapie należy je jednak traktować jako istotną deklarację firmy, a nie rozstrzygający dowód, że krajowy sprzęt zlikwidował szerszą lukę infrastrukturalną.
Strategia z Ox Alpha dała Z.ai coś, czego często nie zapewnia klasyczna premiera: masowy, nieuporządkowany i rzeczywisty feedback od programistów, którzy nie znali tożsamości modelu. Użytkownicy testowali go w agentach kodujących i zadaniach z długim kontekstem dlatego, że był darmowy i sprawiał wrażenie wyjątkowo wydajnego — nie dlatego, że przekonała ich tabela marketingowych specyfikacji. Z.ai podało, że celem było zebranie opinii przed oficjalnym wydaniem. 5
9
Podejście pasuje także do strategii dystrybucji opartej na otwartych wagach. Połączenie liberalnej licencji, niskich cen API i szerokiego dostępu zachęca do eksperymentów, ułatwia zbieranie informacji zwrotnej i pozwala budować wykorzystanie modelu poza typowym, zamkniętym abonamentem. Wcześniejsze anonimowe eksperymenty z modelami, w tym opisywany test Pony Alpha, sugerują, że nie był to całkowicie odosobniony pomysł, choć dostępne źródła podają niewiele szczegółów na temat tamtego projektu.
GLM-5.3-Flash nie dowodzi samo w sobie, że Z.ai ustanowiło nowy, ogólny front rozwoju modeli AI. Najmocniejszy zestaw dowodów obejmuje opublikowane parametry, wyjątkowo skuteczny publiczny test oraz deklarowane przez firmę wyniki benchmarków i informacje o infrastrukturze. O tym, jak model wypada w programowaniu, rozumowaniu multimodalnym, korzystaniu z narzędzi, opóźnieniach i niezawodności, zdecydują niezależne ewaluacje oraz dłuższe wdrożenia produkcyjne.
Sygnał konkurencyjny jest jednak wyraźny. Model z milionowym kontekstem, natywną obsługą danych multimodalnych, otwartymi wagami i ceną API liczoną w centach za milion tokenów wywiera presję na ekonomię drogich, zamkniętych systemów. Pokazuje również, że anonimowa premiera może jednocześnie pełnić funkcję testu obciążeniowego w prawdziwym świecie i kanału dystrybucji.
Zagadka Ox Alpha została rozwiązana: za anonimowym modelem stał GLM-5.3-Flash firmy Z.ai. Najważniejsze pytanie nie dotyczy już jego tożsamości, lecz praktyki — jak dobrze obietnica niskiego kosztu i bardzo długiego kontekstu sprawdzi się po przejściu od darmowego, wiralowego testu do powtarzalnych zadań produkcyjnych.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha było anonimowym wdrożeniem GLM 5.3 Flash, co Z.ai potwierdziło 26 sierpnia 2026 roku po sześciu dniach publicznych testów.
Ox Alpha było anonimowym wdrożeniem GLM 5.3 Flash, co Z.ai potwierdziło 26 sierpnia 2026 roku po sześciu dniach publicznych testów. GLM 5.3 Flash korzysta z architektury mixture of experts: ma 320 mld parametrów, z czego przy każdym tokenie aktywowanych jest 18 mld.
Największą siłą premiery była nie tylko architektura, lecz także sposób dystrybucji: darmowy i pozbawiony atrybucji test przyciągnął ogromną uwagę programistów, zanim stał się oficjalnym produktem.