Ox Alpha okazał się modelem GLM 5.3 Flash firmy Zhipu AI, co potwierdzono 26 sierpnia 2026 roku po bezpłatnym, anonimowym teście rozpoczętym 20 sierpnia. GLM 5.3 Flash celuje w programowanie, wizualne tworzenie oprogramowania, pracę z długim kontekstem i agentów korzystających z narzędzi.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash był modelem stojącym za anonimowym punktem dostępowym Ox Alpha, który 20 sierpnia 2026 roku pojawił się na OpenRouterze i w innych narzędziach dla deweloperów. Firma Zhipu AI, działająca na rynkach międzynarodowych jako Z.ai, ujawniła jego tożsamość 26 sierpnia. Anonimowa publikacja miała posłużyć jako test rzeczywistej jakości modelu w programowaniu, zadaniach multimodalnych i pracy agentowej. 3
4
Ujawnienie zakończyło trwającą około tygodnia zagadkę i przyniosło premierę znaczącego modelu z otwartymi wagami. GLM-5.3-Flash to system typu mixture-of-experts o łącznej liczbie 320 mld parametrów, z 18 mld parametrów aktywowanymi przy każdym tokenie. Model ma kontekst o długości 1 048 576 tokenów, natywnie obsługuje wiele rodzajów danych, a jego wagi udostępniono na licencji MIT. 3
6
8
Ox Alpha pojawił się bez publicznej karty modelu, informacji o producencie i szczegółowej specyfikacji. Deweloperzy otrzymali bezpłatny punkt dostępowy z bardzo długim kontekstem oraz obsługą danych multimodalnych, po czym zaczęli sprawdzać go w zadaniach programistycznych i workflowach agentowych. Praktyczne rezultaty były na tyle interesujące, że szybko rozpoczęły się spekulacje dotyczące laboratorium stojącego za modelem. 13
16
Zhipu twierdzi, że celowo ukryło markę i parametry systemu. Firma chciała, aby użytkownicy oceniali model na podstawie jego odpowiedzi, a nie renomy producenta, liczby parametrów czy materiałów promocyjnych. Ruch dostarczył również danych o sposobie korzystania z modelu i informacji zwrotnych z rzeczywistych zadań programistycznych oraz agentowych przed oficjalną premierą. 13
15
W relacjach dotyczących testu pojawia się informacja o około 100 bln tokenów dziennej bezpłatnej przepustowości. Wśród znanych deweloperów, którzy mieli pozytywnie wypowiadać się o jakości modelu, wymieniano Patricka Collisona, współzałożyciela Stripe. Takie reakcje pomogły przekształcić anonimowy punkt dostępowy w szeroko obserwowaną premierę, choć popularność wśród użytkowników nie jest równoznaczna z kontrolowanym testem porównawczym. 13
14
Zhipu podało także, że usługa działała na produkowanych w Chinach akceleratorach sztucznej inteligencji. South China Morning Post informował o klastrze 100 tys. takich układów oraz o przetworzeniu przez model 62 bln tokenów przed oficjalnym wydaniem. Liczby te różnią się od danych dotyczących przepustowości i wykorzystania pojawiających się w innych relacjach, dlatego należy traktować je jako wartości podane przez firmę lub media, a nie niezależnie zweryfikowane pomiary. 7
13
GLM-5.3-Flash jest modelem mixture-of-experts (MoE). Cała pula obejmuje 320 mld parametrów, ale dla każdego tokena aktywowanych jest tylko 18 mld. Taka konstrukcja ma zapewniać możliwości reprezentacyjne bardzo dużego modelu bez obciążania każdego kroku wnioskowania pełną liczbą parametrów. 3
4
Model ma 45 warstw i jest przedstawiany jako pierwszy natywnie multimodalny model w serii GLM-5. Zaprojektowano go do pracy z tekstem, obrazami, wideo, dokumentami wizualnymi, plikami oraz przeplatanymi wejściami multimodalnymi. Ma to znaczenie w zadaniach, w których agent musi obejrzeć interfejs, zinterpretować zrzut ekranu, przeczytać dokument lub ocenić efekt działania kodu, a nie tylko przetwarzać tekst. 4
11
Zhipu deklaruje okno kontekstowe o długości 1 048 576 tokenów, zwykle opisywane jako milion tokenów. Taka pojemność jest przeznaczona między innymi do pracy z dużymi repozytoriami, długimi sesjami agentowymi, obszernymi zbiorami dokumentów oraz zadaniami łączącymi kod z obrazami i plikami. 3
4
Model wytrenowano od nowej bazy, z przeprojektowaną architekturą i recepturą treningową. Zhipu informuje o wykorzystaniu multimodalnego korpusu zawierającego 30 bln tokenów. Oznacza to, że GLM-5.3-Flash ma być nowym modelem zaprojektowanym wokół wydajności i multimodalności, a nie po prostu mniejszą wersją GLM-5.3. 4
16
Model łączy uwagę liniową z uwagą rzadką. Uwaga liniowa ma ograniczać koszt przetwarzania odległych zależności w długich sekwencjach, natomiast uwaga rzadka selektywnie zachowuje dokładniejsze interakcje tam, gdzie są najbardziej potrzebne. Celem jest połączenie długiego kontekstu z łatwiejszym do opanowania kosztem wnioskowania. 4
16
Zhipu opisuje również mechanizm IndexPool, który ma zmniejszać narzut pamięci i opóźnienia związane z indeksowaniem przy bardzo długim kontekście. Architektura wykorzystuje ponadto połączenia hiperwarstwowe ograniczone rozmaitościowo (manifold-constrained hyper-connections) jako kolejny sposób zwiększania efektywności skalowania. Wartość tych rozwiązań w praktyce zależy jednak od konfiguracji serwera, długości sekwencji, sprzętu i rodzaju obciążenia. 4
16
W porównaniu z GLM-5.3 firma deklaruje, że GLM-5.3-Flash zmniejsza koszt obliczeń mechanizmu uwagi 3,01 raza, a wykorzystanie pamięci KV cache 4,44 raza, przy zachowaniu jakości w długim kontekście. Dla deweloperów to istotne, ponieważ obliczenia uwagi i pamięć KV cache mogą być głównymi wąskimi gardłami w długo działających agentach. Są to jednak przede wszystkim wskaźniki pochodzące z materiałów technicznych Zhipu, a nie uniwersalne, niezależnie potwierdzone przyspieszenia. 4
GLM-5.3-Flash jest kierowany przede wszystkim do programowania, wizualnego tworzenia oprogramowania, długich zadań agentowych oraz korzystania z narzędzi. Natywne zdolności wzrokowe mają pozwalać agentowi obserwować interfejsy, efekty renderowania i informacje zwrotne z interakcji. W założeniu tworzy to zamkniętą pętlę między kodem, przeglądarką i graficznym interfejsem użytkownika. 4
Zhipu podało następujące wyniki benchmarków:
Wyniki wspierają pozycjonowanie modelu jako narzędzia do inżynierii oprogramowania i zadań agentowych, ale porównania wymagają ostrożności. Benchmarki agentowe mogą silnie zależeć od promptów, użytych narzędzi, dodatkowej infrastruktury, sprzętu, limitów czasu i wersji testu. Powyższe liczby najlepiej traktować jako rezultaty przedstawione przez Zhipu, a nie ostateczny ranking wszystkich konkurencyjnych modeli. 4
15
Zhipu udostępniło wagi GLM-5.3-Flash w serwisie Hugging Face na liberalnej licencji MIT, w tym wersję BF16. Dokumentacja modelu wskazuje możliwość wdrażania z użyciem frameworków takich jak SGLang i vLLM. Organizacje otrzymują więc możliwość uruchomienia systemu lokalnie lub we własnej infrastrukturze, bez konieczności korzystania wyłącznie z hostowanego API Z.ai. 3
6
8
Otwarty charakter modelu zmienia jego praktyczną atrakcyjność. Deweloperzy mogą sprawdzić go na własnych repozytoriach, dokumentach, interfejsach wizualnych i środowiskach agentowych, a zespoły infrastrukturalne mogą samodzielnie zbadać koszty obsługi i wymagania sprzętowe. Łączna liczba 320 mld parametrów nadal oznacza jednak poważne wyzwanie inżynieryjne. Aktywowanie 18 mld parametrów na token zmniejsza ilość obliczeń, ale nie sprawia automatycznie, że cały model jest lekki do wdrożenia.
Eksperyment z Ox Alpha był czymś więcej niż zabiegiem promocyjnym. Sprawdzał, czy deweloperzy będą korzystać z modelu, gdy nie znają jego nazwy, producenta ani liczby parametrów. Zhipu otrzymało w ten sposób opinie i obciążenia z rzeczywistych zastosowań jeszcze przed formalnym ujawnieniem modelu. 13
15
Eksperyment miał też wyraźne ograniczenia. Bezpłatny dostęp może przyciągać nietypowo duży ruch, publiczne pochwały mogą częściowo wynikać z efektu nowości, a anonimowy test nie kontroluje promptów ani nie porównuje wszystkich systemów w identycznych warunkach. Najostrożniejszy wniosek brzmi więc następująco: GLM-5.3-Flash wzbudził duże zainteresowanie deweloperów, zanim ujawniono jego tożsamość, a Zhipu wykorzystało ten ruch do sprawdzenia i dopracowania premiery.
GLM-5.3-Flash to ujawniona tożsamość Ox Alpha — model GLM firmy Zhipu, z otwartymi wagami i natywną obsługą wielu rodzajów danych, zaprojektowany do wydajnego programowania i pracy agentowej. Najważniejsze parametry to konstrukcja MoE 320B/18B, 45 warstw, kontekst o długości 1 mln tokenów, hybrydowa uwaga liniowa i rzadka oraz wagi na licencji MIT. 3
4
11
Najważniejsza obietnica modelu nie sprowadza się do samej skali. Chodzi o połączenie długiego kontekstu, wejść wizualnych, korzystania z narzędzi i niższego — według deklaracji producenta — kosztu obsługi w modelu, który można pobrać i uruchomić samodzielnie. Anonimowy test dostarczył nietypowo bezpośrednich informacji od użytkowników, ale do pełnej oceny wydajności produkcyjnej nadal potrzebne są niezależne i powtarzalne testy.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha okazał się modelem GLM 5.3 Flash firmy Zhipu AI, co potwierdzono 26 sierpnia 2026 roku po bezpłatnym, anonimowym teście rozpoczętym 20 sierpnia.
Ox Alpha okazał się modelem GLM 5.3 Flash firmy Zhipu AI, co potwierdzono 26 sierpnia 2026 roku po bezpłatnym, anonimowym teście rozpoczętym 20 sierpnia. GLM 5.3 Flash celuje w programowanie, wizualne tworzenie oprogramowania, pracę z długim kontekstem i agentów korzystających z narzędzi.
Zhipu twierdzi, że hybrydowa architektura liniowej i rzadkiej uwagi zmniejsza obliczenia związane z mechanizmem uwagi 3,01 raza, a zużycie pamięci KV cache 4,44 raza względem GLM 5.3.