26 sierpnia 2026 roku Z.ai potwierdziło, że anonimowy, bezpłatny model Ox Alpha to GLM 5.3 Flash — multimodalny model z 320 mld parametrów, z czego 18 mld jest aktywnych przy każdym tokenie, udostępniony na licencji MIT. GLM 5.3 Flash przyjmuje tekst, obrazy i wideo, obsługuje kontekst o długości około miliona token...
Opublikowane przezEdytowane za pomocą GPT-5.6 LunaObrazy wygenerowane za pomocą GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
26 sierpnia 2026 roku Z.ai zakończyło trwające kilka dni spekulacje: Ox Alpha, anonimowy model dostępny wcześniej przez OpenRouter i OpenCode, okazał się GLM-5.3-Flash. Firma przedstawia go jako pierwszy natywnie multimodalny model w rodzinie GLM-5 — z otwartymi wagami, kontekstem sięgającym około miliona tokenów oraz przeznaczeniem do programowania i długotrwałych zadań wykonywanych przez agentów AI. 15
40
Najciekawsza część tej historii nie dotyczy jednak samej nazwy. Ox Alpha połączył bezpłatny, anonimowy dostęp z ruchem pochodzącym od dużej liczby deweloperów, a następnie został przekształcony w nazwany i możliwy do pobrania produkt. Z.ai mogło w ten sposób testować infrastrukturę w warunkach zbliżonych do produkcyjnych, jednocześnie budując zainteresowanie przed oficjalną premierą.
GLM-5.3-Flash to model typu mixture of experts (MoE) z 320 mld parametrów łącznie i 18 mld parametrów aktywnych dla każdego tokena. Natywnie przyjmuje tekst, obrazy oraz wideo, a generuje tekst. Projektowa długość kontekstu wynosi około miliona tokenów, choć dokładna wartość wyświetlana przez poszczególne platformy jest różna: dokumentacja Z.ai mówi o konstrukcji z milionem tokenów, natomiast OpenRouter podaje okno kontekstu o długości 1 310 720 tokenów. 1
2
3
40
Z.ai udostępniło wagi na licencji MIT, dzięki czemu model jest znacznie łatwiejszy do wdrażania niż rozwiązania dostępne wyłącznie jako zamknięte API. Po zakończeniu anonimowego testu GLM-5.3-Flash pojawił się także na OpenRouter pod swoją oficjalną nazwą. 3
4
8
Nie należy mylić go z większym modelem GLM-5.3 ogłoszonym wcześniej w sierpniu. Według dostępnych opisów GLM-5.3-Flash jest osobnym, tańszym wariantem 320B-A18B, a nie tym samym produktem co większa linia GLM-5.3. 10
Z.ai twierdzi, że GLM-5.3-Flash przewyższa GLM-5.2, a jednocześnie jest tańszy w obsłudze. W wynikach przytaczanych przy premierze model uzyskał 63,4 pkt w teście DeepSWE v1.1, podczas gdy GLM-5.2 zdobył 46,2 pkt. Z.ai podało również 29,0 pkt w swoim wewnętrznym benchmarku programistycznym, przy 29,5 pkt deklarowanych dla Claude Opus 4.8. 3
16
To przydatne dane dotyczące pozycjonowania produktu, ale nie są niezależnym potwierdzeniem równorzędności z modelem Anthropic. Znaczenie mają definicje benchmarków, ustawienia testów, sposób tworzenia promptów oraz możliwość odtworzenia wyników. Najostrożniejszy wniosek brzmi więc: Z.ai deklaruje bardzo dobre możliwości programistyczne i agentowe przy znacznie niższym koszcie. Nie oznacza to, że GLM-5.3-Flash definitywnie pokonał zamknięte modele czołowych dostawców.
Najbardziej widoczną cechą Ox Alpha był bezpłatny dostęp w okresie anonimowego testu. Ta faza zakończyła się, gdy model otrzymał oficjalną nazwę. Z.ai podało cenę katalogową 0,15 dolara za milion tokenów wejściowych i 0,50 dolara za milion tokenów wyjściowych. 1
3
W momencie premiery OpenRouter pokazywał niższą, promocyjną stawkę: 0,075 dolara za milion tokenów wejściowych i 0,25 dolara za milion tokenów wyjściowych. 2 To ważne rozróżnienie: bezpłatny test, cena katalogowa Z.ai i czasowa promocja konkretnej platformy to trzy różne warunki dostępu.
Nawet przy cenie katalogowej ekonomia modelu jest jednym z jego głównych atutów. Agenci programistyczni potrafią zużywać ogromne ilości kontekstu i generować dużo tekstu, dlatego niższy koszt tokenów może wpływać na wybór modelu równie mocno jak niewielka przewaga w benchmarku.
Z.ai podało, że GLM-5.3-Flash działa w całości na akceleratorach AI produkowanych w Chinach. 15 Opisy systemu obsługi wskazują na zmodyfikowany stos oparty na SGLang, wykorzystujący między innymi kwantyzację, równoległość tensorową, mieszane formaty pamięci podręcznej, podział warstw oraz rozdzieloną architekturę encode–prefill–decode. Celem miało być zwiększenie wydajności obsługi od początku do końca przy ograniczeniach wynikających z użycia krajowego sprzętu.
25
To rozwija wcześniejszą narrację Z.ai dotyczącą rodziny GLM. Firma twierdziła, że modele GLM-5 były trenowane na procesorach Huawei Ascend bez użycia sprzętu Nvidia. Doniesienia wskazują też, że wpisanie Z.ai na amerykańską listę podmiotów objętych ograniczeniami utrudnia firmie dostęp do akceleratorów Nvidia H100, H200 i B200. 26
Znaczenie tej deklaracji jest strategiczne, ale należy traktować ją jako informację pochodzącą od firmy i relacje branżowe, a nie w pełni niezależny audyt wydajności sprzętu. Ostrożniejszy, lepiej uzasadniony wniosek jest taki, że Z.ai pokazuje możliwość obsługi dużego modelu multimodalnego bez polegania na najwydajniejszych serwerowych układach Nvidia.
Anonimowe wydanie wygląda na świadomie zaplanowany schemat: opublikować sprawny model bez wskazywania twórcy, udostępnić go za darmo przez popularne narzędzia programistyczne, obserwować sposób wykorzystania i dopiero potem ujawnić produkt. Z.ai wiązano już wcześniej z testem „Pony Alpha”, który miał wykorzystywać podobny pomysł. Społeczność próbowała zidentyfikować Ox Alpha między innymi na podstawie zachowania tokenizera, wskazówek dotyczących przetwarzania wideo oraz wzorców błędów API. 7
11
13
Część relacji z okresu premiery mówiła także o wyjątkowo dużej skali użycia i entuzjazmie deweloperów, ale dostępne materiały nie potwierdzają niezależnie każdej z tych liczb ani wszystkich cytatów. Takie twierdzenia należy więc traktować jako element relacji z premiery, a nie audytowane dane o adopcji. 14
Taki „stealth launch” ma dla twórcy kilka zalet. Pozwala zebrać informacje o zachowaniu modelu w prawdziwych zadaniach, sprawdzić opóźnienia i koszty infrastruktury oraz zobaczyć, gdzie system zawodzi — zanim pojawi się oficjalna marka i pełna presja medialna. Jednocześnie sami użytkownicy stają się częścią testu obciążeniowego, nawet jeśli nie znają producenta rozwiązania.
GLM-5.3-Flash nie dowodzi, że Z.ai wyprzedziło OpenAI lub Anthropic we wszystkich obszarach możliwości modeli czołowych. Pokazuje jednak bardziej kłopotliwą dla rywali kombinację: multimodalne wejście, bardzo długi kontekst, wagi na licencji MIT, specjalizację w agentach programistycznych i niską cenę API w jednym produkcie. 15
40
Dla deweloperów oznacza to niższy koszt zmiany dostawcy oraz większą praktyczność wdrożeń opartych na własnej infrastrukturze lub wielu dostawcach jednocześnie. Dla firm oferujących zamknięte modele jest to dodatkowa presja na ceny i marże — szczególnie w zastosowaniach programistycznych, gdzie równie ważne jak miejsce w rankingu mogą być liczba zużywanych tokenów, opóźnienia, kontrola nad wdrożeniem i dostępność wag.
Historia Ox Alpha pokazuje więc nie tyle jednorazowy „sekretny” debiut, ile nowy sposób wprowadzania modeli AI na rynek. Najpierw realne użycie i szybka informacja zwrotna, później marka, otwarte wagi i cennik. Jeśli taki model działania się przyjmie, rywalizacja w AI będzie coraz częściej rozgrywać się nie tylko wokół wyników benchmarków, lecz także wokół kosztu działania i tego, kto ma kontrolę nad infrastrukturą.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
26 sierpnia 2026 roku Z.ai potwierdziło, że anonimowy, bezpłatny model Ox Alpha to GLM 5.3 Flash — multimodalny model z 320 mld parametrów, z czego 18 mld jest aktywnych przy każdym tokenie, udostępniony na licencji MIT.
26 sierpnia 2026 roku Z.ai potwierdziło, że anonimowy, bezpłatny model Ox Alpha to GLM 5.3 Flash — multimodalny model z 320 mld parametrów, z czego 18 mld jest aktywnych przy każdym tokenie, udostępniony na licencji MIT. GLM 5.3 Flash przyjmuje tekst, obrazy i wideo, obsługuje kontekst o długości około miliona tokenów, a oficjalna cena Z.ai wynosi 0,15 dolara za milion tokenów wejściowych i 0,50 dolara za milion tokenów wyjściowych.
Tajny debiut pozwolił Z.ai sprawdzić system obsługi na rzeczywistym, masowym ruchu związanym z programowaniem i agentami AI, zanim firma ujawniła markę oraz udostępniła wagi modelu.
26 sierpnia 2026 roku Z.ai potwierdziło, że anonimowy, bezpłatny model Ox Alpha to GLM 5.3 Flash — multimodalny model z 320 mld parametrów, z czego 18 mld jest aktywnych przy każdym tokenie, udostępniony na licencji MIT. GLM 5.3 Flash przyjmuje tekst, obrazy i wideo, obsługuje kontekst o długości około miliona token...
Opublikowane przezEdytowane za pomocą GPT-5.6 LunaObrazy wygenerowane za pomocą GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
26 sierpnia 2026 roku Z.ai zakończyło trwające kilka dni spekulacje: Ox Alpha, anonimowy model dostępny wcześniej przez OpenRouter i OpenCode, okazał się GLM-5.3-Flash. Firma przedstawia go jako pierwszy natywnie multimodalny model w rodzinie GLM-5 — z otwartymi wagami, kontekstem sięgającym około miliona tokenów oraz przeznaczeniem do programowania i długotrwałych zadań wykonywanych przez agentów AI. 15
40
Najciekawsza część tej historii nie dotyczy jednak samej nazwy. Ox Alpha połączył bezpłatny, anonimowy dostęp z ruchem pochodzącym od dużej liczby deweloperów, a następnie został przekształcony w nazwany i możliwy do pobrania produkt. Z.ai mogło w ten sposób testować infrastrukturę w warunkach zbliżonych do produkcyjnych, jednocześnie budując zainteresowanie przed oficjalną premierą.
GLM-5.3-Flash to model typu mixture of experts (MoE) z 320 mld parametrów łącznie i 18 mld parametrów aktywnych dla każdego tokena. Natywnie przyjmuje tekst, obrazy oraz wideo, a generuje tekst. Projektowa długość kontekstu wynosi około miliona tokenów, choć dokładna wartość wyświetlana przez poszczególne platformy jest różna: dokumentacja Z.ai mówi o konstrukcji z milionem tokenów, natomiast OpenRouter podaje okno kontekstu o długości 1 310 720 tokenów. 1
2
3
40
Z.ai udostępniło wagi na licencji MIT, dzięki czemu model jest znacznie łatwiejszy do wdrażania niż rozwiązania dostępne wyłącznie jako zamknięte API. Po zakończeniu anonimowego testu GLM-5.3-Flash pojawił się także na OpenRouter pod swoją oficjalną nazwą. 3
4
8
Nie należy mylić go z większym modelem GLM-5.3 ogłoszonym wcześniej w sierpniu. Według dostępnych opisów GLM-5.3-Flash jest osobnym, tańszym wariantem 320B-A18B, a nie tym samym produktem co większa linia GLM-5.3. 10
Z.ai twierdzi, że GLM-5.3-Flash przewyższa GLM-5.2, a jednocześnie jest tańszy w obsłudze. W wynikach przytaczanych przy premierze model uzyskał 63,4 pkt w teście DeepSWE v1.1, podczas gdy GLM-5.2 zdobył 46,2 pkt. Z.ai podało również 29,0 pkt w swoim wewnętrznym benchmarku programistycznym, przy 29,5 pkt deklarowanych dla Claude Opus 4.8. 3
16
To przydatne dane dotyczące pozycjonowania produktu, ale nie są niezależnym potwierdzeniem równorzędności z modelem Anthropic. Znaczenie mają definicje benchmarków, ustawienia testów, sposób tworzenia promptów oraz możliwość odtworzenia wyników. Najostrożniejszy wniosek brzmi więc: Z.ai deklaruje bardzo dobre możliwości programistyczne i agentowe przy znacznie niższym koszcie. Nie oznacza to, że GLM-5.3-Flash definitywnie pokonał zamknięte modele czołowych dostawców.
Najbardziej widoczną cechą Ox Alpha był bezpłatny dostęp w okresie anonimowego testu. Ta faza zakończyła się, gdy model otrzymał oficjalną nazwę. Z.ai podało cenę katalogową 0,15 dolara za milion tokenów wejściowych i 0,50 dolara za milion tokenów wyjściowych. 1
3
W momencie premiery OpenRouter pokazywał niższą, promocyjną stawkę: 0,075 dolara za milion tokenów wejściowych i 0,25 dolara za milion tokenów wyjściowych. 2 To ważne rozróżnienie: bezpłatny test, cena katalogowa Z.ai i czasowa promocja konkretnej platformy to trzy różne warunki dostępu.
Nawet przy cenie katalogowej ekonomia modelu jest jednym z jego głównych atutów. Agenci programistyczni potrafią zużywać ogromne ilości kontekstu i generować dużo tekstu, dlatego niższy koszt tokenów może wpływać na wybór modelu równie mocno jak niewielka przewaga w benchmarku.
Z.ai podało, że GLM-5.3-Flash działa w całości na akceleratorach AI produkowanych w Chinach. 15 Opisy systemu obsługi wskazują na zmodyfikowany stos oparty na SGLang, wykorzystujący między innymi kwantyzację, równoległość tensorową, mieszane formaty pamięci podręcznej, podział warstw oraz rozdzieloną architekturę encode–prefill–decode. Celem miało być zwiększenie wydajności obsługi od początku do końca przy ograniczeniach wynikających z użycia krajowego sprzętu.
25
To rozwija wcześniejszą narrację Z.ai dotyczącą rodziny GLM. Firma twierdziła, że modele GLM-5 były trenowane na procesorach Huawei Ascend bez użycia sprzętu Nvidia. Doniesienia wskazują też, że wpisanie Z.ai na amerykańską listę podmiotów objętych ograniczeniami utrudnia firmie dostęp do akceleratorów Nvidia H100, H200 i B200. 26
Znaczenie tej deklaracji jest strategiczne, ale należy traktować ją jako informację pochodzącą od firmy i relacje branżowe, a nie w pełni niezależny audyt wydajności sprzętu. Ostrożniejszy, lepiej uzasadniony wniosek jest taki, że Z.ai pokazuje możliwość obsługi dużego modelu multimodalnego bez polegania na najwydajniejszych serwerowych układach Nvidia.
Anonimowe wydanie wygląda na świadomie zaplanowany schemat: opublikować sprawny model bez wskazywania twórcy, udostępnić go za darmo przez popularne narzędzia programistyczne, obserwować sposób wykorzystania i dopiero potem ujawnić produkt. Z.ai wiązano już wcześniej z testem „Pony Alpha”, który miał wykorzystywać podobny pomysł. Społeczność próbowała zidentyfikować Ox Alpha między innymi na podstawie zachowania tokenizera, wskazówek dotyczących przetwarzania wideo oraz wzorców błędów API. 7
11
13
Część relacji z okresu premiery mówiła także o wyjątkowo dużej skali użycia i entuzjazmie deweloperów, ale dostępne materiały nie potwierdzają niezależnie każdej z tych liczb ani wszystkich cytatów. Takie twierdzenia należy więc traktować jako element relacji z premiery, a nie audytowane dane o adopcji. 14
Taki „stealth launch” ma dla twórcy kilka zalet. Pozwala zebrać informacje o zachowaniu modelu w prawdziwych zadaniach, sprawdzić opóźnienia i koszty infrastruktury oraz zobaczyć, gdzie system zawodzi — zanim pojawi się oficjalna marka i pełna presja medialna. Jednocześnie sami użytkownicy stają się częścią testu obciążeniowego, nawet jeśli nie znają producenta rozwiązania.
GLM-5.3-Flash nie dowodzi, że Z.ai wyprzedziło OpenAI lub Anthropic we wszystkich obszarach możliwości modeli czołowych. Pokazuje jednak bardziej kłopotliwą dla rywali kombinację: multimodalne wejście, bardzo długi kontekst, wagi na licencji MIT, specjalizację w agentach programistycznych i niską cenę API w jednym produkcie. 15
40
Dla deweloperów oznacza to niższy koszt zmiany dostawcy oraz większą praktyczność wdrożeń opartych na własnej infrastrukturze lub wielu dostawcach jednocześnie. Dla firm oferujących zamknięte modele jest to dodatkowa presja na ceny i marże — szczególnie w zastosowaniach programistycznych, gdzie równie ważne jak miejsce w rankingu mogą być liczba zużywanych tokenów, opóźnienia, kontrola nad wdrożeniem i dostępność wag.
Historia Ox Alpha pokazuje więc nie tyle jednorazowy „sekretny” debiut, ile nowy sposób wprowadzania modeli AI na rynek. Najpierw realne użycie i szybka informacja zwrotna, później marka, otwarte wagi i cennik. Jeśli taki model działania się przyjmie, rywalizacja w AI będzie coraz częściej rozgrywać się nie tylko wokół wyników benchmarków, lecz także wokół kosztu działania i tego, kto ma kontrolę nad infrastrukturą.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
26 sierpnia 2026 roku Z.ai potwierdziło, że anonimowy, bezpłatny model Ox Alpha to GLM 5.3 Flash — multimodalny model z 320 mld parametrów, z czego 18 mld jest aktywnych przy każdym tokenie, udostępniony na licencji MIT.
26 sierpnia 2026 roku Z.ai potwierdziło, że anonimowy, bezpłatny model Ox Alpha to GLM 5.3 Flash — multimodalny model z 320 mld parametrów, z czego 18 mld jest aktywnych przy każdym tokenie, udostępniony na licencji MIT. GLM 5.3 Flash przyjmuje tekst, obrazy i wideo, obsługuje kontekst o długości około miliona tokenów, a oficjalna cena Z.ai wynosi 0,15 dolara za milion tokenów wejściowych i 0,50 dolara za milion tokenów wyjściowych.
Tajny debiut pozwolił Z.ai sprawdzić system obsługi na rzeczywistym, masowym ruchu związanym z programowaniem i agentami AI, zanim firma ujawniła markę oraz udostępniła wagi modelu.