Ox Alpha zaliczył 8 z 10 zadań w ograniczonym teście DeepSWE przeprowadzonym przez Bena Davisa. Okno kontekstowe o rozmiarze 1 048 576 tokenów, obsługa tekstu, obrazów i wideo oraz tygodniowy bezpłatny dostęp uczyniły model wyjątkowo interesującym.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is known about the anonymous AI model “stealth/ox-alpha,” which appeared on OpenRouter on August 20, 2026 with no disclosed creator, a. Article summary: Ox Alpha is an anonymous, short-preview “stealth” model, not a verified new frontier-model release. The evidence makes a Zhipu AI / Z.ai GLM-family origin plausible, but it was still unconfirmed as of August 21, so it sh. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Ox Alpha najlepiej traktować jako anonimowy publiczny podgląd modelu, a nie potwierdzoną premierę nowego modelu czołowej generacji. System pojawił się 20 sierpnia 2026 r. na OpenRouterze, z tygodniowym okresem bezpłatnego dostępu i parametrami ukierunkowanymi na programowanie, długotrwałą pracę agentów oraz zastosowania multimodalne. Jego techniczne cechy sprawiają, że pochodzenie z rodziny GLM firmy Zhipu AI, znanej także jako Z.ai, jest prawdopodobną hipotezą — pozostaje jednak hipotezą, a nie ogłoszonym faktem.
OpenRouter umieścił model stealth/ox-alpha jako system zewnętrznego dostawcy, który na czas testów postanowił zachować anonimowość. Platforma podkreśla, że jedynie przekazuje żądania do modelu i nie jest jego twórcą, właścicielem ani dostawcą.
Jak na bezpłatny okres testowy, deklarowane możliwości były wyjątkowo ambitne:
Dostęp do Ox Alpha oferował również OpenCode w ramach bezpłatnego pakietu. W komunikacie obiecywano hojne limity i „niemal nieograniczone użycie”, a także deklarowaną przepustowość na poziomie 100 bilionów tokenów dziennie. To twierdzenie operatora, a nie niezależnie zbadany pomiar rzeczywistej wydajności.
Programista Ben Davis przetestował Ox Alpha na 10 zadaniach wybranych z benchmarku DeepSWE, służącego do oceny agentów AI wykonujących złożone zadania programistyczne. Według opublikowanych rezultatów model zaliczył osiem z nich, osiągając około 80 proc. W tym samym ograniczonym porównaniu Claude Fable 5 uzyskał 65 proc., a GPT-5.6 Sol — 52 proc.
To wynik, który przyciąga uwagę, ale nie powinien być przedstawiany jako oficjalne zwycięstwo w DeepSWE. Wersja DeepSWE v1.1 obejmuje 113 oryginalnych, długoterminowych zadań inżynierii oprogramowania rozłożonych na 91 repozytoriów. Eksperyment obejmował więc tylko niewielką część całego benchmarku.
Na interpretację wpływają także istotne ograniczenia metodologiczne:
W dostępnym wówczas zestawieniu publicznym prowadził Claude Opus 5 z wynikiem 73,6 proc., przed GPT-5.6 Sol (72,7 proc.) i Claude Fable 5 (69,7 proc.). Ostrożny wniosek brzmi zatem: Ox Alpha wypadł bardzo mocno w 10-zadaniowym eksperymencie Davisa, ale rezultat nie dowodzi, że był najlepszym uniwersalnym modelem do programowania.
Najpopularniejsza teoria wiąże Ox Alpha z firmą Zhipu AI, działającą również pod marką Z.ai, oraz z rodziną modeli GLM. Nie opiera się ona na komunikacie firmy, lecz na analizie tzw. odcisków palca modelu — powtarzalnych cech jego działania.
W jednym z opisywanych testów porównano sposób tokenizacji Ox Alpha i GLM-5.3 na 25 promptach. Liczba tokenów miała być identyczna po uwzględnieniu stałej nakładki liczącej 75 tokenów. Osobne testy wideo wykazały podobieństwa w sposobie przeliczania obrazu na tokeny, między innymi w próbkowaniu klatek, skalowaniu czasu trwania i obsłudze rozdzielczości.
Analitycy wskazywali również na podobny styl odpowiedzi, zachowanie interfejsu API oraz sposób reagowania na dane audio. Każda z tych cech z osobna mogłaby wynikać ze wspólnego wrappera, infrastruktury lub naśladowania. W połączeniu tworzą jednak — zdaniem badaczy — bardziej przekonujący zestaw zgodny ze zunifikowaną multimodalną linią GLM firmy Zhipu.
Kontekstu dostarcza także wcześniejsze wykorzystywanie przez Zhipu anonimowych lub „ukrytych” wydań testowych, w tym nazwy Pony Alpha. To poszlaka, nie dowód, że właśnie Zhipu stworzyło Ox Alpha.
W okresie objętym raportami żadna firma publicznie nie przypisała sobie Ox Alpha, a Zhipu nie potwierdziło tej atrybucji. Pojawiały się spekulacje dotyczące konkretnych wariantów GLM, ale dostępne dane nie rozstrzygają, czy Ox Alpha jest nieopublikowanym modelem, wersją produkcyjną, systemem dostrojonym do określonych zadań, czy niezależnie obsługiwanym modelem korzystającym z podobnej infrastruktury.
Najbardziej uzasadniony opis brzmi więc: Ox Alpha prawdopodobnie wywodzi się z rodziny GLM i może być powiązany z Zhipu, ale jego twórca oraz dokładna tożsamość modelu nie zostały potwierdzone. Krążących w sieci procentowych ocen pewności poszczególnych analityków nie należy traktować jak oficjalnej identyfikacji.
Dla programistów jedną z najważniejszych praktycznych informacji jest polityka prywatności Ox Alpha. Wpis modelu na OpenRouterze informował, że prompty i odpowiedzi są przechowywane przez dostawcę modelu, ale nie są wykorzystywane do trenowania.
To nie to samo co ogólna polityka gromadzenia danych OpenRoutera. Platforma deklaruje, że sama nie przechowuje promptów ani odpowiedzi, chyba że użytkownik dobrowolnie włączy rejestrowanie danych wejściowych i wyjściowych. Jednocześnie OpenRouter opisuje polityki dostawców osobno, dlatego warstwa routingu i dostawca modelu mogą stosować różne zasady retencji.
OpenCode reklamował Ox Alpha jako usługę z „zerową retencją danych”. Taka obietnica może dotyczyć sposobu obsługi żądań przez sam OpenCode, ale nie unieważnia automatycznie informacji o przechowywaniu danych przez dostawcę modelu dostępnego przez OpenRouter. Innymi słowy, stwierdzenia „OpenCode nie przechowuje danych” oraz „dostawca modelu przechowuje prompty i odpowiedzi” mogą dotyczyć różnych etapów tej samej ścieżki żądania.
Dopóki dostawcy nie opublikują jednej, jednoznacznej i wiążącej polityki przetwarzania danych, rozsądnie jest zakładać, że dostawca modelu może przechowywać przesłane treści. Nie warto wysyłać do anonimowego, bezpłatnego systemu poufnego kodu źródłowego, danych dostępowych, danych osobowych ani informacji objętych regulacjami tylko dlatego, że model deklaruje brak trenowania na promptach.
Ox Alpha zwrócił uwagę z trzech powodów: krótkiego bezpłatnego okresu testowego, wyjątkowo dużego deklarowanego okna kontekstowego z obsługą wielu formatów oraz zaskakująco dobrego wyniku we wczesnym teście programistycznym. Dostępne dowody uzasadniają jednak ostrożną interpretację, a nie twierdzenie, że anonimowe laboratorium jednoznacznie pokonało wszystkich uznanych liderów.
Wynik 80 proc. w DeepSWE oznacza osiem zaliczonych zadań na 10, a nie rezultat z całego benchmarku obejmującego 113 zadań. Publiczny ranking nadal wskazywał Claude Opus 5 jako lidera, a Ox Alpha nie przeszedł oficjalnej procedury oceny.
Techniczne podobieństwa sprawiają, że związek z Zhipu i rodziną GLM jest dziś najbardziej prawdopodobnym wyjaśnieniem, ale nie ma publicznego potwierdzenia autorstwa. Do eksperymentów Ox Alpha był interesującym modelem. W systemach produkcyjnych i przy pracy z wrażliwym kodem anonimowy operator, retencja danych po stronie dostawcy oraz nierozstrzygnięta tożsamość przemawiają za daleko posuniętą ostrożnością.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha zaliczył 8 z 10 zadań w ograniczonym teście DeepSWE przeprowadzonym przez Bena Davisa.
Ox Alpha zaliczył 8 z 10 zadań w ograniczonym teście DeepSWE przeprowadzonym przez Bena Davisa. Okno kontekstowe o rozmiarze 1 048 576 tokenów, obsługa tekstu, obrazów i wideo oraz tygodniowy bezpłatny dostęp uczyniły model wyjątkowo interesującym.
OpenRouter informuje, że dostawca przechowuje prompty i odpowiedzi, ale nie wykorzystuje ich do trenowania.