Jak na bezpłatny okres testowy, deklarowane możliwości były wyjątkowo ambitne:
Dostęp do Ox Alpha oferował również OpenCode w ramach bezpłatnego pakietu. W komunikacie obiecywano hojne limity i „niemal nieograniczone użycie”, a także deklarowaną przepustowość na poziomie 100 bilionów tokenów dziennie. To twierdzenie operatora, a nie niezależnie zbadany pomiar rzeczywistej wydajności.
Programista Ben Davis przetestował Ox Alpha na 10 zadaniach wybranych z benchmarku DeepSWE, służącego do oceny agentów AI wykonujących złożone zadania programistyczne. Według opublikowanych rezultatów model zaliczył osiem z nich, osiągając około 80 proc. W tym samym ograniczonym porównaniu Claude Fable 5 uzyskał 65 proc., a GPT-5.6 Sol — 52 proc.
To wynik, który przyciąga uwagę, ale nie powinien być przedstawiany jako oficjalne zwycięstwo w DeepSWE. Wersja DeepSWE v1.1 obejmuje 113 oryginalnych, długoterminowych zadań inżynierii oprogramowania rozłożonych na 91 repozytoriów. Eksperyment obejmował więc tylko niewielką część całego benchmarku.
Na interpretację wpływają także istotne ograniczenia metodologiczne:
W dostępnym wówczas zestawieniu publicznym prowadził Claude Opus 5 z wynikiem 73,6 proc., przed GPT-5.6 Sol (72,7 proc.) i Claude Fable 5 (69,7 proc.). Ostrożny wniosek brzmi zatem: Ox Alpha wypadł bardzo mocno w 10-zadaniowym eksperymencie Davisa, ale rezultat nie dowodzi, że był najlepszym uniwersalnym modelem do programowania.
Najpopularniejsza teoria wiąże Ox Alpha z firmą Zhipu AI, działającą również pod marką Z.ai, oraz z rodziną modeli GLM. Nie opiera się ona na komunikacie firmy, lecz na analizie tzw. odcisków palca modelu — powtarzalnych cech jego działania.
W jednym z opisywanych testów porównano sposób tokenizacji Ox Alpha i GLM-5.3 na 25 promptach. Liczba tokenów miała być identyczna po uwzględnieniu stałej nakładki liczącej 75 tokenów. Osobne testy wideo wykazały podobieństwa w sposobie przeliczania obrazu na tokeny, między innymi w próbkowaniu klatek, skalowaniu czasu trwania i obsłudze rozdzielczości.
Analitycy wskazywali również na podobny styl odpowiedzi, zachowanie interfejsu API oraz sposób reagowania na dane audio. Każda z tych cech z osobna mogłaby wynikać ze wspólnego wrappera, infrastruktury lub naśladowania. W połączeniu tworzą jednak — zdaniem badaczy — bardziej przekonujący zestaw zgodny ze zunifikowaną multimodalną linią GLM firmy Zhipu.
Kontekstu dostarcza także wcześniejsze wykorzystywanie przez Zhipu anonimowych lub „ukrytych” wydań testowych, w tym nazwy Pony Alpha. To poszlaka, nie dowód, że właśnie Zhipu stworzyło Ox Alpha.
W okresie objętym raportami żadna firma publicznie nie przypisała sobie Ox Alpha, a Zhipu nie potwierdziło tej atrybucji. Pojawiały się spekulacje dotyczące konkretnych wariantów GLM, ale dostępne dane nie rozstrzygają, czy Ox Alpha jest nieopublikowanym modelem, wersją produkcyjną, systemem dostrojonym do określonych zadań, czy niezależnie obsługiwanym modelem korzystającym z podobnej infrastruktury.
Najbardziej uzasadniony opis brzmi więc: Ox Alpha prawdopodobnie wywodzi się z rodziny GLM i może być powiązany z Zhipu, ale jego twórca oraz dokładna tożsamość modelu nie zostały potwierdzone. Krążących w sieci procentowych ocen pewności poszczególnych analityków nie należy traktować jak oficjalnej identyfikacji.
Dla programistów jedną z najważniejszych praktycznych informacji jest polityka prywatności Ox Alpha. Wpis modelu na OpenRouterze informował, że prompty i odpowiedzi są przechowywane przez dostawcę modelu, ale nie są wykorzystywane do trenowania.
To nie to samo co ogólna polityka gromadzenia danych OpenRoutera. Platforma deklaruje, że sama nie przechowuje promptów ani odpowiedzi, chyba że użytkownik dobrowolnie włączy rejestrowanie danych wejściowych i wyjściowych. Jednocześnie OpenRouter opisuje polityki dostawców osobno, dlatego warstwa routingu i dostawca modelu mogą stosować różne zasady retencji.
OpenCode reklamował Ox Alpha jako usługę z „zerową retencją danych”. Taka obietnica może dotyczyć sposobu obsługi żądań przez sam OpenCode, ale nie unieważnia automatycznie informacji o przechowywaniu danych przez dostawcę modelu dostępnego przez OpenRouter. Innymi słowy, stwierdzenia „OpenCode nie przechowuje danych” oraz „dostawca modelu przechowuje prompty i odpowiedzi” mogą dotyczyć różnych etapów tej samej ścieżki żądania.
Dopóki dostawcy nie opublikują jednej, jednoznacznej i wiążącej polityki przetwarzania danych, rozsądnie jest zakładać, że dostawca modelu może przechowywać przesłane treści. Nie warto wysyłać do anonimowego, bezpłatnego systemu poufnego kodu źródłowego, danych dostępowych, danych osobowych ani informacji objętych regulacjami tylko dlatego, że model deklaruje brak trenowania na promptach.
Ox Alpha zwrócił uwagę z trzech powodów: krótkiego bezpłatnego okresu testowego, wyjątkowo dużego deklarowanego okna kontekstowego z obsługą wielu formatów oraz zaskakująco dobrego wyniku we wczesnym teście programistycznym. Dostępne dowody uzasadniają jednak ostrożną interpretację, a nie twierdzenie, że anonimowe laboratorium jednoznacznie pokonało wszystkich uznanych liderów.
Wynik 80 proc. w DeepSWE oznacza osiem zaliczonych zadań na 10, a nie rezultat z całego benchmarku obejmującego 113 zadań. Publiczny ranking nadal wskazywał Claude Opus 5 jako lidera, a Ox Alpha nie przeszedł oficjalnej procedury oceny.
Techniczne podobieństwa sprawiają, że związek z Zhipu i rodziną GLM jest dziś najbardziej prawdopodobnym wyjaśnieniem, ale nie ma publicznego potwierdzenia autorstwa. Do eksperymentów Ox Alpha był interesującym modelem. W systemach produkcyjnych i przy pracy z wrażliwym kodem anonimowy operator, retencja danych po stronie dostawcy oraz nierozstrzygnięta tożsamość przemawiają za daleko posuniętą ostrożnością.
Jak na bezpłatny okres testowy, deklarowane możliwości były wyjątkowo ambitne:
Dostęp do Ox Alpha oferował również OpenCode w ramach bezpłatnego pakietu. W komunikacie obiecywano hojne limity i „niemal nieograniczone użycie”, a także deklarowaną przepustowość na poziomie 100 bilionów tokenów dziennie. To twierdzenie operatora, a nie niezależnie zbadany pomiar rzeczywistej wydajności.
Programista Ben Davis przetestował Ox Alpha na 10 zadaniach wybranych z benchmarku DeepSWE, służącego do oceny agentów AI wykonujących złożone zadania programistyczne. Według opublikowanych rezultatów model zaliczył osiem z nich, osiągając około 80 proc. W tym samym ograniczonym porównaniu Claude Fable 5 uzyskał 65 proc., a GPT-5.6 Sol — 52 proc.
To wynik, który przyciąga uwagę, ale nie powinien być przedstawiany jako oficjalne zwycięstwo w DeepSWE. Wersja DeepSWE v1.1 obejmuje 113 oryginalnych, długoterminowych zadań inżynierii oprogramowania rozłożonych na 91 repozytoriów. Eksperyment obejmował więc tylko niewielką część całego benchmarku.
Na interpretację wpływają także istotne ograniczenia metodologiczne:
W dostępnym wówczas zestawieniu publicznym prowadził Claude Opus 5 z wynikiem 73,6 proc., przed GPT-5.6 Sol (72,7 proc.) i Claude Fable 5 (69,7 proc.). Ostrożny wniosek brzmi zatem: Ox Alpha wypadł bardzo mocno w 10-zadaniowym eksperymencie Davisa, ale rezultat nie dowodzi, że był najlepszym uniwersalnym modelem do programowania.
Najpopularniejsza teoria wiąże Ox Alpha z firmą Zhipu AI, działającą również pod marką Z.ai, oraz z rodziną modeli GLM. Nie opiera się ona na komunikacie firmy, lecz na analizie tzw. odcisków palca modelu — powtarzalnych cech jego działania.
W jednym z opisywanych testów porównano sposób tokenizacji Ox Alpha i GLM-5.3 na 25 promptach. Liczba tokenów miała być identyczna po uwzględnieniu stałej nakładki liczącej 75 tokenów. Osobne testy wideo wykazały podobieństwa w sposobie przeliczania obrazu na tokeny, między innymi w próbkowaniu klatek, skalowaniu czasu trwania i obsłudze rozdzielczości.
Analitycy wskazywali również na podobny styl odpowiedzi, zachowanie interfejsu API oraz sposób reagowania na dane audio. Każda z tych cech z osobna mogłaby wynikać ze wspólnego wrappera, infrastruktury lub naśladowania. W połączeniu tworzą jednak — zdaniem badaczy — bardziej przekonujący zestaw zgodny ze zunifikowaną multimodalną linią GLM firmy Zhipu.
Kontekstu dostarcza także wcześniejsze wykorzystywanie przez Zhipu anonimowych lub „ukrytych” wydań testowych, w tym nazwy Pony Alpha. To poszlaka, nie dowód, że właśnie Zhipu stworzyło Ox Alpha.
W okresie objętym raportami żadna firma publicznie nie przypisała sobie Ox Alpha, a Zhipu nie potwierdziło tej atrybucji. Pojawiały się spekulacje dotyczące konkretnych wariantów GLM, ale dostępne dane nie rozstrzygają, czy Ox Alpha jest nieopublikowanym modelem, wersją produkcyjną, systemem dostrojonym do określonych zadań, czy niezależnie obsługiwanym modelem korzystającym z podobnej infrastruktury.
Najbardziej uzasadniony opis brzmi więc: Ox Alpha prawdopodobnie wywodzi się z rodziny GLM i może być powiązany z Zhipu, ale jego twórca oraz dokładna tożsamość modelu nie zostały potwierdzone. Krążących w sieci procentowych ocen pewności poszczególnych analityków nie należy traktować jak oficjalnej identyfikacji.
Dla programistów jedną z najważniejszych praktycznych informacji jest polityka prywatności Ox Alpha. Wpis modelu na OpenRouterze informował, że prompty i odpowiedzi są przechowywane przez dostawcę modelu, ale nie są wykorzystywane do trenowania.
To nie to samo co ogólna polityka gromadzenia danych OpenRoutera. Platforma deklaruje, że sama nie przechowuje promptów ani odpowiedzi, chyba że użytkownik dobrowolnie włączy rejestrowanie danych wejściowych i wyjściowych. Jednocześnie OpenRouter opisuje polityki dostawców osobno, dlatego warstwa routingu i dostawca modelu mogą stosować różne zasady retencji.
OpenCode reklamował Ox Alpha jako usługę z „zerową retencją danych”. Taka obietnica może dotyczyć sposobu obsługi żądań przez sam OpenCode, ale nie unieważnia automatycznie informacji o przechowywaniu danych przez dostawcę modelu dostępnego przez OpenRouter. Innymi słowy, stwierdzenia „OpenCode nie przechowuje danych” oraz „dostawca modelu przechowuje prompty i odpowiedzi” mogą dotyczyć różnych etapów tej samej ścieżki żądania.
Dopóki dostawcy nie opublikują jednej, jednoznacznej i wiążącej polityki przetwarzania danych, rozsądnie jest zakładać, że dostawca modelu może przechowywać przesłane treści. Nie warto wysyłać do anonimowego, bezpłatnego systemu poufnego kodu źródłowego, danych dostępowych, danych osobowych ani informacji objętych regulacjami tylko dlatego, że model deklaruje brak trenowania na promptach.
Ox Alpha zwrócił uwagę z trzech powodów: krótkiego bezpłatnego okresu testowego, wyjątkowo dużego deklarowanego okna kontekstowego z obsługą wielu formatów oraz zaskakująco dobrego wyniku we wczesnym teście programistycznym. Dostępne dowody uzasadniają jednak ostrożną interpretację, a nie twierdzenie, że anonimowe laboratorium jednoznacznie pokonało wszystkich uznanych liderów.
Wynik 80 proc. w DeepSWE oznacza osiem zaliczonych zadań na 10, a nie rezultat z całego benchmarku obejmującego 113 zadań. Publiczny ranking nadal wskazywał Claude Opus 5 jako lidera, a Ox Alpha nie przeszedł oficjalnej procedury oceny.
Techniczne podobieństwa sprawiają, że związek z Zhipu i rodziną GLM jest dziś najbardziej prawdopodobnym wyjaśnieniem, ale nie ma publicznego potwierdzenia autorstwa. Do eksperymentów Ox Alpha był interesującym modelem. W systemach produkcyjnych i przy pracy z wrażliwym kodem anonimowy operator, retencja danych po stronie dostawcy oraz nierozstrzygnięta tożsamość przemawiają za daleko posuniętą ostrożnością.