Ox Alpha klarade 8 av 10 uppgifter i Ben Davis begränsade DeepSWE test, jämfört med 65 procent för Claude Fable 5 och 52 procent för GPT 5.6 Sol – men urvalet var för litet för att visa att modellen leder totalt. En kontext på 1 048 576 token, text , bild och videoindata samt en kostnadsfri förhandsperiod på en veck...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is known about the anonymous AI model “stealth/ox-alpha,” which appeared on OpenRouter on August 20, 2026 with no disclosed creator, a. Article summary: Ox Alpha is an anonymous, short-preview “stealth” model, not a verified new frontier-model release. The evidence makes a Zhipu AI / Z.ai GLM-family origin plausible, but it was still unconfirmed as of August 21, so it sh. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Ox Alpha bör främst ses som en anonym offentlig förhandsversion – inte som en bekräftad lansering av en ny ledande AI-modell. Modellen dök upp på OpenRouter den 20 augusti 2026, med fri åtkomst i en vecka och specifikationer som riktar sig mot programmering, långvariga agentuppgifter och multimodala arbetsflöden. Tekniska kännetecken gör det plausibelt att modellen har sitt ursprung i Zhipu AI, även känt som Z.ai, och GLM-familjen. Men det är fortfarande en slutsats, inte ett offentliggjort faktum.
OpenRouter listade stealth/ox-alpha som en modell från en extern leverantör vars utvecklare och operatör valde att vara anonyma under förhandsperioden. OpenRouter uppger att plattformen bara vidarebefordrar förfrågningar och inte är modellens utvecklare, ägare eller leverantör.
De utannonserade specifikationerna var ovanligt ambitiösa för en kostnadsfri förhandsversion:
Även OpenCode erbjöd tillgång via sitt kostnadsfria abonnemang. I sitt tillkännagivande beskrev tjänsten generösa begränsningar och ”nästan obegränsad användning”, samt uppgav en kapacitet på 100 biljoner token per dag. Det är ett påstående från operatören, inte en oberoende granskad mätning av faktisk genomströmning.
Utvecklaren Ben Davis testade Ox Alpha på 10 uppgifter hämtade från DeepSWE, ett benchmark för mjukvaruutveckling. Modellen uppges ha klarat åtta av dem, vilket motsvarar ungefär 80 procent. I samma begränsade jämförelse fick Claude Fable 5 65 procent och GPT-5.6 Sol 52 procent.
Det är ett iögonfallande resultat, men bör inte beskrivas som en officiell seger i DeepSWE. DeepSWE v1.1 består av 113 ursprungliga, långvariga utvecklingsuppgifter från 91 kodbaser. Testet med 10 uppgifter täckte alltså bara en liten del av benchmarket.
Jämförelsen hade dessutom flera metodologiska begränsningar:
Den offentliga topplistan som fanns tillgänglig vid tidpunkten placerade Claude Opus 5 först på 73,6 procent, följd av GPT-5.6 Sol på 72,7 procent och Claude Fable 5 på 69,7 procent. Den försiktiga slutsatsen är därför snävare: Ox Alpha såg mycket stark ut i Davis test med 10 uppgifter, men resultatet visar inte att modellen var bäst på programmering i allmänhet.
Den ledande teorin kopplar Ox Alpha till Zhipu AI, även kallat Z.ai, och företagets GLM-modeller. Bevisningen bygger på beteendemässiga och tekniska fingeravtryck, inte på ett uttalande från företaget.
I ett rapporterat test jämfördes Ox Alphas tokenisering med GLM-5.3 i 25 olika promptar. De underliggande tokenräkningarna uppges ha matchat efter att en konstant omslutning på 75 token räknats bort. Separata videotester ska också ha visat samma beteende för visuella token, bland annat likheter i bildrutornas sampling, skalning efter videolängd och hantering av upplösning.
Andra rapporterade likheter gäller svarsstil, API-beteende och hur modellen hanterar ljudindata. Var och en av dessa ledtrådar skulle kunna förklaras av ett gemensamt omslag, samma infrastruktur eller efterlikning. Tillsammans menar analytiker att de bildar ett starkare mönster som stämmer överens med Zhipus enhetliga multimodala GLM-serie.
Att Zhipu tidigare har använt anonyma eller så kallade stealth-lanseringar, däribland namnet Pony Alpha, ger ytterligare ett indirekt sammanhang. Det bevisar däremot inte att Zhipu skapade Ox Alpha.
Inget företag hade offentligt tagit på sig Ox Alpha under den period som rapporterna gäller, och Zhipu hade inte bekräftat kopplingen. Spekulationerna har nämnt specifika GLM-varianter, men det tillgängliga materialet visar inte om Ox Alpha är en ännu inte lanserad modell, en produktionsvariant, ett finjusterat system eller en fristående modell som använder närliggande infrastruktur.
Den mest hållbara beskrivningen är därför: Ox Alpha är sannolikt GLM-baserad och kan vara kopplad till Zhipu, men skaparen och modellens exakta identitet var inte verifierade. Konfidenssiffror som enskilda analytiker har spridit bör inte behandlas som en officiell identifiering.
Ox Alphas integritetsvillkor är en av de viktigaste praktiska detaljerna för utvecklare. I modellens OpenRouter-listning stod det att frågor och svar sparas av den underliggande leverantören, men inte används för träning.
Det är inte samma sak som OpenRouters allmänna policy för datainsamling. Den säger att OpenRouter inte lagrar promptar eller svar, såvida användaren inte väljer att aktivera loggning av in- och utdata. OpenRouter redovisar också leverantörernas policyer separat, vilket innebär att routningslagret och modellens leverantör kan ha olika regler för lagring.
OpenCode marknadsförde samtidigt Ox Alpha med ”noll datalagring”. Det löftet kan gälla OpenCodes egen hantering av förfrågningar, men upphäver inte automatiskt uppgiften om att leverantören sparar data när samma modell nås via OpenRouter. Med andra ord kan påståendena ”OpenCode sparar inte data” och ”den underliggande modellleverantören sparar frågor och svar” båda beskriva olika delar av samma förfrågningskedja.
Tills leverantörerna publicerar en enda tydlig och avtalsmässigt bindande policy för personuppgifts- och databehandling är det klokt att utgå från att modellleverantören kan spara inskickat material. Utvecklare bör undvika att skicka proprietär källkod, inloggningsuppgifter, personuppgifter eller reglerad information bara för att tjänsten är kostnadsfri eller uppges inte träna på promptar.
Ox Alpha blev uppmärksammad av tre skäl: en kort kostnadsfri förhandsperiod, ett ovanligt stort kontextfönster med multimodala funktioner och ett slående tidigt kodresultat. Men underlaget talar för en nyanserad tolkning – inte för påståendet att ett okänt labb definitivt har besegrat de etablerade ledande modellerna.
Siffran 80 procent i DeepSWE kom från åtta godkända uppgifter av tio, inte från hela benchmarkets 113 uppgifter. Den offentliga topplistan hade fortfarande Claude Opus 5 i topp, och Ox Alpha hade inte genomgått den officiella utvärderingen.
De tekniska fingeravtrycken gör en koppling till Zhipu och GLM till den ledande förklaringen, men ingen offentlig bekräftelse fastställde vem som låg bakom modellen. För experiment var Ox Alpha en intressant modell att prova. För produktionssystem eller känslig kod var den anonyma ägaren, leverantörens datalagring och den oklara identiteten skäl att gå försiktigt fram.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha klarade 8 av 10 uppgifter i Ben Davis begränsade DeepSWE test, jämfört med 65 procent för Claude Fable 5 och 52 procent för GPT 5.6 Sol – men urvalet var för litet för att visa att modellen leder totalt.
Ox Alpha klarade 8 av 10 uppgifter i Ben Davis begränsade DeepSWE test, jämfört med 65 procent för Claude Fable 5 och 52 procent för GPT 5.6 Sol – men urvalet var för litet för att visa att modellen leder totalt. En kontext på 1 048 576 token, text , bild och videoindata samt en kostnadsfri förhandsperiod på en vecka gjorde modellen uppmärksammad.
OpenRouter uppger att leverantören sparar frågor och svar utan att använda dem för träning, medan OpenCode marknadsförde tjänsten med noll datalagring.