Ilmaiseen esikatseluun nähden ilmoitetut tekniset tiedot olivat kunnianhimoiset:
Myös OpenCode tarjosi mallia ilmaistasollaan. Sen ilmoituksessa luvattiin avokätisiä käyttörajoja ja ”lähes rajatonta käyttöä”. Lisäksi palvelu kertoi kapasiteetin yltävän 100 biljoonaan tokeniin päivässä. Tämä on palveluntarjoajan ilmoittama kapasiteettiluku, ei riippumattomasti auditoitu mitta todellisesta läpimenosta.
Kehittäjä Ben Davis testasi Ox Alphaa kymmenellä DeepSWE-ohjelmistokehitysbenchmarkin tehtävällä. Malli selvitti niistä tiettävästi kahdeksan, joten tulokseksi muodostui noin 80 prosenttia. Samassa rajatussa vertailussa Claude Fable 5 sai 65 prosenttia ja GPT-5.6 Sol 52 prosenttia.
Tulos on huomiota herättävä, mutta sitä ei pidä kutsua viralliseksi DeepSWE-voitoksi. DeepSWE v1.1 sisältää 113 alkuperäistä, pitkäkestoista ohjelmistokehitystehtävää 91 repositoriossa. Kymmenen tehtävän koe kattoi siis vain pienen osan koko benchmarkista.
Vertailuun liittyy myös useita menetelmällisiä rajoituksia:
Tuolloin saatavilla ollut julkinen leaderboard-tilanne asetti Claude Opus 5:n ensimmäiseksi 73,6 prosentin tuloksella, GPT-5.6 Solin toiseksi 72,7 prosentilla ja Claude Fable 5:n kolmanneksi 69,7 prosentilla.
Varovainen johtopäätös onkin tämä: Ox Alpha vaikutti erittäin vahvalta Davisin kymmenen tehtävän kokeessa, mutta tulos ei osoita sen olevan paras yleiskäyttöinen koodausmalli.
Suosituin alkuperäteoria yhdistää Ox Alphan Zhipu AI:hin, joka tunnetaan myös nimellä Z.ai, sekä sen GLM-malliperheeseen. Päätelmä perustuu mallin käyttäytymisen tekniseen sormenjälkianalyysiin, ei yhtiön ilmoitukseen.
Eräässä raportoidussa testissä Ox Alphan ja GLM-5.3:n tokenisointia verrattiin 25 kehotteella. Raakatokenien määrät vastasivat toisiaan, kun Ox Alphan joka kerta tuottama 75 tokenin vakioero otettiin huomioon. Erillisissä videotesteissä havaittiin tiettävästi vastaavuuksia myös visuaalisten tokenien käsittelyssä, kuten kuvataajuuden näytteistyksessä, videon keston skaalauksessa ja resoluution käsittelyssä.
Muita raportoituja yhtäläisyyksiä ovat vastaustyyli, rajapinnan toiminta ja tapa käsitellä äänisyötettä. Yksittäin tarkasteltuna mikä tahansa näistä vihjeistä voisi selittyä yhteisellä kääreellä, infrastruktuurilla tai jäljittelyllä. Yhdessä ne muodostavat analyytikoiden mukaan vahvemman kokonaisuuden, joka sopii Zhipun yhtenäiseen multimodaaliseen GLM-linjaan.
Zhipun aiemmat anonyymit tai niin sanotut stealth-julkaisut, kuten Pony Alpha -nimellä tehty julkaisu, tarjoavat teorialle lisää taustaa. Ne eivät kuitenkaan todista, että juuri Zhipu olisi luonut Ox Alphan.
Yksikään yhtiö ei ollut julkisesti ilmoittautunut Ox Alphan tekijäksi lähteissä käsiteltynä ajanjaksona, eikä Zhipu ollut vahvistanut yhteyttä. Spekulaatioissa on mainittu tiettyjä GLM-versioita, mutta saatavilla oleva näyttö ei kerro, onko Ox Alpha julkaisematon malli, tuotantoversio, hienosäädetty järjestelmä vai itsenäisesti ylläpidetty malli, joka hyödyntää siihen liittyvää infrastruktuuria.
Puolustettavin kuvaus on siksi seuraava: Ox Alpha on todennäköisesti GLM-pohjainen ja saattaa liittyä Zhipuun, mutta sen tekijä ja tarkka malli-identiteetti olivat vahvistamatta. Yksittäisten analyytikoiden ilmoittamia varmuusprosentteja ei pidä tulkita viralliseksi tunnistamiseksi.
Ox Alphan tietosäilytystä koskevat ehdot ovat kehittäjille käytännössä yksi tärkeimmistä yksityiskohdista. Mallin OpenRouter-listauksen mukaan taustalla oleva palveluntarjoaja säilyttää kehotteet ja vastaukset, mutta ei käytä niitä koulutukseen.
Tämä on eri asia kuin OpenRouterin yleinen tiedonkeruukäytäntö. OpenRouter kertoo, ettei se itse tallenna kehotteita tai vastauksia, ellei käyttäjä erikseen ota käyttöön syöte- ja tulostelokien keräämistä. Samalla palvelu dokumentoi palveluntarjoajien käytännöt erikseen, joten reitityskerroksella ja varsinaisella mallipalveluntarjoajalla voi olla erilaiset säilytyssäännöt.
OpenCode puolestaan mainosti Ox Alphaa ”nollatiedonsäilytyksellä”. Tämä voi kuvata OpenCoden omaa pyyntöjen käsittelyä, mutta se ei automaattisesti kumoa OpenRouter-reitille ilmoitettua palveluntarjoajan säilytyskäytäntöä. Toisin sanoen väitteet ”OpenCode ei säilytä tietoja” ja ”mallipalveluntarjoaja säilyttää kehotteet ja vastaukset” voivat molemmat pitää paikkansa, jos ne koskevat pyynnön eri vaiheita.
Ennen kuin palveluntarjoajat julkaisevat yhden selkeän ja sopimuksellisesti sitovan tietojenkäsittelypolitiikan, varovainen oletus on, että mallipalveluntarjoaja saattaa säilyttää lähetetyn sisällön. Kehittäjien ei kannata lähettää palveluun yrityssalaisuuksia, omistusoikeuden alaista lähdekoodia, tunnistetietoja, henkilötietoja tai säänneltyä dataa vain siksi, että palvelu on ilmainen tai että kehotteita ei ilmoiteta käytettävän koulutukseen.
Ox Alpha nousi otsikoihin kolmesta syystä: se oli lyhyen aikaa ilmainen, sen ilmoitettu konteksti-ikkuna ja multimodaaliset ominaisuudet olivat poikkeuksellisen laajat, ja sen ensimmäinen koodauskoe tuotti näyttävän tuloksen.
Näyttö tukee kuitenkin maltillista tulkintaa – ei väitettä siitä, että tuntematon laboratorio olisi kiistatta päihittänyt vakiintuneet huippumallit.
DeepSWE:n 80 prosentin tulos syntyi kahdeksasta onnistumisesta kymmenessä tehtävässä, ei koko 113 tehtävän benchmarkista. Julkisella leaderboardilla Claude Opus 5 oli edelleen kärjessä, eikä Ox Alpha ollut käynyt läpi virallista arviointiprosessia.
Mallin tekniset sormenjäljet tekevät Zhipun ja GLM:n yhteydestä vahvimman selityksen, mutta julkista vahvistusta tekijästä ei ole. Kokeiluihin Ox Alpha oli kiinnostava tuttavuus. Tuotantojärjestelmissä tai arkaluonteisen koodin kanssa sen anonyymi omistajuus, palveluntarjoajan tietojen säilytys ja ratkaisematon identiteetti ovat kuitenkin hyviä syitä edetä varovasti.
Ilmaiseen esikatseluun nähden ilmoitetut tekniset tiedot olivat kunnianhimoiset:
Myös OpenCode tarjosi mallia ilmaistasollaan. Sen ilmoituksessa luvattiin avokätisiä käyttörajoja ja ”lähes rajatonta käyttöä”. Lisäksi palvelu kertoi kapasiteetin yltävän 100 biljoonaan tokeniin päivässä. Tämä on palveluntarjoajan ilmoittama kapasiteettiluku, ei riippumattomasti auditoitu mitta todellisesta läpimenosta.
Kehittäjä Ben Davis testasi Ox Alphaa kymmenellä DeepSWE-ohjelmistokehitysbenchmarkin tehtävällä. Malli selvitti niistä tiettävästi kahdeksan, joten tulokseksi muodostui noin 80 prosenttia. Samassa rajatussa vertailussa Claude Fable 5 sai 65 prosenttia ja GPT-5.6 Sol 52 prosenttia.
Tulos on huomiota herättävä, mutta sitä ei pidä kutsua viralliseksi DeepSWE-voitoksi. DeepSWE v1.1 sisältää 113 alkuperäistä, pitkäkestoista ohjelmistokehitystehtävää 91 repositoriossa. Kymmenen tehtävän koe kattoi siis vain pienen osan koko benchmarkista.
Vertailuun liittyy myös useita menetelmällisiä rajoituksia:
Tuolloin saatavilla ollut julkinen leaderboard-tilanne asetti Claude Opus 5:n ensimmäiseksi 73,6 prosentin tuloksella, GPT-5.6 Solin toiseksi 72,7 prosentilla ja Claude Fable 5:n kolmanneksi 69,7 prosentilla.
Varovainen johtopäätös onkin tämä: Ox Alpha vaikutti erittäin vahvalta Davisin kymmenen tehtävän kokeessa, mutta tulos ei osoita sen olevan paras yleiskäyttöinen koodausmalli.
Suosituin alkuperäteoria yhdistää Ox Alphan Zhipu AI:hin, joka tunnetaan myös nimellä Z.ai, sekä sen GLM-malliperheeseen. Päätelmä perustuu mallin käyttäytymisen tekniseen sormenjälkianalyysiin, ei yhtiön ilmoitukseen.
Eräässä raportoidussa testissä Ox Alphan ja GLM-5.3:n tokenisointia verrattiin 25 kehotteella. Raakatokenien määrät vastasivat toisiaan, kun Ox Alphan joka kerta tuottama 75 tokenin vakioero otettiin huomioon. Erillisissä videotesteissä havaittiin tiettävästi vastaavuuksia myös visuaalisten tokenien käsittelyssä, kuten kuvataajuuden näytteistyksessä, videon keston skaalauksessa ja resoluution käsittelyssä.
Muita raportoituja yhtäläisyyksiä ovat vastaustyyli, rajapinnan toiminta ja tapa käsitellä äänisyötettä. Yksittäin tarkasteltuna mikä tahansa näistä vihjeistä voisi selittyä yhteisellä kääreellä, infrastruktuurilla tai jäljittelyllä. Yhdessä ne muodostavat analyytikoiden mukaan vahvemman kokonaisuuden, joka sopii Zhipun yhtenäiseen multimodaaliseen GLM-linjaan.
Zhipun aiemmat anonyymit tai niin sanotut stealth-julkaisut, kuten Pony Alpha -nimellä tehty julkaisu, tarjoavat teorialle lisää taustaa. Ne eivät kuitenkaan todista, että juuri Zhipu olisi luonut Ox Alphan.
Yksikään yhtiö ei ollut julkisesti ilmoittautunut Ox Alphan tekijäksi lähteissä käsiteltynä ajanjaksona, eikä Zhipu ollut vahvistanut yhteyttä. Spekulaatioissa on mainittu tiettyjä GLM-versioita, mutta saatavilla oleva näyttö ei kerro, onko Ox Alpha julkaisematon malli, tuotantoversio, hienosäädetty järjestelmä vai itsenäisesti ylläpidetty malli, joka hyödyntää siihen liittyvää infrastruktuuria.
Puolustettavin kuvaus on siksi seuraava: Ox Alpha on todennäköisesti GLM-pohjainen ja saattaa liittyä Zhipuun, mutta sen tekijä ja tarkka malli-identiteetti olivat vahvistamatta. Yksittäisten analyytikoiden ilmoittamia varmuusprosentteja ei pidä tulkita viralliseksi tunnistamiseksi.
Ox Alphan tietosäilytystä koskevat ehdot ovat kehittäjille käytännössä yksi tärkeimmistä yksityiskohdista. Mallin OpenRouter-listauksen mukaan taustalla oleva palveluntarjoaja säilyttää kehotteet ja vastaukset, mutta ei käytä niitä koulutukseen.
Tämä on eri asia kuin OpenRouterin yleinen tiedonkeruukäytäntö. OpenRouter kertoo, ettei se itse tallenna kehotteita tai vastauksia, ellei käyttäjä erikseen ota käyttöön syöte- ja tulostelokien keräämistä. Samalla palvelu dokumentoi palveluntarjoajien käytännöt erikseen, joten reitityskerroksella ja varsinaisella mallipalveluntarjoajalla voi olla erilaiset säilytyssäännöt.
OpenCode puolestaan mainosti Ox Alphaa ”nollatiedonsäilytyksellä”. Tämä voi kuvata OpenCoden omaa pyyntöjen käsittelyä, mutta se ei automaattisesti kumoa OpenRouter-reitille ilmoitettua palveluntarjoajan säilytyskäytäntöä. Toisin sanoen väitteet ”OpenCode ei säilytä tietoja” ja ”mallipalveluntarjoaja säilyttää kehotteet ja vastaukset” voivat molemmat pitää paikkansa, jos ne koskevat pyynnön eri vaiheita.
Ennen kuin palveluntarjoajat julkaisevat yhden selkeän ja sopimuksellisesti sitovan tietojenkäsittelypolitiikan, varovainen oletus on, että mallipalveluntarjoaja saattaa säilyttää lähetetyn sisällön. Kehittäjien ei kannata lähettää palveluun yrityssalaisuuksia, omistusoikeuden alaista lähdekoodia, tunnistetietoja, henkilötietoja tai säänneltyä dataa vain siksi, että palvelu on ilmainen tai että kehotteita ei ilmoiteta käytettävän koulutukseen.
Ox Alpha nousi otsikoihin kolmesta syystä: se oli lyhyen aikaa ilmainen, sen ilmoitettu konteksti-ikkuna ja multimodaaliset ominaisuudet olivat poikkeuksellisen laajat, ja sen ensimmäinen koodauskoe tuotti näyttävän tuloksen.
Näyttö tukee kuitenkin maltillista tulkintaa – ei väitettä siitä, että tuntematon laboratorio olisi kiistatta päihittänyt vakiintuneet huippumallit.
DeepSWE:n 80 prosentin tulos syntyi kahdeksasta onnistumisesta kymmenessä tehtävässä, ei koko 113 tehtävän benchmarkista. Julkisella leaderboardilla Claude Opus 5 oli edelleen kärjessä, eikä Ox Alpha ollut käynyt läpi virallista arviointiprosessia.
Mallin tekniset sormenjäljet tekevät Zhipun ja GLM:n yhteydestä vahvimman selityksen, mutta julkista vahvistusta tekijästä ei ole. Kokeiluihin Ox Alpha oli kiinnostava tuttavuus. Tuotantojärjestelmissä tai arkaluonteisen koodin kanssa sen anonyymi omistajuus, palveluntarjoajan tietojen säilytys ja ratkaisematon identiteetti ovat kuitenkin hyviä syitä edetä varovasti.