Il 26 agosto 2026 Z.ai ha confermato che l’anteprima gratuita e anonima chiamata Ox Alpha era GLM 5.3 Flash, un modello da 320 miliardi di parametri con 18 miliardi attivi per token e pesi distribuiti con licenza MIT. GLM 5.3 Flash accetta nativamente testo, immagini e video, offre un contesto di circa un milione di...
Pubblicato daModificato con GPT-5.6 LunaImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
La risposta al mistero è arrivata il 26 agosto 2026: Z.ai ha confermato che Ox Alpha, il modello anonimo disponibile su OpenRouter e OpenCode, era in realtà GLM-5.3-Flash. L’azienda lo presenta come il primo modello nativamente multimodale della famiglia GLM-5: ha pesi aperti, una finestra di contesto da circa un milione di token ed è progettato soprattutto per il coding e per attività agentiche di lunga durata. 15
40
La notizia, però, non riguarda soltanto l’identità del modello. Ox Alpha ha unito un’anteprima gratuita e senza marchio a un utilizzo su larga scala da parte degli sviluppatori. In seguito, quel sistema anonimo è diventato un prodotto ufficiale e scaricabile. Per Z.ai, il percorso ha offerto un modo per testare l’infrastruttura con carichi realistici e, allo stesso tempo, creare attenzione intorno al lancio.
GLM-5.3-Flash è un modello Mixture of Experts (MoE) con 320 miliardi di parametri complessivi e 18 miliardi di parametri attivi per token. Accetta nativamente testo, immagini e video, mentre produce testo. La capacità di contesto dichiarata è di circa un milione di token: il limite esatto può cambiare a seconda della piattaforma. La documentazione di Z.ai parla di un design da un milione di token, mentre OpenRouter indica una finestra da 1.310.720 token. 1
2
3
40
Z.ai ha distribuito i pesi con licenza MIT, rendendo il modello molto più facilmente utilizzabile e installabile rispetto a un sistema accessibile esclusivamente tramite API proprietarie. Dopo la fine dell’anteprima anonima, il modello è comparso su OpenRouter con il suo nome ufficiale. 3
4
8
È importante non confonderlo con il più grande GLM-5.3 annunciato in precedenza ad agosto. Le informazioni disponibili descrivono GLM-5.3-Flash come un prodotto distinto, un modello 320B-A18B a costi inferiori, non come la stessa versione commerciale della linea GLM-5.3 più grande. 10
Z.ai sostiene che GLM-5.3-Flash migliori GLM-5.2 riducendo nel contempo i costi di servizio. Nei risultati citati al momento del lancio, il modello ha ottenuto 63,4 punti su DeepSWE v1.1, contro i 46,2 di GLM-5.2. Z.ai ha inoltre riferito un punteggio di 29,0 su un proprio benchmark interno di coding, vicino al 29,5 attribuito a Claude Opus 4.8. 3
16
Sono numeri utili per capire come Z.ai voglia posizionare il prodotto, ma non costituiscono una conferma indipendente di una piena equivalenza con il modello di Anthropic. Definizioni dei benchmark, impostazioni di valutazione, prompt e possibilità di riprodurre i risultati fanno la differenza.
La conclusione più prudente è quindi questa: Z.ai rivendica prestazioni solide nel coding e negli agenti AI a un costo molto più basso. I dati disponibili non dimostrano però che GLM-5.3-Flash abbia definitivamente superato i modelli frontier proprietari.
L’elemento più evidente di Ox Alpha era la possibilità di provarlo senza pagare durante la fase anonima. Quella fase si è conclusa quando il modello ha ricevuto un’identità ufficiale. Il listino dichiarato da Z.ai è di 0,15 dollari per milione di token in ingresso e 0,50 dollari per milione di token in uscita. 1
3
Intorno al lancio, OpenRouter mostrava invece una tariffa promozionale più bassa: 0,075 dollari per milione di token in ingresso e 0,25 dollari per milione in uscita. 2 Le tre condizioni non vanno confuse: l’anteprima gratuita, il listino di Z.ai e lo sconto temporaneo applicato da una piattaforma sono modalità di accesso diverse.
Anche al prezzo ufficiale, l’economia del modello è uno degli aspetti centrali. Gli agenti per il coding possono consumare grandi quantità di contesto e generare molti token; per questo, un costo inferiore può pesare sulla scelta del modello quanto un piccolo vantaggio in classifica.
Z.ai ha dichiarato che GLM-5.3-Flash funziona interamente su acceleratori AI prodotti in Cina. 15 Le informazioni sul sistema di servizio descrivono uno stack personalizzato basato su SGLang, con tecniche come quantizzazione, parallelismo dei tensori, formati di cache misti, suddivisione dei layer e un’architettura separata per codifica, prefill e decodifica. L’obiettivo dichiarato è migliorare le prestazioni complessive del servizio operando entro i vincoli dell’hardware nazionale.
25
La scelta prosegue la narrazione già costruita da Z.ai intorno alla famiglia GLM. L’azienda ha affermato in precedenza che i modelli GLM sono stati addestrati su processori Huawei Ascend senza ricorrere a hardware Nvidia. Inoltre, Z.ai è inserita nella U.S. Entity List, una lista statunitense che limita l’accesso a determinati prodotti e tecnologie, inclusi gli acceleratori Nvidia H100, H200 e B200 secondo le informazioni riportate. 26
Il significato strategico della dichiarazione è rilevante, ma va interpretato per quello che è: una rivendicazione dell’azienda accompagnata da resoconti di settore, non un confronto indipendente e completamente verificato delle prestazioni hardware.
Il dato più solido è che Z.ai sta presentando il proprio stack come capace di servire un modello multimodale di grandi dimensioni senza dipendere dalle principali GPU per data center di Nvidia.
La distribuzione anonima sembra seguire uno schema preciso: pubblicare un modello capace senza attribuirgli subito un produttore, offrirlo gratuitamente attraverso strumenti di coding molto usati, osservare come gli sviluppatori lo impiegano e svelarne l’identità solo dopo aver raccolto feedback e traffico reale.
Z.ai era già stata associata a un test precedente chiamato Pony Alpha, basato su un’idea simile. Nel caso di Ox Alpha, alcuni membri della community hanno cercato di identificarlo analizzando il comportamento del tokenizer, gli indizi legati all’elaborazione video e i pattern degli errori API. 7
11
13
Alcuni resoconti pubblicati durante il lancio hanno parlato anche di volumi di utilizzo eccezionalmente elevati e di forte entusiasmo tra gli sviluppatori. Tuttavia, il materiale disponibile non consente di verificare in modo indipendente ogni cifra o citazione. È quindi più corretto considerarli dati della fase di lancio, non statistiche di adozione sottoposte a revisione.
GLM-5.3-Flash non dimostra che Z.ai abbia superato OpenAI o Anthropic in ogni area delle capacità dei modelli frontier. Mostra però una combinazione potenzialmente dirompente: input multimodale, contesto molto esteso, pesi aperti con licenza MIT, specializzazione nel coding e negli agenti e prezzi API contenuti nello stesso prodotto. 15
40
Per gli sviluppatori, questa combinazione può ridurre i costi di passaggio da un fornitore all’altro e rendere più praticabili il self-hosting e le architetture multi-provider. Per i fornitori di modelli chiusi, aumenta la pressione su prezzi e margini, soprattutto nei carichi di lavoro legati agli agenti di coding.
In questi scenari, infatti, la posizione in classifica è solo una parte del problema. Contano anche il numero di token consumati, la latenza, la possibilità di controllare la distribuzione del modello e la disponibilità dell’hardware necessario per eseguirlo.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Il 26 agosto 2026 Z.ai ha confermato che l’anteprima gratuita e anonima chiamata Ox Alpha era GLM 5.3 Flash, un modello da 320 miliardi di parametri con 18 miliardi attivi per token e pesi distribuiti con licenza MIT.
Il 26 agosto 2026 Z.ai ha confermato che l’anteprima gratuita e anonima chiamata Ox Alpha era GLM 5.3 Flash, un modello da 320 miliardi di parametri con 18 miliardi attivi per token e pesi distribuiti con licenza MIT. GLM 5.3 Flash accetta nativamente testo, immagini e video, offre un contesto di circa un milione di token ed è proposto da Z.ai a 0,15 dollari per milione di token in ingresso e 0,50 dollari per milione in uscita.
Il lancio anonimo ha consentito a Z.ai di sottoporre il modello a carichi reali di coding e di attività agentiche prima di presentarlo ufficialmente, trasformando il test infrastrutturale in una strategia di lancio ad...
Il 26 agosto 2026 Z.ai ha confermato che l’anteprima gratuita e anonima chiamata Ox Alpha era GLM 5.3 Flash, un modello da 320 miliardi di parametri con 18 miliardi attivi per token e pesi distribuiti con licenza MIT. GLM 5.3 Flash accetta nativamente testo, immagini e video, offre un contesto di circa un milione di...
Pubblicato daModificato con GPT-5.6 LunaImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
La risposta al mistero è arrivata il 26 agosto 2026: Z.ai ha confermato che Ox Alpha, il modello anonimo disponibile su OpenRouter e OpenCode, era in realtà GLM-5.3-Flash. L’azienda lo presenta come il primo modello nativamente multimodale della famiglia GLM-5: ha pesi aperti, una finestra di contesto da circa un milione di token ed è progettato soprattutto per il coding e per attività agentiche di lunga durata. 15
40
La notizia, però, non riguarda soltanto l’identità del modello. Ox Alpha ha unito un’anteprima gratuita e senza marchio a un utilizzo su larga scala da parte degli sviluppatori. In seguito, quel sistema anonimo è diventato un prodotto ufficiale e scaricabile. Per Z.ai, il percorso ha offerto un modo per testare l’infrastruttura con carichi realistici e, allo stesso tempo, creare attenzione intorno al lancio.
GLM-5.3-Flash è un modello Mixture of Experts (MoE) con 320 miliardi di parametri complessivi e 18 miliardi di parametri attivi per token. Accetta nativamente testo, immagini e video, mentre produce testo. La capacità di contesto dichiarata è di circa un milione di token: il limite esatto può cambiare a seconda della piattaforma. La documentazione di Z.ai parla di un design da un milione di token, mentre OpenRouter indica una finestra da 1.310.720 token. 1
2
3
40
Z.ai ha distribuito i pesi con licenza MIT, rendendo il modello molto più facilmente utilizzabile e installabile rispetto a un sistema accessibile esclusivamente tramite API proprietarie. Dopo la fine dell’anteprima anonima, il modello è comparso su OpenRouter con il suo nome ufficiale. 3
4
8
È importante non confonderlo con il più grande GLM-5.3 annunciato in precedenza ad agosto. Le informazioni disponibili descrivono GLM-5.3-Flash come un prodotto distinto, un modello 320B-A18B a costi inferiori, non come la stessa versione commerciale della linea GLM-5.3 più grande. 10
Z.ai sostiene che GLM-5.3-Flash migliori GLM-5.2 riducendo nel contempo i costi di servizio. Nei risultati citati al momento del lancio, il modello ha ottenuto 63,4 punti su DeepSWE v1.1, contro i 46,2 di GLM-5.2. Z.ai ha inoltre riferito un punteggio di 29,0 su un proprio benchmark interno di coding, vicino al 29,5 attribuito a Claude Opus 4.8. 3
16
Sono numeri utili per capire come Z.ai voglia posizionare il prodotto, ma non costituiscono una conferma indipendente di una piena equivalenza con il modello di Anthropic. Definizioni dei benchmark, impostazioni di valutazione, prompt e possibilità di riprodurre i risultati fanno la differenza.
La conclusione più prudente è quindi questa: Z.ai rivendica prestazioni solide nel coding e negli agenti AI a un costo molto più basso. I dati disponibili non dimostrano però che GLM-5.3-Flash abbia definitivamente superato i modelli frontier proprietari.
L’elemento più evidente di Ox Alpha era la possibilità di provarlo senza pagare durante la fase anonima. Quella fase si è conclusa quando il modello ha ricevuto un’identità ufficiale. Il listino dichiarato da Z.ai è di 0,15 dollari per milione di token in ingresso e 0,50 dollari per milione di token in uscita. 1
3
Intorno al lancio, OpenRouter mostrava invece una tariffa promozionale più bassa: 0,075 dollari per milione di token in ingresso e 0,25 dollari per milione in uscita. 2 Le tre condizioni non vanno confuse: l’anteprima gratuita, il listino di Z.ai e lo sconto temporaneo applicato da una piattaforma sono modalità di accesso diverse.
Anche al prezzo ufficiale, l’economia del modello è uno degli aspetti centrali. Gli agenti per il coding possono consumare grandi quantità di contesto e generare molti token; per questo, un costo inferiore può pesare sulla scelta del modello quanto un piccolo vantaggio in classifica.
Z.ai ha dichiarato che GLM-5.3-Flash funziona interamente su acceleratori AI prodotti in Cina. 15 Le informazioni sul sistema di servizio descrivono uno stack personalizzato basato su SGLang, con tecniche come quantizzazione, parallelismo dei tensori, formati di cache misti, suddivisione dei layer e un’architettura separata per codifica, prefill e decodifica. L’obiettivo dichiarato è migliorare le prestazioni complessive del servizio operando entro i vincoli dell’hardware nazionale.
25
La scelta prosegue la narrazione già costruita da Z.ai intorno alla famiglia GLM. L’azienda ha affermato in precedenza che i modelli GLM sono stati addestrati su processori Huawei Ascend senza ricorrere a hardware Nvidia. Inoltre, Z.ai è inserita nella U.S. Entity List, una lista statunitense che limita l’accesso a determinati prodotti e tecnologie, inclusi gli acceleratori Nvidia H100, H200 e B200 secondo le informazioni riportate. 26
Il significato strategico della dichiarazione è rilevante, ma va interpretato per quello che è: una rivendicazione dell’azienda accompagnata da resoconti di settore, non un confronto indipendente e completamente verificato delle prestazioni hardware.
Il dato più solido è che Z.ai sta presentando il proprio stack come capace di servire un modello multimodale di grandi dimensioni senza dipendere dalle principali GPU per data center di Nvidia.
La distribuzione anonima sembra seguire uno schema preciso: pubblicare un modello capace senza attribuirgli subito un produttore, offrirlo gratuitamente attraverso strumenti di coding molto usati, osservare come gli sviluppatori lo impiegano e svelarne l’identità solo dopo aver raccolto feedback e traffico reale.
Z.ai era già stata associata a un test precedente chiamato Pony Alpha, basato su un’idea simile. Nel caso di Ox Alpha, alcuni membri della community hanno cercato di identificarlo analizzando il comportamento del tokenizer, gli indizi legati all’elaborazione video e i pattern degli errori API. 7
11
13
Alcuni resoconti pubblicati durante il lancio hanno parlato anche di volumi di utilizzo eccezionalmente elevati e di forte entusiasmo tra gli sviluppatori. Tuttavia, il materiale disponibile non consente di verificare in modo indipendente ogni cifra o citazione. È quindi più corretto considerarli dati della fase di lancio, non statistiche di adozione sottoposte a revisione.
GLM-5.3-Flash non dimostra che Z.ai abbia superato OpenAI o Anthropic in ogni area delle capacità dei modelli frontier. Mostra però una combinazione potenzialmente dirompente: input multimodale, contesto molto esteso, pesi aperti con licenza MIT, specializzazione nel coding e negli agenti e prezzi API contenuti nello stesso prodotto. 15
40
Per gli sviluppatori, questa combinazione può ridurre i costi di passaggio da un fornitore all’altro e rendere più praticabili il self-hosting e le architetture multi-provider. Per i fornitori di modelli chiusi, aumenta la pressione su prezzi e margini, soprattutto nei carichi di lavoro legati agli agenti di coding.
In questi scenari, infatti, la posizione in classifica è solo una parte del problema. Contano anche il numero di token consumati, la latenza, la possibilità di controllare la distribuzione del modello e la disponibilità dell’hardware necessario per eseguirlo.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Il 26 agosto 2026 Z.ai ha confermato che l’anteprima gratuita e anonima chiamata Ox Alpha era GLM 5.3 Flash, un modello da 320 miliardi di parametri con 18 miliardi attivi per token e pesi distribuiti con licenza MIT.
Il 26 agosto 2026 Z.ai ha confermato che l’anteprima gratuita e anonima chiamata Ox Alpha era GLM 5.3 Flash, un modello da 320 miliardi di parametri con 18 miliardi attivi per token e pesi distribuiti con licenza MIT. GLM 5.3 Flash accetta nativamente testo, immagini e video, offre un contesto di circa un milione di token ed è proposto da Z.ai a 0,15 dollari per milione di token in ingresso e 0,50 dollari per milione in uscita.
Il lancio anonimo ha consentito a Z.ai di sottoporre il modello a carichi reali di coding e di attività agentiche prima di presentarlo ufficialmente, trasformando il test infrastrutturale in una strategia di lancio ad...