Il 26 agosto Zhipu AI ha confermato che il modello anonimo “Ox Alpha”, chiamato “Niu Lai” in Cina, era GLM 5.3 Flash, un modello open weight, multimodale nativo e basato su un’architettura mixture of experts. Il test gratuito su OpenRouter e OpenCode avrebbe superato i 50 trilioni di token in cinque giorni e i 60 tr...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
Il 26 agosto 2026 Zhipu AI, la società cinese che opera anche con il marchio internazionale Z.ai, ha svelato l’identità di Ox Alpha, il modello anonimo che aveva attirato l’attenzione degli sviluppatori su OpenRouter e OpenCode. Il sistema era GLM-5.3-Flash, un modello con pesi aperti, multimodale nativo e basato su un’architettura mixture-of-experts (MoE), sottoposto a un test pubblico senza rivelarne inizialmente il produttore. 1
4
6
Durante la fase di prova, Ox Alpha era disponibile gratuitamente e senza il logo di Zhipu. Secondo i resoconti disponibili, il modello ha superato i 50 trilioni di token elaborati in cinque giorni; il conteggio è poi salito oltre i 60 trilioni in sei giorni. In quel periodo ha raggiunto il primo posto nelle classifiche di utilizzo sia di OpenRouter, aggregatore di modelli AI, sia di OpenCode, piattaforma orientata agli strumenti per sviluppatori e agli agenti software. Il picco di traffico sarebbe stato più del doppio di quello registrato da prodotti DeepSeek comparabili. 3
Il successo del test ha trasformato un modello senza identità pubblica in uno dei lanci più osservati del settore. Il 26 agosto Bloomberg ha riportato la conferma di Zhipu; il giorno successivo la società ha pubblicato i pesi del modello con licenza MIT, secondo i resoconti citati nel materiale disponibile. 1
10
17
Zhipu ha dichiarato che l’intero servizio durante il test è stato eseguito su un cluster formato da oltre 100.000 chip prodotti in Cina, senza ricorrere a GPU Nvidia per l’inferenza. La società ha inoltre sostenuto che, dopo interventi di ottimizzazione software, l’efficienza dell’hardware e il costo per token erano comparabili a quelli delle principali GPU Nvidia. 3
6
Questo non dimostra che i chip cinesi abbiano raggiunto Nvidia in ogni ambito, né che i costi dell’inferenza siano sempre equivalenti. Il dato mostra piuttosto che un carico reale, globale e di grandi dimensioni può essere gestito su una piattaforma nazionale non basata su Nvidia grazie a un forte lavoro di ingegneria dei sistemi. 3
6
Zhipu non ha indicato pubblicamente i fornitori esatti. Huawei, Moore Threads e Hygon sono stati menzionati da alcuni resoconti come possibili componenti della fornitura, ma si tratta di ipotesi non verificate e non di una conferma ufficiale di Zhipu. 40
Per adattare GLM-5.3-Flash alle limitazioni di memoria, banda e comunicazione dei chip disponibili, Zhipu avrebbe costruito un motore di inferenza basato su SGLang. Tra le tecniche indicate figurano:
L’obiettivo era gestire una finestra di contesto da un milione di token, riducendo i colli di bottiglia legati alla memoria, alla larghezza di banda, alle comunicazioni tra acceleratori e alla pianificazione delle richieste. 4
7
Secondo Zhipu, queste modifiche avrebbero portato a un miglioramento di circa tre volte nelle prestazioni end-to-end rispetto alla configurazione iniziale. La documentazione SGLang riporta inoltre incrementi di throughput e una capacità della cache FP8 sensibilmente superiore a quella di una configurazione comparabile in BF16. Questi risultati, tuttavia, non costituiscono un audit indipendente della dichiarazione di Zhipu sul miglioramento complessivo di tre volte. 2
GLM-5.3-Flash dispone di 320 miliardi di parametri totali, ma ne attiva circa 18 miliardi per ogni token. Questo approccio MoE consente di mantenere una capacità complessiva molto elevata limitando il calcolo effettivo richiesto per ciascun passaggio. Il modello supporta una finestra di contesto di 1.048.576 token ed è multimodale nativo, con input che includono testo, immagini, video e file. 5
7
Il modello avrebbe ottenuto un punteggio di 57 nell’Artificial Analysis Intelligence Index, lo stesso valore riportato per Claude Opus 4.8. Il confronto va interpretato come una parità su quell’indice composito, non come la prova che i due modelli offrano risultati identici in ogni benchmark o attività pratica basata su agenti. 1
La sua collocazione commerciale è quella dei modelli efficienti di fascia alta, in competizione con proposte come DeepSeek V4 Flash e Pro. Il materiale disponibile non è però sufficiente per verificare confronti esatti, benchmark per benchmark, con entrambe le varianti DeepSeek.
Il prezzo API pubblicato da Zhipu è stato indicato in 0,15 dollari per milione di token in input e 0,50 dollari per milione di token in output. 1
I resoconti contemporanei hanno descritto queste tariffe come circa un decimo di quelle di GLM-5.3 e circa un quarantesimo di quelle di Claude Opus 4.8. I rapporti esatti, però, dipendono dalla direzione dei token, dal livello di contesto e dal piano tariffario utilizzato per il confronto. 1
Il risultato più interessante per il mercato dei semiconduttori non è la semplice quantità di chip impiegati, ma la dimostrazione che il software può ridurre la dipendenza da CUDA in alcuni scenari di inferenza in produzione. Un motore ottimizzato per un determinato modello e una determinata architettura hardware può compensare parte dello svantaggio rispetto all’ecosistema Nvidia.
Questo non cancella però il vantaggio più ampio di CUDA in termini di strumenti, librerie, sviluppatori, ecosistema e addestramento dei modelli. La vicenda Ox Alpha mostra quindi una capacità concreta di ottimizzazione su hardware cinese, non la prova definitiva che l’intero divario tecnologico con Nvidia sia stato colmato.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Il 26 agosto Zhipu AI ha confermato che il modello anonimo “Ox Alpha”, chiamato “Niu Lai” in Cina, era GLM 5.3 Flash, un modello open weight, multimodale nativo e basato su un’architettura mixture of experts.
Il 26 agosto Zhipu AI ha confermato che il modello anonimo “Ox Alpha”, chiamato “Niu Lai” in Cina, era GLM 5.3 Flash, un modello open weight, multimodale nativo e basato su un’architettura mixture of experts. Il test gratuito su OpenRouter e OpenCode avrebbe superato i 50 trilioni di token in cinque giorni e i 60 trilioni in sei giorni, portando il modello al primo posto su entrambe le piattaforme.
Zhipu ha dichiarato che il servizio funzionava su un cluster composto da oltre 100.000 chip prodotti in Cina, con prestazioni e costi per token comparabili a quelli delle GPU Nvidia dopo le ottimizzazioni software.