Zhipu AI, 26 Ağustos 2026'da anonim “Ox Alpha” veya “Niu Lai” modelinin GLM 5.3 Flash olduğunu doğruladı; model açık ağırlıklı, doğal çok modlu ve Mixture of Experts mimarisine sahip. OpenRouter ve OpenCode üzerindeki ücretsiz anonim test, beş günde 50 trilyondan fazla, altı günün sonunda ise 60 trilyondan fazla tok...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
26 Ağustos 2026'da Zhipu AI (Z.ai), geliştirici topluluklarının günlerdir “Ox Alpha” adıyla kullandığı ve Çincede “Niu Lai” olarak anılan anonim yapay zekâ modelinin kendi GLM-5.3-Flash modeli olduğunu açıkladı. Model, resmi tanıtımdan önce kimliği gizlenerek test edilmiş; açık ağırlıklı, doğal çok modlu ve Mixture-of-Experts (uzman karışımı) mimarisine sahip bir sistem olarak konumlandırılmıştı. 1
4
6
Model, OpenRouter ve OpenCode platformlarında ücretsiz ve anonim biçimde kullanıma açıldı. İlgi kısa sürede olağanüstü boyutlara ulaştı:
Bununla birlikte şirket, kullanılan çiplerin kesin üretici ve modellerini açıklamadı. Huawei, Moore Threads ve Hygon olası tedarikçiler olarak anılsa da bu iddialar doğrulanmış bir Zhipu açıklaması değil, haber ve sektör kaynaklarına dayanan spekülasyonlar olarak görülmeli. 40
Bu gelişme, Çin'in genel olarak Nvidia donanımını yakaladığını kanıtlamıyor. Aynı şekilde yerli çiplerle yapılan çıkarımın her iş yükünde Nvidia GPU'larıyla aynı maliyete sahip olduğu da söylenemez.
Daha temkinli ve desteklenebilir sonuç şu: Büyük ölçekli, gerçek dünya kullanım trafiği; model özelinde geliştirilen yazılım, donanım kümelendirmesi ve çıkarım optimizasyonları sayesinde Nvidia dışı bir altyapı üzerinde de çalıştırılabildi. Bu durum, bazı üretim tipi çıkarım işlerinde Nvidia'nın CUDA ekosistemine olan bağımlılığın azaltılabileceğine işaret ediyor. Ancak CUDA'nın geniş yazılım ekosistemi, geliştirici tabanı, araçları ve eğitim süreçlerindeki avantajları ortadan kalkmış değil.
Zhipu'nun SGLang tabanlı çıkarım motorunda W8A8 nicemleme, INT8/FP8/BF16 karma önbellek nicemleme, düğüm içi tensör paralelliği ve Encode–Prefill–Decode (EPD) ayrımı gibi teknikler kullanıldığı bildirildi. Bu yaklaşım, 1 milyon tokenlık bağlam penceresinde bellek, bant genişliği, iletişim ve iş planlama darboğazlarını yönetmeyi amaçlıyor. 4
7
Zhipu, bu optimizasyonların ilk temel yapılandırmaya kıyasla uçtan uca hizmet performansını yaklaşık üç kat artırdığını belirtti. Daha sonra yayımlanan SGLang belgelerinde de FP8 önbellek yapılandırmasının BF16 karşılaştırmasına göre daha yüksek aktarım hızı ve belirgin biçimde daha fazla önbellek kapasitesi sunduğu aktarılıyor. Ancak bu belgeler, Zhipu'nun ilk üç katlık performans iddiasından bağımsız bir denetim anlamına gelmiyor. 2
GLM-5.3-Flash, toplam 320 milyar parametreye sahip seyrek bir uzman karışımı modeli. Her token işlenirken yaklaşık 18 milyar parametre etkinleştiriliyor. Modelin bağlam penceresi 1.048.576 tokena, yani yaklaşık 1 milyon tokena kadar çıkıyor. 5
7
Model; metinle birlikte görüntü, video ve dosya girdilerini işleyebilen doğal çok modlu bir yapı olarak tanımlanıyor. Bu özellik, görsel yeteneklerin sonradan eklenen ayrı bir modül yerine model tasarımının parçası olması bakımından GLM serisi için önemli bir adım olarak öne çıkıyor. 4
5
Performans tarafında GLM-5.3-Flash'ın Artificial Analysis Intelligence Index'ten 57 puan aldığı ve bildirilen puanla Claude Opus 4.8 seviyesine geldiği aktarılıyor. Bu sonuç, söz konusu bileşik endekste bir eşitliğe işaret eder; her kıyaslama testinde veya gerçek dünyadaki her ajan görevinde iki modelin aynı performansı verdiğini kanıtlamaz. 1
Model, DeepSeek V4 Flash ve Pro gibi verimli, üst düzey modellerle rekabet edecek şekilde konumlandırılıyor. Ancak bu iki DeepSeek sürümüyle yapılan karşılaştırmaların test bazında tamamını doğrulamaya yetecek kanıt mevcut değil.
Zhipu'nun açıkladığı API fiyatı, 1 milyon giriş tokenı için 0,15 dolar ve 1 milyon çıkış tokenı için 0,50 dolar. 1
Dönemin haberlerinde bu fiyatın GLM-5.3'ün yaklaşık onda biri, Claude Opus 4.8'in ise yaklaşık kırkta biri olduğu belirtildi. Yine de bu oranlar; giriş ve çıkış tokenlarının ayrı ayrı karşılaştırılmasına, kullanılan bağlam katmanına ve seçilen fiyatlandırma planına göre değişebilir. 1
Özetle Ox Alpha'nın ortaya çıkışı yalnızca yeni bir modelin tanıtımı değildi. Zhipu, anonim bir testle küresel geliştirici talebini ölçerken aynı zamanda GLM-5.3-Flash'ın çok büyük hacimli çıkarım trafiğini Çin üretimi çipler ve özel yazılım optimizasyonlarıyla taşıyabildiğini göstermeye çalıştı. Bu, Nvidia'nın yapay zekâ altyapısındaki rolünü ortadan kaldırmıyor; ancak model ve sistem düzeyindeki mühendisliğin donanım tercihleri kadar belirleyici olabileceğini ortaya koyuyor.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI, 26 Ağustos 2026'da anonim “Ox Alpha” veya “Niu Lai” modelinin GLM 5.3 Flash olduğunu doğruladı; model açık ağırlıklı, doğal çok modlu ve Mixture of Experts mimarisine sahip.
Zhipu AI, 26 Ağustos 2026'da anonim “Ox Alpha” veya “Niu Lai” modelinin GLM 5.3 Flash olduğunu doğruladı; model açık ağırlıklı, doğal çok modlu ve Mixture of Experts mimarisine sahip. OpenRouter ve OpenCode üzerindeki ücretsiz anonim test, beş günde 50 trilyondan fazla, altı günün sonunda ise 60 trilyondan fazla token kullanımına ulaştı.
Zhipu, hizmetin 100.000'den fazla Çin üretimi çipten oluşan bir küme üzerinde çalıştığını ve yazılım optimizasyonları sonrasında token başına maliyetin ana akım Nvidia GPU'larıyla karşılaştırılabilir seviyeye geldiğin...