Zhipu AI, 26 Ağustos 2026’da Çinli geliştirici topluluklarında “Niu Lai” olarak da anılan anonim Ox Alpha modelinin GLM 5.3 Flash olduğunu doğruladı. GLM 5.3 Flash; toplam 320 milyar parametreye, token başına yaklaşık 18 milyar etkin parametreye ve 1.048.576 tokenlık bağlam penceresine sahip seyrek bir Mixture of Ex...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM-5.3-Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM-5.3-Flash: an open-weight, native-multimodal mixture-of-experts model tested anonymously before release. [1][4][6] ## What. Topic tags: general, general web, documentation, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
26 Ağustos 2026’da Zhipu AI, uluslararası alanda Z.ai adıyla da bilinen şirketin anonim modeli Ox Alpha hakkındaki merakı giderdi. Çinli geliştirici topluluklarında “Niu Lai” adıyla anılan modelin, GLM serisinin açık ağırlıklı ve doğrudan çok modlu modeli GLM-5.3-Flash olduğu açıklandı. 1
15
Duyuru yalnızca yeni bir model lansmanı değildi. Zhipu AI, modelin OpenRouter ve OpenCode platformlarında ücretsiz ve anonim biçimde test edildiği beş günlük süreçte 50 trilyondan fazla token işlediğini söyledi. Şirkete göre bu trafiğin tamamı, 100 bini aşkın Çin üretimi çipten oluşan bir küme üzerinden sunuldu. 8
15
Ox Alpha, arkasındaki şirketin adı açıklanmadan kullanıma açıldı. Böylece geliştiriciler modeli geleneksel bir lansman kampanyasının etkisiyle değil; yanıt kalitesi, hız, erişilebilirlik ve maliyet üzerinden değerlendirdi. Model kısa sürede OpenRouter ve OpenCode kullanım listelerinin zirvesine çıktı.
Daha sonraki haberlerde altı günlük toplam trafiğin 60 trilyon tokenı aştığı, OpenRouter’daki kullanımın ise karşılaştırılabilir DeepSeek trafiğinin iki katından fazla olduğu aktarıldı. Farklı rakamlar, platformların farklı ölçüm yöntemleri ve raporlama dönemleri kullanmasından kaynaklanıyor olabilir. Bu nedenle en temkinli sonuç, testin 50 trilyon tokenı aştığı ve olağanüstü yüksek bir talep gördüğüdür. 1
3
30
Bu gelişmenin önemli tarafı, modelin kimliği bilinmeden büyük miktarda gerçek geliştirici trafiğine maruz kalmasıydı. Kullanıcılar Zhipu AI markasına veya kullanılan donanımın menşeine göre değil, doğrudan modelin performansına göre karar verdi.
Zhipu AI, çevrim içi çıkarım yükünün 100 bini aşkın Çin üretimi hızlandırıcı üzerinde çalıştığını ve yazılım optimizasyonları sayesinde donanım verimliliği ile token başına maliyetin yaygın Nvidia GPU’larıyla karşılaştırılabilir seviyeye geldiğini belirtti. 15
24
Ancak şirket, bu çiplerin hangi üreticilere ait olduğunu kamuoyuna açıklamadı. Sektör haberlerinde Huawei, Moore Threads ve Hygon olası tedarikçiler olarak anıldı; fakat bu bağlantılar doğrulanmış değil ve Zhipu AI tarafından teyit edilmiş bir bilgi olarak değerlendirilmemeli. 30
40
İddianın kapsamını doğru okumak önemli. Bu açıklama:
göstermiyor.
Gösterdiği daha sınırlı ve somut nokta şu: Model ile sunum sistemi birlikte optimize edildiğinde, büyük ölçekli bir çıkarım hizmeti Nvidia dışı bir yerli donanım yığını üzerine kurulabilir.
Bu lansman, Nvidia’nın genel üstünlüğünün bir gecede ortadan kalktığı anlamına gelmiyor. CUDA’nın yazılım ekosistemi, araçları, kurulu kullanıcı tabanı ve yapay zekâ eğitimi alanındaki konumu, çıkarım hizmetlerinin maliyetinden ayrı başlıklar.
Bununla birlikte GLM-5.3-Flash örneği, belirli üretim iş yüklerinde modele özel çekirdeklerin, nicemleme yöntemlerinin, paralel hesaplamanın ve gelişmiş zamanlama tekniklerinin CUDA’ya olan bağımlılığı azaltabileceğini gösteriyor. Dolayısıyla tartışma, Nvidia’nın tüm avantajlarının kaybolmasından çok, bu avantajların özellikle çıkarım tarafında ne ölçüde aşınabileceği üzerine kuruluyor.
Bir milyon tokenlık bağlam penceresi; bellek kapasitesi, bellek bant genişliği, çipler arası iletişim ve iş planlama açısından ciddi zorluklar yaratıyor. Zhipu AI, bu sorunları aşmak için SGLang temelinde özel bir çıkarım motoru geliştirdiğini ve çeşitli optimizasyonlar kullandığını bildirdi:
Zhipu AI, bu yapı sayesinde aynı donanım üzerindeki başlangıç referansına kıyasla uçtan uca servis performansının yaklaşık üç katına çıktığını açıkladı. 24
26 SGLang’ın sonraki dokümantasyonu da BF16 karşılaştırma yapılandırmasına göre ek verim ve FP8 önbellek kapasitesi kazanımları raporluyor. Ancak bu dokümantasyon, Zhipu’nun açıkladığı üç katlık artış için bağımsız bir denetim niteliğinde değil.
17
Buradaki asıl ders, ham çip gücünden çok sistem tasarımında yatıyor: daha düşük bellek ve bant genişliği kapasitesine sahip donanım, model mimarisi ve çıkarım yazılımı birlikte tasarlanarak büyük bir hizmet yükünü taşıyabilir.
GLM-5.3-Flash’in bildirilen teknik özellikleri şöyle:
Bu yapı, modeli uzun belgeler, kodlama ve uzun süre çalışan ajan görevleri için konumlandırıyor. Büyük toplam parametre sayısına rağmen her token için yalnızca yaklaşık 18 milyar parametrenin etkinleşmesi, çıkarım maliyetini düşürmeye yardımcı olabiliyor. 2
5
7
Modelin Artificial Analysis Intelligence Index puanı 57 olarak bildirildi; bu, aynı kaynaklarda Claude Opus 4.8 için verilen puana eşit. Ancak bu sonuç yalnızca tek bir bileşik endekste eşitlik anlamına geliyor. Tüm kıyaslamalarda, uygulamalarda veya ajan görevlerinde aynı performansın gösterildiğini kanıtlamıyor. 9
Zhipu AI’nin açıkladığı API fiyatı, bir milyon token için girişte 0,15 dolar, çıkışta ise 0,50 dolar olarak verildi. 4
29
Dönemin haberlerinde bu fiyatın GLM-5.3’ün yaklaşık onda biri, Claude Opus 4.8’in ise yaklaşık kırkta biri olduğu aktarıldı. Yine de oranlar; giriş veya çıkış tokenının esas alınmasına, fiyatlandırma kademesine ve seçilen plana göre değişebilir. 1
4
GLM-5.3-Flash’in rekabet avantajı bu nedenle tek bir başlığa dayanmıyor. Modelin seyrek mimarisi, çıkarım katmanındaki agresif optimizasyonlar ve düşük API fiyatı birlikte çalışıyor. Ox Alpha testi de bu üçlü kombinasyonun, modelin kimliği açıklanmadan önce bile büyük bir kullanıcı kitlesini çekebildiğini ortaya koydu.
Bu sonuç, Zhipu AI’nin tüm donanım ve yazılım sınırlamalarını çözdüğü anlamına gelmiyor. Ancak model, çıkarım çağında rekabetin yalnızca en güçlü çipi üretmekten ibaret olmadığını; model, motor ve donanımın birlikte tasarlanmasının da en az ham işlem gücü kadar belirleyici olabileceğini gösteren dikkat çekici bir üretim ölçeği örneği sunuyor.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI, 26 Ağustos 2026’da Çinli geliştirici topluluklarında “Niu Lai” olarak da anılan anonim Ox Alpha modelinin GLM 5.3 Flash olduğunu doğruladı.
Zhipu AI, 26 Ağustos 2026’da Çinli geliştirici topluluklarında “Niu Lai” olarak da anılan anonim Ox Alpha modelinin GLM 5.3 Flash olduğunu doğruladı. GLM 5.3 Flash; toplam 320 milyar parametreye, token başına yaklaşık 18 milyar etkin parametreye ve 1.048.576 tokenlık bağlam penceresine sahip seyrek bir Mixture of Experts modeli.
Açıklamanın asıl önemi, Çin üretimi çiplerin genel olarak Nvidia’yı geride bıraktığını kanıtlaması değil; modele özel yazılım optimizasyonlarının, Nvidia dışı bir çıkarım altyapısını büyük ölçekte kullanılabilir hâle...