Z.ai ने 26 अगस्त 2026 को पुष्टि की कि गुप्त मुफ्त प्रीव्यू Ox Alpha वास्तव में GLM 5.3 Flash था—320 अरब कुल पैरामीटर और प्रति टोकन 18 अरब सक्रिय पैरामीटर वाला मॉडल। इसके वेट्स MIT लाइसेंस के तहत जारी किए गए हैं। यह मॉडल टेक्स्ट, इमेज और वीडियो इनपुट ले सकता है, करीब 10 लाख टोकन का कॉन्टेक्स्ट संभालता है और Z.ai की स...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
26 अगस्त 2026 को रहस्य से पर्दा उठ गया। Z.ai ने पुष्टि की कि OpenRouter और OpenCode पर Ox Alpha नाम से गुमनाम रूप से उपलब्ध कराया गया मॉडल वास्तव में GLM-5.3-Flash था। कंपनी के अनुसार यह GLM-5 परिवार का पहला नेटिव मल्टीमॉडल मॉडल है, जिसमें ओपन वेट्स, करीब 10 लाख टोकन की कॉन्टेक्स्ट क्षमता और कोडिंग व लंबे समय तक चलने वाले AI एजेंट टास्क पर खास जोर है। 1540
इस खबर की अहमियत केवल मॉडल की पहचान तक सीमित नहीं है। Ox Alpha को पहले मुफ्त और बिना ब्रांड के जारी किया गया, जहां डेवलपर्स ने बड़े पैमाने पर इसका इस्तेमाल किया। इसके बाद उसी सिस्टम को एक नाम, आधिकारिक कीमत और डाउनलोड किए जा सकने वाले वेट्स के साथ पेश किया गया। इस तरीके से Z.ai ने वास्तविक काम के दौरान अपनी सर्विंग इन्फ्रास्ट्रक्चर को परखा और आधिकारिक लॉन्च से पहले बाजार में उत्सुकता पैदा की।
GLM-5.3-Flash एक mixture-of-experts (MoE) मॉडल है। इसमें कुल 320 अरब पैरामीटर हैं, लेकिन हर टोकन तैयार करते समय इनमें से करीब 18 अरब पैरामीटर सक्रिय होते हैं। यह डिजाइन बड़े मॉडल की क्षमता को अपेक्षाकृत कम कंप्यूट लागत में इस्तेमाल करने का प्रयास करता है। मॉडल नेटिव रूप से टेक्स्ट, इमेज और वीडियो इनपुट स्वीकार करता है तथा टेक्स्ट आउटपुट देता है।
मॉडल की डिजाइन क्षमता करीब 10 लाख टोकन की है। हालांकि अलग-अलग प्लेटफॉर्म पर दिखने वाली सीमा थोड़ी अलग हो सकती है। Z.ai के दस्तावेजों में 10 लाख टोकन का डिजाइन बताया गया है, जबकि OpenRouter पर 1,310,720 टोकन की कॉन्टेक्स्ट विंडो सूचीबद्ध थी। 12340
Z.ai ने इसके वेट्स MIT License के तहत जारी किए हैं। इसका अर्थ है कि डेवलपर्स और संगठन इसे पारंपरिक केवल-API मॉडल की तुलना में अधिक आसानी से डाउनलोड, अनुकूलित और अपने इन्फ्रास्ट्रक्चर पर तैनात कर सकते हैं। गुमनाम प्रीव्यू समाप्त होने के बाद मॉडल OpenRouter पर भी अपने आधिकारिक नाम से दिखाई देने लगा। 348
यह मॉडल अगस्त की शुरुआत में घोषित बड़े GLM-5.3 से अलग है। रिपोर्टों के मुताबिक GLM-5.3-Flash एक अलग और कम लागत वाला 320B-A18B मॉडल है, न कि बड़े GLM-5.3 लाइनअप का वही SKU। 10
Z.ai का कहना है कि GLM-5.3-Flash, GLM-5.2 से बेहतर प्रदर्शन देता है और इसकी सर्विंग लागत भी कम है। लॉन्च के आसपास बताए गए परिणामों में मॉडल ने DeepSWE v1.1 पर 63.4 अंक हासिल किए, जबकि GLM-5.2 का स्कोर 46.2 बताया गया। Z.ai ने अपने आंतरिक कोडिंग बेंचमार्क पर 29.0 का स्कोर भी बताया, जो Claude Opus 4.8 के लिए रिपोर्ट किए गए 29.5 के करीब है। 316
ये आंकड़े बताते हैं कि Z.ai अपने मॉडल को किस तरह पेश कर रहा है, लेकिन इन्हें Anthropic के मॉडल के साथ स्वतंत्र रूप से समानता की पुष्टि नहीं माना जा सकता। बेंचमार्क की परिभाषा, टेस्टिंग सेटिंग, प्रॉम्प्ट और परिणाम दोहराए जा सकने की जानकारी महत्वपूर्ण होती है। इसलिए फिलहाल सबसे सुरक्षित निष्कर्ष यही है कि Z.ai कम कीमत पर मजबूत कोडिंग और एजेंट प्रदर्शन का दावा कर रहा है—यह नहीं कि GLM-5.3-Flash ने निश्चित रूप से सभी बंद फ्रंटियर मॉडलों को पीछे छोड़ दिया है।
Ox Alpha की सबसे चर्चित बात यह थी कि डेवलपर्स इसे गुमनाम प्रीव्यू के दौरान बिना भुगतान आजमा सकते थे। मॉडल के आधिकारिक नाम के साथ आने पर यह मुफ्त चरण समाप्त हो गया। Z.ai की सूचीबद्ध कीमत 10 लाख इनपुट टोकन के लिए 0.15 डॉलर और 10 लाख आउटपुट टोकन के लिए 0.50 डॉलर है। 13
लॉन्च के आसपास OpenRouter पर इससे कम प्रचारात्मक दर दिखाई गई: इनपुट के लिए 0.075 डॉलर और आउटपुट के लिए 0.25 डॉलर प्रति 10 लाख टोकन। यहां तीन स्थितियों को अलग-अलग समझना जरूरी है—मुफ्त प्रीव्यू, Z.ai की सामान्य सूची कीमत और किसी प्लेटफॉर्म की अस्थायी लॉन्च छूट। 2
फिर भी, सूचीबद्ध कीमत पर भी मॉडल की अर्थव्यवस्था इसकी बड़ी ताकत है। कोडिंग एजेंट लंबे संदर्भ और बहुत अधिक आउटपुट टोकन इस्तेमाल कर सकते हैं। ऐसे में मॉडल चुनते समय मामूली बेंचमार्क बढ़त जितना ही टोकन खर्च भी महत्वपूर्ण हो सकता है।
Z.ai ने कहा कि GLM-5.3-Flash पूरी तरह चीन में निर्मित AI एक्सेलेरेटर पर चल रहा था। 15 मॉडल की सर्विंग प्रणाली पर आई रिपोर्टों में कस्टम SGLang-आधारित स्टैक का उल्लेख है, जिसमें क्वांटाइजेशन, टेंसर पैरेललिज्म, मिश्रित कैश फॉर्मेट, लेयर स्प्लिटिंग और अलग encode–prefill–decode आर्किटेक्चर जैसी तकनीकें शामिल हैं। इसका उद्देश्य घरेलू हार्डवेयर की सीमाओं के भीतर एंड-टू-एंड सर्विंग प्रदर्शन सुधारना था। 25
यह Z.ai के GLM परिवार से जुड़ी पहले की कहानी को भी आगे बढ़ाता है। कंपनी ने कहा है कि GLM परिवार की ट्रेनिंग Huawei Ascend प्रोसेसर पर की गई और इसमें Nvidia हार्डवेयर का इस्तेमाल नहीं हुआ। रिपोर्टों के अनुसार, Z.ai को अमेरिकी Entity List में शामिल किए जाने के कारण Nvidia के H100, H200 और B200 एक्सेलेरेटर तक पहुंच पर प्रतिबंध है। 26
घरेलू चिप्स पर संचालन का दावा रणनीतिक रूप से महत्वपूर्ण है, लेकिन इसे पूरी तरह ऑडिट की गई हार्डवेयर तुलना की तरह नहीं पढ़ना चाहिए। अधिक सावधानीपूर्ण निष्कर्ष यह है कि Z.ai अपने मॉडल स्टैक को Nvidia के प्रमुख डेटा-सेंटर GPU पर निर्भर हुए बिना बड़े मल्टीमॉडल मॉडल की सर्विंग करने में सक्षम बता रहा है।
गुमनाम रिलीज एक सोची-समझी stealth launch रणनीति जैसी दिखती है: पहले बिना पहचान बताए सक्षम मॉडल जारी करना, उसे लोकप्रिय कोडिंग माध्यमों पर मुफ्त उपलब्ध कराना, डेवलपर्स के वास्तविक इस्तेमाल को देखना और फिर सिस्टम के बारे में आधिकारिक जानकारी सामने लाना। Z.ai से पहले के Pony Alpha परीक्षण को भी इसी तरह के विचार से जोड़ा गया है।
इस दौरान कम्युनिटी के शोधकर्ताओं ने टोकनाइजर व्यवहार, वीडियो प्रोसेसिंग संकेतों और API एरर पैटर्न के आधार पर Ox Alpha की पहचान का अनुमान लगाने की कोशिश की। 71113 इस तरह लॉन्च एक साथ इन्फ्रास्ट्रक्चर स्ट्रेस टेस्ट, डेवलपर फीडबैक अभियान और मार्केटिंग इवेंट बन गया।
लॉन्च के समय कुछ रिपोर्टों में बहुत बड़े उपयोग आंकड़ों और डेवलपर उत्साह का भी उल्लेख हुआ, लेकिन उपलब्ध सामग्री हर संख्या या उद्धरण की स्वतंत्र पुष्टि नहीं करती। इसलिए इन दावों को ऑडिट किए गए अपनाने के आंकड़ों के बजाय लॉन्च-पीरियड रिपोर्टिंग के रूप में देखना बेहतर है। 14
GLM-5.3-Flash से यह साबित नहीं होता कि Z.ai ने हर तरह की फ्रंटियर क्षमता में OpenAI या Anthropic को पीछे छोड़ दिया है। लेकिन यह रिलीज एक प्रभावशाली संयोजन जरूर पेश करती है: मल्टीमॉडल इनपुट, बहुत लंबा कॉन्टेक्स्ट, MIT-लाइसेंस वाले ओपन वेट्स, कोडिंग एजेंट पर फोकस और कम API कीमत। 1540
डेवलपर्स के लिए इसका मतलब है कि मॉडल बदलना आसान हो सकता है और अपने सर्वर या कई प्रदाताओं वाले सेटअप का इस्तेमाल अधिक व्यावहारिक बन सकता है। वहीं बंद मॉडल देने वाली कंपनियों पर कीमत और मार्जिन का दबाव बढ़ सकता है—खासकर कोडिंग वर्कलोड में, जहां टोकन खर्च, लेटेंसी, तैनाती का नियंत्रण और हार्डवेयर उपलब्धता कई बार लीडरबोर्ड रैंकिंग जितने ही महत्वपूर्ण होते हैं।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Z.ai ने 26 अगस्त 2026 को पुष्टि की कि गुप्त मुफ्त प्रीव्यू Ox Alpha वास्तव में GLM 5.3 Flash था—320 अरब कुल पैरामीटर और प्रति टोकन 18 अरब सक्रिय पैरामीटर वाला मॉडल। इसके वेट्स MIT लाइसेंस के तहत जारी किए गए हैं।
Z.ai ने 26 अगस्त 2026 को पुष्टि की कि गुप्त मुफ्त प्रीव्यू Ox Alpha वास्तव में GLM 5.3 Flash था—320 अरब कुल पैरामीटर और प्रति टोकन 18 अरब सक्रिय पैरामीटर वाला मॉडल। इसके वेट्स MIT लाइसेंस के तहत जारी किए गए हैं। यह मॉडल टेक्स्ट, इमेज और वीडियो इनपुट ले सकता है, करीब 10 लाख टोकन का कॉन्टेक्स्ट संभालता है और Z.ai की सूचीबद्ध कीमत 10 लाख इनपुट टोकन के लिए 0.15 डॉलर तथा आउटपुट के लिए 0.50 डॉलर है।
गुप्त लॉन्च ने Z.ai को मॉडल का नाम सार्वजनिक करने से पहले वास्तविक डेवलपर ट्रैफिक पर अपनी इन्फ्रास्ट्रक्चर क्षमता परखने का मौका दिया—यानी यह तकनीकी परीक्षण और मार्केटिंग रणनीति, दोनों था।