यह उस लॉन्च की कहानी है — मॉडल वास्तव में क्या कर सकता है, इसकी कीमत कितनी है, और यह चल रही US-चीन AI प्रतिस्पर्धा में एक महत्वपूर्ण क्षण क्यों है।
Kimi K3 ने स्वतंत्र आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स v4.1 पर 57.1 स्कोर किया, जिससे यह वैश्विक स्तर पर तीसरे स्थान पर रहा — Claude Fable 5 (60) और GPT-5.6 Sol (59) के पीछे । यह अंतर लगभग 3 अंकों का है — ऐतिहासिक मानकों के हिसाब से कम, लेकिन स्पष्ट: व्यापक उपलब्ध इंटेलिजेंस टेस्ट में अब भी टॉप US मॉडल आगे हैं
। Moonshot ने खुद इसे स्वीकार किया, सार्वजनिक रूप से कहा कि K3 "समग्र एग्रीगेट परफॉर्मेंस पर Anthropic और OpenAI के सबसे शक्तिशाली प्रोपराइटरी मॉडल्स से पीछे है"
।
K3 जहां आगे निकलता है, वह है विशिष्ट, रियल-वर्ल्ड एजेंटिक बेंचमार्क:
| बेंचमार्क | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| DeepSWE | 73.0 | 70.0 | 67.5 | 59.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| Automation Bench | 75.6 | — | — | — |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 |
इन पांच एजेंटिक बेंचमार्क और Program Bench (77.8) पर, K3 ने 6 में से 5 को सीधे जीता, विशिष्ट परीक्षणों पर Fable 5 और GPT-5.6 Sol दोनों को हराया । इसने Claude Opus 4.8 को हर प्रकाशित बेंचमार्क पर काफी बेहतर प्रदर्शन किया — एक सार्थक परिणाम क्योंकि Opus 4.8 की कीमत $5 इनपुट / $25 आउटपुट प्रति मिलियन टोकन है, जो इसे एक सीधा लागत प्रतिस्पर्धी बनाता है
।
UC बर्कले के शोधकर्ताओं द्वारा बनाए गए एरीना ब्लाइंड ह्यूमन प्रेफरेंस प्लेटफॉर्म पर, K3 ने लॉन्च के तुरंत बाद कोडिंग लीडरबोर्ड में टॉप किया । एरीना के क्राउड-कम्पेरिजन मूल्यांकन में K3 ने फ्रंट-एंड वेब डेवलपमेंट में 1,679 का स्कोर हासिल कर पहला स्थान लिया, जो Fable 5 (1,631) और GPT-5.6 Sol (1,618) से आगे है
।
GPU कर्नेल ऑप्टिमाइजेशन पर — वे तकनीकें जो AI मॉडल और हार्डवेयर के बीच इंटरेक्शन को बेहतर बनाती हैं — Moonshot ने रिपोर्ट किया कि K3 ने Opus 4.8, GPT-5.6 Sol और GPT-5.5 को "काफी बेहतर प्रदर्शन" किया । यह व्यावसायिक रूप से महत्वपूर्ण है क्योंकि बेहतर कर्नेल ऑप्टिमाइजेशन का मतलब एक ही हार्डवेयर पर कम लेटेंसी और बेहतर थ्रूपुट है।
मॉडल एक स्पार्स MoE आर्किटेक्चर का उपयोग करता है जिसमें 896 एक्सपर्ट्स हैं, जिनमें से प्रति टोकन केवल 16 एक्टिवेट होते हैं, जो कुल 2.8 ट्रिलियन पैरामीटर होने के बावजूद इसकी इन्फ्रेंस लागत को GPT-5.6 Sol के लगभग बराबर बनाता है । यह Kimi Delta Attention (KDA) और Attention Residuals (AttnRes) भी पेश करता है — लॉन्ग-कॉन्टेक्स्ट रीजनिंग को बेहतर बनाने के लिए डिज़ाइन किए गए नए आर्किटेक्चरल कॉम्पोनेंट
।
Kimi K3 का सबसे बाजार-विघटनकारी पहलू इसकी API प्राइसिंग है, जो शीर्ष US मॉडल्स की तुलना में काफी कम है:
| मॉडल | इनपुट (प्रति 1M टोकन) | आउटपुट (प्रति 1M टोकन) |
|---|---|---|
| Kimi K3 | $3.00 | $15.00 |
| GPT-5.6 Sol | $5.00 | $30.00 |
| Claude Fable 5 | $10.00 | $50.00 |
| Claude Opus 4.8 | $5.00 | $25.00 |
Kimi K3 की कीमत GPT-5.6 Sol से ~40% कम और Claude Fable 5 से ~70% कम है । ये तीनों मॉडल एक साफ 3.3 गुना की सीढ़ी पर बैठते हैं: Fable 5 की कीमत इनपुट और आउटपुट दोनों पर Kimi K3 से 3.3 गुना है, GPT-5.6 Sol लगभग बीच में है
।
इसके अतिरिक्त, K3 के लिए कैश-हिट इनपुट रेट $0.30 प्रति मिलियन टोकन है — जो इसके कैश-मिस रेट से 10 गुना सस्ता है — उन संदर्भ क्वेरीज के लिए जो पहले सर्व की जा चुकी हैं । प्रति-कार्य के आधार पर, K3 की लागत US फ्लैगशिप से 50-65% कम होने का अनुमान है
।
K3 के लिए Moonshot की प्राइसिंग एक उल्लेखनीय बदलाव दर्शाती है: यह अब बजट विकल्प के बजाय फ्रंटियर मॉडल की तरह कीमत वाला है । पिछले Kimi मॉडल जैसे K2.5 और K2.6 की कीमत $0.60 इनपुट / $2.50-4.00 आउटपुट थी, जिससे K3 अपने पूर्ववर्तियों की तुलना में लगभग 3-4 गुना अधिक महंगा है
। हालांकि, यह टॉप-टियर US मॉडल्स से सस्ता रहता है, जबकि विशिष्ट एजेंटिक कार्यों पर तुलनीय या बेहतर प्रदर्शन देता है।
19 जुलाई 2026 को — लॉन्च के लगभग 48 घंटे बाद — Moonshot AI ने घोषणा की कि वह Kimi K3 के लिए नए सब्सक्रिप्शन टेम्परेरली रोक रहा है। कंपनी ने X पर पोस्ट किया: "Kimi K3 को हमारी उम्मीद से कहीं अधिक प्यार मिला है, और हमारे GPUs इसे महसूस कर रहे हैं। पिछले 48 घंटों में, डिमांड हमारी मौजूदा क्षमता की सीमा के करीब पहुंच गई है" ।
कंपनी ने कहा कि वह मौजूदा सब्सक्राइबर्स के लिए कंप्यूट को प्राथमिकता देगी, जबकि जितनी जल्दी हो सके क्षमता बढ़ाएगी, और बैचों में नए सब्सक्रिप्शन स्लॉट फिर से खोलने की योजना बनाई । मौजूदा उपयोगकर्ताओं की पूर्ण पहुंच बनी रही, और एंटरप्राइज/API सेवाएं जारी रहीं
।
कई समाचार आउटलेट्स ने नोट किया कि यह घटना US चिप एक्सपोर्ट प्रतिबंधों के कारण चीन की चल रही कंप्यूट बाधाओं को उजागर करती है । साउथ चाइना मॉर्निंग पोस्ट ने लिखा कि यह स्थिति "चीनी AI लैब्स के सामने अपने उत्पादों को वैश्विक उपयोगकर्ताओं तक पहुंचाने में आने वाली चुनौतियों को रेखांकित करती है"
। मॉडल के पूर्ण वेट्स, जो तीसरे पक्षों को इसे अपने हार्डवेयर पर चलाने की अनुमति देंगे, 27 जुलाई तक जारी नहीं होने वाले थे — लॉन्च विंडो के दौरान Moonshot को इन्फ्रेंस क्षमता का एकमात्र प्रदाता छोड़ते हुए
।
Moonshot ने इस ठहराव का उपयोग अपनी सदस्यता को दो योजनाओं में विभाजित करने के लिए किया: Kimi Membership (वेब, ऐप और Work के लिए) और Kimi Code Membership (कोडिंग वर्कफ्लो के लिए), कंप्यूट संसाधनों को बेहतर ढंग से आवंटित करने के लिए डिज़ाइन किया गया एक पुनर्गठन ।
Kimi K3 के लॉन्च का AI बेंचमार्क से परे भी प्रभाव पड़ा। स्ट्रेट्स टाइम्स ने सीधे रिपोर्ट किया कि K3 ने "टेक राउट को बढ़ावा दिया," और कई आउटलेट्स ने रिलीज़ को US सेमीकंडक्टर और AI स्टॉक्स में बिकवाली से जोड़ा ।
कॉर्पोरेट पक्ष पर, रॉयटर्स ने 20 जुलाई 2026 को रिपोर्ट किया कि सब्सक्रिप्शन ठहराव "ऐसे समय में आया है जब कंपनी ताजा फंडिंग की तलाश कर रही है, सूत्रों का कहना है कि यह हांगकांग में प्रारंभिक सार्वजनिक पेशकश (IPO) की ओर बढ़ रही है" ।
Kimi K3 के पूर्ण मॉडल वेट्स 27 जुलाई 2026 को सार्वजनिक रिलीज़ के लिए निर्धारित हैं । यह एक महत्वपूर्ण विवरण है क्योंकि इसका मतलब है कि डेवलपर्स और संगठन अंततः मॉडल को सिर्फ API के माध्यम से किराए पर लेने के बजाय डाउनलोड, रन, इंस्पेक्ट, फाइन-ट्यून और अपना कर सकते हैं
। दो-चरणीय रोलआउट — पहले API, ग्यारह दिन बाद ओपन वेट्स — पूरी घोषणा का आकार है
।
ओपन-वेट रिलीज़ से पहले, डेवलपर्स kimi.com, Kimi API या OpenRouter के माध्यम से K3 तक पहुंच सकते हैं । मॉडल OpenAI SDK बोलता है, टूल कॉलिंग, स्ट्रक्चर्ड आउटपुट और ऑटोमैटिक कॉन्टेक्स्ट कैशिंग को सपोर्ट करता है, और इसमें 1-मिलियन-टोकन कॉन्टेक्स्ट विंडो है जिसमें कोई लॉन्ग-कॉन्टेक्स्ट सरचार्ज नहीं है
।
हालांकि, 2.8 ट्रिलियन पैरामीटर वाले मॉडल को स्थानीय रूप से चलाना आसान नहीं है। फ़ाइल का आकार लगभग 1.5 TB होने का अनुमान है, और अनुशंसित हार्डवेयर में 64+ एंटरप्राइज NVIDIA H100 GPUs शामिल हैं । अधिकांश टीमों के लिए, API ही व्यावहारिक पहुंच बिंदु रहेगा।
Kimi K3 वह मॉडल नहीं है जो GPT-5.6 Sol या Claude Fable 5 को समग्र बुद्धिमत्ता पर उखाड़ फेंके — Moonshot खुद ऐसा कहता है। लेकिन यह वह मॉडल है जो साबित करता है कि एक ओपन-वेट सिस्टम विशिष्ट, व्यावसायिक रूप से मूल्यवान कार्यों पर फ्रंटियर प्रोपराइटरी मॉडल्स के साथ प्रतिस्पर्धा कर सकता है, जबकि एक अंश कीमत पर आता है। यह अब तक जारी किया गया सबसे बड़ा ओपन-वेट मॉडल है, और यह इतनी रियल-वर्ल्ड डिमांड के साथ आया कि दो दिनों में एक कंपनी के GPU इंफ्रास्ट्रक्चर को क्रैश कर दिया।
यह संयोजन — एजेंटिक बेंचमार्क पर फ्रंटियर-टियर परफॉर्मेंस, आक्रामक प्राइसिंग, ओपन वेट्स और डिमांड का स्पष्ट संकेत — K3 को AI परिदृश्य में एक महत्वपूर्ण मील का पत्थर बनाता है, चाहे वह किसी भी एकल लीडरबोर्ड पर कहीं भी हो।