| मॉडल | इनपुट कीमत (प्रति 10 लाख टोकन) | आउटपुट कीमत (प्रति 10 लाख टोकन) | बदलाव |
|---|---|---|---|
| GPT-5.6 Luna | $0.20 | $1.20 | 80% कटौती, पहले $1/$6 |
| GPT-5.6 Terra | $2.00 | $12.00 | 20% कटौती, पहले $2.50/$15 |
| GPT-5.6 Sol | $5.00 | $30.00 | कीमत अपरिवर्तित; Fast मोड जोड़ा गया |
Luna के इनपुट और आउटपुट को मिलाकर प्रभावी कीमत $1.40 प्रति 10 लाख टोकन बैठती है । Terra की संयुक्त कीमत $14 प्रति 10 लाख टोकन हो गई है।
फ्लैगशिप Sol की Standard कीमत वही है, लेकिन API ग्राहकों के लिए Fast मोड उपलब्ध कराया गया है। OpenAI के अनुसार, यह मोड Standard प्रोसेसिंग की तुलना में 2.5 गुना तक तेज़ है और इसकी कीमत Standard दर से दोगुनी है—बिना इंटेलिजेंस में बदलाव के ।
इस घोषणा का सबसे दिलचस्प हिस्सा कीमत नहीं, बल्कि इसके पीछे की इंजीनियरिंग है। 29 जुलाई को OpenAI ने बताया कि GPT-5.6 Sol ने कंपनी के प्रोडक्शन GPU कर्नेल को स्वायत्त रूप से फिर से लिखने और ऑप्टिमाइज़ करने में मदद की । GPU कर्नेल वह लो-लेवल कोड होता है जो हार्डवेयर पर AI मॉडल को चलाता है।
Codex डेवलपमेंट वातावरण के ज़रिए Sol ने OpenAI के आंतरिक इंफ्रास्ट्रक्चर से कनेक्ट होकर सैकड़ों आर्किटेक्चर प्रयोग तैयार किए और चलाए, डिप्लॉयमेंट शुरू किए, उनके परिणामों पर नज़र रखी और फिर सुधारों को दोहराया । मॉडल ने OpenAI के कर्नेल स्टैक में इस्तेमाल होने वाली Triton और Gluon भाषाओं का सिंटैक्स भी सीखा ।
OpenAI द्वारा बताए गए प्रमुख नतीजे ये हैं:
स्पेकुलेटिव डिकोडिंग में एक छोटा “ड्राफ्ट मॉडल” अगले टोकन का अनुमान लगाता है। इससे बड़े मॉडल को हर टोकन पर पूरी गणना करने की जरूरत कम पड़ती है और जवाब जल्दी तैयार हो सकता है।
रिपोर्टों में इंफ्रास्ट्रक्चर के अन्य सुधारों का भी उल्लेख है। इनमें भौगोलिक स्थिति, एक्सेलरेटर के प्रकार और उपलब्ध कैश के आधार पर अनुरोधों को अलग-अलग GPU क्लस्टर में भेजने वाला बेहतर लोड बैलेंसिंग सिस्टम शामिल है ।
OpenAI की प्रॉम्प्ट कैशिंग व्यवस्था में लगभग 30 मिनट का TTL यानी cache life है। कैश में मौजूद इनपुट को नए इनपुट की तुलना में 90% कम कीमत पर प्रोसेस किया जा सकता है । बार-बार एक ही कोडबेस या संदर्भ इस्तेमाल करने वाले डेवलपर्स और एजेंटिक वर्कफ़्लो के लिए यह खास तौर पर उपयोगी हो सकता है।
OpenAI का इतना बड़ा प्राइस कट लॉन्च के तुरंत बाद हुआ है। इससे संकेत मिलता है कि AI बाजार में केवल बेहतर मॉडल बनाना काफी नहीं रहा; कंपनियों को कम लागत पर समान या बेहतर प्रदर्शन भी देना होगा।
बीजिंग स्थित Moonshot AI ने 17 जुलाई को Kimi K3 जारी किया। यह 2.8 ट्रिलियन पैरामीटर वाला open-weight मॉडल है, जिसे कंपनी ने दुनिया का सबसे बड़ा open-weight AI मॉडल बताया । कुछ फ्रंट-एंड कोडिंग बेंचमार्क में Kimi K3 ने GPT-5.6 Sol और Anthropic के Fable 5 को पीछे छोड़ा ।
Arena के Frontend Code लीडरबोर्ड पर Kimi K3 को 1,679 अंक मिले, जो GPT-5.6 Sol और Fable 5 से अधिक थे । एक स्वतंत्र फ्रंट-एंड इंजीनियरिंग बेंचमार्क में पूरे टेस्ट सूट को चलाने की लागत Kimi K3 के लिए $7.17 बताई गई, जबकि Claude Opus 5 के लिए यह $21.17 थी ।
Microsoft द्वारा Kimi K3 को Copilot में आज़माने पर विचार किए जाने की खबर ने इस दबाव को और बढ़ाया। रिपोर्ट के अनुसार, ऐसा बदलाव Microsoft को प्रति टोकन लागत में 60% तक, यानी संभावित रूप से $600 मिलियन तक, बचत दे सकता है ।
Anthropic ने 24 जुलाई को Claude Opus 5 को $5 प्रति 10 लाख इनपुट टोकन की शुरुआती कीमत पर पेश किया—यह Fable 5 की कीमत का आधा है। कुछ बेंचमार्क में Opus 5 ने Fable 5 को भी पीछे छोड़ा । इससे GPT-5.6 Sol के प्रीमियम सेगमेंट में प्रतिस्पर्धा और तीखी हुई।
Google और Microsoft ने भी जुलाई में कई किफायती AI मॉडल पेश किए, जिससे मिड-रेंज और बजट सेगमेंट में कीमतों पर दबाव बढ़ा ।
ऐसे माहौल में OpenAI Luna को बड़े पैमाने और कीमत के प्रति संवेदनशील कामों के लिए एक “लॉस लीडर” की तरह इस्तेमाल कर सकता है—यानी कम कीमत वाला विकल्प जो ग्राहकों को प्लेटफॉर्म पर बनाए रखे। वहीं Sol को जटिल रीजनिंग और प्रीमियम प्रदर्शन के लिए अलग रखा गया है ।
AI मॉडल सस्ते होने के बावजूद उनका कुल खर्च कई कंपनियों के लिए चिंता का विषय बना हुआ है। खासकर ऐसे एजेंट जो लगातार काम करते हैं, टूल्स चलाते हैं और बड़ी मात्रा में API अनुरोध भेजते हैं, उनके बिल तेजी से बढ़ सकते हैं।
22 जुलाई 2026 को OpenAI ने API प्लेटफॉर्म पर हार्ड मासिक खर्च सीमा जोड़ी । एडमिन संगठन या किसी प्रोजेक्ट के लिए मासिक बजट तय कर सकते हैं। सीमा पूरी होने के बाद API अनुरोध फेल हो जाते हैं और HTTP 429 प्रतिक्रिया मिलती है; अगला बिलिंग चक्र शुरू होने पर सीमा रीसेट होती है ।
यह जून में ChatGPT Enterprise के लिए जोड़े गए सॉफ्ट कैप से अलग है। सॉफ्ट कैप मुख्य रूप से निगरानी और रिपोर्टिंग के लिए था, जबकि हार्ड लिमिट वास्तविक अनुरोधों को रोक देती है।
Amazon समेत बड़ी कंपनियों द्वारा AI खर्च पर आंतरिक और ग्राहक-पक्ष की सीमाएं लगाने की खबरें भी सामने आई हैं । Reuters के अनुसार, खरीद और बजट प्रक्रिया में AI को अब क्लाउड सेवाओं की तरह देखा जा रहा है—अलग बजट, सीमित आवंटन और बड़े इस्तेमाल के लिए CIO स्तर की मंजूरी के साथ ।
इसका सीधा मतलब है कि “AI पर जितना खर्च हो, करने दो” वाला दौर खत्म हो रहा है। कंपनियां अब प्रदर्शन के साथ-साथ लागत का अनुमान, बजट सीमा और निवेश पर रिटर्न भी देख रही हैं।
बड़ी तस्वीर यह है कि AI की कीमतों में गिरावट केवल प्रतिस्पर्धा का नतीजा नहीं है। मॉडल अब अपने ही सॉफ़्टवेयर और सर्विंग सिस्टम को बेहतर बनाने में मदद कर रहे हैं। जैसे-जैसे GPU उपयोग, कर्नेल, रूटिंग और कैशिंग में ऐसे सुधार बढ़ेंगे, कीमतों पर और दबाव आ सकता है। दूसरी ओर, open-weight मॉडल क्षमता के मामले में आगे बढ़ते रहे तो क्लाउड और API प्रदाताओं के लिए प्रीमियम कीमतें बनाए रखना और कठिन होगा।