DeepSeek ने 17 अगस्त 2026 को 00:00 Beijing समय से V4 Flash और V4 Pro के लिए समय आधारित बिलिंग शुरू की। ऑफ पीक दरें पीक दरों की आधी हैं। पीक समय रोज़ाना 09:00–12:00 और 14:00–18:00 Beijing समय है। पीक पर V4 Flash आउटपुट की कीमत ¥9 और V4 Pro आउटपुट की कीमत ¥27 प्रति 10 लाख टोकन तक पहुंचती है। अब मॉडल चुनने के साथ साथ प...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek ने अपने V4 API की सपाट यानी flat pricing व्यवस्था खत्म कर दी है। 17 अगस्त 2026 को 00:00 Beijing समय से DeepSeek-V4-Flash और DeepSeek-V4-Pro के लिए पीक और ऑफ-पीक बिलिंग लागू हो गई। इसका मतलब है कि एक ही API अनुरोध की कीमत इस बात पर निर्भर करेगी कि प्लेटफॉर्म को वह अनुरोध किस समय मिला। ऑफ-पीक दरें पीक दरों की ठीक आधी हैं। 1
2
हर दिन के दो समय-खंड पीक माने जाएंगे:
बाकी सभी घंटे ऑफ-पीक होंगे। किसी अनुरोध की दर उसके पूरा होने के समय से नहीं, बल्कि सर्वर द्वारा उसे प्राप्त किए जाने के समय से तय होगी। इसलिए ट्रैफिक शेड्यूल करने वाले डेवलपर्स को Beijing समय का हिसाब रखना होगा। 2
7
यह केवल एक समान कीमत बढ़ाने का मामला नहीं है। पीक और ऑफ-पीक दरों के बीच अनुपात 1:2 है—यानी एक ही मॉडल कॉल पीक विंडो में ऑफ-पीक की तुलना में दोगुनी महंगी होगी।
नीचे दी गई सभी कीमतें चीनी युआन में हैं। Cache hit का अर्थ है कि इनपुट में पहले से कैश किया गया प्रॉम्प्ट हिस्सा दोबारा इस्तेमाल हो सकता है। Cache miss में इनपुट को बिना कैश के प्रोसेस किया जाता है, इसलिए उसकी दर अधिक है। प्रतिशत पुराने flat rate की तुलना में बदलाव दिखाते हैं।
| मॉडल और टोकन प्रकार | पुरानी दर | ऑफ-पीक दर | बदलाव | पीक दर | बदलाव |
|---|---|---|---|---|---|
| V4-Flash cache-hit इनपुट | ¥0.02 | ¥0.05 | +150% | ¥0.10 | +400% |
| V4-Flash cache-miss इनपुट | ¥1.00 | ¥1.50 | +50% | ¥3.00 | +200% |
| V4-Flash आउटपुट | ¥2.00 | ¥4.50 | +125% | ¥9.00 | +350% |
| V4-Pro cache-hit इनपुट | ¥0.025 | ¥0.15 | +500% | ¥0.30 | +1,100% |
| V4-Pro cache-miss इनपुट | ¥3.00 | ¥4.50 | +50% | ¥9.00 | +200% |
| V4-Pro आउटपुट | ¥6.00 | ¥13.50 | +125% | ¥27.00 | +350% |
V4-Flash के लिए दस्तावेज़ों में ऑफ-पीक दरें cache-hit इनपुट, cache-miss इनपुट और आउटपुट के लिए क्रमशः ¥0.05, ¥1.50 और ¥4.50 दी गई हैं। पीक समय में यही दरें ¥0.10, ¥3 और ¥9 हो जाती हैं। 2 Reuters के अनुसार, अलग-अलग मॉडल, टोकन प्रकार और उपयोग के समय के आधार पर नई कीमतों में बढ़ोतरी 50% से 1,100% तक है।
1
8
मॉडल मूल्यांकन, दस्तावेज़ों की इंडेक्सिंग, बैकफिल, सिंथेटिक डेटा तैयार करना और दूसरे गैर-तत्काल काम ऑफ-पीक घंटों में भेजे जा सकते हैं। चूंकि ऑफ-पीक दर पीक दर की आधी है, केवल शेड्यूल बदलने से flexible workloads की लागत में उल्लेखनीय कमी आ सकती है। 2
इससे समय क्षेत्र AI इंफ्रास्ट्रक्चर का नया ऑपरेशनल वेरिएबल बन गया है। ऐसा queueing सिस्टम जो काम की deadline और Beijing-समय वाली बिलिंग विंडो दोनों को समझता हो, मॉडल बदलने या token budget घटाने के बजाय काम को बाद के लिए टाल सकता है।
कस्टमर सपोर्ट, coding assistant और real-time agent आम तौर पर उसी समय चलते हैं जब उपयोगकर्ता सक्रिय होते हैं। ऐसे ऐप्स को पीक रेट स्वीकार करना पड़ सकता है। फिर भी prompt reuse, cache-friendly request design, छोटे आउटपुट और बेहतर model routing से खर्च घटाया जा सकता है।
कैशिंग खास तौर पर महत्वपूर्ण है, क्योंकि दोनों मॉडलों में cache-hit इनपुट की कीमत cache-miss इनपुट से काफी कम है। जो सिस्टम बार-बार समान निर्देश, tool definitions या दस्तावेज़ी संदर्भ भेजते हैं, उनके लिए cache-hit rate सुधारना अनुरोधों की संख्या में मामूली कटौती से ज्यादा प्रभावी हो सकता है।
लंबे reasoning trace, विस्तृत रिपोर्ट और बड़े code response आउटपुट टोकन की खपत बढ़ाते हैं। पीक समय में V4-Flash आउटपुट की कीमत ¥9 प्रति 10 लाख टोकन और V4-Pro की ¥27 है। डेवलपर्स tighter output limits लगा सकते हैं, नियमित कामों के लिए Flash इस्तेमाल कर सकते हैं और Pro को उन कार्यों तक सीमित रख सकते हैं जहां उसकी अतिरिक्त क्षमता का फायदा लागत से अधिक हो। 1
2
V4-Pro की पीक cache-hit दर पुरानी flat pricing से 12 गुना है—नई व्यवस्था में यही सबसे बड़ी प्रतिशत बढ़ोतरी है। हालांकि युआन के लिहाज से यह दर अभी भी cache-miss इनपुट और आउटपुट से कम है, लेकिन बहुत बड़े पैमाने पर बार-बार कैश किए गए प्रॉम्प्ट चलाने वाले सिस्टमों पर इसका असर महत्वपूर्ण हो सकता है। 1
19
अगस्त में DeepSeek-V4-Pro-0813 को deepseek-v4-pro endpoint के पीछे general availability मिली। प्रकाशित स्पेसिफिकेशन के अनुसार यह text model है, जिसमें 10 लाख टोकन का context window, अधिकतम 384,000 टोकन का आउटपुट और लगभग 1.6 ट्रिलियन कुल parameters वाला mixture-of-experts architecture है। प्रति टोकन करीब 49 अरब parameters सक्रिय रहते हैं। 29
33
DeepSeek से जुड़े दस्तावेज़ों में दोनों tiers के लिए अलग concurrency limits भी दी गई हैं:
Stream की गई response सहित, अनुरोध पूरा होने तक वह एक concurrency slot घेरता है। 28
कीमत और concurrency को साथ देखने पर यह product segmentation दिखाई देती है: Flash बड़े पैमाने के routine traffic के लिए अधिक उपयुक्त है, जबकि Pro को कठिन reasoning और बड़े context वाले कामों के लिए सीमित क्षमता वाले premium tier की तरह रखा गया है। यह प्रकाशित कीमतों और limits से निकला निष्कर्ष है, हर use case के बारे में DeepSeek का सीधा दावा नहीं। 2
28
DeepSeek का कदम GPU inference में demand shaping जैसा है। इंटरैक्टिव उपयोगकर्ता ऑनलाइन होने पर मांग एक साथ बढ़ती है, जबकि batch workloads अक्सर कुछ घंटे इंतजार कर सकते हैं। पीक समय में अधिक शुल्क और बाकी समय कम शुल्क लेने से provider computation को पूरे दिन में फैलाने के लिए प्रोत्साहन बनाता है।
डेवलपर्स के लिए cost optimization अब केवल मॉडल चुनने और टोकन गिनने तक सीमित नहीं रहेगा। प्रोडक्शन टीमों को यह भी तय करना होगा:
बड़े मॉडल की price war के व्यापक संदर्भ में यह flat-rate competition से capacity scarcity पर आधारित pricing की ओर बदलाव है। DeepSeek flexible demand के लिए कम लागत वाला रास्ता बनाए रख रहा है, लेकिन high-end inference की कीमत को उस समय की उपलब्ध क्षमता से जोड़ रहा है। Reuters ने भी इसे मॉडल, टोकन श्रेणी और उपयोग अवधि के अनुसार अलग-अलग प्रभाव वाली बड़ी कीमत बढ़ोतरी बताया है, न कि एक समान surcharge। 1
DeepSeek V4 इस्तेमाल करने वाली टीमों के लिए व्यावहारिक सबक सीधा है: scheduling, caching, routing और output controls को API cost model का हिस्सा मानें। जो काम समय के हिसाब से टाला नहीं जा सकता, उसके लिए अलग मॉडल या कम token budget की जरूरत पड़ सकती है। जो काम इंतजार कर सकता है, वह off-peak में चलाकर अपनी लागत का बड़ा हिस्सा बचा सकता है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
DeepSeek ने 17 अगस्त 2026 को 00:00 Beijing समय से V4 Flash और V4 Pro के लिए समय आधारित बिलिंग शुरू की। ऑफ पीक दरें पीक दरों की आधी हैं।
DeepSeek ने 17 अगस्त 2026 को 00:00 Beijing समय से V4 Flash और V4 Pro के लिए समय आधारित बिलिंग शुरू की। ऑफ पीक दरें पीक दरों की आधी हैं। पीक समय रोज़ाना 09:00–12:00 और 14:00–18:00 Beijing समय है। पीक पर V4 Flash आउटपुट की कीमत ¥9 और V4 Pro आउटपुट की कीमत ¥27 प्रति 10 लाख टोकन तक पहुंचती है।
अब मॉडल चुनने के साथ साथ प्रॉम्प्ट कैशिंग, आउटपुट सीमा और बैच जॉब का समय तय करना भी API लागत नियंत्रित करने का हिस्सा है।