इसी समय DeepSeek ने DeepSeek Harness के closed beta के लिए ओपन-सोर्स डेवलपर्स को आमंत्रित किया है। यह ऐसा execution framework है जो बड़े भाषा मॉडल को context संभालने, tools इस्तेमाल करने और कई चरणों वाले काम पूरे करने वाले AI agents में बदलने के लिए बनाया गया है ।
V4 Flash, DeepSeek V4 परिवार का efficiency-focused मॉडल है। इसका लक्ष्य कम लागत और कम latency के साथ high-volume workloads संभालना है। MoE architecture में मॉडल के सभी विशेषज्ञों का ज्ञान उपलब्ध रहता है, लेकिन हर token पर केवल चुने हुए experts सक्रिय किए जाते हैं। यही वजह है कि कुल मॉडल आकार बहुत बड़ा होने के बावजूद हर inference step का computation उससे काफी कम रहता है।
| विशेषता | जानकारी |
|---|---|
| कुल पैरामीटर | 284 अरब |
| DSpark draft module सहित repository आकार | लगभग 304 अरब |
| प्रति token सक्रिय पैरामीटर | 13 अरब |
| Architecture | Mixture-of-Experts (MoE) |
| Context window | 10 लाख tokens |
| अधिकतम output | 3.84 लाख tokens |
| Precision | FP4 + FP8 mixed precision |
| License | MIT |
| Download size | लगभग 160 GB |
स्रोत:
31 जुलाई का production release preview मॉडल का पूरी तरह नया architecture नहीं है। उपलब्ध रिपोर्टों के अनुसार इसके agentic और coding प्रदर्शन में सुधार मुख्य रूप से दोबारा किए गए post-training से आया, न कि मॉडल के आकार या मूल architecture में बदलाव से ।
V4 Flash और V4 Pro दोनों के weights permissive MIT license के तहत जारी किए गए हैं । इसका अर्थ है कि डेवलपर्स और कंपनियां इन्हें commercial products में इस्तेमाल, modify, distribute और private infrastructure पर self-host कर सकती हैं—बिना royalty देने की बाध्यता के। Weights Hugging Face पर उपलब्ध हैं।
यह उन enterprises के लिए महत्वपूर्ण है जो proprietary API पर पूरी तरह निर्भर नहीं रहना चाहते। हालांकि self-hosting के लिए model weights के अलावा KV cache, serving stack और लंबे context की memory जरूरतों को भी ध्यान में रखना होगा।
V4 Flash का सबसे उल्लेखनीय तकनीकी पक्ष इसका 1-million-token context window है। मॉडल hybrid attention architecture का इस्तेमाल करता है, जिसमें दो मुख्य तंत्र शामिल हैं:
मॉडल की layers CSA और HCA के बीच बारी-बारी से काम करती हैं। हाल के 128 raw tokens के लिए sliding-window branch हमेशा मौजूद रहती है, ताकि बातचीत या code context की ताज़ा जानकारी बनी रहे । सरल शब्दों में, मॉडल पुराने context को संक्षिप्त रूप में रखता है और जरूरत पड़ने पर चुने हुए हिस्सों पर ज्यादा ध्यान देता है।
V4 Flash checkpoint में अलग-अलग हिस्सों के लिए अलग precision इस्तेमाल की गई है:
nvidia/DeepSeek-V4-Flash-NVFP4 ।सिर्फ FP8 weights के हिसाब से 284B मॉडल को लगभग 284 GB memory चाहिए। 1M-token context के लिए एक deployment estimate में 4 NVIDIA H200 SXM5 GPUs, यानी कुल 564 GB VRAM, की सिफारिश की गई है । इसलिए “13B active parameters” का मतलब यह नहीं है कि पूरा मॉडल 13B मॉडल जितनी memory में चल जाएगा; कुल weights और context cache की जरूरत अलग रहती है।
V4 Flash developers को reasoning_effort parameter के जरिए speed और reasoning depth के बीच चुनाव करने देता है । उपलब्ध modes हैं:
इससे एक ही मॉडल को classification या extraction जैसे routine कामों में तेज़ चलाया जा सकता है और complex code generation या planning में अधिक computation दिया जा सकता है ।
DeepSeek V4 Flash की pricing इसे high-volume AI applications के लिए खास बनाती है:
| Token प्रकार | कीमत प्रति 10 लाख tokens |
|---|---|
| Input, cache miss | $0.14 |
| Input, cache hit | $0.0028 |
| Output | $0.28 |
ये कीमतें प्रति 1M tokens हैं । Repeated system prompts या common prefixes जैसे cached input पर लागत cache-miss दर से लगभग 98% कम हो सकती है ।
कुछ उद्योग रिपोर्टों ने V4 Flash को उपलब्ध सबसे सस्ते frontier-class APIs में से एक बताया है। तुलना के लिए, उसकी output कीमत Sonnet 4.6 की $15/M और GPT-5.5 की $30/M दरों से क्रमशः लगभग 54 गुना और 107 गुना कम बताई गई है । वास्तविक बिलिंग, caching और provider की वर्तमान pricing policy के अनुसार बदल सकती है।
31 जुलाई के V4-Flash-0731 update में DeepSeek ने agentic और coding tasks में बड़े सुधार का दावा किया। आधिकारिक update log में निम्न scores बताए गए हैं:
DeepSeek के release विवरण के अनुसार Flash अब agentic और coding benchmarks पर अपने बड़े sibling V4 Pro के comparable स्तर पर प्रदर्शन करता है । इससे यह पारंपरिक धारणा कमजोर होती है कि Flash केवल तेज़ और सस्ता विकल्प है, जबकि Pro ही कठिन agent workloads के लिए उपयुक्त है ।
फिर भी, उपलब्ध स्रोतों में V4-Flash-0731 के exact SWE-bench scores स्वतंत्र रूप से स्पष्ट नहीं किए गए हैं । इसलिए coding प्रदर्शन के बारे में आधिकारिक benchmark claims और स्वतंत्र reproducible evaluations को अलग-अलग देखना चाहिए।
DeepSeek Harness एक agent execution framework है। इसका उद्देश्य केवल text generate करना नहीं, बल्कि मॉडल को ऐसे agent में बदलना है जो:
इस framework का नाम 31 जुलाई के V4-Flash-0731 changelog में “to be released soon” टिप्पणी के साथ सामने आया था । 1 अगस्त, 2026 को DeepSeek ने Agent Harness से जुड़े open-source projects के developers को beta testing के लिए आमंत्रित किया। इच्छुक applicants से GitHub ID और अपने representative open-source work की जानकारी मांगी गई ।
Harness की सार्वजनिक release date अभी घोषित नहीं की गई है । उपलब्ध रिपोर्टों के अनुसार इसकी engineering team मार्च 2026 में Cui Tianyi के DeepSeek से जुड़ने के बाद बनाई गई थी । Cui की पिछली संस्थाओं या भूमिकाओं से जुड़ी कुछ अतिरिक्त जानकारियां एकल blog source में हैं, लेकिन उन्हें अन्य स्रोतों से स्वतंत्र रूप से corroborate नहीं किया गया है।
DeepSeek के CEO Liang Wenfeng के नेतृत्व में कंपनी की रणनीति को सस्ते लेकिन सक्षम models के जरिए AGI की दिशा में आगे बढ़ने के रूप में देखा जाता है । V4 Flash की $0.14/$0.28 pricing और MIT open-weight approach इस सोच का व्यावहारिक उदाहरण हैं: AI model call की लागत इतनी कम करना कि वह premium सुविधा के बजाय सामान्य infrastructure component बन सके।
DeepSeek को चीन में Alibaba के Qwen, ByteDance के Doubao, Moonshot AI, MiniMax और Z.AI जैसे प्रतिस्पर्धियों का सामना करना पड़ता है । V4 परिवार की विशेष स्थिति यह है कि इस स्तर का 1M-context open-weight मॉडल permissive MIT license के साथ उपलब्ध है ।
DeepSeek की कथित IPO तैयारियों का भी कई रिपोर्टों में उल्लेख मिलता है, लेकिन उपलब्ध स्रोतों में इसकी निश्चित तारीख, underwriters या confirmed filing details नहीं हैं ।
V4 Flash खास तौर पर इन उपयोग मामलों के लिए दिलचस्प हो सकता है:
लेकिन self-hosting का निर्णय केवल active parameter count देखकर नहीं लेना चाहिए। Model weights, quantization format, GPU memory, context length, KV cache और serving framework मिलकर वास्तविक deployment cost तय करते हैं। जिन teams को तुरंत scale चाहिए, उनके लिए API सरल विकल्प है; जिन organizations को data control और customization चाहिए, वे MIT weights के साथ self-hosting या fine-tuning पर विचार कर सकती हैं।