يمثل V4 Flash الفئة الموجهة للكفاءة والسرعة ضمن عائلة DeepSeek V4، ولذلك يستهدف الاستخدامات التي تتطلب عددًا كبيرًا من الطلبات وزمن استجابة منخفضًا، مثل المحادثة، واستخراج البيانات، والمساعدة البرمجية، وتنسيق مهام الوكلاء.
تعتمد بنيته على خليط الخبراء (Mixture-of-Experts أو MoE). ويعني ذلك أن النموذج يحتوي على مجموعة كبيرة من الخبراء المتخصصين، لكن كل رمز يمر عبر جزء محدود منهم بدل تشغيل جميع المُعاملات في كل مرة. والنتيجة هي الوصول إلى قاعدة معرفية واسعة مع تقليل الكلفة الحسابية أثناء الاستدلال.
| الخاصية | القيمة |
|---|---|
| إجمالي المُعاملات | 284 مليارًا |
| المُعاملات النشطة لكل رمز | 13 مليارًا |
| البنية | خليط الخبراء (MoE) |
| نافذة السياق | مليون رمز |
| الحد الأقصى للإخراج | 384 ألف رمز |
| الدقة | FP4 وFP8 مختلطتان |
| الترخيص | MIT |
| حجم التنزيل التقريبي | 160 غيغابايت |
وتشير وثائق الإصدار إلى أن إجمالي المُعاملات قد يصل إلى 304 مليارات عند احتساب وحدة DSpark المرفقة الخاصة بالمسودة والتسريع، بينما يبقى عدد المُعاملات الأساسية النشطة لكل رمز عند 13 مليارًا .
أصدرت DeepSeek النموذج بترخيص MIT، وهو ترخيص permissive يسمح بالاستخدام التجاري، والتعديل، وإعادة التوزيع دون رسوم ملكية، مع الالتزام بشروط الترخيص الأساسية . كما تتوفر الأوزان عبر Hugging Face، ما يتيح للمطورين تنزيل النموذج وتشغيله على بنية خاصة أو دمجه في منتجاتهم.
وتكمن أهمية هذه الخطوة في أن المطور أو المؤسسة لا يضطران إلى الاعتماد بالكامل على واجهة برمجة تطبيقات خارجية. لكن التشغيل الذاتي للنموذج الكامل، خصوصًا مع سياق يبلغ مليون رمز، يتطلب عتادًا وذاكرة رسومية كبيرة؛ فحجم الأوزان وحده عند FP8 يقترب من 284 غيغابايت .
يستخدم V4 Flash بنية انتباه هجينة تجمع بين آليتين لضغط السياق:
تتناوب طبقات النموذج بين CSA وHCA؛ إذ تستخدم الطبقات الزوجية، بدءًا من الطبقة الثانية، ضغطًا بنسبة 4 إلى 1، بينما تستخدم الطبقات الفردية، بدءًا من الثالثة، ضغطًا بنسبة 128 إلى 1. كما توجد نافذة منزلقة تحتفظ بآخر 128 رمزًا الخام للمحافظة على المعلومات الأحدث .
يستخدم الإصدار مزيجًا من دقتي FP4 وFP8:
nvidia/DeepSeek-V4-Flash-NVFP4 .وبحسب تقديرات النشر، فإن تشغيل النموذج بدقة FP8 يحتاج إلى نحو 284 غيغابايت للأوزان فقط. أما التكوين الموصى به لتشغيل سياق كامل يبلغ مليون رمز، فيتضمن أربع وحدات NVIDIA H200 SXM5 بإجمالي 564 غيغابايت من ذاكرة الفيديو .
يتيح النموذج للمطورين ضبط قيمة reasoning_effort لاختيار التوازن المناسب بين السرعة وعمق التفكير:
ويمنح هذا الإعداد المطورين قدرة عملية على اختيار ما إذا كانت الأولوية لزمن الاستجابة أم لدقة التخطيط وحل المشكلات متعددة الخطوات .
تبلغ كلفة استخدام DeepSeek V4 Flash عبر الواجهة البرمجية:
ويفيد السعر المخفض خصوصًا في التطبيقات التي تعيد استخدام تعليمات النظام أو بادئات متشابهة، مثل المحادثات الطويلة وسير عمل الوكلاء. وتصف عدة مصادر V4 Flash بأنه من أرخص واجهات برمجة التطبيقات المتاحة ضمن فئة النماذج المتقدمة .
وبحسب المقارنات المنشورة، فإن سعر الإخراج البالغ 0.28 دولار لكل مليون رمز يقل بنحو 54 مرة عن Sonnet 4.6، وبنحو 107 مرات عن GPT-5.5، وفق الأسعار المستخدمة في تلك المقارنات .
لم تعتمد نسخة 31 يوليو على تغيير معماري كبير؛ إذ جاءت التحسينات الأساسية من إعادة التدريب اللاحق (re-post-training)، مع بقاء حجم النموذج وبنيته دون تغيير .
وتذكر مذكرة التحديث النتائج التالية:
كما تقول ملاحظات الإصدار إن النسخة الإنتاجية أصبحت تقدم أداءً قريبًا من شقيقتها الأكبر V4 Pro في اختبارات البرمجة والمهام الوكيلة . وهذا يضعف الفارق التقليدي بين فئة Pro وفئة Flash عندما يكون الاستخدام مرتبطًا بتنفيذ المهام البرمجية أو إدارة الأدوات .
مع ذلك، لم تؤكد المصادر المراجعة أرقامًا مستقلة محددة لاختبار SWE-bench للإصدار V4-Flash-0731 . لذلك ينبغي التعامل مع المقارنات النهائية بحذر إلى أن تتوفر نتائج قابلة لإعادة الاختبار من جهات مستقلة.
إلى جانب تحديث النموذج، بدأت DeepSeek في 1 أغسطس 2026 استقطاب مطوري البرمجيات مفتوحة المصدر لاختبار النسخة التجريبية المغلقة من DeepSeek Harness .
ويوصف Harness بأنه إطار لتنفيذ الوكلاء يعمل خارج النموذج نفسه، ويتولى مهام مثل:
ظهر اسم الإطار للمرة الأولى في سجل تغييرات V4-Flash-0731 مع عبارة تفيد بأنه سيصدر قريبًا . أما موعد الإطلاق العام فلم تعلنه DeepSeek بعد .
وتشير التقارير إلى أن فريق Harness تأسس في مارس 2026 بعد انضمام كوي تياني (Cui Tianyi) إلى DeepSeek لبناء الفريق من الصفر . لكن بعض التفاصيل المتعلقة بأدواره السابقة في TSY Capital وJane Street وردت في مصدر واحد ولم تُ corroborate independently من مصادر أخرى، لذا لا يمكن تأكيدها بثقة كاملة.
للمشاركة في الاختبار، يُطلب من المطورين امتلاك خبرة في مشاريع مرتبطة بـ Agent Harness، وإرسال معرّف GitHub ونماذج من أعمالهم مفتوحة المصدر .
تدفع DeepSeek باتجاه نموذج مختلف للمنافسة: نماذج قوية بما يكفي للبرمجة والتخطيط، لكنها منخفضة الكلفة وقابلة للتشغيل خارج السحابة. ويظهر هذا التوجه بوضوح في تسعير V4 Flash، وفي إتاحة الأوزان بترخيص MIT، وفي الاستثمار المتزامن في أدوات الوكلاء.
وتتنافس DeepSeek داخل الصين مع شركات ومختبرات مثل Alibaba عبر سلسلة Qwen، وByteDance عبر Doubao، وMoonshot AI، وMiniMax، وZ.AI . وتمنحها الأوزان المفتوحة والترخيص المرن موقعًا مختلفًا عن الخدمات التي تتيح الوصول إلى النماذج عبر واجهات مغلقة فقط.
أما التقارير المتعلقة باستعداد DeepSeek لطرح عام أولي، فتظل غير محسومة؛ إذ لم تتأكد مواعيد الطرح أو أسماء الجهات الضامنة أو تفاصيل الإيداع من المصادر المتاحة . وينطبق الأمر نفسه على بعض التصريحات المباشرة المنسوبة إلى الرئيس التنفيذي ليانغ وينفنغ بشأن استراتيجية الوصول إلى الذكاء الاصطناعي العام؛ فالفكرة متداولة في التغطية الصناعية، لكن الاقتباسات المباشرة لم تُتحقق ضمن المصادر المراجعة .
لا يقتصر تأثير DeepSeek V4 Flash على كونه نموذجًا ضخمًا بسعر منخفض. فالجمع بين 284 مليار مُعامل، و13 مليارًا نشطة لكل رمز، وسياق يبلغ مليون رمز، وترخيص MIT، وخيارات استدلال قابلة للضبط، يضعه في فئة جذابة للمطورين الذين يحتاجون إلى تشغيل كثيف دون تحمل كلفة النماذج المغلقة.
لكن الجانب الأكثر أهمية قد يكون انتقال DeepSeek من إطلاق النموذج إلى بناء طبقة تنفيذ للوكلاء عبر Harness. فإذا نجح الإطار في تحويل القدرة البرمجية للنموذج إلى سير عمل موثوق يستدعي الأدوات وينفذ المهام الطويلة، فقد تصبح المنافسة القادمة في الذكاء الاصطناعي مرتبطة ليس بالنموذج وحده، بل بالنظام الكامل المحيط به.