يدعم النموذج سياقًا يصل إلى مليون رمز، ويُفعّل نحو ٨ مليارات مُعامل لكل رمز عند معالجة المدخلات، و١٦ مليارًا عند توليد المخرجات. تُخفّض تقنيات CSA2 وتخزين KV بصيغة FP4 حجم الذاكرة العالمية المعلن إلى ٨٩٠ بايت لكل رمز، أي نحو ربع حجمها في V4 Flash.
نشر بواسطةتم التحرير باستخدام GPT-6 Solتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
في جلسة وكيل ذكاء اصطناعي طويلة، قد يقرأ النموذج سجلًا واسعًا من الرسائل والملفات قبل أن يكتب ردًا قصيرًا. صُمّم DeepSeek-V4.1-Flash لهذا النوع من العمل كثيف المدخلات: فهو نموذج متعدد الوسائط قائم على «مزيج الخبراء» وذو أوزان منشورة، ويدعم نافذة سياق تصل إلى مليون رمز. لكن الحد الأقصى للسياق يصف كمية ما يمكن تمريره إلى النموذج، لا قدرته المضمونة على استرجاع كل تفصيل منها بدقة. 2
8
حساب أقل عند القراءة. تضم البنية الأساسية ٥٥٢ مليار مُعامل، موزعة على مُرمّز سببي من ٢٠ طبقة، يليه مفكّك ترميز من ٢٠ طبقة. وتُشتق ذاكرة «المفاتيح والقيم» العالمية، المعروفة اختصارًا بـ KV، لمفكّك الترميز من الحالات النهائية للمُرمّز، بدل إنشائها على نحو منفصل في كل طبقة من طبقات مفكّك الترميز. ووفق DeepSeek، يُفعّل النموذج نحو ٨ مليارات مُعامل لكل رمز أثناء مرحلة قراءة المدخلات (prefill)، مقابل ١٦ مليارًا أثناء توليد المخرجات (decode). وتبرز فائدة هذا التفاوت عندما يقرأ الوكيل نصوصًا أكثر بكثير مما يكتب. 2
8
ذاكرة أصغر للسجل الطويل. تمنح تقنية الانتباه المتناثر المضغوط CSA2 كل طبقة انتباه أحد ثلاثة أوضاع ثابتة: Full أو Reindex أو Reuse. وتسمح هذه الأوضاع بمشاركة بيانات مخزّنة وإعادة استخدام اختيارات الانتباه المتناثر بين الطبقات. ومع تخزين ذاكرة KV الرئيسية بصيغة FP4، تقول DeepSeek إن حجم ذاكرة KV العالمية يبلغ ٨٩٠ بايت لكل رمز، أي نحو ربع حجمها في DeepSeek-V4-Flash. هذه مقارنة لحجم الذاكرة، وليست دليلًا على انخفاض الكلفة الإجمالية لكل استخدام بالنسبة نفسها. 6
8
إعادة حساب جزء حديث بدل تخزينه دائمًا. تعيد تقنية SWA Bounded Replay بناء حالات KV المفقودة لانتباه النافذة المنزلقة، بإعادة معالجة أحدث نافذة من الرموز فقط، بدل الاحتفاظ بتلك الحالات على وحدة تخزين SSD. وتصف بطاقة النموذج حجم ذاكرة KV المطلوب تخزينها باستمرار بأنه نحو ثُمن نظيره في V4-Flash. وهذا مقياس مختلف عن مقارنة «الربع» الخاصة بذاكرة KV العالمية. 5
9
تذكر بيانات النموذج أنه دُرّب من الصفر على مجموعة متعددة الوسائط تضم ٤٥ تريليون رمز، وأن تدريب الانتباه المتناثر جرى بتسلسلات طولها ٦٤ ألف رمز، قبل تمديد السياق إلى مليون رمز عند نقطة ٣٤ تريليون رمز من التدريب. وتعزو DeepSeek تحسن الأداء أيضًا إلى أساليب جديدة في التدريب المسبق وتدريب لاحق بالتعلّم المعزّز على نطاق أكبر، من دون أن تحدد المواد المذكورة وصفة تفصيلية لذلك التدريب اللاحق. 9
16
يتعامل النموذج مع النصوص والصور بصورة أصلية، وتقول DeepSeek إن إصدار واجهته البرمجية يدعم الوسائط المتعددة. لكن المقتطفات المتاحة لا تقدم نتائج مفصلة لاختبارات الرؤية. 2
16
وفي تقييمات DeepSeek، حققت النسخة الأساسية مستوى مقاربًا لـ V4-Pro-Base في المعرفة والاستدلال والبرمجة، مع تحسن يتراوح بين ٥٪ و١٠٪ في تقييمات منفصلة عن التدريب، رغم استخدامها نحو ثلث إجمالي المُعاملات وربع المُعاملات المُفعّلة. وتقول الشركة أيضًا إن النموذج المطروح يتفوق على V4-Pro في مهام الوكلاء، لكن المواد المذكورة لا تكفي لمقارنة موثوقة اختبارًا باختبار. هذه نتائج تعلنها DeepSeek، لا مواجهة مستقلة بين النموذجين. 1
16
اسم النموذج في واجهة DeepSeek البرمجية هو deepseek-flash، والأوزان المنشورة مدرجة بترخيص MIT. وتعرض مواد النموذج طريقة لتشغيله عبر SGLang، كما تشير قوائم النماذج إلى دعم الاستدلال باستخدام Transformers وvLLM. يجدر التحقق من متطلبات بيئة التشغيل المختارة قبل افتراض تطابق دعم الصور أو السياق الطويل بينها. 8
9
16
وتقول DeepSeek إنها أوقفت V4-Flash وV4-Flash-Vision-Exp، مع توجيه اسميهما القديمين في الواجهة مؤقتًا إلى V4.1-Flash. كما أعلنت توجيه طلبات deepseek-v4-pro إلى V4.1-Flash بأسعار Flash اعتبارًا من ١٤ سبتمبر ٢٠٢٦، ريثما يُطرح V4.1-Pro. إذا كان تطبيقك يعتمد على سلوك خاص بإصدار Pro، فتحقّق من النموذج الذي يخدم الطلبات فعليًا، لا من الاسم المستعمل في الطلب وحده. 16
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
يدعم النموذج سياقًا يصل إلى مليون رمز، ويُفعّل نحو ٨ مليارات مُعامل لكل رمز عند معالجة المدخلات، و١٦ مليارًا عند توليد المخرجات.
يدعم النموذج سياقًا يصل إلى مليون رمز، ويُفعّل نحو ٨ مليارات مُعامل لكل رمز عند معالجة المدخلات، و١٦ مليارًا عند توليد المخرجات. تُخفّض تقنيات CSA2 وتخزين KV بصيغة FP4 حجم الذاكرة العالمية المعلن إلى ٨٩٠ بايت لكل رمز، أي نحو ربع حجمها في V4 Flash.
تتيح DeepSeek النموذج عبر الاسم deepseek flash؛ أما مقارنات الأداء الواردة فهي نتائج مُعلنة، وليست اختبارًا مستقلًا.