أطلقت DeepSeek في 21 أغسطس 2026 نموذج V4 Flash Vision Exp التجريبي عبر API، مع الحفاظ على قدرات V4 Flash في النص والاستدلال والوكلاء والمعرفة العامة، وإضافة فهم الصور. يقبل النموذج صور JPEG وPNG وGIF وWebP إلى جانب النص، ويدعم واجهتي Chat Completions وResponses، ما يجعله مناسبًا لتحليل لقطات الشاشة والوثائق والمخططا...
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4-Flash-Vision-Exp, the experimental multimodal variant of DeepSeek’s V4-Flash text model, and how does its claimed perfor. Article summary: DeepSeek-V4-Flash-Vision-Exp is a newly released, API-only experimental multimodal version of DeepSeek V4-Flash: it retains the base model’s text/agent, reasoning, and world-knowledge functions while adding image underst. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
يمثل DeepSeek-V4-Flash-Vision-Exp أول نموذج مزود بقدرات بصرية ضمن خط V4-Flash API من DeepSeek. فهو يحتفظ، بحسب الشركة، بقدرات النموذج الأساسية في النص والاستدلال والوكلاء والمعرفة العامة، ويضيف القدرة على فهم الصور ضمن مهام متعددة الوسائط. وتصفه DeepSeek بأنه نموذج تجريبي، وتقول إن أداءه في مهام الوكلاء متعددة الوسائط يقترب من Claude Opus 4.8؛ غير أن الأدلة المستقلة المتاحة لا تكفي بعد لاعتبار ذلك نتيجة محسومة في لوائح التقييم.
يتوفر النموذج عبر API بالمعرّف deepseek-v4-flash-vision-exp. وتقول ملاحظات الإصدار الرسمية إنه يضاهي V4-Flash في القدرات النصية، بما فيها الوكلاء والاستدلال والمعرفة العامة، مع تحسن كبير في الاختبارات التي تتطلب فهمًا بصريًا.
التغيير الأهم هنا هو نوع المدخلات. إذ يستطيع النموذج معالجة النص إلى جانب صور JPEG وPNG وGIF وWebP، ما يتيح استخدامه في وصف الصور، وقراءة النصوص من لقطات الشاشة، والإجابة عن الأسئلة المرئية، وتحليل المخططات والرسوم البيانية.
لكن اللاحقة Exp ليست تفصيلًا شكليًا؛ فهي تشير إلى أن الإصدار تجريبي. لذلك ينبغي للمطورين التعامل معه كنموذج للاختبار والتقييم والنشر المحدود، لا كبديل تلقائي لنموذج إنتاجي مستقر.
توثق DeepSeek دعم الطلبات التي تجمع بين النص والصورة، وتتيح النموذج عبر واجهتي Chat Completions وResponses. كما تدرج وثائق API المعرّف deepseek-v4-flash-vision-exp ضمن النماذج المدعومة في هذه الواجهات.
ويمكن إرسال الصور بعدة طرق، من بينها تضمين بيانات الصورة مباشرة، أو استخدام روابط خارجية، أو الاستعانة بـ Files API. وتوضح وثائق Responses API أيضًا طريقة تمرير الصور إلى هذا النموذج.
تجعل هذه الإمكانات النموذج ملائمًا لبناء الوكلاء. فقد يستطيع الوكيل، مثلًا، قراءة لقطة شاشة أو مخطط أو مستند ممسوح ضوئيًا قبل أن يقرر الأداة التي سيستخدمها في الخطوة التالية. كما توثق DeepSeek تكاملًا مع Codex، وتدرج Vision Exp خيارًا يضيف دعم إدخال الصور.
وتقول ملاحظات الإصدار إن DeepSeek Harness 0.1.1 أضاف دعمًا للنموذج، ما يوفر مسارًا إضافيًا لإدخاله في سير عمل الوكلاء. أما وثائق DeepSeek الخاصة بـ GitHub Copilot فتذكر V4 Pro وV4 Flash في قائمة النماذج، وتشرح التعامل مع الصور عبر نموذج Copilot آخر؛ لذلك لا تثبت هذه الوثائق أن Vision Exp متاح مباشرةً في تلك القائمة.
تتمحور مطالبة DeepSeek الأساسية حول احتفاظ Vision Exp بأداء V4-Flash النصي، مع تحقيق قفزة كبيرة في اختبارات الوكلاء متعددة الوسائط، بحيث يقترب أداؤه، بحسب الشركة، من Claude Opus 4.8.
وتنقل بعض التغطيات أرقامًا فردية من الاختبارات، منها 64.3 في Chartography، و36.5 في ApexBench Pass@1، و27.3 في Agents’ Last Exam، و35.0 في ZeroBench Pass@5. لكن هذه الأرقام وردت عبر تغطيات ثانوية لإعلان DeepSeek، لا عبر تقييم مفصل مستقل يمكن إعادة إنتاجه ومقارنة نتائجه بين الشركات.
وهنا تكمن نقطة مهمة: عبارة «يقترب من Opus 4.8» لا تعني أن النموذج يتفوق على Claude عمومًا، أو يساويه في كل مهمة، أو يقدم مستوى الاعتمادية نفسه في بيئات الإنتاج. فالمصادر المتاحة لا تقدم اختبارًا محايدًا يستخدم المطالبات ذاتها، وبيئات الأدوات نفسها، مع قياس زمن الاستجابة ومعدلات الفشل والتكلفة لدى DeepSeek وAnthropic.
والاستنتاج الأكثر تحفظًا هو أن DeepSeek أطلقت نموذج API حقيقيًا وموثقًا قادرًا على فهم الصور، وأن نتائجها المعلنة تشير إلى تحسن ملموس مقارنةً بـ V4-Flash النصي في المهام التي تعتمد على المدخلات البصرية. أما موقع النموذج الفعلي مقارنةً بـ Claude أو OpenAI أو Google أو النماذج الصينية الأخرى، فما زال غير محسوم.
تُظهر قوائم النماذج المتاحة سعر Vision Exp عند 0.22 دولار لكل مليون رمز إدخال و0.66 دولار لكل مليون رمز إخراج، مع نافذة سياق تبلغ مليون رمز. كما تؤكد وثائق التسعير الرسمية لدى DeepSeek أن الحساب يتم لكل مليون رمز، وتدرج
deepseek-v4-flash-vision-exp في جدول النماذج.
وتحوّل الصور إلى رموز لأغراض الفوترة. ووفق تقرير يستند إلى إرشادات DeepSeek المنشورة، يمكن أن تستهلك الصورة الواحدة ما يصل إلى 384 رمزًا، ويُطبَّق عليها هيكل تسعير V4-Flash. لذلك تعتمد التكلفة الفعلية لسير العمل البصري على عدد الصور وحجمها، وكمية النص المصاحب، وطول إجابة النموذج، وما إذا كان السياق يتكرر بين الطلبات.
في المقابل، تحدد Anthropic سعر Claude Opus 4.8 عند 5 دولارات لكل مليون رمز إدخال أساسي و25 دولارًا لكل مليون رمز إخراج، مع أسعار منفصلة للتخزين المؤقت ووضع السرعة.
على مستوى سعر الرموز المعلن، تبدو DeepSeek أرخص بفارق كبير. وهذا سبب منطقي لاختبارها، لكنه لا يساوي تلقائيًا انخفاض التكلفة الإجمالية. فقد يكون النموذج الأرخص أقل توفيرًا إذا احتاج إلى محاولات إعادة أكثر، أو ارتكب أخطاء أكبر في استدعاء الأدوات، أو تطلبت صوره معالجة مسبقة إضافية.
رغم تداخل بعض الاستخدامات، يشغل النموذجان موقعين مختلفين:
الرسالة الاستراتيجية لـ DeepSeek واضحة: إضافة الرؤية إلى فئة نماذج Flash الأقل تكلفة، مع الادعاء بأداء قريب من نموذج متقدم مرتفع السعر في مهام الوكلاء متعددة الوسائط. ولا تثبت الأدلة المقدمة تفوق Claude في كل اختبار؛ لكن ميزته هنا تتمثل في نضج المنتج، واتساع الأدوات، ووضوح موقعه في السوق.
لذلك يجب إجراء المقارنة مهمةً بمهمة. ففي خط أنابيب يقرأ لقطات الشاشة أو يستخرج البيانات من مخطط، قد يقدم Vision Exp جودة كافية بتكلفة رموز أقل كثيرًا. أما في سير عمل مستقل عالي الحساسية، فستكون أسئلة الاتساق، ودقة استخدام الأدوات، وسلوك الرفض، وإمكانية المراقبة، والدعم، والتعافي من الأخطاء أهم من السعر المعلن وحده.
تزداد أهمية الرؤية الحاسوبية لأن الصور لم تعد مجرد ميزة منفصلة للإجابة عن أسئلة بصرية؛ بل أصبحت جزءًا من عمل الوكلاء نفسه. فقد تحتاج وكلاء البرمجة إلى قراءة لقطات الشاشة، وقد تحتاج وكلاء المتصفح إلى تفسير صفحات الويب، بينما تتطلب أنظمة المؤسسات الجمع بين الوثائق والمخططات واستدعاءات الأدوات المنظمة.
تركز عائلة DeepSeek V4 أصلًا على السياق الطويل ومهام الوكلاء، وتقدم وثائق الشركة Flash بوصفه خيارًا أسرع وأكثر اقتصادية داخل العائلة. ويواصل Vision Exp هذا الاتجاه بإضافة الوسائط المتعددة إلى الوكلاء، بدل طرح نموذج مستقل مخصص للصور فقط.
ومع ذلك، لا تبرر الأدلة المتاحة إعلان تفوق DeepSeek على Anthropic أو OpenAI أو Google أو المختبرات الصينية الرائدة. فلا يوجد تقييم مستقل متكافئ بين الشركات في المصادر المقدمة، كما أن إصدار API تجريبي لا يعادل نموذجًا رائدًا ناضجًا ومثبتًا في الإنتاج.
نعم، بشرط أن يكون الاختبار منضبطًا.
ينبغي مقارنة Vision Exp مع Claude Opus 4.8 ومع النموذج المستخدم حاليًا في الإنتاج، على مجموعة المهام نفسها التي تجمع بين الصور والأدوات. ويمكن تتبع المؤشرات التالية:
حتى تتوفر هذه النتائج، يبقى الحكم الأنسب حذرًا وإيجابيًا في الوقت نفسه: DeepSeek V4 Flash Vision Exp تجربة API متعددة الوسائط موثوقة مبدئيًا، بسعر معلن جذاب وواجهات مفيدة للمطورين. أما ادعاء اقترابه من Claude Opus 4.8 في أداء الوكلاء متعدد الوسائط، فهو يستحق الاختبار، لكنه لم يتحول بعد إلى حقيقة مثبتة مستقلًا.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
أطلقت DeepSeek في 21 أغسطس 2026 نموذج V4 Flash Vision Exp التجريبي عبر API، مع الحفاظ على قدرات V4 Flash في النص والاستدلال والوكلاء والمعرفة العامة، وإضافة فهم الصور.
أطلقت DeepSeek في 21 أغسطس 2026 نموذج V4 Flash Vision Exp التجريبي عبر API، مع الحفاظ على قدرات V4 Flash في النص والاستدلال والوكلاء والمعرفة العامة، وإضافة فهم الصور. يقبل النموذج صور JPEG وPNG وGIF وWebP إلى جانب النص، ويدعم واجهتي Chat Completions وResponses، ما يجعله مناسبًا لتحليل لقطات الشاشة والوثائق والمخططات وسير عمل الوكلاء متعدد الوسائط.
تُظهر القوائم المتاحة سعرًا قدره 0.22 دولار لكل مليون رمز إدخال و0.66 دولار لكل مليون رمز إخراج، مقابل 5 دولارات و25 دولارًا لـ Claude Opus 4.8؛ لكن تكلفة الصور وجودة التنفيذ الفعلية يجب أن تدخلا في أي مقارنة عملية.