أطلقت DeepSeek في 21 أغسطس 2026 نموذج V4 Flash Vision Exp، مضيفةً فهم الصور إلى V4 Flash، مع احتساب الصورة بما لا يتجاوز 384 رمزًا وبالسعر المعتاد للنموذج. يمكن للمطورين إرسال الصور بصيغة Base64 مضمّنة، أو عبر رابط عام، أو باستخدام Files API المجاني لإعادة استعمال الصورة نفسها من خلال file id في طلبات متعددة.
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
أطلقت DeepSeek في 21 أغسطس 2026 النموذج التجريبي deepseek-v4-flash-vision-exp، مضيفةً فهم الصور إلى واجهة V4-Flash البرمجية. ويستطيع النموذج استقبال طلبات تجمع بين النص والصورة، ما يمنح المطورين وسيلة أقل تكلفة لبناء وكلاء قادرين على فحص لقطات الشاشة والواجهات والمخططات وغيرها من الحالات المرئية. 114
لكن النقطة الأبرز ليست مجرد إضافة الرؤية، بل طريقة احتسابها: تُحوَّل كل صورة إلى ما لا يزيد على 384 رمزًا للإدخال، وتُحاسَب وفق أسعار V4-Flash نفسها، من دون رسم إضافي خاص بالمعالجة البصرية. وتقول DeepSeek إن أداء النموذج في مهام الوكلاء المرئية يقترب من Claude Opus 4.8، إلا أن هذه المقارنة مبنية على نتائج أعلنتها الشركة ولم تُثبت بعد باختبارات مستقلة. 319
يُستدعى النموذج عبر معرّف API التالي: deepseek-v4-flash-vision-exp. وهو يجمع بين الإدخال النصي والبصري مع الاحتفاظ بأساس V4-Flash في توليد النصوص واستدعاء الأدوات. كما يدعم الطلبات المختلطة عبر واجهات Chat Completions وMessages وResponses. 412
وهذا يجعله أكثر من أداة لوصف الصور. فمن الممكن أن يستخدم الوكيل لقطة شاشة ضمن حلقة عمل متكاملة: يفحص الواجهة الحالية، يقرر الإجراء المناسب، يستدعي أداة، ثم يحلل الشاشة الناتجة من جديد. وتضمنت العروض المعلنة توليد كود قابل للتنفيذ انطلاقًا من لقطات الشاشة، واستخدام المدخلات البصرية في تجارب بناء الألعاب. 510
يتيح DeepSeek للمطورين إدخال الصور بثلاث وسائل:
data URL.file_id الذي تعيده الواجهة. 6714وتُتاح Files API مجانًا، وهي الخيار العملي عندما يحتاج التطبيق إلى الرجوع إلى الصورة نفسها مرارًا. فإعادة استخدام مرجع الملف تلغي الحاجة إلى رفع بيانات الصورة ذاتها مع كل طلب، ما يقلل استهلاك النطاق الترددي في حلقات الوكلاء المتكررة. 112
تقول DeepSeek إن كل صورة تُحوَّل لأغراض الفوترة إلى ما يصل إلى 384 رمزًا من رموز الإدخال. وتُحتسب هذه الرموز بسعر إدخال V4-Flash المعتاد، لذلك لا تنتقل معالجة الصور إلى فئة تسعير متعددة الوسائط أعلى. 3614
ويعرض أحد جداول الأسعار تعرفة الذروة عند 0.44 دولار لكل مليون رمز إدخال غير مخزّن مؤقتًا، و1.32 دولار لكل مليون رمز إخراج لنموذج الرؤية. كما يذكر الجدول نافذة سياق تبلغ مليون رمز، وحدًا أقصى للإخراج قدره 384 ألف رمز. 1
ووصفت تقارير سقف الـ384 رمزًا بأنه أقل من نصف استهلاك الصور من الرموز في بعض المقارنات مع GPT وClaude. لكن هذه النتيجة تظل مؤشرًا تقريبيًا لا مقارنة معيارية مكتملة، لأن الأدلة المتاحة لا تثبت تطابق إصدارات النماذج أو دقة الصور أو افتراضات الفوترة بين الخدمات المختلفة. 327
أما الفائدة العملية فهي أوضح: يستطيع الوكيل البصري فحص عدد كبير من لقطات الشاشة بتكلفة إدخال متوقعة ومنخفضة نسبيًا وفق تعرفة Flash، بدل الاعتماد في كل ملاحظة على نموذج متعدد الوسائط مرتفع السعر.
تقول DeepSeek إن النموذج الجديد يحافظ على قدرات V4-Flash النصية، بما في ذلك الاستدلال والمعرفة العامة ووظائف الوكلاء، مع إضافة القدرة على استقبال المدخلات البصرية. 626
كما أعلنت الشركة تحسنًا كبيرًا في اختبارات الوكلاء متعددي الوسائط، بحيث اقترب الأداء من Claude Opus 4.8. وتضع بعض المقارنات المنشورة النموذج قريبًا من Opus 4.8 في مهام محددة، بينما تظهر تقارير أخرى تفاوتًا بين الاختبارات. 4192123
وهنا تبرز ضرورة التمييز بين الادعاء والنتيجة المثبتة. فعبارة «قريب من Opus 4.8» تعني حاليًا أن DeepSeek حققت نتائج مماثلة نسبيًا في تقييماتها، ولا تثبت أن النموذجين متكافئان في جميع مهام الوكلاء البصرية الواقعية. وستكون الاختبارات المستقلة ضرورية لتقييم الاعتمادية والدقة البصرية وأداء استدعاء الأدوات خارج ظروف الاختبارات التي أعلنتها الشركة.
على المطورين اختبار إعدادات الاستدلال قبل إدخال النموذج في حلقة بصرية ضمن بيئة إنتاج. فقد وجد اختبار عملي منشور أن رموز التفكير يمكن أن تستهلك ميزانية الإكمال كاملة، فلا يتبقى أي جواب ظاهر للمستخدم. ويوصي التقرير بتعطيل التفكير في المهام البصرية المناسبة أو رفع قيمة max_tokens لمنح النموذج مساحة كافية لإرجاع الاستجابة. 27
وهذه ملاحظة تتعلق بالتكامل البرمجي، وليست حكمًا عامًا على قدرات النموذج. فعند تفعيل الاستدلال، ينبغي للتطبيق حجز عدد كافٍ من الرموز لكل من عملية التفكير الداخلية والإجابة النهائية. كما يُستحسن التأكد من السلوك الحالي وأسماء المعلمات في وثائق DeepSeek الرسمية قبل الاعتماد على إعداد بعينه.
لم تقدم DeepSeek، وفق الأدلة المتاحة، تفسيرًا استراتيجيًا رسميًا مفصلًا. لكن تصميم المنتج يشير إلى هدف واضح: جعل الإدراك البصري رخيصًا بما يكفي ليتكرر ضمن خطوات الوكيل. فلقطات الشاشة وإطارات الألعاب ولوحات البيانات وحالات التطبيقات لا تصبح مفيدة للوكيل إلا إذا تمكن من فحصها دوريًا من دون أن تجعل كل دورة مكلفة بصورة مبالغ فيها.
كما يسمح إطلاق الرؤية في نسخة Flash تجريبية للمطورين بإضافة الصور إلى مسارات العمل الحالية منخفضة التكلفة، بما فيها الوكلاء واستدعاء الأدوات، بدل نقل التطبيق بأكمله إلى فئة منفصلة من النماذج متعددة الوسائط مرتفعة السعر. ولهذا قد يكون الإصدار مهمًا خصوصًا لمن يبنون وكلاء يتعاملون مع الشاشات، وأدوات تحول لقطات الشاشة إلى كود، وتطبيقات تحتاج إلى تغذية بصرية متكررة.
الخلاصة أن DeepSeek V4-Flash-Vision-Exp يقدم سقفًا معلنًا منخفضًا بصورة لافتة لاستهلاك رموز الصور، إلى جانب خيارات مرنة لإدخالها. أما تفوقه في الاختبارات وسلوكه في بيئات الإنتاج فما زالا بحاجة إلى التحقق. والبداية المنطقية للمطورين هي إجراء اختبارات مضبوطة باستخدام لقطات شاشة واقعية، مع تحديد ميزانية الإخراج مسبقًا وإضافة فحوص جودة مستقلة.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
أطلقت DeepSeek في 21 أغسطس 2026 نموذج V4 Flash Vision Exp، مضيفةً فهم الصور إلى V4 Flash، مع احتساب الصورة بما لا يتجاوز 384 رمزًا وبالسعر المعتاد للنموذج.
أطلقت DeepSeek في 21 أغسطس 2026 نموذج V4 Flash Vision Exp، مضيفةً فهم الصور إلى V4 Flash، مع احتساب الصورة بما لا يتجاوز 384 رمزًا وبالسعر المعتاد للنموذج. يمكن للمطورين إرسال الصور بصيغة Base64 مضمّنة، أو عبر رابط عام، أو باستخدام Files API المجاني لإعادة استعمال الصورة نفسها من خلال file id في طلبات متعددة.
يحافظ النموذج على قدرات V4 Flash النصية والاستدلالية ووظائف الوكلاء، لكن ينبغي ضبط ميزانية الإخراج بعناية؛ إذ أفادت اختبارات عملية بأن وضع التفكير قد يستهلك الاستجابة كاملة.