لكن عبارة «الاقتراب من Opus 4.8» ينبغي قراءتها بحذر. فهي تصف أداء النموذج ضمن مجموعة الاختبارات التي اختارتها DeepSeek، ولا تثبت تكافؤًا شاملًا في كل مهام الرؤية أو البرمجة أو جلسات الوكلاء الطويلة.
كما أن هذه النتائج لا تحسم أسئلة مهمة للاستخدام الإنتاجي، مثل الاعتمادية، وزمن الاستجابة، والتعامل مع الأخطاء، وسلوك الأدوات، وتأثير صياغة التعليمات وبيئة الاختبار. وتظل الأدلة المستقلة المتاحة غير كافية لتحويل المقارنة إلى ترتيب نهائي للنماذج. لذلك، من الأفضل أن يتعامل المطورون مع النتائج بوصفها ادعاءات من الشركة تحتاج إلى إعادة إنتاج واختبار مستقل.
في المهام النصية البحتة، تروّج DeepSeek للنموذج باعتباره امتدادًا لـ V4-Flash، لا بديلًا مثبتًا عن النماذج الأعلى سعرًا. وتتمثل قيمته الأساسية هنا في الحصول على الإدخال البصري دون التخلي، بحسب الشركة، عن قدرات V4-Flash في الاستدلال والوكلاء والمعرفة العامة.
وعمليًا:
يتوفر DeepSeek-V4-Flash-Vision-Exp عبر منصة DeepSeek API، ويدعم Chat Completions وMessages وResponses، بما في ذلك الطلبات التي تجمع بين النص والصورة.
يمكن تمرير الصور بثلاث طرق:
file_id لصورة مرفوعة عبر Files API.وتدعم الوثائق الرسمية صيغ JPEG وPNG وGIF وWebP. كما تقبل Responses API جزء محتوى من نوع input_image، مع إمكانية استخدام رابط صورة أو عنوان base64 أو ملف مرفوع.
تُحوَّل الصور إلى رموز إدخال قابلة للفوترة. وتقول DeepSeek إن كل صورة تُحتسب بما لا يتجاوز 384 رمزًا، وفق أسعار V4-Flash.
وتبلغ الأسعار المنشورة المرتبطة بالإطلاق لكل مليون رمز:
يجعل سقف 384 رمزًا تكلفة الجزء الخاص بالصورة أكثر قابلية للتوقع. لكنه لا يشمل النص المصاحب أو استدعاءات الأدوات أو المخرجات التي ينشئها النموذج؛ لذلك قد تستهلك جلسة وكيل كاملة عددًا أكبر بكثير من الرموز مقارنة بالصورة وحدها.
أصدرت DeepSeek الإصدار 0.1.1 من Harness مع دعم جاهز لـ Vision-Exp. وتهم هذه الإضافة المطورين الذين يبنون وكلاء يستخدمون الأدوات، لا أولئك الذين يرسلون أسئلة منفردة عن الصور فحسب.
كما أطلقت الشركة Files API مجانًا. إذ يمكن رفع الصورة مرة واحدة ثم إعادة استخدامها في طلبات لاحقة عبر تمرير file_id بدلًا من إرسال بيانات الصورة من جديد. وتستخدم مراجع الملفات الصيغة file-api-....
يفيد ذلك خصوصًا عندما يحتاج الوكيل إلى فحص لقطة شاشة أو صفحة مستند أو أصل بصري نفسه عبر عدة جولات. لكن مجانية Files API لا تعني أن الاستدلال أو استهلاك الرموز مجاني؛ فهذه الاستخدامات تظل خاضعة لفوترة النموذج.
يعكس Vision-Exp اتجاهًا يتجاوز مقارنة جودة النماذج وحدها. فالمنافسة أصبحت تشمل أيضًا سعر API، وتوافق الواجهات، وأدوات الوكلاء، وإمكانية إعادة استخدام الملفات، وسهولة دمج النموذج في المنتجات.
وتحاول DeepSeek عبر هذا الإطلاق إتاحة الاستدلال البصري بتكلفة V4-Flash نفسها، في وقت تستخدم فيه Claude Opus 4.8 بوصفه نقطة مقارنة متقدمة في تقاريرها. وهذا يضع شركات الذكاء الاصطناعي الصينية والأمريكية في سباق على جعل القدرات البصرية عملية ومتاحة، لا حكرًا على النماذج الرائدة مرتفعة التكلفة.
مع ذلك، فإن اسمَي Flash وExp يقدمان وصفًا مهمًا للمنتج: نحن أمام إصدار تجريبي متوسط الفئة يوسّع نموذجًا قائمًا إلى سير عمل بصري، وليس إعلانًا واضحًا عن نموذج رائد جديد.
الخلاصة الأكثر دقة هي أن DeepSeek جعلت بناء وكلاء يفهمون الصور أسهل وأقل تكلفة عبر منظومتها الحالية، وأن نتائجها المبكرة تشير إلى منافسة جدية في بعض الاختبارات متعددة الوسائط. لكن مستقبل النموذج سيتحدد بمدى موثوقيته في البرمجة المعتمدة على لقطات الشاشة، وتحليل المستندات، ووكلاء الواجهات، واستخدام الأدوات البصرية، إضافة إلى نتائج الاختبارات المستقلة واعتماد المطورين عليه في العالم الحقيقي.