אבל צריך לפרש את הטענה באופן מצומצם. הביטוי ״מתקרב ל-Opus 4.8״ מתייחס למערכת מבחנים שנבחרה ופורסמה על ידי DeepSeek; הוא אינו מוכיח איכות שווה בכל משימת ראייה, תרחיש תכנות, סביבת כלים או הפעלה ממושכת של סוכן.
ביומן הרשמי מופיעות גם תוצאות של 36.5 ב-ApexBench, 27.3 ב-Agents’ Last Exam, 64.3 ב-Chartography ו-35.0 ב-ZeroBench Pass@5.
המספרים האלה אינם עונים על כמה שאלות חשובות ליישום אמיתי: כיצד המודל מתמודד עם הנחיות שונות, עם כלי עבודה אחרים, עם זמני תגובה, עם שגיאות ועם משימות ארוכות? תוצאות של מבחני ביצועים עשויות להשתנות בהתאם לניסוח הבקשה, לסביבת הכלים, לבחירת המשימות ולשיטת ההערכה. בחומר הזמין אין די ראיות בלתי תלויות כדי להפוך את ההשוואה לדירוג סופי של המודלים.
הטענה החזקה ביותר לשימושים מבוססי-טקסט היא המשכיות, לא בהכרח עליונות. DeepSeek מציגה את Vision-Exp כמודל ששומר על יכולות הטקסט של V4-Flash, כך שמפתחים אינם אמורים לוותר על ההיגיון, התנהגות הסוכנים והידע הקיימים רק כדי לקבל קלט חזותי.
לכן בחירת המודל תלויה בשימוש:
DeepSeek מציעה את Vision-Exp דרך פלטפורמת ה-API שלה. המודל תומך ב-Chat Completions, ב-Messages וב-Responses, כולל קלט משולב של טקסט ותמונה.
אפשר להעביר תמונות בשלוש דרכים:
file_id של תמונה שהועלתה מראש דרך Files API.הפורמטים המתועדים הם JPEG, PNG, GIF ו-WebP. גם Responses API מקבל רכיב תוכן מסוג
input_image, עם כתובת תמונה, כתובת נתונים מסוג base64 או הפניה לקובץ שהועלה.
קלט תמונה מומר לטוקנים שעליהם מחויבים. לפי DeepSeek, כל תמונה תורמת לכל היותר 384 טוקני קלט, בתמחור של V4-Flash.
התעריפים שפורסמו עבור V4-Flash בהקשר להשקה הם:
תקרת 384 הטוקנים הופכת את עלות רכיב התמונה לצפויה יחסית. עם זאת, היא אינה מגבילה את עלות הטקסט הנלווה, קריאות לכלים או הפלט שנוצר — ולכן שיחה מלאה עם סוכן עשויה לצרוך הרבה יותר טוקנים מהתמונה עצמה.
DeepSeek השיקה את Harness 0.1.1 עם תמיכה מובנית ב-Vision-Exp. הדבר רלוונטי במיוחד למפתחים שבונים סוכנים המשתמשים בכלים, ולא רק שולחים שאלות בודדות על תמונות.
במקביל הושק Files API חינמי. מפתחים יכולים להעלות תמונה פעם אחת ולהשתמש בה בבקשות מאוחרות יותר באמצעות file_id, במקום לשלוח מחדש את אותם נתוני תמונה בכל פעם. DeepSeek מתעדת מזהי קבצים בפורמט file-api-....
הפניה חוזרת לקובץ יכולה להיות שימושית כאשר סוכן צריך לבדוק שוב את אותו צילום מסך, עמוד במסמך או נכס חזותי לאורך כמה סבבים. השימוש ב-Files API עצמו עשוי להיות חינמי, אך עיבוד המודל וצריכת הטוקנים עדיין מחויבים.
Vision-Exp ממחיש כיצד התחרות עוברת מהשאלה ״איזה מודל חכם יותר?״ אל חבילת המפתחים כולה: יכולות מולטימודליות, תאימות ל-API, מחיר, אחסון קבצים וכלי בניית סוכנים. DeepSeek מציעה הרחבה חזותית של קו Flash באותם תעריפי טוקנים שפורסמו עבור V4-Flash, ומציבה את Opus 4.8 של Anthropic כנקודת השוואה בקנה המידה הגבוה.
החשיבות המעשית של המודל תיקבע פחות לפי טבלת מבחנים אחת ויותר לפי השאלה אם מפתחים ימצאו אותו אמין למשימות כמו תכנות על בסיס צילומי מסך, ניתוח מסמכים, סוכני ממשק ושימוש בכלים חזותיים. התווית ״ניסיוני״ היא תזכורת לבדוק את זרימות העבודה האלה ישירות לפני שימוש במשימות ייצור קריטיות.
המסקנה הברורה ביותר היא מאוזנת: DeepSeek הפכה את היכולת להוסיף היגיון חזותי בעלות נמוכה לנגישה יותר דרך סביבת ה-API הקיימת שלה, והטענות הראשוניות שלה מצביעות על אתגר משמעותי בחלק מהמבחנים המולטימודליים. עם זאת, הערכות בלתי תלויות, אמינות בעולם האמיתי ואימוץ מתמשך מצד מפתחים יקבעו אם Vision-Exp יהפוך לחלופה יציבה — או יישאר השקה ניסיונית מסקרנת.