
Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
ב־21 באוגוסט 2026 השיקה DeepSeek את deepseek-v4-flash-vision-exp, גרסה ניסיונית של V4-Flash שמוסיפה הבנת תמונות ל־API. המודל מקבל קלט משולב של טקסט ותמונה, ומאפשר לסוכנים לנתח צילומי מסך, ממשקי משתמש, תרשימים ומצבים חזותיים אחרים — במחיר המכוון להישאר ברמת Flash. 114
המספר המרכזי בהשקה הוא 384: כל תמונה מומרת לעד 384 טוקני קלט לצורכי חיוב, והטוקנים מחויבים לפי תעריפי V4-Flash, ללא תוספת מחיר נפרדת עבור ראייה. DeepSeek טוענת גם שביצועי הסוכנים החזותיים של המודל מתקרבים ל־Claude Opus 4.8, אך זו טענה המבוססת על תוצאות שהחברה פרסמה בעצמה ועדיין לא אומתה בבדיקות בלתי תלויות. 319
הגישה למודל מתבצעת באמצעות מזהה ה־API deepseek-v4-flash-vision-exp. הוא משלב תמונות וטקסט, תוך שמירה על בסיס היכולות של משפחת V4-Flash — יצירת טקסט, שימוש בכלים ותפקוד כסוכן. התמיכה בקלט חזותי זמינה בממשקי Chat Completions, Messages ו־Responses. 412
לכן לא מדובר רק בכלי שמסביר מה מופיע בתמונה. סוכן יכול לקבל צילום מסך, להבין את מצב הממשק, להחליט על פעולה, להפעיל כלי ואז לבדוק שוב את המסך שהתקבל. הדגמות שדווחו כללו יצירת קוד בר־הרצה מצילומי מסך ושימוש בקלט חזותי בתהליכי בניית משחקים. 510
מפתחים יכולים להזין תמונות באחת משלוש דרכים:
file_id, שאותו ניתן לצרף לבקשות עתידיות. 6714ה־Files API ניתן לשימוש ללא תשלום, והוא האפשרות המתאימה ביותר ליישומים שחוזרים שוב ושוב לאותה תמונה. במקום להעלות את נתוני התמונה בכל בקשה, היישום מפנה לקובץ שכבר נשמר — וכך מצמצם את רוחב הפס בתהליכי עבודה חוזרים של סוכנים. 112
DeepSeek אומרת שכל תמונה תחויב לכל היותר כ־384 טוקני קלט. הטוקנים האלה מחויבים בתעריף הקלט הרגיל של V4-Flash, כך שעיבוד תמונה אינו מחייב מעבר למסלול מולטימודלי יקר יותר. 3614
טבלת מחירים שפורסמה מציינת, בשעות שיא, מחיר של 0.44 דולר למיליון טוקני קלט שאינם בזיכרון מטמון ו־1.32 דולר למיליון טוקני פלט עבור מודל הראייה. הטבלה מציינת גם חלון הקשר של מיליון טוקנים ותפוקת פלט מרבית של 384,000 טוקנים. 1
כמה דיווחים תיארו את תקרת 384 הטוקנים כפחות ממחצית מצריכת הטוקנים של תמונה בגישות מסוימות המבוססות על GPT ו־Claude. עם זאת, מדובר בהשוואה כיוונית בלבד: המידע שסופק אינו מוכיח שהושוו אותן גרסאות מודל, רזולוציות תמונה או הנחות חיוב. 327
המשמעות המעשית ברורה יותר מההשוואה בין הספקים: סוכן שבודק צילומי מסך רבים יכול לקבל עלות תמונה צפויה ונמוכה יחסית, בתעריף Flash, במקום להשתמש בכל איטרציה במודל מולטימודלי יקר.
DeepSeek טוענת שהמודל שומר על יכולות הטקסט של V4-Flash, ובהן הסקת מסקנות, ידע כללי ותפקוד של סוכנים, ומוסיף להן קלט חזותי. 626
החברה דיווחה גם על שיפור משמעותי במבחני ביצועים לסוכנים מולטימודליים, עד לרמה הקרובה ל־Claude Opus 4.8. בחלק מההשוואות שפורסמו המודל אכן ממוקם בקרבת Opus 4.8 במשימות נבחרות, אך התוצאות משתנות בין מבחן למבחן. 4192123
לכן את הביטוי “מתקרב ל־Opus 4.8” צריך לקרוא בשלב זה כטענה על תוצאות ההערכה של DeepSeek — לא כהוכחה לשוויון בין המודלים בכל משימת סוכן חזותי בעולם האמיתי. יהיה צורך בבדיקות חיצוניות כדי להעריך את אמינות המודל, דיוק הזיהוי החזותי ויכולת השימוש בכלים בתנאים שונים.
מפתחים צריכים לבדוק היטב את הגדרות ההסקה לפני שילוב המודל בלולאת סוכן חזותי בסביבת ייצור. בדיקה מעשית שדווחה מצאה שטוקני החשיבה עלולים לצרוך את כל תקציב ההשלמה, כך שלא נשארת תשובה גלויה למשתמש. באותו דיווח הומלץ להשבית את מצב החשיבה במשימות חזותיות מתאימות, או להגדיל את max_tokens כדי להשאיר למודל מקום להחזיר תשובה. 27
זו אזהרה הנדסית, ולא מסקנה כללית על יכולות המודל. כאשר החשיבה מופעלת, היישום צריך להקצות מספיק טוקנים גם לתהליך הפנימי וגם לתשובה המוצגת. מומלץ לאמת את ההתנהגות ואת שמות הפרמטרים העדכניים בתיעוד ה־API של DeepSeek לפני שמסתמכים על הגדרה מסוימת.
ההשקה אינה כוללת הסבר אסטרטגי רשמי של DeepSeek במסגרת המקורות שסופקו, אך מבנה המוצר מצביע על מטרה ברורה: להפוך את התפיסה החזותית לזולה מספיק עבור פעולות חוזרות של סוכן. צילומי מסך, פריימים ממשחקים, לוחות בקרה ומצבי אפליקציה מועילים לסוכן רק אם הוא יכול לבדוק אותם שוב ושוב בלי להפוך כל סבב ליקר מדי.
הצעת הראייה כגרסת Flash ניסיונית מאפשרת למפתחים להוסיף תמונות לזרימת עבודה קיימת של סוכן וכלים, במקום להעביר את היישום כולו למסלול מולטימודלי פרימיום. לכן המודל רלוונטי במיוחד לסוכנים שמופעלים דרך מסך, לכלים שממירים צילומי מסך לקוד וליישומים שזקוקים למשוב חזותי תכוף.
השורה התחתונה: DeepSeek V4-Flash-Vision-Exp מציע תקרת חיוב מוצהרת ונמוכה במיוחד לתמונות, לצד כמה אפשרויות הזנה גמישות ו־Files API לשימוש חוזר. מנגד, את טענות הביצועים ואת ההתנהגות בסביבת ייצור עדיין צריך לבדוק. נקודת פתיחה סבירה למפתחים היא ניסוי מבוקר עם צילומי מסך אמיתיים, תקציב פלט מפורש ובדיקות איכות בלתי תלויות.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
המודל הושק ב־21 באוגוסט 2026 ומוסיף הבנת תמונה ל־V4 Flash; כל תמונה מחויבת בעד 384 טוקני קלט, בתעריף הרגיל של Flash.
המודל הושק ב־21 באוגוסט 2026 ומוסיף הבנת תמונה ל־V4 Flash; כל תמונה מחויבת בעד 384 טוקני קלט, בתעריף הרגיל של Flash. אפשר לשלוח תמונות באמצעות Base64, כתובת URL ציבורית או Files API חינמי, שמאפשר להעלות תמונה פעם אחת ולהשתמש בה שוב באמצעות file id.
DeepSeek טוענת שהביצועים של סוכנים חזותיים מתקרבים ל־Claude Opus 4.8, אך מדובר בנתוני החברה שעדיין לא אומתו באופן בלתי תלוי.