V4 Flash הוא הדגם היעיל והחסכוני יותר במשפחת DeepSeek V4, ומכוון במיוחד לעומסי עבודה בהיקף גדול, זמני תגובה קצרים ומשימות שדורשות שימוש בכלים או עבודה עם קוד.
המודל משתמש בארכיטקטורת Mixture-of-Experts: הוא כולל מאגר של 284 מיליארד פרמטרים, אך מפעיל רק כ־13 מיליארד פרמטרים עבור כל טוקן. כך הוא יכול להיעזר במומחיות של רשת גדולה, בלי לשלם בכל חישוב את מלוא העלות של מודל צפוף באותו גודל .
| מאפיין | נתון |
|---|---|
| פרמטרים בסך הכול | 284 מיליארד |
| פרמטרים פעילים בכל טוקן | 13 מיליארד |
| פרמטרים כולל מודול DSpark | 304 מיליארד |
| ארכיטקטורה | Mixture-of-Experts (MoE) |
| חלון הקשר | מיליון טוקנים |
| אורך פלט מרבי | 384 אלף טוקנים |
| דיוק | שילוב FP4 ו־FP8 |
| רישיון | MIT |
| גודל הורדה משוער | כ־160 גיגה־בייט |
הגרסה היצרנית מ־31 ביולי אינה מציגה שינוי בגודל או בארכיטקטורה לעומת גרסת התצוגה המוקדמת. לפי דיווחי השחרור, השיפור הגיע בעיקר מתהליך אימון נוסף לאחר האימון — re-post-training — ולא מתכנון חומרה או מודל חדש .
DeepSeek-V4-Flash ו־V4-Pro מופצים תחת רישיון MIT, רישיון מתירני שמאפשר שימוש מסחרי, שינוי, שילוב במוצרים והפצה מחדש ללא תשלום תמלוגים . המשקלים זמינים בפלטפורמות כמו Hugging Face, ולכן ארגונים יכולים להפעיל את המודל בתשתית פרטית במקום לשלוח את הנתונים לספק API חיצוני.
לפי המקורות שנאספו, משפחת V4 היא משפחת המודלים היחידה בקטגוריית הביצועים הזו שמציעה חלון הקשר של מיליון טוקנים לצד משקלים פתוחים ורישיון MIT מתירני . עם זאת, רישיון פתוח אינו מבטל את הצורך לבדוק אבטחה, פרטיות, מגבלות שימוש ועלויות תפעול לפני פריסה בארגון.
חלון הקשר של מיליון טוקנים דורש להתמודד עם כמויות גדולות מאוד של מידע. DeepSeek משתמשת בארכיטקטורת תשומת לב היברידית, המשלבת שני מנגנוני דחיסה:
השכבות מתחלפות בין שני הנתיבים: שכבות זוגיות, החל משכבה 2, משתמשות ב־CSA, ושכבות אי־זוגיות, החל משכבה 3, משתמשות ב־HCA. במקביל, חלון נע של 128 הטוקנים האחרונים נשמר כדי לתת עדיפות למידע העדכני .
המשקלים של V4 Flash משתמשים בדיוק מעורב:
nvidia/DeepSeek-V4-Flash-NVFP4 .ב־FP8, משקלי המודל לבדם תופסים כ־284 גיגה־בייט. להפעלה עצמית עם חלון הקשר מלא של מיליון טוקנים, אחת התצורות המומלצות כוללת ארבעה מעבדי NVIDIA H200 SXM5, עם 564 גיגה־בייט של זיכרון VRAM במצטבר . כלומר, למרות שהמודל פתוח להורדה, הפעלה מקומית מלאה עדיין דורשת תשתית חומרה משמעותית.
V4 Flash חושף את הפרמטר reasoning_effort, שמאפשר למפתח לבחור בין מהירות לבין עומק חשיבה:
האפשרות לשנות את מאמץ החשיבה לפי המשימה מאפשרת להשתמש באותו מודל לסיווג מהיר, חילוץ מידע, יצירת קוד או תכנון רב־שלבי — במקום לבחור מראש בין מודל מהיר למודל כבד יותר .
מחיר DeepSeek V4 Flash הוא:
מחיר הקלט במטמון משקף הפחתה של 98% לעומת קלט שלא נשמר במטמון . הדבר עשוי להיות משמעותי במיוחד עבור מערכות עם הוראות מערכת קבועות, הקשר חוזר או זרמי עבודה של סוכנים שמבצעים קריאות רבות לאותו פרויקט.
לשם השוואה, מקורות בתחום מציינים כי פלט של V4 Flash זול פי 54 מ־Sonnet 4.6, שמחירו מצוין כ־15 דולר למיליון טוקנים, וזול פי 107 מ־GPT-5.5, שמחירו מצוין כ־30 דולר למיליון טוקנים . לכן כמה מהדיווחים מגדירים אותו כ־API הזול ביותר הזמין בקטגוריית מודלי החזית .
העדכון של 31 ביולי הביא שיפור משמעותי בביצועים במשימות סוכנים וקוד, בעיקר בזכות אימון נוסף לאחר האימון ולא בזכות שינוי ארכיטקטוני . ביומן העדכונים הרשמי שצוינו במקורות מופיעים הציונים הבאים:
בהודעת השחרור נכתב כי הגרסה החדשה מתפקדת ברמה דומה ל־V4-Pro הגדול יותר במבחני קוד וסוכנים . במילים אחרות, ההבחנה המסורתית שלפיה גרסת Pro חזקה ו־Flash חלשה יותר נעשית פחות ברורה בעומסי עבודה סוכניים .
עם זאת, הציונים המדויקים של SWE-bench עבור V4-Flash-0731 לא אומתו במקורות שנבדקו . לכן אין להסיק מהנתונים הללו על יתרון גורף בכל מבחן תוכנה או בכל סוג משימה.
DeepSeek Harness היא מסגרת להרצת סוכנים שפועלת לצד מודל השפה. לפי התיאורים שפורסמו, היא מטפלת בניהול הקשר, בקריאה לכלים ובביצוע משימות — כלומר, ברכיבים שמאפשרים למודל לא רק לנסח תשובה, אלא גם לפעול לאורך רצף של צעדים .
השם Harness הופיע לראשונה ביומן השינויים של V4-Flash-0731 ב־31 ביולי, בצירוף ההערה שהמערכת "תשוחרר בקרוב" . ב־1 באוגוסט החלה DeepSeek לגייס מפתחי פרויקטים בקוד פתוח לבדיקת בטא סגורה. מועמדים נדרשים להציג ניסיון בפרויקטים הקשורים ל־Agent Harness ולשלוח את מזהה GitHub שלהם ודוגמאות עבודה .
הצוות הוקם במרץ 2026, כאשר Cui Tianyi הצטרף ל־DeepSeek כדי לבנות את פעילות ה־Harness . המקורות שנאספו אינם מאמתים באופן עצמאי את הטענות לגבי תפקידיו הקודמים ב־TSY Capital וב־Jane Street. כמו כן, DeepSeek לא פרסמה מועד שחרור רשמי ל־Harness .
הכיוון של DeepSeek ברור: להציע מודלים בעלי יכולת גבוהה במחיר נמוך, עם משקלים פתוחים ועם דגש גובר על סוכנים. התמחור של 0.14 ו־0.28 דולר למיליון טוקנים, לצד רישיון MIT, הוא הביטוי המעשי ביותר לאסטרטגיה הזו .
DeepSeek מתחרה בשוק הסיני מול Alibaba עם משפחת Qwen, ByteDance עם Doubao, וכן Moonshot AI, MiniMax ו־Z.AI . היתרון הייחודי שהיא מציגה לפי המקורות הוא שילוב של מודל פתוח, חלון הקשר של מיליון טוקנים ורישיון מתירני — שילוב שלא כל המתחרות מציעות באותה קטגוריה.
דיווחים שונים אף הזכירו הכנות אפשריות להנפקה של DeepSeek, אך לא נמצאו אישורים לתאריך, לחתמים או ללוח זמנים רשמי . לכן מדובר בשלב זה בהקשר דיווחי בלבד, ולא בעובדה מאומתת.
DeepSeek V4 Flash אינו רק עוד מודל גדול. השילוב של 284 מיליארד פרמטרים, 13 מיליארד פרמטרים פעילים בכל טוקן, חלון הקשר של מיליון טוקנים, רישיון MIT ותמחור API נמוך במיוחד הופך אותו למועמד טבעי לעומסי עבודה בהיקף גדול — במיוחד קוד, חילוץ מידע, ניתוב, צ'אט וסוכנים.
החלק החשוב לא פחות הוא DeepSeek Harness: אם המסגרת תבשיל ותשוחרר באופן רחב, DeepSeek עשויה להתחרות לא רק ברמת המודל, אלא גם ברמת התשתית שמסביבה. נכון לעכשיו, Harness עדיין נמצאת בבדיקות בטא, וחלק מהטענות על ביצועים, הנהלה ותוכניות עתידיות נותרו ללא אימות עצמאי.