המודל תומך בהקשר של עד מיליון טוקנים, אך מגבלת הקשר גדולה אינה מבטיחה שליפה אמינה של כל פרט בשיחה ארוכה. בעת עיבוד הקלט מופעלים כ־8 מיליארד פרמטרים לכל טוקן, לעומת כ־16 מיליארד בעת יצירת הפלט; DeepSeek מדווחת גם על מטמון KV גלובלי של 890 בייט לטוקן.
פורסם על ידינערך באמצעות GPT-6 Solהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
סוכן AI שקורא שוב ושוב מסמכים, תוצאות חיפוש והיסטוריית שיחה עשוי לעבד הרבה יותר טקסט מכפי שהוא כותב. לשימוש כזה מיועד DeepSeek-V4.1-Flash: מודל רב־מודלי מסוג תערובת מומחים (MoE), שמשקולותיו זמינות להורדה ותומך בחלון הקשר של עד מיליון טוקנים. התכנון שלו נועד להפחית את החישוב והזיכרון הדרושים לטיפול בקלט ארוך. עם זאת, תמיכה באורך כזה אינה הבטחה שהמודל יאתר באופן אמין כל פרט שהופיע לאורך השיחה. 2
8
פחות חישוב בקריאה מאשר בכתיבה. למודל בסיס של 552 מיליארד פרמטרים, הבנוי ממקודד סיבתי בן 20 שכבות וממפענח בן 20 שכבות. מטמון ה־KV הגלובלי של המפענח — המידע שהמודל שומר כדי להשתמש בהקשר שכבר עיבד — נגזר מהמצבים הסופיים של המקודד, במקום להיווצר בנפרד בכל שכבת מפענח. לפי DeepSeek, המודל מפעיל כ־8 מיליארד פרמטרים לטוקן בשלב עיבוד הקלט (prefill), וכ־16 מיליארד בשלב יצירת הפלט (decode). הפער הזה משמעותי במיוחד כשהסוכן קורא היסטוריה ארוכה ומחזיר תשובה קצרה יחסית. 2
8
פחות מקום להיסטוריה במטמון. מנגנון הקשב CSA2 מקצה לכל שכבת קשב אחד משלושה מצבים קבועים — Full, Reindex או Reuse — כדי לשתף מידע שנשמר במטמון ולהשתמש מחדש בבחירות של קשב דליל. יחד עם שמירת מטמון ה־KV הראשי בפורמט FP4, DeepSeek מדווחת על מטמון KV גלובלי בנפח 890 בייט לטוקן, בערך רבע מהנפח המקביל ב־DeepSeek-V4-Flash. זו השוואה של נפח המטמון, לא מדידה של החיסכון הכולל בעלויות בכל סביבת הפעלה. 6
8
שחזור במקום שמירה מתמשכת. בשיטה שנקראת SWA Bounded Replay, המערכת משחזרת מצבי KV חסרים של קשב בחלון נע באמצעות עיבוד חוזר של חלון הטוקנים האחרון בלבד. כך אין צורך לשמור את המצבים האלה בכונן SSD. לפי כרטיס המודל, נפח מטמון ה־KV שצריך להישמר באופן מתמשך הוא בערך שמינית מזה של V4-Flash. זהו מדד אחסון שונה מנתון רבע הנפח של המטמון הגלובלי. 5
9
לפי רישום כרטיס המודל, האימון החל מאפס על מאגר רב־מודלי של 45 טריליון טוקנים. אימון הקשב הדליל נערך באורך רצף של 64 אלף טוקנים, וההקשר הורחב למיליון טוקנים בנקודת 34 טריליון הטוקנים. DeepSeek מייחסת שיפורים גם לשיטות חדשות באימון הראשוני ולאימון המשך נרחב יותר באמצעות למידת חיזוק; החומר המצוטט אינו מפרט די הצורך את מתכון אימון ההמשך. 9
16
המודל מטפל באופן מובנה בטקסט ובתמונות, ולדברי DeepSeek גם גרסת ה־API תומכת בקלט רב־מודלי. המקורות המצוטטים אינם מספקים כאן תוצאות מפורטות של מבחני ביצועים בתחום הראייה. 2
16
בהערכות של DeepSeek, גרסת הבסיס הגיעה לרמה דומה לזו של V4-Pro-Base בידע, בהסקה ובתכנות, ולשיפור של 5%–10% במבחני הערכה שהושארו מחוץ לאימון — תוך שימוש בכשליש ממספר הפרמטרים הכולל וברבע ממספר הפרמטרים המופעלים. החברה טוענת גם שהמודל שפורסם עולה על V4-Pro במשימות סוכן, אך המקורות המצוטטים אינם מאפשרים השוואה מהימנה מבחן אחר מבחן. אלה תוצאות מדווחות, לא בדיקת ראש־בראש עצמאית. 1
16
שם המודל ב־API של DeepSeek הוא deepseek-flash, והמשקולות שפורסמו רשומות תחת רישיון MIT. חומרי המודל מתארים מסלול הפעלה באמצעות SGLang, ורישומי מודל מציינים גם תמיכה בהרצה באמצעות Transformers ו־vLLM. לפני פריסה, כדאי לבדוק את הדרישות של סביבת ההרצה המסוימת ולא להניח שכל אחת מהן תומכת באותו אופן בתמונות או בהקשר ארוך. 8
9
16
לפי DeepSeek, הדגמים V4-Flash ו־V4-Flash-Vision-Exp הוצאו משימוש, ושמות ה־API הישנים שלהם מנותבים זמנית ל־V4.1-Flash. החברה הודיעה גם שהחל מ־14 בספטמבר 2026, בקשות ל־deepseek-v4-pro ינותבו ל־V4.1-Flash בתעריפי Flash, עד להשקת V4.1-Pro. לכן, יישום שמסתמך על התנהגות ייחודית של Pro צריך לבדוק איזה מודל משרת את הבקשות בפועל, ולא להסתמך על שם ה־API בלבד. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
המודל תומך בהקשר של עד מיליון טוקנים, אך מגבלת הקשר גדולה אינה מבטיחה שליפה אמינה של כל פרט בשיחה ארוכה.
המודל תומך בהקשר של עד מיליון טוקנים, אך מגבלת הקשר גדולה אינה מבטיחה שליפה אמינה של כל פרט בשיחה ארוכה. בעת עיבוד הקלט מופעלים כ־8 מיליארד פרמטרים לכל טוקן, לעומת כ־16 מיליארד בעת יצירת הפלט; DeepSeek מדווחת גם על מטמון KV גלובלי של 890 בייט לטוקן.
המודל זמין ב־API בשם deepseek flash. טענות הביצועים מול V4 Pro מבוססות על דיווחי DeepSeek, ולא על השוואה עצמאית.