DeepSeek מסרה כי V4.1 Flash זקוק עבור מטמון ה־KV לרבע מכמות זיכרון ה־HBM ולשמינית מנפח אחסון ה־SSD של הדור הקודם. החשש בשוק היה שמערך חומרה קיים יוכל לשרת יותר עומסי הסקה, ולכן הביקוש לזיכרון ולאחסון לכל בקשה עשוי להיות נמוך מהתחזיות.
פורסם על ידינערך באמצעות GPT-5.6 Terraהתמונות נוצרו באמצעות GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10, 2026 release of its V4.1 Flash AI model—whose architectural changes reduced key-value-cache usage to about. Article summary: The selloff was a rapid repricing of an AI-memory scarcity thesis, not proof that memory demand has permanently collapsed. DeepSeek showed that serving long-context models can require far less KV-cache HBM and persistent. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
ההשקה של DeepSeek V4.1-Flash ערערה הנחת יסוד מרכזית במסחר סביב תשתיות בינה מלאכותית: שככל שהמודלים משתפרים, כך הם בהכרח צורכים יותר ויותר זיכרון ואחסון לכל עומס עבודה. תגובת השוק הייתה תמחור מחדש של ההנחה הזאת — לא הוכחה לכך שמחזור הביקוש ארוך הטווח לזיכרון עבור AI הסתיים.
DeepSeek מסרה כי מטמון ה־KV של V4.1-Flash זקוק ל־רבע מכמות זיכרון ה־HBM ול־שמינית מנפח אחסון ה־SSD שנדרשו בדור הקודם. החברה הדגישה שעלויות של שימוש חוזר במטמון — "cache hit" — עשויות להוות חלק גדול מעלויות של סוכני AI. 29
מטמון KV שומר את מצב הקשב של טוקנים קודמים, וכך מאפשר למודל להמשיך שיחה או תהליך ארוך בלי לחשב מחדש את כל ההקשר. לכן הוא מגבלה חשובה בהפעלת מודלים לצורכי הסקה (inference), במיוחד בשיחות ארוכות ובמערכות של סוכני AI.
הנתון אינו אומר שמערכת AI שלמה זקוקה לפתע ל־75% פחות HBM או ל־87.5% פחות אחסון. ההשוואה מתייחסת רק לדרישות מטמון ה־KV מול הארכיטקטורה הקודמת של DeepSeek. משקלי המודל, תשתיות האימון ורכיבים אחרים עדיין צורכים זיכרון ואחסון ניכרים. 25
מבחינת המשקיעים, המשמעות הייתה פשוטה: אם מודל מסוגל לשרת פעילות הסקה דומה עם פחות זיכרון מטמון, אותו ציוד AI יכול, בתיאוריה, לשרת יותר משתמשים או יותר תהליכים במקביל. הדבר עלול להחליש את הציפיות המיידיות לכמות הזיכרון הנדרשת לכל עומס עבודה — ובהמשך גם את הנחות הביקוש והתמחור של HBM ואחסון ארגוני.
בסיאול, מניית סמסונג ירדה ב־3.5% ומניית SK Hynix ירדה ב־2.2% לאחר ההשקה, לפי דיווחים מאותה תקופה. 49 במסחר בארה״ב שהגיע לאחר מכן נרשם לחץ גם על מניות זיכרון ואחסון. דיווחים קישרו את החשש להערכת המשקיעים מחדש של צורכי HBM ו־SSD בעקבות המודל החדש.
51
52
אין בכך הוכחה שהשקת מודל אחת לבדה גרמה לכל תנועה במניות. מניות שבבים מושפעות גם מציפיות לדוחות, תנאי היצע, ריביות, מצב הרוח בשווקים ותחזיות להשקעות הון של מפעילי מרכזי נתונים. אך התגובה המחישה עד כמה שוויין של חברות המקושרות ל־AI רגיש לראיות לכך שתוכנה וארכיטקטורת מודלים יכולות להפחית את החומרה הדרושה לכל יחידת שירות.
לחדשות על היעילות התווסף חשש מסוג אחר — קצב התקדמות ה־AI. דַריוֹ אַמוֹדֵיי, מנכ״ל Anthropic, כתב במאמרו We Must Pace the Frontier שיש להאט את קצב השיפור ביכולות AI, כדי שלחברות ולממשלות יהיה זמן ליישר את המודלים עם כללי בטיחות ולהגן מפני סיכונים. הוא הבהיר כי "קיצוב הקצב" אינו עצירת אימון מודלים או עצירת ההתקדמות הטכנולוגית, והציע מעריכים חיצוניים קבועים בתוך החברות, תיאום בין ממשלות דמוקרטיות ותיאום גלובלי. 40
השוק יכול לפרש מסלול איטי יותר של שיפור יכולות — גם ללא הקפאה של אימונים — כסיכון לדחייה של חלק מההשקעות במאיצים, רשתות, זיכרון ומרכזי נתונים. ביום שאליו התייחסו דיווחי השוק, החוזים על נאסד״ק־100 ירדו ב־1.77%; Marvell ירדה ביותר מ־7%, אינטל בכ־6% ומיקרון ביותר מ־5%. 51
אלו שני מנגנונים שונים:
ביחד, הם הפכו תחזיות אגרסיביות במיוחד לביקוש לתשתיות AI לפחות מובנות מאליהן.
המשקיע מייקל ברי כינה את הרטוריקה בעד האטת הפיתוח "משרתת את עצמה". לטענתו, היא עשויה להועיל למעבדות AI מובילות באמצעות הקשיית התחרות, לספק "הייפ וניפוח" לקראת הנפקות אפשריות, ולשמש ככיסוי להאטה בצמיחה. הוא גם טען שמודלי שפה גדולים אינם בינה מלאכותית כללית (AGI), ולכן אין "דבר כזה" שיש להאט. 14
אלה עמדותיו של ברי לגבי תחרות, תמחור ויכולות AI — לא מסקנות טכנולוגיות מוסכמות. עם זאת, מבחינת השוק, הן מדגישות שהוויכוח על האטת הפיתוח נקרא לא רק דרך עדשת הבטיחות, אלא גם דרך עדשת התמריצים העסקיים.
הגרסה הפשוטה של תזת ה־AI לזיכרון הייתה ליניארית: מודלים גדולים יותר, חלונות הקשר ארוכים יותר ויותר משתמשי AI אמורים להוביל ליותר HBM, NAND וקיבולת אחסון. DeepSeek מכניסה כוח נגדי משמעותי: יעילות ארכיטקטונית.
דרך מדויקת יותר לבחון את הביקוש מפרידה בין שני משתנים:
ירידה במדד הראשון אינה קובעת אוטומטית את המדד השני. הסקה זולה ויעילה יותר עשויה להרחיב את השימוש ולייצר יותר בקשות בסך הכול. מנגד, אם היעילות תתפשט מהר יותר מקצב גידול השימוש, ייתכן שיידרש פחות ציוד כדי לייצר אותה תפוקת AI.
V4.1-Flash רלוונטי בעיקר להפעלת מודלים לצורכי הסקה ולמטמון KV. ההשוואה של DeepSeek אינה מבטלת את הזיכרון הדרוש למשקלי המודל או לאימון. 25 ההבחנה חשובה, משום שאימון והסקה מציבים דרישות שונות ממחשוב, זיכרון וקישוריות בין רכיבים.
לכן השאלה המרכזית איננה אם השיפור ביעילות משמעותי — הוא משמעותי — אלא אם הוא ישנה את הביקוש המצטבר. המשקיעים יצטרכו לעקוב אחר אימוץ טכניקות חיסכון דומות במטמון, קצב הצמיחה של עומסים ארוכי הקשר ושל סוכני AI, מחירי HBM ואחסון, והאם אימון ופריסה של מודלים מתקדמים ממשיכים להאיץ.
לעת עתה, המכירה במניות היא בעיקר תזכורת לא להתייחס למחסור בזיכרון ל־AI כאל עסקה חד־כיוונית. חדשנות במודלים יכולה להוריד את כמות החומרה לכל בקשה, במקביל לכך ששימושים חדשים מגדילים את מספר הבקשות.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek מסרה כי V4.1 Flash זקוק עבור מטמון ה־KV לרבע מכמות זיכרון ה־HBM ולשמינית מנפח אחסון ה־SSD של הדור הקודם.
DeepSeek מסרה כי V4.1 Flash זקוק עבור מטמון ה־KV לרבע מכמות זיכרון ה־HBM ולשמינית מנפח אחסון ה־SSD של הדור הקודם. החשש בשוק היה שמערך חומרה קיים יוכל לשרת יותר עומסי הסקה, ולכן הביקוש לזיכרון ולאחסון לכל בקשה עשוי להיות נמוך מהתחזיות.
הירידות התחזקו גם על רקע הדיון בהאטת קצב הפיתוח של מודלי AI מתקדמים; אך השפעת החיסכון על הביקוש הכולל בטווח הארוך עדיין פתוחה.