ההשקה של DeepSeek ב־10 בספטמבר, V4.1-Flash, ערערה סיפור השקעות פשוט שהלך והשתרש בשוק: מודלים גדולים יותר, חלונות הקשר ארוכים יותר וסוכני AI רבים יותר יחייבו באופן כמעט אוטומטי עוד ועוד זיכרון ברוחב פס גבוה (HBM), שבבי NAND ומערכות אחסון. הטענה הטכנית של החברה אינה אומרת שזיכרון כבר אינו נחוץ; היא כן מראה שכמות הזיכרון הדרושה להפעלת משימת AI מסוימת עשויה לרדת משמעותית בזכות ארכיטקטורת המודל וניהול המטמון.
61
25
השינוי הטכני: מטמון KV קטן בהרבה
מטמון מפתח־ערך (KV cache) שומר את מצב מנגנון הקשב של המודל בזמן מענה לבקשה. הוא חשוב במיוחד בשיחות עם הקשר ארוך ובעומסים של סוכני AI, משום שהוא מאפשר להימנע מעיבוד מחדש של כל היסטוריית השיחה.
לפי DeepSeek, V4.1-Flash מצמצם את דרישת מטמון ה‑KV ל־רבע מכמות ה‑HBM ול־שמינית מנפח אחסון ה‑SSD של הדור הקודם.
61 בכרטיס המודל החברה מייחסת זאת לתכנון מסוג מקודד־מפענח סיבתי (causal encoder-decoder): מטמון ה‑KV הגלובלי של המפענח נגזר ממצביו הסופיים של המקודד, במקום להיווצר בנפרד בכל שכבה. שיטת פריסה בשם SWA Bounded Replay גם חוסכת את הצורך לשמור ב‑SSD מצבי מטמון מסוימים של חלון קשב נע.
52
סיקור עצמאי העריך את טביעת הרגל של מטמון ה‑KV הגלובלי בכ־890 בתים לטוקן — בערך רבע מזו של V4-Flash — והעריך כי אותו נפח מטמון יכול לשרת בערך פי 4 עד פי 8 משתמשים.
53 DeepSeek מציינת גם שהמודל מפעיל 8 מיליארד פרמטרים לכל טוקן בשלב עיבוד הקלט ו־16 מיליארד בשלב יצירת הפלט, תכנון שנועד לשפר יעילות בעומסים עתירי קלט.
52
מדוע מניות הזיכרון והשבבים נמכרו
השאלה המיידית לא הייתה אם מערכות AI זקוקות לזיכרון — הן בוודאי זקוקות לו. השאלה הייתה האם כמות הזיכרון הדרושה ליחידת תפוקה של הסקה יכולה לרדת הרבה מהר יותר מכפי שהונח בתחזיות הביקוש וההכנסות.
אם מודל בעל יכולת דומה יכול לשרת יותר בקשות מקבילות וארוכות־הקשר מאותו מאגר של HBM או אחסון, ספקיות ענן עשויות להפיק יותר תפוקה מהתשתית שכבר הותקנה. האפשרות הזו מסכנת הנחות לגבי היקפי יחידות עתידיים, מחסור בהיצע וכוח תמחור בשוקי HBM, DRAM, כונני SSD ארגוניים וציוד אחסון משיק.
לפי דיווחים, מניות Samsung Electronics ו‑SK Hynix ירדו כל אחת ביותר מ־3% במהלך המסחר בקוריאה לאחר ההשקה.
17 החשש התפשט משום שמסחר תשתיות ה‑AI מקשר בין יצרני זיכרון לספקי אחסון, רשתות ומחשוב: טביעת זיכרון קטנה יותר משנה את כלכלת ההפעלה של מודלים, גם אם אינה מקטינה באותה מידה את הביקוש לכל קטגוריית חומרה.
SanDisk המחישה עד כמה סיפור ההשקעה נעשה רגיש להנחות על ביקוש מונע AI. נתוני שוק מאותה תקופה הצביעו על טווח של כ־85 עד 2,354 דולר ב־52 השבועות שקדמו לכך, בעוד קונצנזוס האנליסטים נותר ״קנייה״ או ״קנייה מתונה״.
35
37 קונצנזוס חיובי אינו פותר את אי־הוודאות המרכזית: עד כמה הביקוש העתידי לאחסון נשען על המשך קיומן של ארכיטקטורות הסקה עתירות זיכרון.
קריאתו של אמודיי להאטה הוסיפה סיכון שני
חדשות DeepSeek היו זעזוע של התייעלות. הקריאה של דריו אמודיי, מנכ״ל Anthropic, ל״קיצוב קצב החזית״ העלתה שאלה אחרת: מה יהיה קצב הגידול ביכולות ה‑AI, ובהמשך לכך קצב ההשקעה בתשתיות.
במסה שפרסם בספטמבר, אמודיי טען שחברות צריכות להאט בכוונה את קצב השיפור ביכולות של מודלי החזית, ולנצל את הזמן הנוסף לעבודה על בטיחות והתאמה לערכים אנושיים. הוא הציע מעריכים חיצוניים שישולבו בחברות ויקבלו גישה רחבה, תיאום בין חברות במדינות דמוקרטיות, ובהמשך גם הסכמות בין ממשלות.
4
5
זו לא הייתה קריאה לעצור כל פיתוח AI. אך התמיכה הפומבית של מובילי AI בולטים אחרים גרמה לשווקים לשקול אם תיאום וולונטרי או מדיניות עתידית עשויים למתן את ההוצאה על מאיצים, מרכזי נתונים וזיכרון — ההוצאה התומכת בעסקת ה‑AI הרחבה. חוזים עתידיים על Nasdaq 100 דווחו בירידה של 1% באותו סוף שבוע, כשהדיון העמיד את תזת ההשקעה תחת בחינה.
8
מבחינת המשקיעים, השילוב היה לא נוח: DeepSeek רמזה ששירותי AI עשויים לדרוש פחות זיכרון לכל עומס עבודה; הוויכוח על האטת מודלי החזית העלה אפשרות לצמיחה איטית יותר גם בהיקף עומסי העבודה עצמם.
למה מייקל ברי כינה את הקריאה להאטה ״אינטרסנטית״
המשקיע מייקל ברי דחה את הקריאות להאט את פיתוח ה‑AI וכינה אותן ״אינטרסנטיות״. לטענתו, האטה עשויה להועיל למעבדות AI מבוססות ולהקשות על מתחרות קטנות לצמצם פערים; הוא גם הטיל ספק בכך שצ׳טבוטים עכשוויים נמצאים במסלול לבינה מלאכותית כללית.
15
דבריו של ברי הם ביקורת על תמריצים, ולא ראיה למניעיהן של החברות. גם טענות שלפיהן מסרי בטיחות נועדו לשרת הנפקות מתוכננות צריכות להיתפס כטענתו, ולא כעובדה מבוססת.
11
15
מה DeepSeek שינתה — ומה לא
המסקנה החזקה היא ממוקדת אך חשובה: DeepSeek ערערה גרסה פשטנית של תזת זיכרון ה‑AI. היא הדגימה שתוכנה, ארכיטקטורת מודל, קוונטיזציה וטכניקות ניהול מטמון יכולים להפחית במידה מהותית את עצימות הזיכרון של ההסקה.
52
55
היא לא הוכיחה שסך הביקוש לזיכרון יירד. הקיצוצים שעליהם הוכרז נוגעים למטמון KV בזמן הסקה, ובהשוואה לארכיטקטורה הקודמת של DeepSeek. אין זו טענה שלפיה המודל כולו או מרכז הנתונים כולו משתמשים ב־75% פחות HBM וב־87.5% פחות אחסון SSD; והיא אינה מבטלת את הזיכרון הנדרש למשקלי המודל או לאימון.
25
יתרה מכך, עלות שירות נמוכה יותר עשויה להרחיב את השימוש: הסקה זולה יותר יכולה לאפשר יותר משתמשים, הקשרים ארוכים יותר ויותר לולאות של סוכני AI. תוצאת הביקוש הסופית תלויה בשאלה איזה כוח יגבר — החיסכון לכל בקשה, או העלייה במספר הבקשות ובמורכבותן.
המשמעות לתזת ההשקעה בזיכרון AI
V4.1-Flash של DeepSeek לא ביטל את ההצדקה ארוכת הטווח ל‑HBM, ל‑NAND או לתשתיות AI. הוא הפך אותה למותנית יותר. משקיעים אינם יכולים עוד להניח שגידול בשימוש ב‑AI יתורגם אחד־לאחד לגידול בצריכת הזיכרון לכל עומס עבודה.
השאלה השימושית יותר היא האם שיפורי היעילות יקדימו את התרחבות הטמעת ה‑AI. DeepSeek סיפקה ראיה לכך שהסקה יכולה להיעשות חסכונית בהרבה בזיכרון; היא לא הכריעה באיזה קצב יצמחו לאחר מכן השימוש העולמי ב‑AI, היקף האימון והביקוש לחומרה.