V4.1 Flash від DeepSeek використовує для KV кешу чверть HBM і одну восьму SSD сховища порівняно з попередньою архітектурою. Інвестори побачили ризик нижчої потреби в пам’яті на один AI запит, що вдарило по котируваннях виробників пам’яті та сховищ.
ОпублікувавВідредаговано за допомогою GPT-5.6 TerraЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10, 2026 release of its V4.1 Flash AI model—whose architectural changes reduced key-value-cache usage to about. Article summary: The selloff was a rapid repricing of an AI-memory scarcity thesis, not proof that memory demand has permanently collapsed. DeepSeek showed that serving long-context models can require far less KV-cache HBM and persistent. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Реліз V4.1-Flash від DeepSeek дав ринку привід переглянути ключове припущення AI-буму: що дедалі потужніші моделі автоматично вимагатимуть дедалі більше пам’яті та сховища на кожне розгорнуте навантаження.
Негайна реакція була не вироком для всього ринку пам’яті, а переоцінкою цього припущення. Її посилила окрема дискусія про темпи розвитку передових AI-моделей.
DeepSeek заявила, що V4.1-Flash потребує для свого KV-кешу лише чверть високошвидкісної пам’яті HBM і одну восьму SSD-сховища порівняно з попереднім поколінням. Компанія окремо наголосила, що витрати на звернення до кешу становлять значну частину витрат агентних AI-систем. 29
KV-кеш зберігає стан уваги моделі для вже оброблених токенів. Завдяки цьому під час довгої розмови або багатоетапного процесу моделі не потрібно щоразу перераховувати весь попередній контекст. Отже, він є важливим обмеженням місткості для інференсу — тобто запуску вже навченої моделі — особливо для довгих контекстів і AI-агентів.
Водночас це не означає, що вся AI-система раптово потребує на 75% менше HBM чи на 87,5% менше сховища. Зіставлення стосується саме потреб KV-кешу відносно попередньої архітектури DeepSeek. Ваги моделі, інфраструктура навчання та інші компоненти й надалі споживають значні обсяги пам’яті й сховища. 25
Логіка інвесторів була простою: якщо модель може обслуговувати подібний обсяг інференсу з набагато меншим кешем, то наявне AI-обладнання потенційно здатне підтримувати більше одночасних сесій. Це послаблює короткострокові очікування щодо кількості пам’яті на одне навантаження — а отже, і щодо попиту та цін на HBM і корпоративні системи зберігання даних.
У Сеулі після релізу акції Samsung знизилися на 3,5%, а SK Hynix — на 2,2%, за даними тогочасного висвітлення. 49 Під час наступних торгів у США під тиск також потрапили компанії секторів пам’яті та сховищ: учасники ринку оцінювали наслідки нижчих заявлених потреб V4.1-Flash у HBM і SSD.
51
52
Це не доводить, що саме один реліз моделі став єдиною причиною кожного руху котирувань. На напівпровідникові акції впливають прогнози прибутків, баланс попиту й пропозиції, відсоткові ставки, загальний апетит до ризику та плани витрат великих технологічних компаній. Проте реакція показала: оцінки AI-пов’язаних компаній стали дуже чутливими до доказів того, що програмні рішення й архітектура моделей можуть зменшити потребу в «залізі» на одиницю AI-послуги.
Новина про ефективність збіглася в часі з іншою тривогою щодо попиту. Генеральний директор Anthropic Даріо Амодеї у своєму есе We Must Pace the Frontier закликав уповільнити темп нарощування можливостей AI, щоб компанії й уряди встигали узгоджувати та убезпечувати дедалі потужніші системи.
Амодеї прямо пояснив, що «пейсинг» не означає зупинки навчання моделей або технічного прогресу. Він запропонував постійний доступ незалежних оцінювачів усередині компаній, координацію між демократичними державами та глобальну координацію. 40
Ринок міг сприйняти повільнішу траєкторію зростання можливостей AI — навіть без заморожування навчання — як ризик відтермінування частини витрат на прискорювачі, мережі, пам’ять і дата-центри. У день, який охоплювали ринкові повідомлення, ф’ючерси на Nasdaq-100 знизилися на 1,77%, Marvell втратила понад 7%, Intel — близько 6%, а Micron — понад 5%. 51
Ці дві події варто розділяти:
Разом вони зробили найагресивніші прогнози попиту на AI-інфраструктуру менш беззаперечними.
Інвестор Майкл Беррі назвав риторику про сповільнення розвитку AI «корисливою». На його думку, вона може грати на руку великим чинним лабораторіям, ускладнюючи конкуренцію; створювати «hype & puffery» — інформаційний ажіотаж — перед можливими публічними розміщеннями акцій; а також маскувати сповільнення зростання.
Беррі також стверджував, що великі мовні моделі не є штучним загальним інтелектом, тож, на його погляд, «немає чого» уповільнювати. 14
Це позиція Беррі щодо конкуренції, оцінок компаній і можливостей AI, а не усталений технічний висновок. Для ринку важливо інше: дебати про темп розвитку AI читалися одночасно крізь призму безпеки та стимулів великих гравців.
Спрощена версія інвестиційної тези для AI-пам’яті була лінійною: більші моделі, довші контекстні вікна та більше користувачів AI мають означати більше HBM, NAND-пам’яті та сховищ.
DeepSeek додає вагому протидію — архітектурну ефективність.
Корисніше розділяти попит на дві змінні:
Зниження першого показника не визначає автоматично другого. Дешевший та ефективніший інференс може розширити використання AI й створити більше запитів загалом. Але якщо ефективність поширюватиметься швидше, ніж зростатиме використання, для того самого обсягу AI-результату знадобиться менше обладнання.
V4.1-Flash найбезпосередніше впливає на інференс і KV-кеш. Заявлене DeepSeek порівняння не скасовує витрат пам’яті на ваги моделі чи її навчання. 25 Це суттєво, бо навчання та обслуговування моделей створюють різні вимоги до обчислень, пам’яті й міжз’єднань.
Тому головна невизначеність полягає не в тому, чи є заявлене покращення значущим — воно значуще. Питання в тому, чи змінить воно сукупний попит.
Інвесторам варто стежити за поширенням схожих методів економії кешу, темпами зростання довгих контекстів і агентних навантажень, цінами на HBM і сховища, а також за тим, чи продовжать прискорюватися навчання та розгортання передових моделей.
Наразі цей розпродаж радше є застереженням проти сприйняття дефіциту AI-пам’яті як односторонньої ставки. Інновації в моделях можуть зменшувати потребу в обладнанні на один запит так само швидко, як нові сценарії використання збільшують кількість таких запитів.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
V4.1 Flash від DeepSeek використовує для KV кешу чверть HBM і одну восьму SSD сховища порівняно з попередньою архітектурою.
V4.1 Flash від DeepSeek використовує для KV кешу чверть HBM і одну восьму SSD сховища порівняно з попередньою архітектурою. Інвестори побачили ризик нижчої потреби в пам’яті на один AI запит, що вдарило по котируваннях виробників пам’яті та сховищ.
Довгостроковий ефект не визначений: дешевший інференс може водночас збільшити кількість AI запитів, а потреби тренування моделей нікуди не зникають.