DeepSeek заявляет, что V4.1 Flash требуется для KV кеша лишь четверть прежнего объёма HBM и одна восьмая объёма SSD хранилища. После релиза акции Samsung Electronics и SK Hynix в Сеуле внутридневно потеряли более 3%, поскольку рынок переоценивал спрос на память для ИИ.
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeek 10 сентября представила V4.1-Flash — и этим нарушила очень удобную для рынка историю: чем крупнее модели, длиннее контекст и больше ИИ-агентов, тем неизбежнее растёт потребность в высокоскоростной памяти HBM, NAND и системах хранения данных.
Модель не делает память ненужной. Но она показывает, что расход памяти на обслуживание конкретной ИИ-нагрузки можно резко снизить за счёт архитектуры модели и более умной работы с кешем. 61
25
KV-кеш (кеш «ключей и значений») хранит состояние механизма внимания во время ответа модели. Он особенно важен для длинных диалогов и агентных сценариев: благодаря ему системе не приходится каждый раз заново обрабатывать всю предыдущую историю.
По данным DeepSeek, V4.1-Flash для KV-кеша требует лишь 1/4 объёма HBM и 1/8 объёма SSD-хранилища по сравнению с предыдущим поколением. 61 В карточке модели это объясняется причинной архитектурой «энкодер—декодер»: глобальный KV-кеш декодера формируется на основе финальных скрытых состояний энкодера. Дополнительный механизм SWA Bounded Replay позволяет не сохранять часть состояний кеша скользящего окна на SSD.
52
Независимые публикации оценили глобальный KV-кеш примерно в 890 байт на токен — около четверти показателя V4-Flash. При том же объёме KV-кеша такая конструкция теоретически позволяет обслуживать примерно в 4–8 раз больше пользователей. 53 DeepSeek также сообщает, что при обработке входных данных модель активирует 8 млрд параметров на токен, а при генерации — 16 млрд; это должно повышать эффективность в сценариях с большим объёмом входного контекста.
52
Для инвесторов вопрос был не в том, нужна ли память ИИ-системам. Нужна. Однако стало менее очевидно, что объём памяти, необходимый на единицу инференса, будет расти прежними темпами.
Если сопоставимая модель способна одновременно обслуживать больше длинных запросов в рамках фиксированного пула HBM или накопителей, облачные провайдеры получают больше пропускной способности от уже установленной инфраструктуры. Это ставит под сомнение прогнозы по будущим физическим объёмам поставок, дефициту и ценовой власти в сегментах HBM, DRAM, корпоративных SSD и смежного оборудования для хранения данных.
После сообщения DeepSeek бумаги Samsung Electronics и SK Hynix в Корее внутридневно упали более чем на 3%. 17 Реакция вышла за пределы производителей памяти: вся инвестиционная ставка на ИИ-инфраструктуру связывает между собой память, накопители, сети и вычислительное оборудование. Меньший расход памяти способен изменить экономику развёртывания моделей, хотя влияние на разные категории «железа» будет неодинаковым.
На примере SanDisk видно, насколько оценка компаний стала зависеть от ожиданий вокруг ИИ-спроса. В тот период 52-недельный диапазон котировок составлял примерно от 85 до 2 354 долларов, а общий консенсус аналитиков оставался на уровне Buy или Moderate Buy. 35
37 Но положительный рейтинг не снимает ключевой вопрос: какая доля будущего спроса на накопители основана на предположении, что ИИ-инференс и дальше будет становиться всё более прожорливым к памяти.
Новость DeepSeek стала шоком эффективности. А призыв Дарио Амодеи, генерального директора Anthropic, «задавать темп переднему краю» ИИ добавил отдельную неопределённость — относительно скорости роста возможностей ИИ и, следовательно, капитальных затрат на инфраструктуру.
В сентябрьском эссе Амодеи призвал компании намеренно замедлить повышение возможностей передовых моделей, чтобы выигранное время направить на выравнивание поведения моделей с человеческими целями и меры безопасности. Он предложил привлечь встроенных независимых оценщиков с доступом к компаниям, координировать действия между фирмами демократических стран, а затем добиваться межгосударственных соглашений. 4
5
Это не был призыв полностью остановить разработку ИИ. Но публичная поддержка идеи со стороны других заметных лидеров отрасли заставила рынки учитывать сценарий, при котором добровольная координация или будущие правила замедлят расходы на ускорители, дата-центры и память. В те выходные фьючерсы на Nasdaq 100, по сообщениям, снизились на 1%. 8
Вместе эти факторы оказались неприятны для инвесторов: DeepSeek показала возможность снизить расход памяти на нагрузку, а дискуссия о замедлении развития передовых моделей поставила под вопрос темпы роста самих нагрузок.
Инвестор Майкл Бьюрри, известный ставкой против рынка ипотечных бумаг перед кризисом 2008 года, назвал призывы к замедлению ИИ «корыстными». По его мнению, такая пауза может быть выгодна уже устоявшимся ведущим лабораториям и одновременно усложнить догоняющим конкурентам путь к ним. Он также усомнился, что нынешние ИИ-чат-боты ведут к созданию общего искусственного интеллекта. 15
Это критика стимулов, а не доказательство мотивов компаний. Утверждения, что риторика о безопасности предназначена для поддержки планируемых IPO, следует воспринимать именно как предположение Бьюрри, а не как установленный факт. 11
15
Главный вывод достаточно узок, но важен: DeepSeek поставила под сомнение упрощённую версию инвестиционной идеи об ИИ-памяти. Архитектура моделей, квантизация и управление кешем действительно могут существенно снизить ресурсоёмкость инференса. 52
55
Но релиз не доказывает, что совокупный спрос на память обязательно сократится. Заявленные улучшения относятся к KV-кешу при инференсе и сравниваются с предшествующей архитектурой DeepSeek. Это не означает, что вся модель или дата-центр будут использовать на 75% меньше HBM и на 87,5% меньше SSD. Сюда также не входит память для весов модели и её обучения. 25
Снижение стоимости обслуживания может, напротив, расширить спрос: более дешёвый инференс способен привести больше пользователей, увеличить длину контекста и число циклов ИИ-агентов. Итог зависит от того, что окажется сильнее: экономия на одном запросе или рост числа и сложности запросов.
DeepSeek V4.1-Flash не отменяет долгосрочную историю HBM, NAND и ИИ-инфраструктуры. Но делает её менее автоматической. Рост использования ИИ больше нельзя напрямую приравнивать к росту потребления памяти на каждую рабочую нагрузку.
Полезнее спрашивать не «будет ли ИИ требовать больше памяти», а перекроет ли повышение эффективности дальнейшее расширение ИИ-сервисов. DeepSeek показала, что инференс может стать значительно экономнее. Но она не ответила, как быстро после этого будут расти глобальное использование ИИ, масштабы обучения моделей и спрос на оборудование.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
DeepSeek заявляет, что V4.1 Flash требуется для KV кеша лишь четверть прежнего объёма HBM и одна восьмая объёма SSD хранилища.
DeepSeek заявляет, что V4.1 Flash требуется для KV кеша лишь четверть прежнего объёма HBM и одна восьмая объёма SSD хранилища. После релиза акции Samsung Electronics и SK Hynix в Сеуле внутридневно потеряли более 3%, поскольку рынок переоценивал спрос на память для ИИ.
Призыв главы Anthropic Дарио Амодеи замедлить развитие передовых ИИ моделей добавил ещё один риск: расходы на ИИ инфраструктуру могут расти не так быстро, как ожидали инвесторы.