DeepSeek 的 V4.1-Flash 让市场开始质疑一个曾被视为理所当然的前提:模型能力越强,部署每一份 AI 服务就必然需要越来越多的内存和存储。
这并不意味着 AI 存储周期已经结束。更准确地说,市场是在重新给“单位 AI 工作负载的硬件需求”定价;与此同时,关于放缓前沿 AI 能力推进速度的讨论,又给基础设施投资前景增加了另一层不确定性。
DeepSeek到底改变了什么?
DeepSeek 在9月10日发布的 V4.1-Flash 表示,与上一代相比,该模型的 KV 缓存只需要四分之一的 HBM,以及八分之一的 SSD 存储。公司还特别指出,在智能体(Agent)应用中,缓存命中的费用往往占据相当大的成本比例。
29
KV 缓存可以理解为模型在处理过的上下文中保留的“注意力状态”。有了它,模型在延续长对话、处理长文档或执行连续任务时,无须每次都从头重复计算此前内容。因此,KV 缓存是推理服务的重要容量约束,尤其关系到长上下文与智能体工作负载。
但这里有一个关键限定:DeepSeek 并没有说整个模型或整个数据中心的 HBM 使用量突然减少75%、存储使用量减少87.5%。这些比例只针对其 KV 缓存,而且是与 DeepSeek 上一代架构相比。模型权重、训练系统以及其他环节,仍会占用大量内存和存储资源。
25
为什么存储和内存股会迅速下跌?
投资者的推导并不复杂:如果一套模型能以更少的缓存内存支撑相近的推理业务量,那么既有 AI 硬件就可能服务更多并发会话。这样一来,市场对每单位 AI 服务所需内存强度的预期会下降,进而影响对 HBM、企业级 SSD 和相关存储产品需求及价格的判断。
韩国市场首先反映了这种担忧。据同期报道,三星电子股价下跌3.5%,SK 海力士下跌2.2%。
49 随后的美国交易时段,内存和存储类股票也走弱,报道普遍将 DeepSeek 所称的更低 HBM 与 SSD 需求,视为投资者重估 AI 基础设施需求前景的因素之一。
51
52
当然,不能把所有跌幅都归因于一次模型发布。半导体股还会受业绩预期、供需关系、利率、市场风险偏好以及云厂商资本开支预测等多重因素影响。但这轮反应至少说明:AI 产业链估值对“软件和模型架构能减少单位服务所需硬件”的证据非常敏感。
第二重压力:前沿AI会不会放慢?
效率消息出现的同时,市场还在消化另一类需求担忧。
Anthropic 首席执行官达里奥·阿莫代伊(Dario Amodei)在文章《We Must Pace the Frontier》中主张,应放缓 AI 能力提升的速度,以便企业和政府有足够时间对日益强大的系统进行对齐与安全保障。他明确表示,“放缓节奏”不等于停止训练或停止技术进步;其建议包括引入常驻式第三方评估人员、民主国家之间协调,以及全球层面的协调机制。
40
资本市场可能将这种较慢的能力演进路径——即使不是全面暂停训练——理解为风险:部分加速器、网络设备、内存和数据中心支出或许会被推迟。相关市场报道当日显示,纳斯达克100指数期货下跌1.77%,Marvell 跌幅超过7%,英特尔下跌约6%,美光下跌超过5%。
51
两件事其实并不相同:
- DeepSeek提出的是效率问题: 每项推理任务究竟需要多少内存与存储?
- “放缓”讨论提出的是节奏问题: 行业将以多快速度建设和部署能力更强的前沿系统?
两者叠加后,最激进的 AI 基础设施需求预测就不再显得那么顺理成章。
迈克尔·伯里如何看待“放缓AI”
投资人迈克尔·伯里(Michael Burry)将行业的放缓论调称为“自利”。他的观点是,这种主张可能抬高后来者的竞争门槛、让既有前沿实验室受益,也可能为潜在上市营造“炒作与吹嘘”的空间,并为增长放缓提供掩护。他还认为,大语言模型并非通用人工智能(AGI),所以并没有此类技术需要放缓。
14
这些是伯里对竞争格局、估值和 AI 能力边界的个人判断,并非已经确立的技术结论。对市场而言,更值得注意的是:同一场“放缓”讨论同时被置于安全风险与商业激励两种视角下解读。
AI内存的多头逻辑,哪些部分被挑战?
过去,AI 内存投资逻辑往往接近一条直线:模型更大、上下文窗口更长、AI 用户更多,因此 HBM、NAND 闪存和存储容量的需求也应持续增长。
DeepSeek 引入了一个不可忽略的反向变量:架构效率。
更合理的分析框架,应拆成两个维度:
- 每项工作负载需要多少内存。 更高效的 KV 缓存设计可以压低这一数值。
- 工作负载总量与使用强度有多大。 更多用户、更长上下文和更多自主智能体,可能抬高这一数值。
前者下降,并不能自动决定后者也会下降。更便宜、更高效的推理有可能扩大应用范围,带来更多总请求量;但若效率扩散的速度快于使用量增长,同等 AI 产出所需的硬件就可能减少。
长期结论为何仍未确定?
V4.1-Flash 最直接影响的是推理服务中的 KV 缓存。DeepSeek 的对比并没有消除模型权重或训练过程的内存需求。
25 这一区分很重要,因为训练与在线推理对算力、内存和互连能力的需求并不相同。
接下来的核心问题,不是这项效率提升是否重要——它显然重要——而是它会不会改变总体需求。投资者需要继续观察:
- 类似缓存压缩技术的采用速度;
- 长上下文和智能体工作负载的增长;
- HBM 与存储产品的价格走势;
- 前沿模型的训练和部署是否仍在加速。
因此,这轮抛售更像是一记提醒:不能把 AI 内存稀缺当作单向逻辑。模型创新能够降低单次请求所需硬件,而新应用也能推高请求总量;最终决定内存与存储需求的,是这两股力量谁跑得更快。