DeepSeek在9月10日发布V4.1-Flash后,冲击的并不是“AI不再需要存储”的事实,而是市场长期默认的一条推演:模型越大、上下文越长、智能体越多,HBM、高端DRAM、NAND和企业级存储的需求就会近乎线性上升。
V4.1-Flash给出了另一种可能:通过模型架构和缓存工程,同样一份AI推理工作所需的存储资源可以显著下降。
61
25 对投资者而言,这意味着未来的出货量、供给紧张程度和定价能力,未必还能只靠“AI使用量增长”来推断。
核心变化:KV缓存变小了
**KV缓存(Key-Value Cache,键值缓存)**可以理解为模型在连续对话或持续执行任务时保留的“上下文工作记忆”。它让模型不必在每次生成时从头处理全部历史内容,因此对长上下文对话和AI智能体尤其关键。
DeepSeek称,V4.1-Flash的KV缓存,相比上一代只需四分之一的HBM和八分之一的SSD存储空间。
61 其模型卡将这一改进归因于因果编码器—解码器(CED)设计:解码器的全局KV缓存由最终编码器隐藏状态投影得到,而非由每一层解码器各自生成;此外,名为SWA Bounded Replay的部署技术可避免将部分滑动窗口缓存状态持久写入SSD。
52
相关报道估算,其全局KV缓存约为每个token 890字节,约为V4-Flash的四分之一;在相同KV缓存容量下,系统理论上可承载约4至8倍的用户量。
53 DeepSeek还表示,该模型在输入预填充阶段每个token激活80亿参数、在生成阶段激活160亿参数,意在提升输入密集型智能体工作负载的效率。
52
这也是市场紧张的原因:如果一套云端基础设施能用既有HBM和存储资源服务更多并发、长上下文请求,那么每单位推理产出对应的存储消耗就可能比预期下降得更快。
为什么存储与半导体股会被抛售
市场担心的不是AI系统从此不需要内存,而是每单位推理输出所需的内存可能明显减少。
若性能相近的模型能在固定的HBM或存储资源池中支持更多并发请求,云服务商就可能从现有基础设施中榨出更高吞吐量。这会动摇市场对HBM、DRAM、企业级SSD及相关存储设备未来销量、供需紧张和议价能力的预期。
据报道,消息发布后,三星电子和SK海力士在韩国市场盘中跌幅均超过3%。
17 这类担忧也迅速波及更广泛的AI基础设施交易,因为存储厂商、存储设备商、网络与算力供应商在资本市场上往往被打包看待:内存占用下降会改变模型部署的经济账,即使它未必会同等程度地削弱所有硬件品类的需求。
以闪迪(SanDisk)为例,当时其52周股价区间约为85美元至2,354美元,而分析师总体评级仍为“买入”或“适度买入”。
35
37 但乐观评级无法消除一个关键问题:未来存储需求中,有多大比例依赖于“推理架构会持续变得更吃内存”这一假设。
阿莫迪的“放缓前沿”倡议,带来第二重风险
DeepSeek带来的是效率冲击;Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)提出“放缓前沿”的倡议,则引出了另一个问题:AI能力提升的速度会不会放慢,进而令基础设施投资节奏降温?
阿莫迪在9月发表的文章中主张,企业应有意识地放缓前沿模型能力提升的速度,把争取到的时间用于对齐和安全工作。他提出三步方案:引入拥有公司内部访问权限的常驻第三方评估者、民主国家的企业之间进行协调,以及最终推动政府间协议。
4
5
这并非要求全面停止AI研发。但其他知名AI行业领袖的公开支持,令市场开始评估:自愿协调或未来政策是否可能压低支撑AI交易的加速器、数据中心和存储投入增速。相关讨论发酵的周末,报道称纳斯达克100指数期货下跌1%。
8
于是,投资者面对的是一个不太舒服的组合:DeepSeek暗示每项AI工作负载所需存储可能更少;而“放缓前沿”的讨论,则暗示工作负载本身的增长速度也可能放缓。
为什么迈克尔·伯里称其“利己”
投资人迈克尔·伯里(Michael Burry)将放缓AI研发的呼声称为“利己”。他的观点是,减速可能让已经处于领先地位的前沿AI实验室受益,同时提高小型竞争者追赶的难度;他也质疑现有AI聊天机器人是否正通向通用人工智能。
15
这是一种对激励机制的批评,而不是对企业动机的事实认定。至于安全论述旨在为计划中的IPO服务等说法,也应被视为伯里的指控,而非已获证实的事实。
11
15
DeepSeek改变了什么,又没有改变什么
最有力的结论其实很明确,也很有限:DeepSeek挑战的是AI存储逻辑中最简单化的一版。它表明,软件、模型架构、量化以及缓存管理技术,能够实质性降低推理环节的内存强度。
52
55
但这不等于总存储需求一定会下降。公告中的降幅针对的是推理期间的KV缓存,并且是与DeepSeek上一代架构相比;它并不意味着整个模型或整座数据中心的HBM减少75%、SSD减少87.5%,更没有消除模型权重和训练所需的内存。
25
而且,推理成本下降也可能扩大使用规模:更便宜的推理服务,可能带来更多用户、更长上下文,以及更多智能体循环。最终需求取决于哪股力量更强——单次请求效率提升,还是请求数量与复杂度的增长。
对AI存储投资逻辑意味着什么
DeepSeek V4.1-Flash没有推翻HBM、NAND或AI基础设施的长期逻辑,却让这一逻辑变得更有条件。投资者不能再默认:AI使用量增加,就会一对一地转化为每项工作负载的存储消耗增加。
更值得追踪的问题是,效率提升能否跑赢AI部署扩张。DeepSeek证明了推理可以大幅“瘦身”;但它尚未回答,之后全球AI使用量、训练规模和硬件需求究竟会以多快速度增长。