DeepSeek 推出 V4.1-Flash 後,市場即時重估一個原本相當受歡迎的 AI 投資假設:模型愈強,部署每單位 AI 服務就必然要用愈多記憶體同儲存空間。
今次拋售唔代表 AI 記憶體的長期需求已經見頂,而係投資者忽然要面對另一個變數:模型架構與軟件優化,可能大幅降低每次 AI 推理所需的硬件資源。
DeepSeek 到底慳咗乜?
DeepSeek 表示,V4.1-Flash 的鍵值快取(KV cache)相較上一代,只需要 四分一的高頻寬記憶體(HBM),以及 八分一的 SSD 儲存。公司亦指出,對 AI agent(可自行分步完成任務的 AI 系統)而言,cache hit 的費用往往佔成本相當大部分。
29
KV cache 可以理解為模型保留之前已處理內容的「短期工作記憶」:用戶一路對話、或者 AI agent 處理長篇文件時,模型毋須每次由頭計過所有上下文。正因如此,長上下文及 agent 類工作負載愈多,KV cache 對推理服務的記憶體容量壓力就愈大。
不過,呢個數字有重要限制:DeepSeek 講緊的是 KV cache 的需求,並非整個模型、整個數據中心突然少用 75% HBM 或 87.5% SSD。模型權重、訓練設備及其他系統部件,仍然會用到大量記憶體和儲存資源。
25
點解記憶體與儲存股即時受壓?
投資者的推論好直接:如果一個模型用少好多 cache 記憶體,都可以支援相近的推理服務量,固定數量的 AI 硬件便可能服務更多同時使用的工作負載。換句話講,每宗工作所需的記憶體密度可能下降。
這會動搖市場對 HBM、企業級 SSD 及相關儲存產品的短期需求、定價和供應緊張程度的預測。首爾市場方面,Samsung 股價在消息後跌 3.5%,SK Hynix 跌 2.2%。
49 隨後美國交易時段,記憶體及儲存相關股份同樣受壓,市場報道將焦點放在 V4.1-Flash 較低的 HBM 與 SSD 需求。
51
52
當然,唔可以簡單講一款模型「造成」所有跌幅。半導體股同時會受業績預期、供需、息口、市場風險胃納,以及大型科技公司資本開支等因素影響。但今次反應反映,AI 概念股的估值對一件事非常敏感:軟件創新會否令每單位 AI 服務所需硬件變少。
另一重壓力:前沿 AI 應否放慢?
效率消息出現的同時,市場亦在消化另一個需求風險。Anthropic 行政總裁 Dario Amodei 在文章《We Must Pace the Frontier》主張放慢 AI 能力提升的速度,讓公司和政府有時間作好對齊與安全保障。
他強調,「放慢節奏」不等於停止模型訓練或技術進步;其方案包括讓第三方評估人員長駐式接觸前沿 AI 公司、民主政府之間協調,以及全球層面的協調。
40
從股票市場角度看,即使不是全面停訓,若最尖端模型的研發與部署節奏放慢,部分加速器、網絡、記憶體和數據中心的投資都可能延後。相關市場報道當日指出,Nasdaq-100 期貨跌 1.77%,Marvell 跌逾 7%、Intel 跌約 6%、Micron 跌逾 5%。
51
兩件事其實要分開看:
- DeepSeek 提出的是效率問題:每一宗 AI 推理工作需要多少記憶體和儲存?
- 「放慢前沿 AI」討論提出的是時間問題:業界會以幾快速度建設及部署更強的模型?
兩者疊加,就令原本最進取的 AI 基建需求預測,睇落冇咁理所當然。
Michael Burry 點睇「放慢 AI」說法?
投資者 Michael Burry 批評 AI 業界的放慢論述是「自利」(self-serving)。他認為,這樣做可能令既有的前沿 AI 公司更容易守住優勢、增加新競爭者追上的難度;以「AI 強大得可能危險」作宣傳,亦可成為潛在上市前的「hype & puffery」;此外,放慢發展亦可能為增長減速提供掩護。
14
Burry 亦認為大型語言模型(LLM)不是人工通用智能(AGI),所以在他看來沒有這類 AI 要放慢。這是他對競爭、估值與 AI 能力的個人觀點,並非已獲技術界定論。市場真正關注的是:AI 放慢論述既可以從安全角度理解,亦可以從商業誘因角度解讀。
牛市邏輯由「單線」變成兩條數
過去較簡化的 AI 記憶體投資邏輯是:模型更大、上下文更長、AI 用戶更多,便會帶來更多 HBM、NAND 和儲存容量需求。
DeepSeek 令市場不得不加入一個抵銷因素:架構效率。更合理的框架,是分開看兩條數:
- 每宗工作所需的記憶體。 更有效率的 KV cache 設計可以令這項下降。
- 工作總量與使用強度。 更多用戶、更長上下文、更多自主 agent,則可以推高這項。
第一項下降,唔代表第二項一定會下降。推理成本更低,反而可能刺激更多企業和用戶採用 AI,令總請求量大增;但如果效率技術普及得比使用量增長更快,達到同等 AI 產出的硬件需求便可能減少。
長線結論仍未揭盅
V4.1-Flash 最直接影響的是推理服務與 KV cache。DeepSeek 的比較並沒有消除模型權重和訓練所需要的記憶體。
25 而訓練與推理對運算、記憶體及互連的要求,本身亦不相同。
因此,真正未解的問題不是這次效率提升有冇意義——它顯然有——而是它最終會否改變整體需求。市場要持續留意:類似慳 cache 技術的採用速度、長上下文和 agent 工作負載的增長、HBM 與儲存產品價格,以及前沿模型的訓練與部署有否繼續加速。
現階段,這輪拋售較適合理解為一次提醒:AI 記憶體短缺未必是只升不跌的單向交易。模型創新可以降低每次請求的硬件需要,而新應用同時亦可以推高請求總數;哪一邊跑得更快,仍然未有答案。