DeepSeek 推出 V4.1-Flash,讓市場開始質疑 AI 硬體交易中一項很強的預設:模型能力愈高,每個部署中的 AI 工作負載就必然需要愈多記憶體與儲存空間。
這次股價反應的本質,是投資人快速重估這項假設,而不是證明 AI 記憶體的長期成長循環已經結束。
DeepSeek 實際改變了什麼?
DeepSeek 表示,與前一代相比,V4.1-Flash 的**鍵值快取(KV cache)**僅需四分之一的高頻寬記憶體(HBM),以及八分之一的 SSD 儲存空間。公司特別指出,對 AI 代理(agent)工作負載而言,快取命中的成本往往占整體費用相當大的比重。
29
KV 快取可理解為模型保存先前文字處理狀態的記憶區,使其在延續長對話或長流程任務時,不必每次都重新計算所有舊內容。因此,在提供推論服務時,尤其是長上下文與 AI 代理工作負載,KV 快取往往是限制可同時服務量的重要資源。
但這不代表一整套 AI 系統突然少用 75% 的 HBM、或少用 87.5% 的儲存空間。DeepSeek 的比較範圍是KV 快取需求,且對照基準是自家前一代架構;模型權重、訓練基礎設施及其他元件,仍會占用大量記憶體與儲存資源。
25
為何記憶體與儲存類股會下跌?
市場的推論相當直接:若模型能以更少的快取記憶體支援相近的推論活動,同一批既有 AI 硬體就可能承載更多對話或任務。這將削弱短期內「每一份 AI 工作負載都需要更多記憶體」的預期,連帶動搖市場對 HBM 與企業級儲存需求、定價的部分樂觀假設。
南韓市場首先反映此一疑慮。報導指出,三星電子股價下跌 3.5%,SK 海力士下跌 2.2%。
49 隨後美股交易中,記憶體與儲存相關股票也承受壓力;市場報導將焦點放在 V4.1-Flash 較低的 HBM 與 SSD 需求,以及投資人對 AI 基礎設施需求前景的重新評估。
51
52
當然,不能據此認定單一模型發布獨自造成所有跌幅。半導體股同時受財測、供需、利率、整體風險偏好與大型雲端業者資本支出預期影響。不過,這次反應凸顯一點:AI 概念股估值對於「軟體與模型架構能降低每單位 AI 服務所需硬體」的證據,已變得相當敏感。
另一層壓力:前沿 AI 是否應放慢腳步?
效率消息出現之際,市場也在消化另一項不同的需求風險。Anthropic 執行長達里奧.阿莫迪(Dario Amodei)在〈We Must Pace the Frontier〉一文主張,應放慢 AI 能力提升的速度,讓企業與政府有時間對更強大的系統進行對齊與安全防護。
他明確表示,「調節速度」不等於停止模型訓練或技術進展,並提出三項方向:讓第三方評估人員以嵌入式方式持續檢驗、民主國家間協調,以及全球協調機制。
40
市場可能將較慢的能力推進軌跡——即使不是訓練凍結——解讀為部分加速器、網路設備、記憶體與資料中心支出有延後風險。相關市場報導當日,納斯達克 100 指數期貨下跌 1.77%;Marvell 下跌逾 7%、Intel 約跌 6%,美光則跌逾 5%。
51
兩項發展其實屬於不同問題:
- **DeepSeek 提出的是效率問題:**每一筆推論工作負載到底需要多少記憶體與儲存?
- **放緩討論提出的是時程問題:**產業將以多快速度建置並部署能力更強的前沿系統?
兩者疊加,讓最積極的 AI 基礎設施需求預測不再顯得理所當然。
Michael Burry 如何看待「放緩 AI」論述?
投資人 Michael Burry 將業界的放緩論述形容為「自利」。他認為,這種主張可能讓既有的前沿 AI 實驗室受益、提高後進競爭者追趕難度;把 AI 描繪為極度危險的技術,也可能為潛在首次公開募股(IPO)製造「炒作與吹捧」的空間;同時還可能掩蓋成長正在放緩的情況。
Burry 也主張,大型語言模型(LLM)不是人工通用智慧(AGI),因而沒有那種意義上的 AI 發展可供放慢。
14
這些是 Burry 對競爭、估值與 AI 能力的觀點,並非已被定論的技術結論。對市場而言,重點在於:這場「調節速度」的辯論,同時被置於安全與商業誘因兩種視角下檢視。
AI 記憶體多頭論述,需要改寫而非直接推翻
過去較直線式的 AI 記憶體投資邏輯是:模型更大、上下文更長、AI 使用者更多,將帶來更多 HBM、NAND 與儲存容量需求。
DeepSeek 加入了一個不可忽視的反向變數:架構效率。
更合理的框架,應將總需求拆成兩個變數:
- **每單位工作負載所需的記憶體。**更有效率的 KV 快取設計可降低這項用量。
- **工作負載的總量與強度。**更多使用者、更長的上下文,以及更多自主代理任務,則可能推高這項數字。
第一項下降,並不能自動決定第二項的走向。更便宜、更有效率的推論,可能擴大採用並帶來更多請求;反過來說,若效率改進擴散得比使用量成長更快,則在既定 AI 產出下,所需硬體可能減少。
長期結論仍未定
V4.1-Flash 最直接影響的是推論服務與 KV 快取。DeepSeek 所稱的改善,並未消除模型權重與訓練所需的記憶體。
25 這個區別很重要,因為模型訓練與線上服務推論,對算力、記憶體及互連能力的需求並不相同。
真正的不確定性不在於這項效率提升是否重要——它確實重要——而在於它能否改變整體需求。投資人接下來需要觀察:類似節省快取技術的採用速度、長上下文與 AI 代理工作負載的成長、HBM 與儲存產品的價格,以及前沿模型的訓練與部署是否仍持續加速。
目前,這波賣壓較適合被理解為一項提醒:不能把 AI 記憶體稀缺視為只會單向發展的交易。模型創新可以降低每次請求所需的硬體,同樣地,新應用也能提高請求總量;最終勝負,取決於兩股力量何者跑得更快。