DeepSeek 在 9 月 10 日發布 V4.1-Flash,動搖的並不是「AI 不再需要記憶體」這件事,而是市場長期習慣的一套直線式推論:模型愈大、上下文愈長、AI 代理愈普及,就必然需要持續增加高頻寬記憶體(HBM)、NAND 與儲存硬體。
這次技術更新顯示,透過模型架構與快取工程,完成相同 AI 推論工作所需的記憶體資源,可能大幅下降。這正是 AI 記憶體族群承壓的核心。
61
25
關鍵技術:KV 快取變小了
所謂 KV 快取(key-value cache),是模型在回應請求時用來保留注意力狀態的資料。對長篇對話、長上下文任務與 AI 代理工作流程尤其重要:保留先前脈絡,就不必在每一步都重新處理完整歷史內容。
DeepSeek 表示,V4.1-Flash 的 KV 快取,所需 HBM 降為前一代的 四分之一,SSD 儲存空間則降至 八分之一。
61 根據其模型說明,這項改進來自因果編碼器—解碼器(causal encoder-decoder)設計:解碼器的全域 KV 快取由最終編碼器隱藏狀態投影而來,而不是由每一層解碼器各自的隱藏狀態產生;另透過名為 SWA Bounded Replay 的部署方法,避免將某些滑動視窗快取狀態持久寫入 SSD。
52
外部報導估計,其全域 KV 快取約為每個 token 890 位元組,約為 V4-Flash 的四分之一;在相同 KV 快取資源下,理論上可同時服務約 4 至 8 倍的使用者。
53 DeepSeek 也指出,模型在預填(prefill)階段每個 token 啟用 80 億個參數、解碼生成時啟用 160 億個參數,目標是提升輸入量大的代理型工作負載效率。
52
為何記憶體與半導體股被賣?
市場當下在意的,不是 AI 系統是否仍需要記憶體——答案顯然是需要;而是每單位推論輸出所需的記憶體,是否可能比原先營收與需求模型假設的速度更快下滑。
若性能可比的模型,能用固定的 HBM 或儲存資源同時處理更多長上下文請求,雲端服務商便可能從既有基礎設施榨出更高吞吐量。這會使市場重新檢視 HBM、DRAM、企業級 SSD,以及相鄰儲存設備領域的未來出貨量、供應吃緊程度與定價能力假設。
報導指出,消息發布後,三星電子與 SK 海力士股價在韓國盤中都下跌逾 3%。
17 憂慮之所以擴散,是因為 AI 基礎建設交易將記憶體製造商、儲存、網路與運算供應商連在一起:記憶體占用降低,可能改變模型部署的經濟性,但不代表所有硬體類別的需求都會同幅度下降。
以 SanDisk 為例,當時的市場資料顯示,其 52 週股價區間約在 85 美元至 2,354 美元,而整體分析師共識仍為「買進」或「適度買進」。
35
37 不過,正面的分析師共識無法消除一個核心疑問:未來儲存需求究竟有多少,是建立在推論架構將持續變得更吃記憶體的前提上?
Amodei 的「放慢前沿」倡議,帶來第二層風險
DeepSeek 的消息是一記效率衝擊;Anthropic 執行長 Dario Amodei 則提出另一個問題:AI 能力與工作負載本身的成長速度,會不會放慢?
Amodei 在 9 月的文章中主張,企業應刻意放慢提升前沿模型能力的速度,將多出的時間投入對齊與安全工作。他提出的方向包括:讓第三方評估者常駐並取得公司內部存取權、民主國家企業之間進行協調,以及最終促成政府間協議。
4
5
這不是要求全面停止 AI 研發。但隨著其他知名 AI 領袖公開支持,市場開始思考:自願協調或未來政策,是否會壓低支撐 AI 題材的加速器、資料中心與記憶體支出增速。報導稱,這項討論使當週末的 Nasdaq 100 期貨下跌 1%。
8
兩件事疊加,讓投資人感到棘手:DeepSeek 暗示每一份 AI 工作負載的記憶體需求可能降低;「放慢前沿」的辯論則讓工作負載總量的成長速度也出現疑慮。
Michael Burry 為何稱減速倡議「自利」?
投資人 Michael Burry 將放緩 AI 開發的呼籲斥為「自利」。他的論點是,若研發放慢,既有的前沿 AI 實驗室可能從中受益,較小的競爭者則更難追上;他也質疑目前的 AI 聊天機器人是否正通往通用人工智慧(AGI)。
15
不過,Burry 的說法是對各方誘因的批評,並不是公司動機的證據。同樣地,把安全論述解讀為服務於規劃中的首次公開募股(IPO),應視為他的指控,而非已被證實的事實。
11
15
DeepSeek 改變了什麼,又沒有改變什麼?
最有力的結論其實很聚焦:DeepSeek 挑戰了 AI 記憶體投資論述中過於簡化的版本。它顯示,軟體、模型架構、量化與快取管理技術,能顯著降低推論的記憶體密度。
52
55
但它沒有證明整體記憶體需求會下降。這次宣布的縮減,針對的是推論時的 KV 快取,且比較對象是 DeepSeek 的前一代架構;這不等於整個模型或整座資料中心的 HBM 用量減少 75%,或 SSD 用量減少 87.5%。模型權重與訓練所需的記憶體也沒有因此消失。
25
此外,單次服務成本更低也可能擴大使用量:更便宜的推論,可能帶來更多使用者、更長上下文,以及更多 AI 代理循環。最終需求取決於兩股力量何者勝出——每次請求的效率提升,或請求數量與複雜度的擴張。
AI 記憶體投資論述的新考題
DeepSeek V4.1-Flash 並未推翻 HBM、NAND 或 AI 基礎建設的長期投資理由,但它讓這套理由更具條件性。投資人不能再假設 AI 使用量增加,就會以一比一的方式轉化為每份工作負載更高的記憶體消耗。
更值得追蹤的問題是:效率進步會不會跑贏 AI 部署規模的擴張?DeepSeek 證明推論可以變得大幅精簡,卻沒有解答全球 AI 使用量、訓練規模與硬體需求此後會以多快速度成長。