DeepSeek 在 9 月 10 日公布 V4.1-Flash,衝擊的不是「AI 以後唔使記憶體」,而是市場一向過分直線嘅假設:模型愈大、上下文愈長、AI agent 愈多,就必然要一對一地投入更多高頻寬記憶體(HBM)、NAND 快閃記憶體同儲存硬件。
V4.1-Flash 帶出另一種可能:靠模型架構同快取管理優化,同一項 AI 推論工作所需的記憶體可以大幅減少。對本來押注 AI 記憶體需求只會一路升嘅投資者而言,呢個已經足以令估值邏輯要重新計過。
61
25
關鍵技術:KV 快取細得多
所謂 KV 快取(key-value cache),係模型處理請求時保留嘅注意力狀態資料。對長對話、長文件分析,或者 AI agent 不斷來回執行多步任務尤其重要:有咗快取,模型毋須每次由頭重算整段歷史內容。
DeepSeek 表示,V4.1-Flash 的 KV 快取,所需 HBM 只有上一代的 四分一,而 SSD 儲存則只需 八分一。
61 按其模型資料,改良來自因果編碼器—解碼器(causal encoder-decoder)設計:解碼器的全域 KV 快取,改為由最終編碼器隱藏狀態投射產生;再配合稱為 SWA Bounded Replay 的部署技術,毋須把部分滑動視窗快取狀態長期寫入 SSD。
52
報道估計,其全域 KV 快取約為每個 token 890 bytes,約等於 V4-Flash 的四分一;在同一 KV 快取容量之下,理論上可同時支援約 4 至 8 倍用戶。
53 DeepSeek 又稱,模型在處理輸入(prefill)時每個 token 啟用 80 億參數,生成輸出(decode)時啟用 160 億參數,目標是提升輸入量高的 agent 工作負載效率。
52
點解記憶體同半導體股會受壓?
真正令市場緊張的問題,是每單位 AI 推論輸出所需的記憶體,會唔會比原先預期跌得快得多。
如果相若能力的模型,可以用固定的 HBM 或儲存資源,同時服務更多長上下文請求,雲端服務商便有機會從既有硬件榨取更多吞吐量。咁就會動搖市場對 HBM、DRAM、企業級 SSD 以至相關儲存設備的幾項假設:未來需要買幾多、供應會有幾緊、廠商有幾多加價能力。
有報道指,在公布後,三星電子及 SK Hynix 在韓國交易時段一度各跌逾 3%。
17 影響亦容易擴散到更廣泛的 AI 基建概念股,因為記憶體製造商、儲存、網絡及算力供應商的投資敘事緊扣在一起。記憶體用量降低,不代表每一類硬件需求都會同步下降,但足以改變部署 AI 模型的成本效益。
以 SanDisk 為例,市場當時的 52 周股價範圍約為 85 至 2,354 美元,分析師整體評級仍偏向「買入」或「中度買入」。
35
37 不過,正面評級解答唔到最核心的不確定性:未來儲存需求有幾大部分,是建基於推論架構會一直愈來愈「食記憶體」這個前提?
Amodei 倡「放慢前沿」再加第二重風險
DeepSeek 消息屬於效率衝擊;Anthropic 行政總裁 Dario Amodei 的倡議,則令市場開始問另一條問題:AI 能力增長速度會否放慢,繼而影響基建開支的擴張步伐。
Amodei 在 9 月發表的文章中主張,企業應有意識地放慢提升前沿模型能力的速度,騰出時間處理對齊與安全工作。他提出三個方向:讓嵌入式第三方評估員進入公司、民主國家的企業之間協調,以及最終由各國政府達成協議。
4
5
這並不是要求全面停止 AI 研發。不過,其他具影響力的 AI 領袖公開支持後,市場自然會評估:自願協調或未來政策,會否令加速器、數據中心及記憶體的投資增長放緩。報道指,相關討論令該周末的納斯達克 100 指數期貨下跌 1%。
8
兩件事放埋一齊,正是投資者感到不舒服的地方:DeepSeek 暗示每項工作可能更慳記憶體;「放慢前沿」討論則引入工作負載本身增長或會減速的可能。
Michael Burry 點解話「自利」?
投資者 Michael Burry 將放慢 AI 發展的呼籲形容為「自利」(self-serving)。他的觀點是,若放慢步伐,已建立優勢的前沿 AI 實驗室可能得益,而較小的競爭者則更難追上;他亦質疑現時聊天機械人是否真正在通往通用人工智能(AGI)的路上。
15
這是對各方誘因的批評,不是有關企業動機的證據。同樣地,把安全論述指為服務未來上市計劃的講法,應理解為 Burry 的指控,而非已被證實的事實。
11
15
DeepSeek 改變咗乜,冇改變咗乜?
較穩妥的結論其實很清楚:DeepSeek 挑戰了「AI 一擴張,記憶體密度就必然同步大升」這個過於簡化的論述。它證明軟件、模型架構、量化及快取管理,可以明顯降低推論的記憶體密度。
52
55
但它沒有證明總記憶體需求必然下跌。公布的減幅針對推論期間的 KV 快取,而且比較對象是 DeepSeek 的上一代架構;並不等於整個模型或整個數據中心少用 75% HBM、87.5% SSD,亦沒有消除模型權重及訓練所需的記憶體。
25
而且,推論愈平,使用量未必會縮,反而有機會擴大:更多用戶、較長上下文、更多 agent 循環操作,都可能抵銷每次請求節省下來的容量。最後總需求如何,取決於兩種力量邊個跑得快——每次請求的效率提升,抑或請求數量及複雜度的增長。
AI 記憶體投資邏輯:由「必然」變成「有條件」
DeepSeek V4.1-Flash 並未推翻 HBM、NAND 或 AI 基建的長線需求,但令這個投資理據變得更有條件。市場不能再假設 AI 用量增加,就必然按比例推高每項工作負載的記憶體消耗。
接下來真正要睇的,是效率提升會否快過 AI 部署擴張。DeepSeek 提供了推論可大幅「瘦身」的實證;但它未能解答全球 AI 使用量、訓練規模及硬件需求,之後會以幾快速度增長。