三星在 Hot Chips 2026 詳細介紹 LPDDR5X-PIM,核心思路是把部分 AI 推論運算直接放進低功耗 DRAM,讓模型權重與中間資料不必每次都經由外部記憶體介面傳回 SoC。三星表示,這項設計在搭載 Llama 3.1 8B 的邊緣 AI SoC 上,推論時間減少 2.28 倍、Token 吞吐量提高 3.01 倍;但這些數字屬於三星公布的特定配置結果,不能直接視為各種模型與平台都能達到的普遍倍率。
1
9
LPDDR5X-PIM 要解決什麼問題?
大型語言模型推論往往不是單純缺乏運算單元,而是需要反覆把模型權重和中間資料從 DRAM 搬到處理器。當資料搬移成為瓶頸時,即使增加傳統運算能力,效能也未必能同步提升。
記憶體內運算(Processing-in-Memory,PIM)的做法,是在 DRAM 陣列附近執行部分運算,避免所有運算元都穿越外部記憶體連線。三星將 LPDDR5X-PIM 稱為旗下首款以 LPDDR 為基礎、針對 AI 推論打造的 PIM 方案。
2
9
13
這類設計尤其適合反覆執行矩陣向量乘法(GEMV)的工作負載。在這些工作中,降低資料移動量,有時和增加一般運算能力同樣重要。
架構重點:四晶粒封裝內的 16 個 PIM 區塊
三星公布的配置是一款 16 GB LPDDR5X 封裝,由四個 DRAM 晶粒組成,採用 JEDEC 風格的 561 球封裝,單一訊號腳位資料速率為 9,600 Mb/s。四個晶粒共享命令與位址訊號,但使用各自的資料線,符合 LPDDR 系統的平行組織方式。
9
17
封裝內共有 16 個分布於 DRAM 銀行的 PIM 區塊,每個區塊包含兩類硬體:
- MAC 樹:執行 GEMV 和其他矩陣運算中大量出現的乘加與歸約工作。
- 浮點與整數 ALU:處理逐元素運算及其他輔助計算。
這種異質運算配置,代表記憶體不只是針對單一資料型態做簡單加法,而是能處理推論流程中不同類型的運算。三星早期的 PIM 資料也曾描述 SIMD 浮點單元,以及按照 DRAM 銀行配置 PIM 單元的方式,反映出其「讓運算靠近資料」的整體設計方向。
9
11
614 GB/s 不是外部 LPDDR5X 頻寬
三星宣稱 LPDDR5X-PIM 的內部聚合 PIM 頻寬最高可達 614 GB/s。這並不是主機處理器透過一般 LPDDR5X 介面能直接取得的封裝外頻寬,而是多個 DRAM 銀行與 PIM 區塊在記憶體內部平行工作的總和。
1
在三星的比較中,這個內部 PIM 數字約為傳統 LPDDR5X 基準頻寬的八倍。關鍵差異在於:PIM 是針對支援的運算,把更高的平行頻寬暴露在記憶體內部;它並沒有把外部 LPDDR 介面變成 614 GB/s 的連線。
Address Align Mode 如何讓多個記憶體銀行同步運算?
這套架構的重要機制是 Address Align Mode。系統會把對應的運算元放在不同參與銀行中彼此對齊的位址,讓一個共用的 PIM 命令能在多個銀行同步觸發相同運算。
由於 LPDDR rank 中的四個晶粒會收到共同的命令與位址訊號,同時保留各自的資料路徑,這種資料配置便能實現平行執行,而不需要把整個封裝當成傳統的超寬外部記憶體通道。
17
三星介紹了兩種操作模式:
- 單銀行操作:控制粒度較細,也能為一般 DRAM 流量保留更多並行空間。
- 多銀行操作:一次啟用更多 PIM 區塊,針對適合的核心運算提高內部平行度與頻寬。
兩者存在明確取捨。參與運算的銀行越多,特定工作負載的吞吐量可能越高,但當下能處理一般記憶體存取的銀行也會減少。因此,PIM 並不是完全透明、插上即可自動加速的元件;軟體、張量配置和目標核心運算都需要配合記憶體的銀行結構進行映射。
Llama 3.1 8B 測試:2.28 倍更快、3.01 倍 Token 吞吐量
三星在搭載 Llama 3.1 8B 的邊緣 AI SoC 上,將 LPDDR5X-PIM 與傳統 LPDDR5X 進行比較,公布以下結果:
- 推論時間降低 2.28 倍。
- Token 吞吐量提高 3.01 倍。
- 內部 PIM 頻寬最高 614 GB/s;簡報報導中的傳統基準約為 76.8 GB/s。
這些數字反映的是三星特定的測試配置,而不是適用於所有模型的固定效能提升。實際結果會受到模型精度、張量放置方式、批次大小、記憶體容量、軟體支援,以及整體工作負載中 GEMV 類運算比例等因素影響。
三星也把降低 SoC 與記憶體之間的資料搬移,視為降低功耗的架構優勢。不過,目前提供的資料沒有包含可獨立驗證、且可直接比較的「每次推論瓦數」或「每個 Token 焦耳數」數據。因此,功耗優勢較適合理解為針對合適工作負載的設計目標與預期效益,而不是已公布的固定降幅。
LPDDR5X-PIM 與 HBM 的差別
當加速器需要最高外部記憶體頻寬時,HBM 仍然是更適合的方案,尤其是大規模訓練與高階資料中心工作負載。HBM 的效能來自堆疊式 DRAM、矽穿孔(TSV)、先進封裝,以及相應的晶片面積和散熱配置。美光在 Hot Chips 2026 表示,相同容量下,HBM 相對 DDR5 的晶圓面積代價正在擴大;其比較中,HBM 所需晶圓面積約為 DDR5 的三倍。
三星採取的是另一種折衷:保留低功耗 LPDDR5X 的封裝形態,再把有限但專用的運算能力放到 DRAM 銀行附近。它無法提供 HBM 那種面向通用加速器的高外部頻寬,但當主要問題是 AI 推論的資料搬移,而不是峰值浮點運算能力時,LPDDR5X-PIM 可能更具吸引力。
三星目前瞄準的應用場景包括:
- 行動與用戶端裝置:在電池、功耗與散熱受限的條件下執行裝置端 AI。
- 邊緣系統:不配置獨立 HBM 加速器,也能進行本地推論。
- 伺服器:適合受記憶體搬移限制的推論與資料處理工作,而不一定需要 HBM 的最高通用頻寬。
因此,更準確的說法是:LPDDR5X-PIM 是 HBM 的互補方案,或是針對成本與功耗敏感之特定推論工作負載的替代選項,而不是全面取代 HBM。
5
Hot Chips 發表如何接上三星的產品路線?
三星早在 FMS 2026 展示過 LPDDR5X-PIM;Hot Chips 的發表則進一步說明其架構與效能。Hot Chips 2026 議程把三星這場演講列在記憶體專題,主題聚焦於以 LPDDR 為基礎、用於 AI 推論的 PIM 方案。
9
13
三星更長期的方向,是把 PIM 從特殊用途的 HBM 實驗,推向可部署於低功耗記憶體的功能,並朝 LPDDR6-PIM 的標準化發展。不過,目前公開資料尚未證實 JEDEC 已完成相關規格或公布正式批准日期。DeepX 則表示,計畫在第二代 DX-M2 晶片採用三星 LPDDR5X-PIM,並將 LPDDR6-PIM 列為後續 DX-M3 設計方向。
15
LPDDR5X-PIM 與 XCENA MX1:概念相近,層級不同
三星的發表與 XCENA MX1 同屬 Hot Chips 的記憶體場次,但兩者並不是同一類產品。
XCENA MX1 是面向機架級基礎設施的 CXL Type 3 計算記憶體裝置,設計整合最高 2 TB DDR5 容量、由 SSD 支援的容量,以及超過 1,000 個 RISC-V 核心,用於近記憶體處理。
4
10
LPDDR5X-PIM 則是在 LPDDR DRAM 封裝內直接整合數量較少、功能更專用的運算單元。兩者都試圖減少主機與記憶體之間的資料搬移,但 MX1 是透過 CXL 連接的伺服器裝置;三星的設計則是低功耗記憶體封裝,預計靠近 SoC 或其他採用 LPDDR 架構的系統。
10
結論:把 PIM 帶到更廣泛的低功耗記憶體
Hot Chips 2026 的資料顯示,三星正把 LPDDR5X-PIM 打造成一個針對 AI 推論記憶體瓶頸的專用解法。16 個 PIM 區塊、銀行級平行處理、MAC 樹,以及支援混合精度的浮點與整數 ALU,可以讓部分運算留在資料所在的位置;同時,封裝仍維持 LPDDR5X 的低功耗記憶體定位,單腳位運作速率為 9,600 Mb/s。
9
Llama 3.1 8B 的結果值得關注,但應被視為特定工作負載下的供應商基準測試。這項技術真正的策略意義,在於把 PIM 延伸到更容易部署的低功耗記憶體,服務行動、邊緣、用戶端與部分伺服器系統;至於需要更高通用頻寬的工作,HBM 仍會是主要選擇。