Samsung 表示,LPDDR5X PIM 在搭載 Llama 3.1 8B 的邊緣 AI SoC 測試中,令推理時間縮短 2.28 倍、Token 吞吐量提升 3.01 倍;不過數據屬於 Samsung 自家測試,並非廣泛的獨立評測。 這款 16GB、四晶粒封裝在 DRAM Bank 旁加入 16 個 PIM 區塊,配合平行 MAC Tree,以及支援浮點和整數運算的 ALU,減少模型數據來回搬運。
發布者使用 GPT-5.6 Luna 編輯圖片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Samsung reveal about its LPDDR5X-PIM processing-in-memory technology at Hot Chips 2026—including how its 16 in-DRAM processing bloc. Article summary: Samsung positioned LPDDR5X-PIM as an LPDDR5X-compatible, inference-oriented memory architecture that moves repeated vector/matrix work into DRAM. Its headline claim is not that it replaces HBM in top-end GPU training, bu. Topic tags: general, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Samsung 在 Hot Chips 2026 詳細介紹 LPDDR5X-PIM,將部分 AI 推理運算直接放入低功耗 DRAM 內處理。設計在一個 16GB LPDDR5X 封裝內整合 16 個記憶體內運算(Processing-in-Memory,PIM)區塊,配備平行乘加(MAC)邏輯,以及支援浮點和整數運算的 ALU。
在一部執行 Llama 3.1 8B 的邊緣 AI SoC 上,Samsung 報稱推理時間縮短 2.28 倍,Token 吞吐量提升 3.01 倍。不過,這些數字是 Samsung 自家測試結果,不能直接當成所有模型和裝置都適用的性能倍數。1
9
大型語言模型做推理時,處理器未必是唯一瓶頸。模型權重和中間數據需要不斷在 DRAM 與處理器之間搬運,數據來回經過記憶體介面,既消耗時間,也會增加能耗。
PIM 的概念,就是讓記憶體在儲存數據的同時,於接近 DRAM 儲存陣列的位置執行指定運算。這樣,部分操作毋須將每一個運算元都送回 SoC 或加速器處理。Samsung 形容 LPDDR5X-PIM 是其首個以 LPDDR 為基礎、針對 AI 推理的 PIM 方案。2
9
13
這種架構尤其適合反覆進行矩陣向量乘法的工作負載,例如生成式 AI 推理常見的 GEMV 運算。對這類工作來說,減少數據搬運有時與增加傳統運算單元同樣重要。
Samsung 公開的配置是一個 16GB LPDDR5X 封裝,由四粒 Die 組成,採用 JEDEC 風格的 561-ball 封裝,資料率為每 Pin 9,600Mb/s。四粒 Die 共用指令和地址訊號,但各自使用獨立數據線,符合 LPDDR5 系統常見的平行組織方式。9
17
封裝內的 16 個 PIM 區塊分佈於不同 DRAM Bank,每個區塊主要包含兩類硬件:
換句話說,LPDDR5X-PIM 並不只是替記憶體加上一個單一數學運算器,而是將不同類型的專用運算單元放到數據附近。Samsung 早期的 PIM 資料亦曾介紹 SIMD 浮點單元,以及按 Bank 放置 PIM 單元的做法,反映其「讓運算靠近數據」的整體設計方向。9
11
Samsung 提到最高 614GB/s 的內部總 PIM 頻寬。這個數字並不是主處理器透過一般 LPDDR5X 記憶體介面可以使用的封裝外頻寬,也不代表手機或 SoC 突然擁有一條 614GB/s 的外部記憶體連線。1
它反映的是多個 DRAM Bank 和 PIM 區塊同時在記憶體內平行工作時,可提供給特定支援運算的內部數據處理能力。以 Samsung 的比較方式計算,614GB/s 約為傳統 LPDDR5X 基線的 8 倍;重點在於這是記憶體內部的平行度,而不是外部介面的規格提升。
LPDDR5X-PIM 的關鍵機制之一是 Address Align Mode。系統會將互相對應的運算元,放在參與運算的不同 Bank 內相應的地址位置。發出一個共用 PIM 指令後,各個 Bank 便可以同步執行相同操作。
這種安排與 LPDDR Rank 的組織方式有關:四粒 Die 在指令、地址和 Chip Select 訊號上以同步方式運作,同時保留各自的數據路徑。因此,封裝可以在內部進行平行運算,但不等於將四粒 Die 當成一條傳統的超寬外部記憶體通道。17
Samsung 描述了兩種操作模式:
取捨在於工作負載。啟用更多 Bank 可以提高合適 Kernel 的吞吐量,但同一時間可供普通記憶體存取的 Bank 便會減少。換言之,PIM 並不是插入系統後便完全透明的加速器;軟件、Tensor 排列方式和目標 Kernel,都需要配合記憶體的 Bank 結構作映射。
在一部邊緣 AI SoC 上執行 Llama 3.1 8B 推理時,Samsung 以傳統 LPDDR5X 作比較,公布以下結果:
這些結果屬於特定 Samsung 測試配置,並不是所有 LLM 都會獲得相同幅度的提升。實際表現會受模型精度、Tensor 放置方式、Batch Size、記憶體容量、軟件支援,以及推理工作中有多少比例屬於 GEMV 類運算等因素影響。
Samsung 亦將減少 SoC 與記憶體之間的數據搬運,視為降低功耗的架構優勢。不過,目前提供的資料沒有列出可供獨立驗證、而且具可比性的每次推理瓦特數或每 Token 焦耳數。因此,功耗改善較適合理解為針對合適工作負載的設計目標和預期好處,而不是已公布的固定百分比。9
HBM 仍然是需要最高外部記憶體頻寬的 AI 加速器較合適的選擇,尤其是大型模型訓練和高端數據中心工作負載。HBM 的性能來自堆疊 DRAM、矽穿孔(TSV)、先進封裝等技術,但同時帶來較高的封裝、面積和散熱要求。
Micron 在 Hot Chips 表示,與 DDR5 相比,HBM 的晶圓面積代價仍在逐代擴大;其比較指出,相同容量的 HBM 設計所需晶圓面積約為 DDR5 的 3 倍。
Samsung 的方案則採取另一條路:保留低功耗 LPDDR 記憶體的封裝形式,並在 DRAM Bank 附近加入一組有限、針對性的運算能力。它不會提供 HBM 那種面向各類運算的高外部頻寬,但如果系統的主要問題是 AI 推理時搬運數據,而不是缺乏峰值浮點運算能力,LPDDR5X-PIM 便可能更具吸引力。
Samsung 所瞄準的場景包括:
較準確的說法,是將 LPDDR5X-PIM 視為 HBM 的互補方案,或針對成本和功耗敏感的特定推理工作負載的替代選項,而不是 HBM 的全面替代品。
Samsung 早前已在 FMS 2026 展示 LPDDR5X-PIM;Hot Chips 2026 的演講則補充了更完整的架構和性能資料。Hot Chips 大會議程將 Samsung 的演講列為記憶體專題,主題是以 LPDDR 為基礎的 PIM AI 推理方案。2
9
13
更大的方向,是將 PIM 從過往較常見的 HBM 或特殊加速器示範,推向低功耗、較容易部署的記憶體產品。Samsung 長遠亦把 LPDDR6-PIM 與標準化方向連繫起來,但現有證據並未顯示 JEDEC 已完成正式規格或公布批准日期。
韓國 AI 晶片初創公司 DeepX 表示,計劃在第二代 DX-M2 晶片採用 Samsung LPDDR5X-PIM,並將 LPDDR6-PIM 列為較後期 DX-M3 設計的方向。15
如果 LPDDR6-PIM 日後能夠形成更廣泛的標準,對 SoC 廠商而言,標準化指令、封裝和介面兼容性,以及一致的 Bank 和地址語義,都有助於降低導入門檻。不過,現階段只能確認 Samsung 的標準化方向,不能把它描述成已經落實的 JEDEC 規格。
Samsung 的 LPDDR5X-PIM 與 XCENA MX1 出現在 Hot Chips 同一個記憶體專題,但兩者位於系統的不同層級。
XCENA MX1 是面向機架級基礎設施的 CXL Type 3 計算記憶體裝置,把最多 2TB DDR5 容量、由 SSD 支援的容量,以及超過 1,000 個 RISC-V 核心整合在一起,執行近記憶體處理。4
10
LPDDR5X-PIM 則是在低功耗 LPDDR DRAM 封裝內,直接加入數量較少、針對特定 AI 運算的專用單元。兩者都嘗試減少主機與記憶體之間的數據搬運,但 MX1 是透過 CXL 連接的伺服器裝置;Samsung 的方案則是貼近 SoC、適用於 LPDDR 類系統的記憶體封裝。
Samsung 在 Hot Chips 2026 的展示,將 LPDDR5X-PIM 定位為針對 AI 推理記憶體瓶頸的解法。16 個 PIM 區塊、Bank 級平行處理、MAC Tree,以及混合精度的浮點/整數 ALU,可以讓指定運算留在數據附近;同時,封裝仍維持 LPDDR5X 形式,運作點為每 Pin 9,600Mb/s。9
Llama 3.1 8B 的測試數字值得關注,但應視為特定工作負載下的廠商基準,而不是保證性的性能倍數。這項技術更重要的意義,在於 Samsung 正嘗試將 PIM 擴展到低功耗記憶體,服務手機、邊緣、客戶端及部分伺服器推理場景;至於真正需要大幅通用頻寬的工作負載,HBM 仍然有其位置。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Samsung 表示,LPDDR5X PIM 在搭載 Llama 3.1 8B 的邊緣 AI SoC 測試中,令推理時間縮短 2.28 倍、Token 吞吐量提升 3.01 倍;不過數據屬於 Samsung 自家測試,並非廣泛的獨立評測。
Samsung 表示,LPDDR5X PIM 在搭載 Llama 3.1 8B 的邊緣 AI SoC 測試中,令推理時間縮短 2.28 倍、Token 吞吐量提升 3.01 倍;不過數據屬於 Samsung 自家測試,並非廣泛的獨立評測。 這款 16GB、四晶粒封裝在 DRAM Bank 旁加入 16 個 PIM 區塊,配合平行 MAC Tree,以及支援浮點和整數運算的 ALU,減少模型數據來回搬運。
LPDDR5X PIM 的定位是針對受記憶體頻寬限制的低功耗 AI 推理方案,而不是取代高端 AI 加速器和訓練工作負載所用的 HBM。
Samsung 表示,LPDDR5X PIM 在搭載 Llama 3.1 8B 的邊緣 AI SoC 測試中,令推理時間縮短 2.28 倍、Token 吞吐量提升 3.01 倍;不過數據屬於 Samsung 自家測試,並非廣泛的獨立評測。 這款 16GB、四晶粒封裝在 DRAM Bank 旁加入 16 個 PIM 區塊,配合平行 MAC Tree,以及支援浮點和整數運算的 ALU,減少模型數據來回搬運。
發布者使用 GPT-5.6 Luna 編輯圖片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Samsung reveal about its LPDDR5X-PIM processing-in-memory technology at Hot Chips 2026—including how its 16 in-DRAM processing bloc. Article summary: Samsung positioned LPDDR5X-PIM as an LPDDR5X-compatible, inference-oriented memory architecture that moves repeated vector/matrix work into DRAM. Its headline claim is not that it replaces HBM in top-end GPU training, bu. Topic tags: general, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Samsung 在 Hot Chips 2026 詳細介紹 LPDDR5X-PIM,將部分 AI 推理運算直接放入低功耗 DRAM 內處理。設計在一個 16GB LPDDR5X 封裝內整合 16 個記憶體內運算(Processing-in-Memory,PIM)區塊,配備平行乘加(MAC)邏輯,以及支援浮點和整數運算的 ALU。
在一部執行 Llama 3.1 8B 的邊緣 AI SoC 上,Samsung 報稱推理時間縮短 2.28 倍,Token 吞吐量提升 3.01 倍。不過,這些數字是 Samsung 自家測試結果,不能直接當成所有模型和裝置都適用的性能倍數。1
9
大型語言模型做推理時,處理器未必是唯一瓶頸。模型權重和中間數據需要不斷在 DRAM 與處理器之間搬運,數據來回經過記憶體介面,既消耗時間,也會增加能耗。
PIM 的概念,就是讓記憶體在儲存數據的同時,於接近 DRAM 儲存陣列的位置執行指定運算。這樣,部分操作毋須將每一個運算元都送回 SoC 或加速器處理。Samsung 形容 LPDDR5X-PIM 是其首個以 LPDDR 為基礎、針對 AI 推理的 PIM 方案。2
9
13
這種架構尤其適合反覆進行矩陣向量乘法的工作負載,例如生成式 AI 推理常見的 GEMV 運算。對這類工作來說,減少數據搬運有時與增加傳統運算單元同樣重要。
Samsung 公開的配置是一個 16GB LPDDR5X 封裝,由四粒 Die 組成,採用 JEDEC 風格的 561-ball 封裝,資料率為每 Pin 9,600Mb/s。四粒 Die 共用指令和地址訊號,但各自使用獨立數據線,符合 LPDDR5 系統常見的平行組織方式。9
17
封裝內的 16 個 PIM 區塊分佈於不同 DRAM Bank,每個區塊主要包含兩類硬件:
換句話說,LPDDR5X-PIM 並不只是替記憶體加上一個單一數學運算器,而是將不同類型的專用運算單元放到數據附近。Samsung 早期的 PIM 資料亦曾介紹 SIMD 浮點單元,以及按 Bank 放置 PIM 單元的做法,反映其「讓運算靠近數據」的整體設計方向。9
11
Samsung 提到最高 614GB/s 的內部總 PIM 頻寬。這個數字並不是主處理器透過一般 LPDDR5X 記憶體介面可以使用的封裝外頻寬,也不代表手機或 SoC 突然擁有一條 614GB/s 的外部記憶體連線。1
它反映的是多個 DRAM Bank 和 PIM 區塊同時在記憶體內平行工作時,可提供給特定支援運算的內部數據處理能力。以 Samsung 的比較方式計算,614GB/s 約為傳統 LPDDR5X 基線的 8 倍;重點在於這是記憶體內部的平行度,而不是外部介面的規格提升。
LPDDR5X-PIM 的關鍵機制之一是 Address Align Mode。系統會將互相對應的運算元,放在參與運算的不同 Bank 內相應的地址位置。發出一個共用 PIM 指令後,各個 Bank 便可以同步執行相同操作。
這種安排與 LPDDR Rank 的組織方式有關:四粒 Die 在指令、地址和 Chip Select 訊號上以同步方式運作,同時保留各自的數據路徑。因此,封裝可以在內部進行平行運算,但不等於將四粒 Die 當成一條傳統的超寬外部記憶體通道。17
Samsung 描述了兩種操作模式:
取捨在於工作負載。啟用更多 Bank 可以提高合適 Kernel 的吞吐量,但同一時間可供普通記憶體存取的 Bank 便會減少。換言之,PIM 並不是插入系統後便完全透明的加速器;軟件、Tensor 排列方式和目標 Kernel,都需要配合記憶體的 Bank 結構作映射。
在一部邊緣 AI SoC 上執行 Llama 3.1 8B 推理時,Samsung 以傳統 LPDDR5X 作比較,公布以下結果:
這些結果屬於特定 Samsung 測試配置,並不是所有 LLM 都會獲得相同幅度的提升。實際表現會受模型精度、Tensor 放置方式、Batch Size、記憶體容量、軟件支援,以及推理工作中有多少比例屬於 GEMV 類運算等因素影響。
Samsung 亦將減少 SoC 與記憶體之間的數據搬運,視為降低功耗的架構優勢。不過,目前提供的資料沒有列出可供獨立驗證、而且具可比性的每次推理瓦特數或每 Token 焦耳數。因此,功耗改善較適合理解為針對合適工作負載的設計目標和預期好處,而不是已公布的固定百分比。9
HBM 仍然是需要最高外部記憶體頻寬的 AI 加速器較合適的選擇,尤其是大型模型訓練和高端數據中心工作負載。HBM 的性能來自堆疊 DRAM、矽穿孔(TSV)、先進封裝等技術,但同時帶來較高的封裝、面積和散熱要求。
Micron 在 Hot Chips 表示,與 DDR5 相比,HBM 的晶圓面積代價仍在逐代擴大;其比較指出,相同容量的 HBM 設計所需晶圓面積約為 DDR5 的 3 倍。
Samsung 的方案則採取另一條路:保留低功耗 LPDDR 記憶體的封裝形式,並在 DRAM Bank 附近加入一組有限、針對性的運算能力。它不會提供 HBM 那種面向各類運算的高外部頻寬,但如果系統的主要問題是 AI 推理時搬運數據,而不是缺乏峰值浮點運算能力,LPDDR5X-PIM 便可能更具吸引力。
Samsung 所瞄準的場景包括:
較準確的說法,是將 LPDDR5X-PIM 視為 HBM 的互補方案,或針對成本和功耗敏感的特定推理工作負載的替代選項,而不是 HBM 的全面替代品。
Samsung 早前已在 FMS 2026 展示 LPDDR5X-PIM;Hot Chips 2026 的演講則補充了更完整的架構和性能資料。Hot Chips 大會議程將 Samsung 的演講列為記憶體專題,主題是以 LPDDR 為基礎的 PIM AI 推理方案。2
9
13
更大的方向,是將 PIM 從過往較常見的 HBM 或特殊加速器示範,推向低功耗、較容易部署的記憶體產品。Samsung 長遠亦把 LPDDR6-PIM 與標準化方向連繫起來,但現有證據並未顯示 JEDEC 已完成正式規格或公布批准日期。
韓國 AI 晶片初創公司 DeepX 表示,計劃在第二代 DX-M2 晶片採用 Samsung LPDDR5X-PIM,並將 LPDDR6-PIM 列為較後期 DX-M3 設計的方向。15
如果 LPDDR6-PIM 日後能夠形成更廣泛的標準,對 SoC 廠商而言,標準化指令、封裝和介面兼容性,以及一致的 Bank 和地址語義,都有助於降低導入門檻。不過,現階段只能確認 Samsung 的標準化方向,不能把它描述成已經落實的 JEDEC 規格。
Samsung 的 LPDDR5X-PIM 與 XCENA MX1 出現在 Hot Chips 同一個記憶體專題,但兩者位於系統的不同層級。
XCENA MX1 是面向機架級基礎設施的 CXL Type 3 計算記憶體裝置,把最多 2TB DDR5 容量、由 SSD 支援的容量,以及超過 1,000 個 RISC-V 核心整合在一起,執行近記憶體處理。4
10
LPDDR5X-PIM 則是在低功耗 LPDDR DRAM 封裝內,直接加入數量較少、針對特定 AI 運算的專用單元。兩者都嘗試減少主機與記憶體之間的數據搬運,但 MX1 是透過 CXL 連接的伺服器裝置;Samsung 的方案則是貼近 SoC、適用於 LPDDR 類系統的記憶體封裝。
Samsung 在 Hot Chips 2026 的展示,將 LPDDR5X-PIM 定位為針對 AI 推理記憶體瓶頸的解法。16 個 PIM 區塊、Bank 級平行處理、MAC Tree,以及混合精度的浮點/整數 ALU,可以讓指定運算留在數據附近;同時,封裝仍維持 LPDDR5X 形式,運作點為每 Pin 9,600Mb/s。9
Llama 3.1 8B 的測試數字值得關注,但應視為特定工作負載下的廠商基準,而不是保證性的性能倍數。這項技術更重要的意義,在於 Samsung 正嘗試將 PIM 擴展到低功耗記憶體,服務手機、邊緣、客戶端及部分伺服器推理場景;至於真正需要大幅通用頻寬的工作負載,HBM 仍然有其位置。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Samsung 表示,LPDDR5X PIM 在搭載 Llama 3.1 8B 的邊緣 AI SoC 測試中,令推理時間縮短 2.28 倍、Token 吞吐量提升 3.01 倍;不過數據屬於 Samsung 自家測試,並非廣泛的獨立評測。
Samsung 表示,LPDDR5X PIM 在搭載 Llama 3.1 8B 的邊緣 AI SoC 測試中,令推理時間縮短 2.28 倍、Token 吞吐量提升 3.01 倍;不過數據屬於 Samsung 自家測試,並非廣泛的獨立評測。 這款 16GB、四晶粒封裝在 DRAM Bank 旁加入 16 個 PIM 區塊,配合平行 MAC Tree,以及支援浮點和整數運算的 ALU,減少模型數據來回搬運。
LPDDR5X PIM 的定位是針對受記憶體頻寬限制的低功耗 AI 推理方案,而不是取代高端 AI 加速器和訓練工作負載所用的 HBM。