三星称,在搭载边缘 AI SoC 的 Llama 3.1 8B 推理测试中,LPDDR5X PIM 将推理时间缩短至传统 LPDDR5X 的 1/2.28,并将令牌吞吐量提高 3.01 倍;但这些是三星自测结果,并非广泛的独立评测。[1] [9] [19] 这款 16GB、四芯片封装的内存将 16 个 PIM 模块置于 DRAM 存储体附近,并结合并行 MAC 树以及支持浮点和整数运算的 ALU,以减少 AI 推理中的数据搬运。 三星将 LPDDR5X PIM 定位为面向带宽受限推理任务的低功耗方案,而不是高端 AI 训练场景中 HBM 的全面替代品。
发布者使用 GPT-5.6 Luna 编辑图片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Samsung reveal about its LPDDR5X-PIM processing-in-memory technology at Hot Chips 2026—including how its 16 in-DRAM processing bloc. Article summary: Samsung positioned LPDDR5X-PIM as an LPDDR5X-compatible, inference-oriented memory architecture that moves repeated vector/matrix work into DRAM. Its headline claim is not that it replaces HBM in top-end GPU training, bu. Topic tags: general, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
三星在 Hot Chips 2026 上进一步披露了 LPDDR5X-PIM 的架构和测试结果。这项技术把部分处理逻辑直接放进低功耗 LPDDR5X 内存,让数据尽可能在 DRAM 附近完成运算,而不必反复往返于内存和处理器之间。
三星称,在搭载边缘 AI SoC、运行 Llama 3.1 8B 的测试中,LPDDR5X-PIM 将推理时间降低了 2.28 倍,并将令牌吞吐量提高了 3.01 倍。不过,这些数字来自三星公布的特定测试配置,不能直接视为适用于所有模型和设备的通用性能提升。1
9
大型语言模型推理经常受制于“搬数据”而不是纯粹的计算能力。模型权重和中间结果需要在 DRAM 与处理器之间持续传输,外部内存接口因此可能成为瓶颈。
PIM,即“内存内处理”(Processing-in-Memory),试图把部分计算放到存储阵列附近完成。对于反复执行矩阵—向量运算的 AI 推理任务而言,减少数据移动有时与增加传统计算单元同样重要。三星将 LPDDR5X-PIM称为其首款基于 LPDDR 的 AI 推理 PIM 方案。2
9
13
三星公布的配置采用 16GB LPDDR5X 封装,由四颗芯片组成,使用符合 JEDEC 风格的 561 球封装,单引脚数据速率为 9,600 Mb/s。四颗芯片共享命令和地址信号,但使用独立的数据线,这与 LPDDR 系统常见的并行组织方式一致。9
17
封装内部包含分布在多个 DRAM bank 中的 16 个 PIM 模块。每个模块主要结合两类硬件:
这种异构设计意味着内存不只是对单一数据类型执行简单算术,而是可以针对推理中的不同阶段提供相应的计算单元。三星此前公布的 PIM 资料也曾介绍 SIMD 浮点单元,以及按 bank 布置 PIM 单元的设计思路。9
11
三星给出的“最高 614 GB/s”指的是 PIM 内部的聚合带宽,并非主处理器通过传统 LPDDR5X 接口能够获得的封装外带宽。1
这一数字来自多个 bank 和 PIM 模块的并行工作。在三星的对比中,内部 PIM 带宽约为传统 LPDDR5X 基线带宽的 8 倍;但这并不意味着 LPDDR5X 的外部接口突然变成了 614 GB/s 的高速链路。
更准确地说,PIM 为特定支持的运算提供了内存内部的高并行度。只有被映射到这些 PIM 单元、并适合其计算模式的工作负载,才能真正利用这部分带宽。
LPDDR5X-PIM 的关键机制之一是 Address Align Mode(地址对齐模式)。软件会将相互对应的操作数放置在参与运算的不同 bank 的匹配地址上。这样,一个共享的 PIM 命令就能在多个 bank 中触发相同操作,实现并行执行。17
这是因为 LPDDR rank 中的四颗芯片可以接收共同的命令和地址信号,同时保留各自的数据通路。通过精心安排数据布局,封装内部能够并行处理,而不必把整个封装当作一个传统的超宽外部通道。17
三星介绍了两种运行方式:
两者之间存在明显取舍。参与运算的 bank 越多,吞吐量可能越高,但当时可供普通内存访问使用的 bank 也会减少。因此,PIM 并不是一个完全“隐形”的即插即用加速器,软件、张量布局和目标内核都需要适配内存的 bank 结构。
在一款边缘 AI SoC 上运行 Llama 3.1 8B 时,三星将 LPDDR5X-PIM 与传统 LPDDR5X 进行了对比,并报告了以下结果:
这些结果应被理解为特定配置下的厂商基准测试,而不是普遍适用的性能倍数。实际收益可能受到模型精度、量化方式、批大小、张量布局、内存容量、软件支持,以及推理过程中 GEMV 类运算占比等因素影响。
三星还将降低功耗列为该架构的潜在优势,因为减少了内存与 SoC 之间的数据传输。不过,目前提供的材料没有给出经过独立验证、可直接比较的每次推理瓦数或每令牌焦耳数。因此,功耗优势更适合被理解为面向特定工作负载的设计目标和预期收益,而不是已经公布的固定降幅。
HBM 仍然更适合需要极高外部内存带宽的加速器,尤其是大规模训练和高端数据中心工作负载。它依靠堆叠式 DRAM、硅通孔、先进封装和更高的散热与芯片面积投入来实现性能。美光在 Hot Chips 上表示,与 DDR5 相比,HBM 的晶圆面积代价正在扩大;在其对比中,相同容量的 HBM 设计大约需要 DDR5 的三倍晶圆面积。
三星采用的是另一种取舍:保留低功耗 DRAM 的封装和使用方式,同时在 bank 附近加入规模有限的专用计算能力。LPDDR5X-PIM 无法提供 HBM 面向通用加速器的整体带宽,但当瓶颈主要在于推理数据搬运,而不是峰值浮点计算能力时,它可能更具吸引力。
三星所瞄准的场景包括:
因此,更准确的说法是:LPDDR5X-PIM 是 HBM 的补充,或面向成本和功耗敏感型推理任务的替代选项,而不是 HBM 的全面替代品。
三星此前已在 FMS 2026 展示 LPDDR5X-PIM。Hot Chips 2026 的演讲则进一步介绍了其内部架构、运行模式以及 Llama 3.1 8B 的性能讨论;会议日程将三星的演讲列为专门面向 AI 推理的 LPDDR PIM 主题报告。9
13
XCENA MX1 出现在同一场 Hot Chips 内存专题中,但它与 LPDDR5X-PIM 并不是同一种产品。MX1 是面向机架级基础设施的 CXL Type 3 计算内存设备,将最高 2TB DDR5 容量、由 SSD 支持的扩展容量,以及超过 1,000 个 RISC-V 核心结合在一起。4
10
两种技术都试图减少主机与内存之间的数据移动,但系统位置不同:MX1 是通过 CXL 连接到服务器的设备,而 LPDDR5X-PIM 则是直接把少量专用计算单元集成到低功耗 LPDDR DRAM 封装中,更适合靠近 SoC 的系统。
韩国 AI 芯片公司 DeepX 已表示,计划在第二代 DX-M2 芯片中采用三星 LPDDR5X-PIM,并将 LPDDR6-PIM 作为后续 DX-M3 的方向。15
三星更长期的目标,是推动与 JEDEC 对齐的 LPDDR6-PIM 规格,而不是让 LPDDR5X-PIM 成为一次性的专有扩展。统一的命令、封装和接口兼容性、软件工具,以及明确且可预测的 bank 和地址语义,都是 PIM 能否被更多 SoC 采用的关键。不过,目前公开信息只表明了这一标准化方向,并未证明 JEDEC 已经完成相关标准或公布最终批准日期。15
Hot Chips 2026 的披露显示,三星正在尝试把 PIM 从早期的 HBM 专用方案扩展到更易部署的低功耗内存领域。LPDDR5X-PIM 通过 16 个 PIM 模块、bank 级并行、MAC 树以及支持浮点和整数运算的 ALU,将部分 AI 推理操作留在数据附近完成,同时保留 16GB、四芯片 LPDDR5X 封装和 9,600 Mb/s 单引脚速率等特征。9
Llama 3.1 8B 的测试结果颇具吸引力,但仍应视为特定工作负载下的三星厂商数据。它真正值得关注的地方在于战略意义:如果软件和模型映射能够跟上,PIM 有机会将低功耗内存从单纯的存储组件变成面向推理的轻量计算平台,服务于移动、边缘、客户端以及部分服务器系统;而需要更高通用带宽的训练和高端加速任务,仍将继续依赖 HBM。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
三星称,在搭载边缘 AI SoC 的 Llama 3.1 8B 推理测试中,LPDDR5X PIM 将推理时间缩短至传统 LPDDR5X 的 1/2.28,并将令牌吞吐量提高 3.01 倍;但这些是三星自测结果,并非广泛的独立评测。[1] [9] [19]
三星称,在搭载边缘 AI SoC 的 Llama 3.1 8B 推理测试中,LPDDR5X PIM 将推理时间缩短至传统 LPDDR5X 的 1/2.28,并将令牌吞吐量提高 3.01 倍;但这些是三星自测结果,并非广泛的独立评测。[1] [9] [19] 这款 16GB、四芯片封装的内存将 16 个 PIM 模块置于 DRAM 存储体附近,并结合并行 MAC 树以及支持浮点和整数运算的 ALU,以减少 AI 推理中的数据搬运。
三星将 LPDDR5X PIM 定位为面向带宽受限推理任务的低功耗方案,而不是高端 AI 训练场景中 HBM 的全面替代品。
三星称,在搭载边缘 AI SoC 的 Llama 3.1 8B 推理测试中,LPDDR5X PIM 将推理时间缩短至传统 LPDDR5X 的 1/2.28,并将令牌吞吐量提高 3.01 倍;但这些是三星自测结果,并非广泛的独立评测。[1] [9] [19] 这款 16GB、四芯片封装的内存将 16 个 PIM 模块置于 DRAM 存储体附近,并结合并行 MAC 树以及支持浮点和整数运算的 ALU,以减少 AI 推理中的数据搬运。 三星将 LPDDR5X PIM 定位为面向带宽受限推理任务的低功耗方案,而不是高端 AI 训练场景中 HBM 的全面替代品。
发布者使用 GPT-5.6 Luna 编辑图片由 GPT Image 1.5 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Samsung reveal about its LPDDR5X-PIM processing-in-memory technology at Hot Chips 2026—including how its 16 in-DRAM processing bloc. Article summary: Samsung positioned LPDDR5X-PIM as an LPDDR5X-compatible, inference-oriented memory architecture that moves repeated vector/matrix work into DRAM. Its headline claim is not that it replaces HBM in top-end GPU training, bu. Topic tags: general, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
三星在 Hot Chips 2026 上进一步披露了 LPDDR5X-PIM 的架构和测试结果。这项技术把部分处理逻辑直接放进低功耗 LPDDR5X 内存,让数据尽可能在 DRAM 附近完成运算,而不必反复往返于内存和处理器之间。
三星称,在搭载边缘 AI SoC、运行 Llama 3.1 8B 的测试中,LPDDR5X-PIM 将推理时间降低了 2.28 倍,并将令牌吞吐量提高了 3.01 倍。不过,这些数字来自三星公布的特定测试配置,不能直接视为适用于所有模型和设备的通用性能提升。1
9
大型语言模型推理经常受制于“搬数据”而不是纯粹的计算能力。模型权重和中间结果需要在 DRAM 与处理器之间持续传输,外部内存接口因此可能成为瓶颈。
PIM,即“内存内处理”(Processing-in-Memory),试图把部分计算放到存储阵列附近完成。对于反复执行矩阵—向量运算的 AI 推理任务而言,减少数据移动有时与增加传统计算单元同样重要。三星将 LPDDR5X-PIM称为其首款基于 LPDDR 的 AI 推理 PIM 方案。2
9
13
三星公布的配置采用 16GB LPDDR5X 封装,由四颗芯片组成,使用符合 JEDEC 风格的 561 球封装,单引脚数据速率为 9,600 Mb/s。四颗芯片共享命令和地址信号,但使用独立的数据线,这与 LPDDR 系统常见的并行组织方式一致。9
17
封装内部包含分布在多个 DRAM bank 中的 16 个 PIM 模块。每个模块主要结合两类硬件:
这种异构设计意味着内存不只是对单一数据类型执行简单算术,而是可以针对推理中的不同阶段提供相应的计算单元。三星此前公布的 PIM 资料也曾介绍 SIMD 浮点单元,以及按 bank 布置 PIM 单元的设计思路。9
11
三星给出的“最高 614 GB/s”指的是 PIM 内部的聚合带宽,并非主处理器通过传统 LPDDR5X 接口能够获得的封装外带宽。1
这一数字来自多个 bank 和 PIM 模块的并行工作。在三星的对比中,内部 PIM 带宽约为传统 LPDDR5X 基线带宽的 8 倍;但这并不意味着 LPDDR5X 的外部接口突然变成了 614 GB/s 的高速链路。
更准确地说,PIM 为特定支持的运算提供了内存内部的高并行度。只有被映射到这些 PIM 单元、并适合其计算模式的工作负载,才能真正利用这部分带宽。
LPDDR5X-PIM 的关键机制之一是 Address Align Mode(地址对齐模式)。软件会将相互对应的操作数放置在参与运算的不同 bank 的匹配地址上。这样,一个共享的 PIM 命令就能在多个 bank 中触发相同操作,实现并行执行。17
这是因为 LPDDR rank 中的四颗芯片可以接收共同的命令和地址信号,同时保留各自的数据通路。通过精心安排数据布局,封装内部能够并行处理,而不必把整个封装当作一个传统的超宽外部通道。17
三星介绍了两种运行方式:
两者之间存在明显取舍。参与运算的 bank 越多,吞吐量可能越高,但当时可供普通内存访问使用的 bank 也会减少。因此,PIM 并不是一个完全“隐形”的即插即用加速器,软件、张量布局和目标内核都需要适配内存的 bank 结构。
在一款边缘 AI SoC 上运行 Llama 3.1 8B 时,三星将 LPDDR5X-PIM 与传统 LPDDR5X 进行了对比,并报告了以下结果:
这些结果应被理解为特定配置下的厂商基准测试,而不是普遍适用的性能倍数。实际收益可能受到模型精度、量化方式、批大小、张量布局、内存容量、软件支持,以及推理过程中 GEMV 类运算占比等因素影响。
三星还将降低功耗列为该架构的潜在优势,因为减少了内存与 SoC 之间的数据传输。不过,目前提供的材料没有给出经过独立验证、可直接比较的每次推理瓦数或每令牌焦耳数。因此,功耗优势更适合被理解为面向特定工作负载的设计目标和预期收益,而不是已经公布的固定降幅。
HBM 仍然更适合需要极高外部内存带宽的加速器,尤其是大规模训练和高端数据中心工作负载。它依靠堆叠式 DRAM、硅通孔、先进封装和更高的散热与芯片面积投入来实现性能。美光在 Hot Chips 上表示,与 DDR5 相比,HBM 的晶圆面积代价正在扩大;在其对比中,相同容量的 HBM 设计大约需要 DDR5 的三倍晶圆面积。
三星采用的是另一种取舍:保留低功耗 DRAM 的封装和使用方式,同时在 bank 附近加入规模有限的专用计算能力。LPDDR5X-PIM 无法提供 HBM 面向通用加速器的整体带宽,但当瓶颈主要在于推理数据搬运,而不是峰值浮点计算能力时,它可能更具吸引力。
三星所瞄准的场景包括:
因此,更准确的说法是:LPDDR5X-PIM 是 HBM 的补充,或面向成本和功耗敏感型推理任务的替代选项,而不是 HBM 的全面替代品。
三星此前已在 FMS 2026 展示 LPDDR5X-PIM。Hot Chips 2026 的演讲则进一步介绍了其内部架构、运行模式以及 Llama 3.1 8B 的性能讨论;会议日程将三星的演讲列为专门面向 AI 推理的 LPDDR PIM 主题报告。9
13
XCENA MX1 出现在同一场 Hot Chips 内存专题中,但它与 LPDDR5X-PIM 并不是同一种产品。MX1 是面向机架级基础设施的 CXL Type 3 计算内存设备,将最高 2TB DDR5 容量、由 SSD 支持的扩展容量,以及超过 1,000 个 RISC-V 核心结合在一起。4
10
两种技术都试图减少主机与内存之间的数据移动,但系统位置不同:MX1 是通过 CXL 连接到服务器的设备,而 LPDDR5X-PIM 则是直接把少量专用计算单元集成到低功耗 LPDDR DRAM 封装中,更适合靠近 SoC 的系统。
韩国 AI 芯片公司 DeepX 已表示,计划在第二代 DX-M2 芯片中采用三星 LPDDR5X-PIM,并将 LPDDR6-PIM 作为后续 DX-M3 的方向。15
三星更长期的目标,是推动与 JEDEC 对齐的 LPDDR6-PIM 规格,而不是让 LPDDR5X-PIM 成为一次性的专有扩展。统一的命令、封装和接口兼容性、软件工具,以及明确且可预测的 bank 和地址语义,都是 PIM 能否被更多 SoC 采用的关键。不过,目前公开信息只表明了这一标准化方向,并未证明 JEDEC 已经完成相关标准或公布最终批准日期。15
Hot Chips 2026 的披露显示,三星正在尝试把 PIM 从早期的 HBM 专用方案扩展到更易部署的低功耗内存领域。LPDDR5X-PIM 通过 16 个 PIM 模块、bank 级并行、MAC 树以及支持浮点和整数运算的 ALU,将部分 AI 推理操作留在数据附近完成,同时保留 16GB、四芯片 LPDDR5X 封装和 9,600 Mb/s 单引脚速率等特征。9
Llama 3.1 8B 的测试结果颇具吸引力,但仍应视为特定工作负载下的三星厂商数据。它真正值得关注的地方在于战略意义:如果软件和模型映射能够跟上,PIM 有机会将低功耗内存从单纯的存储组件变成面向推理的轻量计算平台,服务于移动、边缘、客户端以及部分服务器系统;而需要更高通用带宽的训练和高端加速任务,仍将继续依赖 HBM。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
三星称,在搭载边缘 AI SoC 的 Llama 3.1 8B 推理测试中,LPDDR5X PIM 将推理时间缩短至传统 LPDDR5X 的 1/2.28,并将令牌吞吐量提高 3.01 倍;但这些是三星自测结果,并非广泛的独立评测。[1] [9] [19]
三星称,在搭载边缘 AI SoC 的 Llama 3.1 8B 推理测试中,LPDDR5X PIM 将推理时间缩短至传统 LPDDR5X 的 1/2.28,并将令牌吞吐量提高 3.01 倍;但这些是三星自测结果,并非广泛的独立评测。[1] [9] [19] 这款 16GB、四芯片封装的内存将 16 个 PIM 模块置于 DRAM 存储体附近,并结合并行 MAC 树以及支持浮点和整数运算的 ALU,以减少 AI 推理中的数据搬运。
三星将 LPDDR5X PIM 定位为面向带宽受限推理任务的低功耗方案,而不是高端 AI 训练场景中 HBM 的全面替代品。