Samsung rapporterer 2,28 gange kortere inferenstid og 3,01 gange højere token gennemløb for Llama 3.1 8B sammenlignet med konventionel LPDDR5X, men resultaterne stammer fra virksomhedens egen edge AI test. Den 16 GB store pakke med fire dies indeholder 16 PIM blokke med parallelle MAC træer samt flydende komma og he...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Samsung reveal about its LPDDR5X-PIM processing-in-memory technology at Hot Chips 2026—including how its 16 in-DRAM processing bloc. Article summary: Samsung positioned LPDDR5X-PIM as an LPDDR5X-compatible, inference-oriented memory architecture that moves repeated vector/matrix work into DRAM. Its headline claim is not that it replaces HBM in top-end GPU training, bu. Topic tags: general, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Samsung brugte Hot Chips 2026 til at forklare, hvordan LPDDR5X-PIM føjer beregningslogik direkte til den lavenergi-DRAM, der normalt primært bruges til at lagre data. PIM står for Processing-in-Memory – altså beregning i hukommelsen.
Løsningen kombinerer 16 processeringsblokke i hukommelsen, parallel logik til multiplikation og addition samt enheder til både flydende komma- og heltalsberegninger. Det hele er integreret i en LPDDR5X-pakke på 16 GB. I en edge-AI-SoC, der kørte Llama 3.1 8B, rapporterede Samsung 2,28 gange kortere inferenstid og 3,01 gange højere token-gennemløb. Tallene er dog Samsungs egne resultater og ikke en bred, uafhængig evaluering. 1 9
Ved inferens med store sprogmodeller bruges der ofte betydelig tid på at flytte modelvægte og mellemliggende data mellem DRAM og processoren. PIM forsøger at afhjælpe flaskehalsen ved at udføre udvalgte operationer tæt på DRAM-cellerne i stedet for at sende alle operander frem og tilbage over hukommelsesgrænsefladen.
Det er især relevant for arbejdsbelastninger, der domineres af gentagne matrix-vektor-beregninger. Her kan mindre datatrafik være lige så vigtigt som mere traditionel beregningskapacitet. Samsung beskriver LPDDR5X-PIM som virksomhedens første LPDDR-baserede PIM-løsning til AI-inferens. 2 9 13
Den viste konfiguration er en 16 GB LPDDR5X-pakke med fire dies i en JEDEC-kompatibel pakke med 561 kuglekontakter. Den arbejder ved 9.600 Mb/s pr. pin. De fire dies deler kommando- og adressesignaler, men bruger separate datalinjer, hvilket passer til den parallelle organisering, der kendetegner LPDDR-systemer. 9 17
Pakken indeholder 16 PIM-blokke fordelt på DRAM-bankene. Hver blok kombinerer to hovedtyper af hardware:
Den heterogene opbygning betyder, at hukommelsen kan håndtere mere end simple beregninger på én datatype. Samsungs tidligere PIM-materiale beskriver også en SIMD-enhed til flydende komma og placering af PIM-enheder på bankniveau – en tilgang, hvor specialiseret beregningslogik placeres tæt på de data, den skal bruge. 9 11
Samsung angav op til 614 GB/s intern, samlet PIM-båndbredde. Det er ikke den almindelige båndbredde, som en processor får adgang til via en traditionel LPDDR5X-grænseflade. Tallet beskriver den parallelle aktivitet på tværs af flere hukommelsesbanker og PIM-blokke. 1
I Samsungs sammenligning var den interne PIM-båndbredde omtrent otte gange højere end den konventionelle LPDDR5X-båndbredde, der blev brugt som reference. Forskellen er vigtig: PIM giver høj intern båndbredde til understøttede operationer, men gør ikke den eksterne LPDDR-forbindelse til et 614 GB/s-link.
En central del af designet er Address Align Mode. Her placeres tilsvarende operander på matchende adresser i de deltagende hukommelsesbanker. En fælles PIM-kommando kan dermed udløse den samme operation parallelt i flere banker.
Det hænger sammen med, at dies i en LPDDR-rang modtager fælles kommando- og adressesignaler, mens de fortsat har separate dataveje. På den måde kan pakken udføre beregninger parallelt uden at fungere som én traditionel, bred ekstern hukommelseskanal. 17
Samsung beskrev to driftstilstande:
Der er dog en afvejning. Flere deltagende banker kan øge gennemløbet, men betyder samtidig, at færre banker er tilgængelige til almindelige hukommelsesadgange. PIM fungerer derfor bedst, når software, tensorlayout og beregningskerner er tilpasset hukommelsens bankstruktur – ikke som en usynlig accelerator, der fungerer ens for alle arbejdsbelastninger.
På en edge-AI-SoC med Llama 3.1 8B rapporterede Samsung følgende sammenlignet med konventionel LPDDR5X:
Resultaterne beskriver en bestemt testopsætning og bør ikke læses som en universel ydelsesfaktor. Den faktiske gevinst vil blandt andet afhænge af modelpræcision, tensorplacering, batchstørrelse, hukommelseskapacitet, softwareunderstøttelse og hvor stor en del af arbejdsbelastningen der består af GEMV-lignende operationer.
Samsung fremhæver også lavere strømforbrug som en arkitektonisk fordel ved at reducere dataflytningen mellem hukommelsen og SoC'en. Det tilgængelige materiale dokumenterer dog ikke et sammenligneligt, uafhængigt verificeret tal for watt pr. inferens eller joule pr. token. Strømfordelen bør derfor forstås som et designmål og en forventet fordel ved egnede arbejdsbelastninger – ikke som en offentliggjort procentvis reduktion.
HBM er fortsat den stærkere løsning, når en accelerator har brug for maksimal ekstern hukommelsesbåndbredde, især til store træningsopgaver og avancerede datacenter-systemer. Ydelsen kommer til gengæld med stablet DRAM, gennem-silicium-forbindelser, avanceret indpakning samt betydelige krav til chipareal og varmehåndtering. Ved Hot Chips beskrev Micron, hvordan HBM's arealulempe i forhold til DDR5 vokser; i virksomhedens sammenligning krævede en HBM-løsning med samme kapacitet omtrent tre gange så stort waferareal.
Samsung vælger en anden balance. LPDDR5X-PIM bevarer den kompakte lavenergi-DRAM-formfaktor og tilføjer begrænset beregningskapacitet tæt på hukommelsesbankene. Teknologien kan ikke levere HBM's generelle acceleratorbåndbredde, men kan være interessant, når den primære udfordring er at flytte data under inferens – ikke at levere maksimal floating-point-ydelse.
Samsung retter derfor teknologien mod flere typer systemer:
Den mest præcise beskrivelse er derfor et supplement eller et omkostningsfølsomt alternativ til HBM i udvalgte inferensopgaver – ikke en universel HBM-erstatning.
Samsung havde allerede demonstreret LPDDR5X-PIM ved FMS 2026. Hot Chips-sessionen tilføjede en mere detaljeret gennemgang af arkitekturen og ydelsen; konferencens program beskrev præsentationen som et særskilt indlæg om LPDDR-baseret PIM til AI-inferens. 9 13
Den bredere retning er at gøre PIM til en mere anvendelig funktion i lavenergi-hukommelse i stedet for at begrænse teknologien til specialiserede HBM-forsøg. Samsungs langsigtede retning med LPDDR6-PIM er også knyttet til standardisering, men de tilgængelige oplysninger dokumenterer ikke en færdig JEDEC-specifikation eller en dato for godkendelse. DeepX har oplyst, at virksomheden vil bruge Samsung LPDDR5X-PIM i sin anden generation af DX-M2-chippen og sigter mod LPDDR6-PIM i en senere DX-M3-model. 15
Samsung-præsentationen fandt sted i samme hukommelsessession som XCENA's MX1, men teknologierne ligger på forskellige niveauer i systemet.
XCENA MX1 er en CXL Type 3-enhed til beregningshukommelse, målrettet rack-baseret infrastruktur. Den kombinerer op til 2 TB DDR5-kapacitet, SSD-understøttet kapacitet og mere end 1.000 RISC-V-kerner til behandling tæt på hukommelsen. 4 10
LPDDR5X-PIM integrerer derimod et mindre antal specialiserede beregningsenheder direkte i LPDDR-DRAM'en. Begge tilgange forsøger at reducere dataflytningen mellem vært og hukommelse, men MX1 er en CXL-tilsluttet serverenhed, mens Samsungs løsning er en lavenergi-hukommelsespakke, der er beregnet til at sidde tæt på en SoC eller et andet LPDDR-baseret system.
Samsungs præsentation ved Hot Chips 2026 fremstiller LPDDR5X-PIM som et målrettet svar på hukommelsesflaskehalsen i AI-inferens. De 16 processeringsblokke, paralleliteten på bankniveau, MAC-træerne og ALU'erne til flere datatyper kan holde udvalgte beregninger tæt på dataene, mens pakken bevarer en LPDDR5X-kompatibel formfaktor og en driftshastighed på 9.600 Mb/s pr. pin. 9
Resultaterne med Llama 3.1 8B er lovende, men skal læses som leverandørens egne, arbejdsbelastningsspecifikke benchmarks. Teknologiens vigtigste betydning er strategisk: Samsung forsøger at udvide PIM til lavenergi-hukommelse, der kan bruges i mobile enheder, edge-systemer, klientprodukter og udvalgte servere – mens HBM fortsat er rettet mod opgaver, der reelt kræver langt højere, generel båndbredde.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Samsung rapporterer 2,28 gange kortere inferenstid og 3,01 gange højere token gennemløb for Llama 3.1 8B sammenlignet med konventionel LPDDR5X, men resultaterne stammer fra virksomhedens egen edge AI test.
Samsung rapporterer 2,28 gange kortere inferenstid og 3,01 gange højere token gennemløb for Llama 3.1 8B sammenlignet med konventionel LPDDR5X, men resultaterne stammer fra virksomhedens egen edge AI test. Den 16 GB store pakke med fire dies indeholder 16 PIM blokke med parallelle MAC træer samt flydende komma og heltals ALU'er, der reducerer behovet for at flytte data mellem hukommelse og processor.
LPDDR5X PIM er tænkt som en energieffektiv løsning til hukommelsesbegrænset inferens – ikke som en fuld erstatning for HBM i avanceret træning og acceleratorer.