Samsung sier LPDDR5X PIM reduserte inferenstiden for Llama 3.1 8B med 2,28 ganger og økte gjennomstrømningen av tokens med 3,01 ganger mot vanlig LPDDR5X. Den 16 GB store pakken med fire minnebrikker har 16 PIM blokker, parallelle MAC trær samt flyttalls og heltalls ALU er som skal redusere datatrafikken mellom minn...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Samsung reveal about its LPDDR5X-PIM processing-in-memory technology at Hot Chips 2026—including how its 16 in-DRAM processing bloc. Article summary: Samsung positioned LPDDR5X-PIM as an LPDDR5X-compatible, inference-oriented memory architecture that moves repeated vector/matrix work into DRAM. Its headline claim is not that it replaces HBM in top-end GPU training, bu. Topic tags: general, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Samsung brukte Hot Chips 2026 til å forklare hvordan LPDDR5X-PIM legger beregningslogikk direkte inn i lavstrømsminne for AI-inferens. Løsningen kombinerer 16 prosesseringsblokker i minnet, parallelle multiplikasjon-og-addisjon-enheter og aritmetikkenheter for både flyttall og heltall i en LPDDR5X-pakke på 16 GB. På en edge-AI-SoC som kjørte Llama 3.1 8B, rapporterte Samsung 2,28 ganger kortere inferenstid og 3,01 ganger høyere token-gjennomstrømning. Tallene er imidlertid selskapets egne resultater, ikke en bred, uavhengig evaluering. 1 9
Når en stor språkmodell skal generere tekst, bruker systemet mye tid på å flytte modellvekter og mellomresultater mellom DRAM og prosessoren. Processing-in-memory, eller PIM, forsøker å redusere denne flaskehalsen ved å utføre utvalgte operasjoner nær minnecellene i stedet for å sende alle operandene over det eksterne minnegrensesnittet. Samsung beskriver LPDDR5X-PIM som selskapets første PIM-løsning basert på LPDDR for AI-inferens. 2 9 13
Tilnærmingen er særlig relevant for arbeidslaster som består av mange gjentatte matrise-vektor-operasjoner. I slike tilfeller kan mindre databevegelse være like viktig som flere tradisjonelle beregningsenheter.
Den annonserte konfigurasjonen er en LPDDR5X-pakke på 16 GB. Den består av fire minnebrikker i en JEDEC-kompatibel 561-ball-pakke og opererer med 9 600 Mb/s per pinne. Brikkene deler kommando- og adressesignaler, men har separate datalinjer – en parallell organisering som er typisk for LPDDR-systemer. 9 17
De 16 PIM-blokkene er fordelt på minnebankene. Hver blokk kombinerer to typer maskinvare:
Denne kombinasjonen gjør at minnet kan håndtere mer enn enkel aritmetikk på én datatype. Samsungs tidligere PIM-materiale beskriver også en SIMD-basert flyttallsenhet og plassering av PIM-enheter på banknivå. Det illustrerer den samme hovedideen: spesialisert beregning skal skje så nær dataene som mulig. 9 11
Samsung oppga opptil 614 GB/s samlet intern PIM-båndbredde. Det er ikke den vanlige båndbredden som en vertsprosessor får tilgang til gjennom et konvensjonelt LPDDR5X-grensesnitt. Tallet beskriver den parallelle behandlingen som skjer på tvers av flere minnebanker og PIM-blokker. 1
I Samsungs sammenligning var den interne PIM-båndbredden omtrent åtte ganger høyere enn båndbredden i LPDDR5X-baselinen. Forskjellen er viktig: PIM gir høy intern båndbredde for operasjoner som støttes av maskinvaren, men gjør ikke det eksterne LPDDR-grensesnittet om til en 614 GB/s-forbindelse.
En sentral del av løsningen er Address Align Mode. Tilsvarende operander plasseres på samsvarende adresser i de minnebankene som skal delta. Dermed kan én felles PIM-kommando utløse samme operasjon parallelt i flere banker.
Dette utnytter også hvordan en LPDDR-rang fungerer: De fire brikkene mottar de samme kommando- og adressesignalene samtidig, samtidig som de beholder separate dataveier. 17
Samsung beskriver to driftsmoduser:
Avveiningen avhenger av arbeidslasten. Flere aktive banker kan gi høyere gjennomstrømning, men etterlater samtidig færre banker tilgjengelig for vanlige minneaksesser. PIM fungerer derfor best når programvaren, tensoroppsettet og beregningskjernene er tilpasset minnets bankstruktur – ikke som en usynlig, generell akselerator som bare kobles inn uten videre.
På en edge-AI-SoC som kjørte inferens med Llama 3.1 8B, rapporterte Samsung følgende sammenlignet med vanlig LPDDR5X:
Dette er resultater fra én bestemt Samsung-konfigurasjon, ikke en universell ytelsesfaktor. Den faktiske gevinsten vil blant annet avhenge av modellens presisjon, tensorplassering, batchstørrelse, minnekapasitet, programvarestøtte og hvor stor del av arbeidslasten som består av GEMV-lignende operasjoner.
Samsung trakk også frem lavere strømforbruk som en arkitektonisk fordel ved å redusere datatrafikken mellom minnet og SoC-en. Materialet som er tilgjengelig her, dokumenterer imidlertid ikke et uavhengig verifisert tall for watt per inferens eller joule per token. Strømfordelen bør derfor forstås som et designmål og en forventet fordel for egnede arbeidslaster – ikke som en publisert prosentvis reduksjon.
HBM er fortsatt det sterkeste alternativet når en akselerator trenger maksimal ekstern minnebåndbredde, særlig i storskala trening og avanserte datasenterløsninger. Ytelsen kommer med en kostnad i form av stablede DRAM-brikker, gjennomgående silisiumforbindelser, avansert pakking og betydelige krav til areal og kjøling. På Hot Chips beskrev Micron hvordan HBM får en stadig større arealulempe sammenlignet med DDR5. I selskapets sammenligning krevde en HBM-konstruksjon med samme kapasitet omtrent tre ganger så stort waferareal.
Samsung gjør et annet kompromiss. LPDDR5X-PIM beholder den kompakte lavstrømsprofilen til LPDDR-minne og legger begrenset beregningskapasitet nær minnebankene. Løsningen kan ikke tilby HBM-båndbredde for generell akseleratorbruk, men kan være interessant når hovedproblemet er å flytte data under inferens – ikke å levere høyest mulig flyttallsytelse.
Det gir teknologien et mer avgrenset bruksområde:
Den mest presise beskrivelsen er derfor at LPDDR5X-PIM kan supplere HBM eller være et kostnadsfølsomt alternativ i utvalgte inferensarbeidslaster – ikke at teknologien erstatter HBM over hele linjen.
Samsung hadde allerede vist frem LPDDR5X-PIM under FMS 2026. Hot Chips-presentasjonen ga en mer detaljert gjennomgang av arkitekturen og ytelsen. Konferanseprogrammet oppførte Samsungs innlegg som en egen presentasjon i minnesesjonen, med fokus på LPDDR-basert PIM for AI-inferens. 9 13
Retningen Samsung beskriver, handler om å gjøre PIM mer anvendelig i lavstrømsminne – ikke bare i spesialiserte HBM-eksperimenter. Selskapets langsiktige plan for LPDDR6-PIM er også knyttet til standardisering, men det tilgjengelige materialet dokumenterer ikke en ferdig JEDEC-spesifikasjon eller en dato for godkjenning.
DeepX har sagt at selskapet planlegger å bruke Samsungs LPDDR5X-PIM i andre generasjon av DX-M2-brikken, og retter blikket mot LPDDR6-PIM for en senere DX-M3-design. 15
Samsungs presentasjon fant sted i samme minnesesjon på Hot Chips som XCENAs MX1, men teknologiene befinner seg på ulike nivåer i systemet.
XCENA MX1 er en CXL Type 3-enhet for beregningsminne rettet mot infrastruktur på racknivå. Den kombinerer opptil 2 TB DDR5-kapasitet, SSD-støttet kapasitet og mer enn 1 000 RISC-V-kjerner for behandling nær minnet. 4 10
LPDDR5X-PIM integrerer på sin side et mindre sett med spesialiserte beregningsenheter direkte i LPDDR-minnet. Begge løsningene forsøker å redusere datatrafikken mellom vertssystemet og minnet, men MX1 er en tilkoblet CXL-enhet for servere, mens Samsungs løsning er en lavstrømspakke som skal sitte nær en SoC eller et annet system med LPDDR-lignende minne.
Samsungs Hot Chips 2026-presentasjon viser LPDDR5X-PIM som et målrettet svar på minneflaskehalsen i AI-inferens. De 16 prosesseringsblokkene, banknivå-parallelliteten, MAC-trærne og ALU-ene for flere datatyper kan holde utvalgte beregninger nær dataene. Samtidig beholder pakken LPDDR5X-formfaktoren og et driftspunkt på 9 600 Mb/s per pinne. 9
Resultatene for Llama 3.1 8B er lovende, men bør leses som leverandørens egne, arbeidslastspesifikke tester. Den større betydningen ligger i strategien: Samsung forsøker å utvide PIM til lavstrømsminne som kan brukes i mobiltelefoner, klientmaskiner, edge-systemer og enkelte servere – mens HBM fortsatt reserveres for arbeidslaster som faktisk trenger den langt høyere, generelle båndbredden.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Samsung sier LPDDR5X PIM reduserte inferenstiden for Llama 3.1 8B med 2,28 ganger og økte gjennomstrømningen av tokens med 3,01 ganger mot vanlig LPDDR5X.
Samsung sier LPDDR5X PIM reduserte inferenstiden for Llama 3.1 8B med 2,28 ganger og økte gjennomstrømningen av tokens med 3,01 ganger mot vanlig LPDDR5X. Den 16 GB store pakken med fire minnebrikker har 16 PIM blokker, parallelle MAC trær samt flyttalls og heltalls ALU er som skal redusere datatrafikken mellom minnet og prosessoren.
614 GB/s er samlet intern PIM båndbredde for støttede operasjoner – ikke den eksterne båndbredden fra en vanlig LPDDR5X kanal.