Samsung podał, że LPDDR5X PIM skróciła czas inferencji modelu Llama 3.1 8B 2,28 raza i zwiększyła przepustowość tokenów 3,01 raza względem konwencjonalnej LPDDR5X. W pakiecie o pojemności 16 GB, złożonym z czterech kości DRAM, umieszczono 16 bloków PIM.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Samsung reveal about its LPDDR5X-PIM processing-in-memory technology at Hot Chips 2026—including how its 16 in-DRAM processing bloc. Article summary: Samsung positioned LPDDR5X-PIM as an LPDDR5X-compatible, inference-oriented memory architecture that moves repeated vector/matrix work into DRAM. Its headline claim is not that it replaces HBM in top-end GPU training, bu. Topic tags: general, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Samsung wykorzystał konferencję Hot Chips 2026, aby dokładniej wyjaśnić działanie pamięci LPDDR5X-PIM — rozwiązania, które dodaje wyspecjalizowane obliczenia bezpośrednio do energooszczędnej pamięci DRAM. Konstrukcja łączy 16 bloków przetwarzania w pamięci, równoległe drzewa operacji MAC oraz jednostki arytmetyczne obsługujące liczby zmiennoprzecinkowe i całkowite. Wszystko mieści się w pakiecie LPDDR5X o pojemności 16 GB.
W teście układu edge AI z modelem Llama 3.1 8B Samsung odnotował 2,28-krotne skrócenie czasu inferencji i 3,01-krotnie większą przepustowość tokenów. Są to jednak wyniki przedstawione przez producenta dla konkretnej konfiguracji, a nie uniwersalny mnożnik wydajności potwierdzony niezależnym testem. 1 9
Podczas inferencji dużych modeli językowych procesor często nie jest ograniczany wyłącznie mocą obliczeniową. Dużo czasu zajmuje także przenoszenie wag modelu, aktywacji i wyników pośrednich między pamięcią DRAM a procesorem.
Technologia Processing-in-Memory (PIM) ma zmniejszyć ten narzut. Zamiast przesyłać każdy operand do zewnętrznego układu obliczeniowego, pamięć wykonuje część operacji bezpośrednio przy swoich bankach. Samsung opisuje LPDDR5X-PIM jako pierwsze rozwiązanie PIM oparte na pamięci LPDDR przeznaczone do inferencji AI. 2 9 13
Podejście to jest szczególnie interesujące w zadaniach zdominowanych przez powtarzalne operacje macierz-wektor, takie jak GEMV. W takich obciążeniach ograniczenie ruchu danych może dać większą korzyść niż samo dodawanie kolejnych klasycznych jednostek obliczeniowych.
Zapowiedziana konfiguracja obejmuje pakiet LPDDR5X o pojemności 16 GB. Wykorzystuje on cztery kości DRAM, standardowy dla LPDDR układ 561 wyprowadzeń zgodny z organizacją JEDEC oraz szybkość 9600 Mb/s na wyprowadzenie. Cztery kości współdzielą sygnały poleceń i adresów, ale korzystają z oddzielnych linii danych, co odpowiada równoległej organizacji stosowanej w systemach LPDDR5. 9 17
W pakiecie rozmieszczono 16 bloków PIM, powiązanych z bankami pamięci. Każdy z nich zawiera dwa główne typy sprzętu:
Taka heterogeniczna konstrukcja pozwala pamięci obsługiwać więcej niż proste działania na jednym typie danych. Wcześniejsze materiały Samsunga dotyczące PIM opisywały również jednostki SIMD do obliczeń zmiennoprzecinkowych oraz umieszczanie jednostek PIM na poziomie banków. Pokazuje to szerszą strategię lokowania wyspecjalizowanych obliczeń możliwie blisko danych. 9 11
Samsung podał wartość do 614 GB/s wewnętrznej, zagregowanej przepustowości PIM. Nie jest to przepustowość dostępna procesorowi przez zwykły, zewnętrzny interfejs LPDDR5X. Wartość odnosi się do równoległego przetwarzania realizowanego wewnątrz wielu banków i bloków PIM. 1
W porównaniu przedstawionym przez Samsunga wewnętrzna przepustowość PIM była około ośmiokrotnie wyższa od konwencjonalnej przepustowości LPDDR5X użytej jako punkt odniesienia. Kluczowa różnica polega na tym, że PIM udostępnia dodatkową przepustowość wewnątrz pamięci dla obsługiwanych operacji. Nie zamienia natomiast zewnętrznego łącza LPDDR w interfejs o przepustowości 614 GB/s.
Istotnym elementem rozwiązania jest tryb Address Align Mode. Odpowiadające sobie operandy są umieszczane pod zgodnymi adresami w uczestniczących bankach. Dzięki temu wspólne polecenie PIM może uruchomić tę samą operację równolegle w wielu bankach.
Jest to możliwe między innymi dlatego, że cztery kości w randze LPDDR otrzymują wspólne sygnały poleceń i adresów oraz pracują synchronicznie, zachowując jednocześnie osobne ścieżki danych. 17
Samsung opisał dwa tryby działania:
Kompromis zależy od charakterystyki zadania. Większa liczba aktywnych banków może poprawić przepustowość, ale jednocześnie ogranicza liczbę banków dostępnych w danym momencie dla standardowych operacji pamięci. PIM nie jest więc całkowicie niewidocznym dla oprogramowania akceleratorem typu „plug and play”. Najlepsze rezultaty wymagają dopasowania układu tensorów, oprogramowania i jąder obliczeniowych do organizacji banków pamięci.
Na układzie edge AI uruchamiającym model Llama 3.1 8B Samsung porównał LPDDR5X-PIM ze standardową pamięcią LPDDR5X. Firma podała:
Rezultatów tych nie należy interpretować jako gwarantowanego przyspieszenia każdego modelu AI. Wydajność będzie zależeć między innymi od precyzji modelu, sposobu rozmieszczenia tensorów, rozmiaru partii, pojemności pamięci, obsługi programowej oraz tego, jaka część obciążenia składa się z operacji podobnych do GEMV.
Samsung wskazuje także na potencjalnie niższe zużycie energii, ponieważ mniej danych musi być przesyłanych między pamięcią a układem SoC. Dostępne materiały nie przedstawiają jednak porównywalnego, niezależnie zweryfikowanego wyniku w watach na operację inferencji ani w dżulach na token. Korzyść energetyczną należy więc traktować jako cel architektoniczny i przewidywaną zaletę dla odpowiednich zadań, a nie jako opublikowany procent redukcji poboru mocy.
HBM nadal jest lepszym wyborem, gdy akcelerator potrzebuje maksymalnej zewnętrznej przepustowości pamięci — szczególnie w wielkoskalowym treningu i zaawansowanych zastosowaniach centrów danych. Jej możliwości wynikają z układania kości DRAM w stosy, wykorzystania połączeń TSV, zaawansowanego pakowania oraz wysokich wymagań dotyczących powierzchni krzemu i chłodzenia. Podczas Hot Chips Micron wskazywał, że narzut powierzchni wafla związany z HBM w porównaniu z DDR5 rośnie; w przedstawionym porównaniu konstrukcja HBM o tej samej pojemności wymagała około trzykrotnie większej powierzchni wafla.
Samsung proponuje inny kompromis. LPDDR5X-PIM zachowuje formę energooszczędnej pamięci DRAM i dodaje ograniczone, wyspecjalizowane obliczenia blisko banków. Nie zapewnia ogólnego zastosowania i przepustowości akceleratora HBM, ale może być atrakcyjna tam, gdzie głównym problemem jest przenoszenie danych podczas inferencji, a nie maksymalna liczba operacji zmiennoprzecinkowych.
Potencjalne obszary zastosowań obejmują:
Najtrafniej opisywać LPDDR5X-PIM jako uzupełnienie HBM lub wrażliwą kosztowo alternatywę dla wybranych zadań inferencyjnych, a nie jako uniwersalny zamiennik HBM.
Samsung po raz pierwszy pokazał LPDDR5X-PIM podczas FMS 2026. Sesja Hot Chips dostarczyła bardziej szczegółowego opisu architektury oraz omówienia wyników wydajnościowych. Program konferencji wymieniał prezentację Samsunga jako osobne wystąpienie w sesji poświęconej pamięci i przetwarzaniu PIM opartemu na LPDDR dla inferencji AI. 9 13
Szerszy kierunek rozwoju zakłada uczynienie z PIM bardziej wdrażanej funkcji energooszczędnej pamięci, a nie wyłącznie eksperymentu z wyspecjalizowanymi stosami HBM. Długoterminowe plany Samsunga obejmują także LPDDR6-PIM i ambicje związane ze standaryzacją. Dostępne informacje nie potwierdzają jednak sfinalizowanej specyfikacji JEDEC ani daty jej ratyfikacji.
Firma DeepX zapowiedziała wykorzystanie LPDDR5X-PIM Samsunga w swoim układzie DX-M2 drugiej generacji oraz wskazała LPDDR6-PIM jako kierunek dla późniejszego projektu DX-M3. 15
Prezentacja Samsunga odbyła się w tej samej sesji pamięci Hot Chips co omówienie układu XCENA MX1, ale oba rozwiązania działają na różnych poziomach systemu.
XCENA MX1 to urządzenie obliczeniowej pamięci CXL Type 3 przeznaczone do infrastruktury serwerowej i systemów działających na poziomie całych szaf. Konstrukcja łączy do 2 TB pamięci DDR5, pojemność wspieraną przez SSD oraz ponad 1000 rdzeni RISC-V przeznaczonych do przetwarzania blisko pamięci. 4 10
LPDDR5X-PIM integruje natomiast mniejszy zestaw wyspecjalizowanych jednostek obliczeniowych bezpośrednio z pamięcią LPDDR DRAM. Obie technologie próbują ograniczyć przesyłanie danych między procesorem a pamięcią, ale MX1 jest dołączanym przez CXL urządzeniem serwerowym, podczas gdy rozwiązanie Samsunga stanowi energooszczędny pakiet pamięci przeznaczony do pracy blisko SoC lub w systemie wykorzystującym pamięć typu LPDDR.
Prezentacja z Hot Chips 2026 pokazuje LPDDR5X-PIM jako ukierunkowaną odpowiedź na problem wąskiego gardła pamięci w inferencji AI. Szesnaście bloków przetwarzania, równoległość na poziomie banków, drzewa MAC oraz jednostki ALU obsługujące różne typy danych pozwalają wykonywać wybrane operacje bliżej danych. Jednocześnie pakiet zachowuje formę LPDDR5X i pracuje z szybkością 9600 Mb/s na wyprowadzenie. 9
Wyniki dla Llama 3.1 8B wyglądają obiecująco, ale pozostają firmowym benchmarkiem zależnym od konkretnego obciążenia. Najważniejsze znaczenie LPDDR5X-PIM jest strategiczne: Samsung próbuje rozszerzyć przetwarzanie w pamięci na energooszczędną pamięć, która mogłaby trafić do urządzeń mobilnych, systemów edge, komputerów klienckich oraz wybranych serwerów. HBM pozostaje przy tym rozwiązaniem dla zadań, które rzeczywiście wymagają znacznie większej, ogólnego przeznaczenia przepustowości.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Samsung podał, że LPDDR5X PIM skróciła czas inferencji modelu Llama 3.1 8B 2,28 raza i zwiększyła przepustowość tokenów 3,01 raza względem konwencjonalnej LPDDR5X.
Samsung podał, że LPDDR5X PIM skróciła czas inferencji modelu Llama 3.1 8B 2,28 raza i zwiększyła przepustowość tokenów 3,01 raza względem konwencjonalnej LPDDR5X. W pakiecie o pojemności 16 GB, złożonym z czterech kości DRAM, umieszczono 16 bloków PIM.
LPDDR5X PIM jest kierowana do energooszczędnej inferencji ograniczanej przepustowością i ruchem danych.