A Samsung afirma que a LPDDR5X PIM reduziu em 2,28 vezes o tempo de inferência do Llama 3.1 8B e elevou em 3,01 vezes o throughput de tokens, mas os resultados são testes da própria empresa. O pacote de 16 GB e quatro chips reúne 16 blocos PIM junto aos bancos de DRAM, com árvores MAC e unidades ALU para operações e...
Publicado porEditado com GPT-5.6 LunaImagens geradas com GPT Image 1.5
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did Samsung reveal about its LPDDR5X-PIM processing-in-memory technology at Hot Chips 2026—including how its 16 in-DRAM processing bloc. Article summary: Samsung positioned LPDDR5X-PIM as an LPDDR5X-compatible, inference-oriented memory architecture that moves repeated vector/matrix work into DRAM. Its headline claim is not that it replaces HBM in top-end GPU training, bu. Topic tags: general, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
A Samsung detalhou na conferência Hot Chips 2026 como a LPDDR5X-PIM coloca capacidade de processamento diretamente dentro de uma memória DRAM de baixo consumo. A proposta é reduzir o tráfego entre a memória e o processador durante a inferência de modelos de inteligência artificial, um dos principais gargalos de sistemas que precisam gerar respostas rapidamente.
No teste divulgado pela empresa, um SoC de IA de borda executando o Llama 3.1 8B apresentou tempo de inferência 2,28 vezes menor e throughput de tokens 3,01 vezes maior em comparação com uma configuração convencional baseada em LPDDR5X. A Samsung também informou até 614 GB/s de largura de banda interna para operações PIM. Esses números são resultados reportados pela fabricante em uma configuração específica, e não uma avaliação independente abrangente. 1
9
Na inferência de grandes modelos de linguagem, o processador passa boa parte do tempo buscando pesos do modelo e dados intermediários na DRAM. Cada transferência entre memória e SoC consome largura de banda, energia e tempo. Em muitos casos, o problema não é apenas a capacidade de cálculo do processador, mas o custo de movimentar os dados até ele.
PIM, sigla em inglês para Processing-in-Memory, tenta atacar esse gargalo executando determinadas operações ao lado das matrizes de células da memória. Em vez de enviar todos os operandos pela interface externa, a própria DRAM realiza parte dos cálculos e retorna resultados parciais ou processados. A Samsung descreve a LPDDR5X-PIM como sua primeira solução PIM baseada em LPDDR voltada à inferência de IA. 2
9
13
A abordagem é especialmente adequada a cargas dominadas por operações repetitivas de matriz e vetor, como GEMV (General Matrix-Vector multiplication). Nesses casos, diminuir a movimentação de dados pode trazer mais benefício do que simplesmente adicionar unidades convencionais de computação.
A configuração apresentada pela Samsung usa 16 GB de LPDDR5X distribuídos em quatro chips, instalados em um pacote de 561 esferas compatível com o padrão JEDEC. O dispositivo opera a 9.600 Mb/s por pino. Os quatro chips compartilham sinais de comando e endereço, mas utilizam linhas de dados independentes, em uma organização paralela típica da LPDDR5. 9
17
Dentro do pacote, há 16 blocos de processamento distribuídos pelos bancos de DRAM. Cada bloco combina dois tipos principais de hardware:
Essa combinação heterogênea permite que a memória faça mais do que uma operação aritmética simples sobre um único formato numérico. Materiais anteriores da Samsung sobre PIM também descrevem unidades SIMD de ponto flutuante e a colocação dos blocos em nível de banco, reforçando a estratégia de aproximar o processamento dos dados. 9
11
O número de 614 GB/s pode causar confusão. Trata-se da largura de banda agregada interna dos blocos PIM, e não da velocidade disponível para um processador conectado à LPDDR5X por uma interface externa convencional. O valor resulta do trabalho paralelo realizado por vários bancos e unidades de processamento dentro do pacote. 1
Na comparação apresentada pela Samsung, a largura de banda interna do PIM é aproximadamente oito vezes maior que a largura de banda LPDDR5X convencional usada como linha de base. A diferença fundamental é que o PIM expõe esse paralelismo dentro da memória para operações compatíveis. Ele não transforma a interface externa da LPDDR5X em um link de 614 GB/s.
Um dos elementos centrais do projeto é o Address Align Mode, ou modo de alinhamento de endereços. Nele, operandos correspondentes são organizados em endereços equivalentes nos bancos participantes. Assim, um comando PIM compartilhado pode disparar a mesma operação em paralelo em vários bancos.
Esse mecanismo aproveita a forma como os chips de um rank LPDDR trabalham: eles recebem os mesmos comandos e endereços, mas mantêm caminhos de dados separados. Com o layout correto dos tensores, a arquitetura consegue explorar o paralelismo interno sem transformar o pacote em um único canal externo convencional. 17
A Samsung apresentou dois modos de operação:
Há uma troca clara entre os dois modos. Envolver mais bancos pode aumentar o throughput, mas também reduz a quantidade de bancos disponível naquele momento para o tráfego convencional. Por isso, a LPDDR5X-PIM não deve ser vista como um acelerador invisível que funciona sem mudanças no software. O desempenho depende de como os tensores, os kernels e o acesso à memória são mapeados para a estrutura de bancos.
Em um SoC de IA de borda executando inferência com o Llama 3.1 8B, a Samsung reportou os seguintes resultados em relação à LPDDR5X convencional:
A Samsung também aponta menor consumo de energia como uma consequência esperada da redução no deslocamento de dados entre a memória e o SoC. No entanto, o material disponível não apresenta uma medição independente comparável em watts por inferência ou joules por token. Portanto, a vantagem energética deve ser entendida como um objetivo arquitetural e um benefício esperado para cargas adequadas, não como uma redução percentual comprovada. 9
Os ganhos reais podem variar conforme a precisão numérica do modelo, o tamanho do lote, a capacidade de memória, a organização dos tensores, o suporte de software e a proporção da carga formada por operações semelhantes a GEMV.
A HBM continua sendo a opção mais forte quando um acelerador precisa de máxima largura de banda externa, especialmente em treinamento de modelos e cargas de data center de alto desempenho. Seu desempenho depende de DRAM empilhada, vias através do silício, encapsulamento avançado e requisitos significativos de área e controle térmico.
Na Hot Chips, a Micron afirmou que a penalidade de área de wafer da HBM em relação à DDR5 está aumentando. Na comparação apresentada, uma implementação HBM de mesma capacidade exigiria aproximadamente três vezes mais área de wafer.
A Samsung faz uma escolha diferente. A LPDDR5X-PIM preserva o formato de uma DRAM de baixo consumo e acrescenta computação especializada próxima aos bancos. Ela não oferece a largura de banda geral de um acelerador equipado com HBM, mas pode ser interessante quando o principal obstáculo é movimentar dados durante a inferência, e não fornecer o máximo de operações de ponto flutuante.
Os possíveis alvos incluem:
A descrição mais precisa é a de um complemento ou alternativa mais sensível a custo para cargas específicas de inferência — e não de uma substituta universal da HBM.
A Samsung já havia demonstrado a LPDDR5X-PIM na FMS 2026. A apresentação na Hot Chips acrescentou detalhes sobre a arquitetura e os resultados de desempenho; o programa do evento listou a tecnologia em uma sessão dedicada a memória e inferência de IA baseada em LPDDR. 9
13
A direção mais ampla é tornar o processamento na memória uma característica mais fácil de implantar em memórias de baixo consumo, em vez de restringi-lo a experimentos especializados com HBM. A empresa também relaciona sua visão de longo prazo à LPDDR6-PIM e a uma possível padronização, mas as evidências disponíveis não confirmam uma especificação JEDEC finalizada nem uma data de ratificação.
A startup sul-coreana DeepX afirmou que pretende usar a LPDDR5X-PIM da Samsung em seu chip DX-M2 de segunda geração e mira a LPDDR6-PIM para uma geração posterior, o DX-M3. 15
A apresentação da Samsung ocorreu na mesma sessão de memória da XCENA MX1, mas as duas soluções atuam em níveis diferentes do sistema.
A XCENA MX1 é um dispositivo de memória computacional CXL Tipo 3 voltado à infraestrutura de servidores em escala de rack. Seu projeto combina até 2 TB de capacidade DDR5, capacidade apoiada por SSD e mais de 1.000 núcleos RISC-V para processamento próximo à memória. 4
10
Já a LPDDR5X-PIM integra um conjunto menor de unidades especializadas diretamente à DRAM LPDDR. As duas tecnologias tentam reduzir a movimentação de dados entre o processador e a memória, mas a MX1 é um dispositivo CXL conectado ao servidor, enquanto a solução da Samsung é um pacote de memória de baixo consumo pensado para ficar próximo de um SoC ou de outro sistema baseado em LPDDR.
A apresentação da Samsung enquadra a LPDDR5X-PIM como uma resposta direcionada ao gargalo de memória na inferência de IA. Seus 16 blocos de processamento, o paralelismo em nível de banco, as árvores MAC e as ALUs para diferentes formatos numéricos permitem manter determinadas operações próximas dos dados, enquanto o pacote conserva o formato LPDDR5X e a operação de 9.600 Mb/s por pino. 9
Os resultados com o Llama 3.1 8B são promissores, mas devem ser lidos como benchmarks específicos da Samsung. O significado estratégico da tecnologia está em ampliar o PIM para uma memória de baixo consumo que possa atender celulares, dispositivos pessoais, sistemas de borda e alguns servidores.
Em outras palavras, a Samsung não está prometendo substituir a HBM em cargas que precisam de largura de banda geral máxima. A aposta é mais específica: colocar uma quantidade moderada de computação dentro de uma DRAM mais fácil de integrar e usar essa capacidade para reduzir o custo energético e o tempo perdido movendo dados em inferência.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A Samsung afirma que a LPDDR5X PIM reduziu em 2,28 vezes o tempo de inferência do Llama 3.1 8B e elevou em 3,01 vezes o throughput de tokens, mas os resultados são testes da própria empresa.
A Samsung afirma que a LPDDR5X PIM reduziu em 2,28 vezes o tempo de inferência do Llama 3.1 8B e elevou em 3,01 vezes o throughput de tokens, mas os resultados são testes da própria empresa. O pacote de 16 GB e quatro chips reúne 16 blocos PIM junto aos bancos de DRAM, com árvores MAC e unidades ALU para operações em ponto flutuante e inteiras.
A LPDDR5X PIM é apresentada como uma opção de menor consumo e complexidade para inferência limitada pela movimentação de dados — não como substituta da HBM em aceleradores de alto desempenho.
A Samsung afirma que a LPDDR5X PIM reduziu em 2,28 vezes o tempo de inferência do Llama 3.1 8B e elevou em 3,01 vezes o throughput de tokens, mas os resultados são testes da própria empresa. O pacote de 16 GB e quatro chips reúne 16 blocos PIM junto aos bancos de DRAM, com árvores MAC e unidades ALU para operações e...
Publicado porEditado com GPT-5.6 LunaImagens geradas com GPT Image 1.5
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did Samsung reveal about its LPDDR5X-PIM processing-in-memory technology at Hot Chips 2026—including how its 16 in-DRAM processing bloc. Article summary: Samsung positioned LPDDR5X-PIM as an LPDDR5X-compatible, inference-oriented memory architecture that moves repeated vector/matrix work into DRAM. Its headline claim is not that it replaces HBM in top-end GPU training, bu. Topic tags: general, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
A Samsung detalhou na conferência Hot Chips 2026 como a LPDDR5X-PIM coloca capacidade de processamento diretamente dentro de uma memória DRAM de baixo consumo. A proposta é reduzir o tráfego entre a memória e o processador durante a inferência de modelos de inteligência artificial, um dos principais gargalos de sistemas que precisam gerar respostas rapidamente.
No teste divulgado pela empresa, um SoC de IA de borda executando o Llama 3.1 8B apresentou tempo de inferência 2,28 vezes menor e throughput de tokens 3,01 vezes maior em comparação com uma configuração convencional baseada em LPDDR5X. A Samsung também informou até 614 GB/s de largura de banda interna para operações PIM. Esses números são resultados reportados pela fabricante em uma configuração específica, e não uma avaliação independente abrangente. 1
9
Na inferência de grandes modelos de linguagem, o processador passa boa parte do tempo buscando pesos do modelo e dados intermediários na DRAM. Cada transferência entre memória e SoC consome largura de banda, energia e tempo. Em muitos casos, o problema não é apenas a capacidade de cálculo do processador, mas o custo de movimentar os dados até ele.
PIM, sigla em inglês para Processing-in-Memory, tenta atacar esse gargalo executando determinadas operações ao lado das matrizes de células da memória. Em vez de enviar todos os operandos pela interface externa, a própria DRAM realiza parte dos cálculos e retorna resultados parciais ou processados. A Samsung descreve a LPDDR5X-PIM como sua primeira solução PIM baseada em LPDDR voltada à inferência de IA. 2
9
13
A abordagem é especialmente adequada a cargas dominadas por operações repetitivas de matriz e vetor, como GEMV (General Matrix-Vector multiplication). Nesses casos, diminuir a movimentação de dados pode trazer mais benefício do que simplesmente adicionar unidades convencionais de computação.
A configuração apresentada pela Samsung usa 16 GB de LPDDR5X distribuídos em quatro chips, instalados em um pacote de 561 esferas compatível com o padrão JEDEC. O dispositivo opera a 9.600 Mb/s por pino. Os quatro chips compartilham sinais de comando e endereço, mas utilizam linhas de dados independentes, em uma organização paralela típica da LPDDR5. 9
17
Dentro do pacote, há 16 blocos de processamento distribuídos pelos bancos de DRAM. Cada bloco combina dois tipos principais de hardware:
Essa combinação heterogênea permite que a memória faça mais do que uma operação aritmética simples sobre um único formato numérico. Materiais anteriores da Samsung sobre PIM também descrevem unidades SIMD de ponto flutuante e a colocação dos blocos em nível de banco, reforçando a estratégia de aproximar o processamento dos dados. 9
11
O número de 614 GB/s pode causar confusão. Trata-se da largura de banda agregada interna dos blocos PIM, e não da velocidade disponível para um processador conectado à LPDDR5X por uma interface externa convencional. O valor resulta do trabalho paralelo realizado por vários bancos e unidades de processamento dentro do pacote. 1
Na comparação apresentada pela Samsung, a largura de banda interna do PIM é aproximadamente oito vezes maior que a largura de banda LPDDR5X convencional usada como linha de base. A diferença fundamental é que o PIM expõe esse paralelismo dentro da memória para operações compatíveis. Ele não transforma a interface externa da LPDDR5X em um link de 614 GB/s.
Um dos elementos centrais do projeto é o Address Align Mode, ou modo de alinhamento de endereços. Nele, operandos correspondentes são organizados em endereços equivalentes nos bancos participantes. Assim, um comando PIM compartilhado pode disparar a mesma operação em paralelo em vários bancos.
Esse mecanismo aproveita a forma como os chips de um rank LPDDR trabalham: eles recebem os mesmos comandos e endereços, mas mantêm caminhos de dados separados. Com o layout correto dos tensores, a arquitetura consegue explorar o paralelismo interno sem transformar o pacote em um único canal externo convencional. 17
A Samsung apresentou dois modos de operação:
Há uma troca clara entre os dois modos. Envolver mais bancos pode aumentar o throughput, mas também reduz a quantidade de bancos disponível naquele momento para o tráfego convencional. Por isso, a LPDDR5X-PIM não deve ser vista como um acelerador invisível que funciona sem mudanças no software. O desempenho depende de como os tensores, os kernels e o acesso à memória são mapeados para a estrutura de bancos.
Em um SoC de IA de borda executando inferência com o Llama 3.1 8B, a Samsung reportou os seguintes resultados em relação à LPDDR5X convencional:
A Samsung também aponta menor consumo de energia como uma consequência esperada da redução no deslocamento de dados entre a memória e o SoC. No entanto, o material disponível não apresenta uma medição independente comparável em watts por inferência ou joules por token. Portanto, a vantagem energética deve ser entendida como um objetivo arquitetural e um benefício esperado para cargas adequadas, não como uma redução percentual comprovada. 9
Os ganhos reais podem variar conforme a precisão numérica do modelo, o tamanho do lote, a capacidade de memória, a organização dos tensores, o suporte de software e a proporção da carga formada por operações semelhantes a GEMV.
A HBM continua sendo a opção mais forte quando um acelerador precisa de máxima largura de banda externa, especialmente em treinamento de modelos e cargas de data center de alto desempenho. Seu desempenho depende de DRAM empilhada, vias através do silício, encapsulamento avançado e requisitos significativos de área e controle térmico.
Na Hot Chips, a Micron afirmou que a penalidade de área de wafer da HBM em relação à DDR5 está aumentando. Na comparação apresentada, uma implementação HBM de mesma capacidade exigiria aproximadamente três vezes mais área de wafer.
A Samsung faz uma escolha diferente. A LPDDR5X-PIM preserva o formato de uma DRAM de baixo consumo e acrescenta computação especializada próxima aos bancos. Ela não oferece a largura de banda geral de um acelerador equipado com HBM, mas pode ser interessante quando o principal obstáculo é movimentar dados durante a inferência, e não fornecer o máximo de operações de ponto flutuante.
Os possíveis alvos incluem:
A descrição mais precisa é a de um complemento ou alternativa mais sensível a custo para cargas específicas de inferência — e não de uma substituta universal da HBM.
A Samsung já havia demonstrado a LPDDR5X-PIM na FMS 2026. A apresentação na Hot Chips acrescentou detalhes sobre a arquitetura e os resultados de desempenho; o programa do evento listou a tecnologia em uma sessão dedicada a memória e inferência de IA baseada em LPDDR. 9
13
A direção mais ampla é tornar o processamento na memória uma característica mais fácil de implantar em memórias de baixo consumo, em vez de restringi-lo a experimentos especializados com HBM. A empresa também relaciona sua visão de longo prazo à LPDDR6-PIM e a uma possível padronização, mas as evidências disponíveis não confirmam uma especificação JEDEC finalizada nem uma data de ratificação.
A startup sul-coreana DeepX afirmou que pretende usar a LPDDR5X-PIM da Samsung em seu chip DX-M2 de segunda geração e mira a LPDDR6-PIM para uma geração posterior, o DX-M3. 15
A apresentação da Samsung ocorreu na mesma sessão de memória da XCENA MX1, mas as duas soluções atuam em níveis diferentes do sistema.
A XCENA MX1 é um dispositivo de memória computacional CXL Tipo 3 voltado à infraestrutura de servidores em escala de rack. Seu projeto combina até 2 TB de capacidade DDR5, capacidade apoiada por SSD e mais de 1.000 núcleos RISC-V para processamento próximo à memória. 4
10
Já a LPDDR5X-PIM integra um conjunto menor de unidades especializadas diretamente à DRAM LPDDR. As duas tecnologias tentam reduzir a movimentação de dados entre o processador e a memória, mas a MX1 é um dispositivo CXL conectado ao servidor, enquanto a solução da Samsung é um pacote de memória de baixo consumo pensado para ficar próximo de um SoC ou de outro sistema baseado em LPDDR.
A apresentação da Samsung enquadra a LPDDR5X-PIM como uma resposta direcionada ao gargalo de memória na inferência de IA. Seus 16 blocos de processamento, o paralelismo em nível de banco, as árvores MAC e as ALUs para diferentes formatos numéricos permitem manter determinadas operações próximas dos dados, enquanto o pacote conserva o formato LPDDR5X e a operação de 9.600 Mb/s por pino. 9
Os resultados com o Llama 3.1 8B são promissores, mas devem ser lidos como benchmarks específicos da Samsung. O significado estratégico da tecnologia está em ampliar o PIM para uma memória de baixo consumo que possa atender celulares, dispositivos pessoais, sistemas de borda e alguns servidores.
Em outras palavras, a Samsung não está prometendo substituir a HBM em cargas que precisam de largura de banda geral máxima. A aposta é mais específica: colocar uma quantidade moderada de computação dentro de uma DRAM mais fácil de integrar e usar essa capacidade para reduzir o custo energético e o tempo perdido movendo dados em inferência.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A Samsung afirma que a LPDDR5X PIM reduziu em 2,28 vezes o tempo de inferência do Llama 3.1 8B e elevou em 3,01 vezes o throughput de tokens, mas os resultados são testes da própria empresa.
A Samsung afirma que a LPDDR5X PIM reduziu em 2,28 vezes o tempo de inferência do Llama 3.1 8B e elevou em 3,01 vezes o throughput de tokens, mas os resultados são testes da própria empresa. O pacote de 16 GB e quatro chips reúne 16 blocos PIM junto aos bancos de DRAM, com árvores MAC e unidades ALU para operações em ponto flutuante e inteiras.
A LPDDR5X PIM é apresentada como uma opção de menor consumo e complexidade para inferência limitada pela movimentação de dados — não como substituta da HBM em aceleradores de alto desempenho.