A nova Hexagon NPU recebe o Element Accelerator para transformers, 50% mais memória compartilhada e suporte a contextos de até 32 mil tokens. A Qualcomm afirma que modelos INT4 podem ter prefill até 50% mais rápido — uma medida da preparação do prompt, não necessariamente da velocidade de geração final.
Publicado porEditado com GPT-5.6 TerraImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did Qualcomm reveal on September 9, 2026 about the redesigned Hexagon NPU in its next-generation premium Snapdragon mobile platform—inc. Article summary: Qualcomm’s September 9 preview positioned its next premium Snapdragon platform as an on-device “agentic AI” design, not merely a faster phone chip. The redesigned Hexagon NPU adds dedicated transformer hardware and more . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
A Qualcomm quer que a próxima geração de celulares premium faça mais tarefas de inteligência artificial sem depender da nuvem. Em prévia divulgada em 9 de setembro, a empresa apresentou uma NPU Hexagon redesenhada para lidar com IA generativa, multimodal e baseada em agentes diretamente no aparelho — inclusive em interações mais longas e com várias tarefas em andamento. 1
O destaque é uma combinação de hardware voltado a modelos de linguagem, mais memória próxima ao processador e suporte a contextos de até 32 mil tokens. Na prática, isso pode permitir que um modelo mantenha uma parcela maior de uma conversa, documento ou histórico de tarefa durante uma sessão local.
A nova NPU inclui o Element Accelerator, um bloco dedicado a cargas de trabalho de transformers. Essa família de modelos está por trás de sistemas generativos de texto e de muitas ferramentas multimodais. O acelerador não substitui os recursos já existentes: ele trabalha ao lado das unidades de processamento escalar, vetorial e tensorial. 1
11
A Qualcomm também afirma que a memória compartilhada da NPU está 50% maior que na geração anterior. A finalidade é manter dados de modelo usados com frequência mais perto da NPU, evitando buscas repetidas na memória principal enquanto um agente de IA lida com contexto extenso, ferramentas e tarefas simultâneas. A empresa ainda não divulgou a capacidade absoluta dessa memória compartilhada. 1
5
Segundo a Qualcomm, a arquitetura atualizada suporta contextos de até 32.000 tokens e traz aceleração de cache chave-valor (key-value cache, ou KV cache). Para o usuário, um contexto maior significa que o modelo pode reter mais informações relevantes de uma conversa ou de um conteúdo analisado no próprio celular. 11
12
A companhia ainda promete prefill até 50% mais rápido em modelos INT4. O prefill é a etapa inicial em que o modelo lê o prompt e prepara seu contexto de trabalho antes de começar a responder. Portanto, o número não equivale automaticamente a respostas 50% mais rápidas, token por token, em todo aplicativo ou modelo. A NPU aceita formatos de precisão entre INT2, INT4, INT8, FP8 e FP16. 1
6
A Qualcomm cita suporte a modelos Mixture-of-Experts (MoE) com até 30 bilhões de parâmetros no total. No exemplo apresentado, aproximadamente 3 bilhões de parâmetros são ativados por token. 6
Essa diferença é essencial. Em um modelo MoE, um mecanismo de roteamento escolhe apenas uma parte dos especialistas do modelo para cada token ou tarefa. Assim, a afirmação não significa que o smartphone processará os 30 bilhões de parâmetros a cada token. A viabilidade depende dessa ativação seletiva, do modelo usado, da implementação e da configuração do dispositivo. 1
13
A apresentação da Hexagon complementa prévias da Qualcomm para a CPU e a GPU da próxima plataforma Snapdragon. A CPU Oryon de oito núcleos terá dois núcleos Prime de até 5 GHz e seis núcleos Performance. A arquitetura FlexCache permite que núcleos heterogêneos acessem um mesmo conjunto de cache com alocação dinâmica. 21
22
Na parte gráfica, a empresa anunciou os Adreno Matrix Cores e 18 MB de Adreno High Performance Memory. A tecnologia Adreno Neural Fusion reúne processamento neural, super-resolução por IA e geração de quadros no pipeline gráfico. A Qualcomm diz que ela pode reduzir o consumo de energia em até 40% em cargas de renderização compatíveis; trata-se de uma alegação da fabricante, não de um resultado de benchmark independente. 17
23
A estratégia, portanto, é distribuir a IA local entre três motores especializados:
A mensagem da Qualcomm não é que todo recurso de IA de um celular passará pela NPU. CPU, GPU e NPU são apresentados como componentes complementares, que fabricantes podem combinar em diferentes partes de uma experiência de IA executada no aparelho.
As divulgações são prévias de arquitetura, e não a ficha técnica completa da plataforma. O Snapdragon Summit está marcado para os dias 22 a 24 de setembro, em Maui, no Havaí. 31
Até lá, os dados devem ser lidos como uma indicação de rumo tecnológico. A Qualcomm não revelou a capacidade absoluta da memória compartilhada da NPU nem apresentou resultados completos e verificáveis de forma independente sobre desempenho e eficiência. 5 Os anúncios finais mostrarão como esses recursos serão configurados nos produtos Snapdragon e, principalmente, como chegarão aos celulares vendidos ao público.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A nova Hexagon NPU recebe o Element Accelerator para transformers, 50% mais memória compartilhada e suporte a contextos de até 32 mil tokens.
A nova Hexagon NPU recebe o Element Accelerator para transformers, 50% mais memória compartilhada e suporte a contextos de até 32 mil tokens. A Qualcomm afirma que modelos INT4 podem ter prefill até 50% mais rápido — uma medida da preparação do prompt, não necessariamente da velocidade de geração final.
O exemplo de modelo com 30 bilhões de parâmetros usa Mixture of Experts: cerca de 3 bilhões de parâmetros são ativados por token.