La nueva NPU Hexagon añade un Element Accelerator para modelos transformer y aumenta un 50% su memoria compartida. Qualcomm afirma que admitirá contextos de hasta 32.000 tokens y un prefill hasta un 50% más rápido en modelos INT4.
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Qualcomm reveal on September 9, 2026 about the redesigned Hexagon NPU in its next-generation premium Snapdragon mobile platform—inc. Article summary: Qualcomm’s September 9 preview positioned its next premium Snapdragon platform as an on-device “agentic AI” design, not merely a faster phone chip. The redesigned Hexagon NPU adds dedicated transformer hardware and more . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Qualcomm ha anticipado el rediseño de su próxima NPU Hexagon para plataformas Snapdragon premium, con una prioridad clara: ejecutar en el propio teléfono tareas de IA generativa y agentes de IA que mantienen conversaciones más largas, usan varias herramientas o trabajan con información multimodal. Las dos novedades centrales son un acelerador especializado para transformers y un aumento del 50% en la memoria compartida de la NPU. 1
La nueva NPU incorpora el Element Accelerator, un bloque dedicado a operaciones de modelos transformer, la arquitectura que sustenta buena parte de los modelos de lenguaje y sistemas de IA generativa y multimodal actuales. No sustituye a las unidades ya existentes: se suma a los recursos de procesamiento escalar, vectorial y tensorial de Hexagon. 1
11
Qualcomm también indica que la memoria compartida de la NPU será un 50% mayor que en el diseño anterior. El propósito es mantener cerca del acelerador los datos del modelo que se consultan con frecuencia, reduciendo accesos repetidos a la memoria principal mientras el agente gestiona contextos extensos, herramientas y tareas simultáneas. La compañía todavía no ha comunicado la capacidad absoluta de esa memoria. 1
5
Según Qualcomm, la arquitectura revisada soporta contextos de hasta 32.000 tokens e incluye aceleración de la caché clave-valor, o KV cache. En la práctica, un contexto más amplio permite a un modelo conservar más partes de una conversación, documento o historial de trabajo durante una sesión local en el dispositivo. 11
12
La empresa también habla de un prefill hasta un 50% más rápido para modelos INT4. El prefill es la etapa inicial en la que el modelo procesa el mensaje del usuario y prepara el contexto de trabajo antes de empezar a generar la respuesta. Por tanto, esa cifra no equivale necesariamente a una generación de texto un 50% más rápida en todas las aplicaciones o modelos. La NPU admite formatos desde INT2 hasta FP16, incluidos INT4, INT8 y FP8. 1
6
Qualcomm destaca la posibilidad de ejecutar modelos Mixture-of-Experts (MoE, o mezcla de expertos) de hasta 30.000 millones de parámetros. Sin embargo, su ejemplo activa aproximadamente 3.000 millones de parámetros por token. 6
La diferencia es importante. En un modelo MoE, un sistema de enrutamiento selecciona solo una parte de sus componentes para cada token o tarea. Es decir, el anuncio no significa que el teléfono procese los 30.000 millones de parámetros en cada token: depende de esa activación selectiva, así como del modelo concreto, su implementación y la configuración del dispositivo. 1
13
El adelanto de Hexagon se integra en la presentación gradual de la próxima plataforma Snapdragon. Qualcomm ya había anunciado una CPU Oryon de ocho núcleos, con dos núcleos Prime que alcanzan los 5 GHz y seis núcleos Performance. Su diseño FlexCache permite que núcleos heterogéneos accedan a una reserva de caché compartida que se asigna dinámicamente según la carga de trabajo. 21
22
En gráficos, la compañía ha presentado los Adreno Matrix Cores y 18 MB de Adreno High Performance Memory. La tecnología Adreno Neural Fusion combina procesamiento neuronal, superresolución mediante IA y generación de fotogramas dentro de la canalización gráfica. Qualcomm asegura que puede reducir el consumo energético hasta un 40% en las cargas de renderizado compatibles; se trata de una afirmación del fabricante, no de un resultado verificado de forma independiente. 17
23
El enfoque es, por tanto, heterogéneo:
La conclusión no es que todas las funciones de IA vayan a utilizar la NPU. Qualcomm plantea CPU, GPU y NPU como motores complementarios que los fabricantes podrán combinar de acuerdo con cada experiencia en el dispositivo.
Estos anuncios son adelantos de arquitectura, no las especificaciones completas de una plataforma Snapdragon. El Snapdragon Summit de Qualcomm está previsto del 22 al 24 de septiembre en Maui, Hawái. 31
Hasta entonces, conviene considerar estas cifras como una indicación de rumbo técnico, no como una comparativa completa de rendimiento. Qualcomm no ha detallado la capacidad absoluta de la memoria compartida ni ha publicado resultados integrales e independientes sobre rendimiento y eficiencia de la nueva NPU. 5 Los anuncios finales determinarán cómo se configuran estas capacidades en productos Snapdragon concretos y cómo llegan, finalmente, a los teléfonos comerciales.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
La nueva NPU Hexagon añade un Element Accelerator para modelos transformer y aumenta un 50% su memoria compartida.
La nueva NPU Hexagon añade un Element Accelerator para modelos transformer y aumenta un 50% su memoria compartida. Qualcomm afirma que admitirá contextos de hasta 32.000 tokens y un prefill hasta un 50% más rápido en modelos INT4.
El reclamo de modelos de 30.000 millones de parámetros se refiere a arquitecturas Mixture of Experts: se activarían unos 3.000 millones de parámetros por token.