Le futur NPU Hexagon de Qualcomm ajoute un Element Accelerator dédié aux modèles transformers, 50 % de mémoire partagée supplémentaire et la prise en charge de contextes allant jusqu’à 32 000 tokens. Qualcomm annonce jusqu’à 50 % de préremplissage plus rapide pour les modèles INT4 ; cette mesure concerne le traiteme...
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Qualcomm reveal on September 9, 2026 about the redesigned Hexagon NPU in its next-generation premium Snapdragon mobile platform—inc. Article summary: Qualcomm’s September 9 preview positioned its next premium Snapdragon platform as an on-device “agentic AI” design, not merely a faster phone chip. The redesigned Hexagon NPU adds dedicated transformer hardware and more . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Qualcomm a présenté, le 9 septembre, les grandes lignes d’un NPU Hexagon repensé pour sa prochaine plateforme Snapdragon haut de gamme. L’objectif affiché : faire tourner sur le smartphone des usages d’IA générative et des « agents » capables de conserver davantage de contexte, d’utiliser plusieurs outils et de traiter des tâches simultanées. 1
L’enjeu est de limiter les allers-retours avec le cloud pour certains traitements, tout en améliorant la réactivité des fonctions d’IA exécutées localement.
La principale nouveauté est l’Element Accelerator, un bloc matériel conçu pour accélérer les charges de travail liées aux transformers. Ces modèles constituent la base de nombreux systèmes d’IA générative, notamment les assistants conversationnels et les modèles multimodaux. Cet accélérateur ne remplace pas les unités existantes : il vient compléter les ressources de calcul scalaires, vectorielles et tensorielles du NPU. 1
11
Qualcomm annonce aussi 50 % de mémoire partagée supplémentaire par rapport à la génération précédente. L’idée est de conserver près du NPU les données de modèle les plus fréquemment utilisées, afin de réduire les accès répétés à la mémoire système lors de traitements sur un long contexte ou de l’exécution de plusieurs tâches. Le fabricant n’a toutefois pas communiqué la capacité absolue de cette mémoire. 1
5
Selon Qualcomm, la nouvelle architecture Hexagon prend en charge des contextes allant jusqu’à 32 000 tokens et accélère le cache clé-valeur, ou KV cache. Concrètement, un contexte plus long permet à un modèle de garder davantage d’éléments d’une conversation, d’un document ou d’un historique de tâches durant une session exécutée sur l’appareil. 11
12
Le groupe revendique également un préremplissage jusqu’à 50 % plus rapide pour les modèles INT4. Le préremplissage (prefill) est la phase où le modèle analyse la demande initiale et établit son contexte de travail avant de commencer à générer une réponse. Ce chiffre ne signifie donc pas automatiquement que chaque application produira ses réponses 50 % plus vite, token par token. Le NPU prend en charge les formats de précision INT2, INT4, INT8, FP8 et FP16. 1
6
Qualcomm met en avant la possibilité d’exécuter des modèles Mixture-of-Experts (MoE) totalisant jusqu’à 30 milliards de paramètres. Dans l’exemple donné, environ 3 milliards de paramètres sont activés pour chaque token. 6
La nuance est essentielle : un modèle MoE ne mobilise pas nécessairement toutes ses composantes à chaque étape. Un mécanisme d’acheminement sélectionne seulement une partie des « experts » selon le token ou la tâche. Cela ne revient donc pas à faire tourner l’intégralité de 30 milliards de paramètres pour chaque token sur un téléphone. La faisabilité dépend de l’activation sélective des experts, du modèle utilisé, de son implémentation et de la configuration de l’appareil. 1
13
Cette présentation du NPU s’inscrit dans une série d’avant-premières consacrées aux autres briques de la prochaine plateforme Snapdragon.
Côté processeur, Qualcomm a annoncé un CPU Oryon à huit cœurs comprenant deux cœurs Prime pouvant atteindre 5 GHz et six cœurs Performance. Son architecture FlexCache doit permettre à des cœurs hétérogènes d’accéder à un même pool de cache, alloué dynamiquement selon la charge de travail. 21
22
Côté graphique, Qualcomm a dévoilé les Adreno Matrix Cores, ainsi que 18 Mo d’Adreno High Performance Memory. La technologie Adreno Neural Fusion associe traitement neuronal, super-résolution par IA et génération d’images dans le pipeline graphique. Qualcomm évoque jusqu’à 40 % de réduction de la consommation pour les charges de rendu compatibles ; il s’agit d’une affirmation du constructeur, et non d’un résultat de test indépendant. 17
23
La stratégie décrite est donc celle d’une IA locale répartie entre plusieurs unités :
Autrement dit, Qualcomm ne présente pas le NPU comme l’unique endroit où s’exécutera l’IA d’un smartphone. Les fabricants pourront répartir les traitements entre CPU, GPU et NPU selon les besoins de leurs fonctions embarquées.
Ces annonces restent des aperçus d’architecture, pas la fiche technique complète d’une plateforme. Le Snapdragon Summit est prévu du 22 au 24 septembre à Maui, à Hawaï. 31
D’ici là, les chiffres communiqués doivent être lus comme une orientation technique plutôt que comme un bilan complet des performances. Qualcomm n’a notamment pas donné la capacité précise de la mémoire partagée du NPU, ni publié de mesures indépendantes détaillées sur ses performances et son efficacité énergétique. 5 Les annonces finales permettront de voir comment ces capacités seront intégrées aux puces Snapdragon commerciales, puis aux smartphones qui les adopteront.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Le futur NPU Hexagon de Qualcomm ajoute un Element Accelerator dédié aux modèles transformers, 50 % de mémoire partagée supplémentaire et la prise en charge de contextes allant jusqu’à 32 000 tokens.
Le futur NPU Hexagon de Qualcomm ajoute un Element Accelerator dédié aux modèles transformers, 50 % de mémoire partagée supplémentaire et la prise en charge de contextes allant jusqu’à 32 000 tokens. Qualcomm annonce jusqu’à 50 % de préremplissage plus rapide pour les modèles INT4 ; cette mesure concerne le traitement initial de l’invite, pas nécessairement la vitesse de génération de chaque réponse.
L’exemple d’un modèle à 30 milliards de paramètres concerne une architecture Mixture of Experts : environ 3 milliards de paramètres seraient activés par token, et non l’ensemble du modèle.