Qualcomm voegt aan de volgende Hexagon NPU een transformergerichte Element Accelerator toe, plus 50% meer gedeeld geheugen voor lokale AI taken. De chip ondersteunt volgens Qualcomm contexten tot 32.000 tokens en een tot 50% snellere prefill fase bij INT4 modellen.
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Qualcomm reveal on September 9, 2026 about the redesigned Hexagon NPU in its next-generation premium Snapdragon mobile platform—inc. Article summary: Qualcomm’s September 9 preview positioned its next premium Snapdragon platform as an on-device “agentic AI” design, not merely a faster phone chip. The redesigned Hexagon NPU adds dedicated transformer hardware and more . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Qualcomm wil dat zwaardere generatieve AI-taken steeds vaker rechtstreeks op een smartphone kunnen draaien. De op 9 september getoonde volgende generatie van de Hexagon-NPU — de AI-processor in een toekomstig premium Snapdragon-platform — is daarom ontworpen voor multimodale AI en zogeheten AI-agents: systemen die een langere taak kunnen volgen, hulpmiddelen kunnen gebruiken en stappen achter elkaar uitvoeren. 1
De belangrijkste boodschap: Qualcomm zet niet alleen in op meer rekenkracht, maar ook op het langer lokaal vasthouden van modeldata. Dat moet AI-toepassingen responsiever maken zonder dat iedere stap naar de cloud hoeft.
De NPU krijgt een Element Accelerator, een apart hardwareblok voor transformer-workloads. Transformers vormen de basis van veel taal- en multimodale modellen. De nieuwe eenheid vervangt de bestaande scalar-, vector- en tensorgerichte rekeneenheden niet, maar vult ze aan. 1
11
Daarnaast wordt het gedeelde NPU-geheugen volgens Qualcomm 50% groter. Veelgebruikte modeldata kan zo dichter bij de NPU blijven, waardoor die minder vaak uit het gewone systeemgeheugen hoeft te worden opgehaald. Dat is vooral relevant wanneer een AI-agent met een lange context, meerdere tools of gelijktijdige taken werkt. Qualcomm heeft de absolute omvang van dat geheugen nog niet bekendgemaakt. 1
5
Qualcomm zegt dat de vernieuwde Hexagon-architectuur contexten tot 32.000 tokens ondersteunt en versnelling voor de key-value-cache bevat. Praktisch betekent een grotere context dat een model tijdens een lokale sessie meer van een gesprek, document of eerdere taakstappen kan onthouden. 11
12
Ook claimt Qualcomm een tot 50% snellere prefill voor INT4-modellen. Prefill is de eerste fase waarin een model de ingevoerde prompt verwerkt en zijn werkcontext opbouwt, vóór het antwoord token voor token wordt gegenereerd. Die claim betekent dus niet automatisch dat elk model of elke app vervolgens 50% sneller tekst genereert. De NPU ondersteunt INT2, INT4, INT8, FP8 en FP16. 1
6
Qualcomm noemt ondersteuning voor Mixture-of-Experts-modellen (MoE) met maximaal 30 miljard parameters. In het aangehaalde voorbeeld zijn per token ongeveer 3 miljard parameters actief. 6
Dat onderscheid is cruciaal. Een MoE-model kiest via een routeringsmechanisme slechts een deel van zijn gespecialiseerde onderdelen voor een bepaalde token of taak. De claim houdt daarom niet in dat de telefoon bij ieder token alle 30 miljard parameters berekent. Of dit in de praktijk werkt, hangt af van het specifieke model, de implementatie en de configuratie van het toestel. 1
13
De Hexagon-NPU is onderdeel van een bredere aanpak waarbij CPU, GPU en NPU verschillende taken krijgen. Qualcomm heeft eerder al een komende Oryon-CPU met acht cores aangekondigd: twee Prime-cores tot 5 GHz en zes Performance-cores. Met FlexCache kunnen verschillende CPU-cores een dynamisch toegewezen gedeelde cachepool gebruiken. 21
22
Aan de grafische kant komen er Adreno Matrix Cores en 18 MB Adreno High Performance Memory. Qualcomms Neural Fusion combineert neurale verwerking, AI-superresolutie en framegeneratie in de grafische pijplijn. De fabrikant claimt daarbij voor geschikte renderingworkloads een energiebesparing tot 40%; dat is een leveranciersclaim en geen onafhankelijk benchmarkresultaat. 17
23
In grote lijnen verdeelt Qualcomm het lokale AI-werk als volgt:
De bedoeling is dus niet dat elke AI-functie uitsluitend op de NPU draait. Qualcomm presenteert CPU, GPU en NPU als aanvullende onderdelen die fabrikanten voor verschillende delen van een lokale AI-ervaring kunnen inzetten.
Het gaat vooralsnog om architectuurvooruitblikken, niet om een volledige platformspecificatie. Qualcomm organiseert de Snapdragon Summit van 22 tot en met 24 september in Maui, Hawaï. 31
Tot dan blijven belangrijke vragen open. Zo zijn er geen absolute cijfers over de gedeelde NPU-geheugencapaciteit en ontbreken volledige, onafhankelijk verifieerbare prestaties en efficiëntiemetingen van de nieuwe NPU. 5 Pas de uiteindelijke aankondigingen moeten duidelijk maken hoe deze mogelijkheden in concrete Snapdragon-producten worden geconfigureerd — en wat daarvan in uiteindelijke smartphones merkbaar is.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qualcomm voegt aan de volgende Hexagon NPU een transformergerichte Element Accelerator toe, plus 50% meer gedeeld geheugen voor lokale AI taken.
Qualcomm voegt aan de volgende Hexagon NPU een transformergerichte Element Accelerator toe, plus 50% meer gedeeld geheugen voor lokale AI taken. De chip ondersteunt volgens Qualcomm contexten tot 32.000 tokens en een tot 50% snellere prefill fase bij INT4 modellen.
De claim over modellen met 30 miljard parameters betreft Mixture of Experts modellen, waarvan per token ongeveer 3 miljard parameters actief zijn.