Qualcomms nästa Hexagon NPU får en Element Accelerator för transformer modeller, 50 procent större delat minne, stöd för sammanhang på upp till 32 000 token och enligt bolaget upp till 50 procent snabbare INT4 prefill. NPU:n ingår i en strategi med tre beräkningsmotorer: Oryon CPU för allmän beräkning, Adreno GPU fö...
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Qualcomm reveal on September 9, 2026 about the redesigned Hexagon NPU in its next-generation premium Snapdragon mobile platform—inc. Article summary: Qualcomm’s September 9 preview positioned its next premium Snapdragon platform as an on-device “agentic AI” design, not merely a faster phone chip. The redesigned Hexagon NPU adds dedicated transformer hardware and more . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Qualcomm vill att nästa premiumplattform i Snapdragon-familjen ska kunna hantera mer långvariga, multimodala AI-uppgifter direkt i telefonen. I centrum står en omarbetad Hexagon-NPU – en särskild processor för neurala nätverk – som är tänkt för generativ AI och så kallade AI-agenter. De kan exempelvis hålla reda på en längre uppgift, använda flera verktyg och hantera flera delmoment utan att allt måste skickas till molnet. 1
Den tydligaste hårdvaruförändringen är Element Accelerator, ett nytt beräkningsblock inriktat på transformer-arbetslaster. Transformer-modeller är grunden för många generativa språk- och multimodala AI-system. Accelereratorn kompletterar NPU:ns befintliga skalära, vektor- och tensorinriktade beräkningsresurser, snarare än att ersätta dem. 1
11
Qualcomm uppger också att det delade minnet i NPU:n har blivit 50 procent större än i föregående konstruktion. Tanken är att ofta använd modelldata ska kunna ligga närmare NPU:n, så att telefonen inte behöver hämta den upprepade gånger från systemminnet när en AI-agent arbetar med längre sammanhang, verktyg och parallella uppgifter. Företaget har ännu inte angett den faktiska minneskapaciteten. 1
5
Den nya Hexagon-arkitekturen ska enligt Qualcomm klara sammanhang på upp till 32 000 token och har acceleration för key-value-cache, ofta förkortat KV-cache. I praktiken innebär ett större sammanhang att modellen kan behålla mer av innehållet i en konversation, ett dokument eller en uppgiftshistorik under en AI-session direkt på enheten. 11
12
Qualcomm hävdar dessutom upp till 50 procent snabbare prefill för INT4-modeller. Prefill är fasen då modellen bearbetar användarens första instruktion och bygger upp sitt arbetsunderlag innan den börjar generera ett svar. Siffran är alltså inte ett löfte om 50 procent snabbare generering av varje nytt ord eller token i alla appar och modeller. NPU:n stöder format från INT2 och INT4 till INT8, FP8 och FP16. 1
6
Qualcomm lyfter stöd för Mixture-of-Experts-modeller, eller MoE, med upp till 30 miljarder parametrar totalt. I företagets exempel aktiveras ungefär 3 miljarder parametrar per token. 6
Skillnaden är väsentlig. En MoE-modell väljer via en styrmekanism bara ut delar av modellen för en viss token eller uppgift. Påståendet innebär därför inte att telefonen räknar på samtliga 30 miljarder parametrar för varje token. Möjligheten beror på att experter aktiveras selektivt, liksom på den aktuella modellen, implementationen och enhetskonfigurationen. 1
13
NPU-beskedet följer Qualcomms tidigare förhandsvisningar av nästa Oryon-CPU och Adreno-GPU. Den kommande Oryon-processorn har åtta kärnor: två Prime-kärnor på upp till 5 GHz och sex Performance-kärnor. Med FlexCache kan de olika CPU-kärnorna dela på en cache-pool som fördelas dynamiskt efter arbetslast. 21
22
På grafiksidan har Qualcomm presenterat Adreno Matrix Cores och 18 MB Adreno High Performance Memory. Tekniken Neural Fusion kombinerar neurala beräkningar, AI-baserad uppskalning och bildrutegenerering i grafikflödet. Qualcomm säger att tekniken kan minska energiförbrukningen med upp till 40 procent i kompatibla renderingsarbetslaster, men det är ett tillverkarpåstående och inte ett oberoende benchmarkresultat. 17
23
Tillsammans beskriver uppgifterna en heterogen strategi för lokal AI:
Poängen är alltså inte att varje AI-funktion i en telefon ska köras av NPU:n. Qualcomm presenterar CPU, GPU och NPU som kompletterande motorer som telefontillverkare kan använda för olika delar av upplevelsen direkt på enheten.
Hittills handlar det om arkitekturförhandsvisningar, inte om en fullständig plattformsspecifikation. Snapdragon Summit är planerat till den 22–24 september i Maui på Hawaii. 31
Fram till dess bör köpare och utvecklare se beskeden som en teknisk riktning snarare än en komplett bild av prestandan. Qualcomm har ännu inte offentliggjort den absoluta kapaciteten för NPU:ns delade minne eller fullständiga, oberoende verifierbara siffror för prestanda och energieffektivitet. 5 De kommande plattformsbeskeden får visa hur funktionerna konfigureras i faktiska Snapdragon-produkter – och vad de betyder i telefoner som når marknaden.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qualcomms nästa Hexagon NPU får en Element Accelerator för transformer modeller, 50 procent större delat minne, stöd för sammanhang på upp till 32 000 token och enligt bolaget upp till 50 procent snabbare INT4 prefill.
Qualcomms nästa Hexagon NPU får en Element Accelerator för transformer modeller, 50 procent större delat minne, stöd för sammanhang på upp till 32 000 token och enligt bolaget upp till 50 procent snabbare INT4 prefill. NPU:n ingår i en strategi med tre beräkningsmotorer: Oryon CPU för allmän beräkning, Adreno GPU för parallell visuell AI och grafik samt Hexagon för effektiv lokal AI inferens.
Påståendet om modeller med 30 miljarder parametrar gäller Mixture of Experts modeller där omkring 3 miljarder parametrar aktiveras per token – inte alla 30 miljarder samtidigt.