Qualcommin seuraava Hexagon NPU saa transformer malleihin suunnatun Element Acceleratorin, 50 % enemmän jaettua muistia sekä tuen enintään 32 000 tokenin konteksteille. Yhtiö lupaa INT4 mallien esitäyttövaiheeseen jopa 50 % nopeutuksen.
JulkaisijaMuokattu mallilla GPT-5.6 TerraKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Qualcomm reveal on September 9, 2026 about the redesigned Hexagon NPU in its next-generation premium Snapdragon mobile platform—inc. Article summary: Qualcomm’s September 9 preview positioned its next premium Snapdragon platform as an on-device “agentic AI” design, not merely a faster phone chip. The redesigned Hexagon NPU adds dedicated transformer hardware and more . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Qualcommin 9. syyskuuta antama ennakkokatsaus kertoo, mihin suuntaan sen seuraava premium-luokan Snapdragon-alusta on menossa: puhelimessa paikallisesti ajettaviin, pitkään kontekstia ylläpitäviin ja useita tietomuotoja käsitteleviin tekoälytyökuormiin. Keskiössä on uudistettu Hexagon-NPU, eli tekoälylaskentaan erikoistunut laskentayksikkö, joka on suunnattu generatiiviselle tekoälylle ja niin sanotuille tekoälyagenteille. 1
Uuden NPU:n merkittävin lisäys on Element Accelerator. Se on transformer-työkuormille tarkoitettu erillinen laskentalohko. Transformer-arkkitehtuuri on monien kieli-, kuva- ja multimodaalisten generatiivisten mallien perusta.
Element Accelerator ei korvaa Hexagonin aiempia skalaari-, vektori- ja tensorilaskennan resursseja, vaan täydentää niitä. Qualcomm pyrkii näin nopeuttamaan juuri sellaisia laskentavaiheita, joita generatiiviset mallit ja agenttimaiset toiminnot tarvitsevat. 1
11
Samalla NPU:n jaetun muistin määrä kasvaa Qualcommin mukaan 50 prosenttia edeltävään ratkaisuun verrattuna. Tarkoitus on pitää usein tarvittavia mallidatoja lähempänä NPU:ta, jolloin niitä ei tarvitse hakea toistuvasti puhelimen järjestelmämuistista. Tästä voi olla hyötyä, kun agentti käsittelee pitkää keskustelua, käyttää useita työkaluja tai suorittaa rinnakkaisia tehtäviä. Yhtiö ei ole kuitenkaan kertonut jaetun muistin absoluuttista kapasiteettia. 1
5
Qualcomm kertoo uuden Hexagon-arkkitehtuurin tukevan enintään 32 000 tokenin kontekstia sekä avain–arvo-välimuistin, eli KV-cachen, kiihdytystä. Käytännössä pidempi konteksti tarkoittaa, että malli voi pitää käsiteltävänään enemmän keskusteluhistoriaa, asiakirjasisältöä tai tehtävän aiempia vaiheita yhden paikallisen istunnon aikana. 11
12
Yhtiö lupaa lisäksi INT4-malleille jopa 50 prosenttia nopeamman prefill-vaiheen. Prefill tarkoittaa alkuvaihetta, jossa malli käsittelee käyttäjän kehotteen ja muodostaa työskentelykontekstinsa ennen vastauksen generointia. Luku ei siis ole yleinen lupaus siitä, että jokainen sovellus tai malli tuottaisi vastauksen tokeneita 50 prosenttia nopeammin.
Tuettuja tarkkuusmuotoja ovat INT2, INT4, INT8, FP8 ja FP16. 1
6
Qualcomm nostaa esiin Mixture-of-Experts-mallit eli MoE-mallit, joiden kokonaisparametrimäärä voi olla jopa 30 miljardia. Yhtiön esimerkissä tokenia kohden aktivoituu kuitenkin noin 3 miljardia parametria. 6
Ero on tärkeä. MoE-mallissa reititysmekanismi valitsee kulloiseenkin tokeniin tai tehtävään vain osan mallin asiantuntijaosista. Väite ei siten tarkoita, että puhelin laskisi jokaisella tokenilla kaikkien 30 miljardin parametrin läpi. Käytännön suorituskyky riippuu käytetystä mallista, toteutuksesta ja laitteen kokoonpanosta. 1
13
Hexagon-NPU ei ole Qualcommin seuraavan alustan ainoa tekoälylaskennan osa. Yhtiö on jo esitellyt tulevan Oryon-suorittimen ja Adreno-grafiikkasuorittimen suuntaa.
Kahdeksanytimisessä Oryon-CPU:ssa on tarkoitus olla kaksi jopa 5 GHz:n Prime-ydintä ja kuusi Performance-ydintä. FlexCache-ratkaisussa erilaiset CPU-ytimet voivat käyttää dynaamisesti jaettavaa välimuistipoolia. 21
22
Adreno-puolelle Qualcomm on kertonut Matrix Core -laskentaytimistä ja 18 megatavun Adreno High Performance Memory -muistista. Neural Fusion yhdistää grafiikkaputkessa neuroverkkolaskennan, tekoälypohjaisen tarkkuuden parannuksen ja ruutujen generoinnin. Qualcomm sanoo tekniikan voivan pienentää virrankulutusta jopa 40 prosenttia soveltuvissa renderöintityökuormissa, mutta kyse on yhtiön omasta väitteestä eikä riippumattomasta mittaustuloksesta. 17
23
Kokonaisuus on heterogeenista paikallista tekoälylaskentaa:
Keskeinen viesti ei ole, että kaikki puhelimen tekoälyominaisuudet suoritettaisiin NPU:lla. Qualcomm esittää CPU:n, GPU:n ja NPU:n toisiaan täydentävinä laskentamoottoreina, joita laitevalmistajat voivat hyödyntää eri osissa käyttökokemusta.
Kyseessä ovat arkkitehtuurin ennakkotiedot, eivät täydelliset alustamäärittelyt. Snapdragon Summit järjestetään Mauilla Havaijilla 22.–24. syyskuuta. 31
Ennen tapahtumaa tiedot kannattaa nähdä ennen kaikkea teknisenä suuntaviivana. Qualcomm ei ole julkaissut uuden NPU:n jaetun muistin tarkkaa kapasiteettia eikä täydellisiä, riippumattomasti varmennettavia suorituskyky- ja energiatehokkuuslukuja. 5 Varsinaiset alustajulkistukset näyttävät, miten ominaisuudet otetaan käyttöön eri Snapdragon-tuotteissa – ja miten ne lopulta näkyvät markkinoille tulevissa puhelimissa.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qualcommin seuraava Hexagon NPU saa transformer malleihin suunnatun Element Acceleratorin, 50 % enemmän jaettua muistia sekä tuen enintään 32 000 tokenin konteksteille.
Qualcommin seuraava Hexagon NPU saa transformer malleihin suunnatun Element Acceleratorin, 50 % enemmän jaettua muistia sekä tuen enintään 32 000 tokenin konteksteille. Yhtiö lupaa INT4 mallien esitäyttövaiheeseen jopa 50 % nopeutuksen. Tämä ei suoraan tarkoita vastaavaa nopeutusta mallin tuottamille vastaustokeneille.
30 miljardin parametrin MoE malliväite perustuu siihen, että esimerkkimallissa aktivoituu noin 3 miljardia parametria tokenia kohden – ei koko mallia kerralla.