La prossima Hexagon NPU aggiunge l’Element Accelerator per i transformer, il 50% in più di memoria condivisa e supporto a contesti fino a 32.000 token. Qualcomm dichiara un prefill fino al 50% più veloce con modelli INT4: riguarda l’elaborazione iniziale del prompt, non necessariamente la velocità di generazione in...
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Qualcomm reveal on September 9, 2026 about the redesigned Hexagon NPU in its next-generation premium Snapdragon mobile platform—inc. Article summary: Qualcomm’s September 9 preview positioned its next premium Snapdragon platform as an on-device “agentic AI” design, not merely a faster phone chip. The redesigned Hexagon NPU adds dedicated transformer hardware and more . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Qualcomm ha anticipato il 9 settembre la direzione della sua prossima piattaforma Snapdragon di fascia alta: non soltanto prestazioni superiori per gli smartphone, ma IA generativa e agenti IA capaci di lavorare più a lungo direttamente sul dispositivo. Al centro c’è una Hexagon NPU ridisegnata, con hardware dedicato ai transformer e più memoria locale condivisa. 1
La novità principale è l’Element Accelerator, un blocco pensato specificamente per i carichi di lavoro dei transformer, l’architettura alla base di molti modelli linguistici, generativi e multimodali. Non sostituisce le altre risorse della NPU: lavora accanto alle unità scalari, vettoriali e tensoriali già presenti. 1
11
Qualcomm dichiara inoltre un aumento del 50% della memoria condivisa della NPU rispetto al progetto precedente. L’obiettivo è mantenere vicino all’acceleratore lo stato del modello e i dati usati più spesso, evitando accessi ripetuti alla memoria di sistema mentre un agente gestisce contesti più lunghi, strumenti diversi e attività simultanee. L’azienda non ha però indicato la capacità assoluta di questa memoria. 1
5
Secondo Qualcomm, la nuova architettura supporta contesti fino a 32.000 token e accelera la cache chiave-valore, o KV cache. In pratica, un contesto più esteso consente al modello di mantenere in memoria una porzione maggiore di conversazione, documento o cronologia dell’attività durante una sessione eseguita sul telefono. 11
12
L’azienda dichiara anche un prefill fino al 50% più rapido per i modelli INT4. Il prefill è la fase in cui il modello elabora il prompt iniziale e costruisce il contesto di lavoro prima di iniziare a generare la risposta. Non equivale quindi a una promessa di generazione dei token più veloce del 50% in ogni applicazione o con qualunque modello. La NPU supporta i formati INT2, INT4, INT8, FP8 e FP16. 1
6
Qualcomm cita il supporto a modelli Mixture-of-Experts (MoE) con fino a 30 miliardi di parametri totali. Nell’esempio indicato, tuttavia, vengono attivati circa 3 miliardi di parametri per token. 6
La differenza è rilevante: in un modello MoE, un meccanismo di instradamento seleziona soltanto una parte degli “esperti” del modello per ciascun token o compito. Questo non significa quindi che lo smartphone elabori tutti i 30 miliardi di parametri a ogni token; la fattibilità dipende dall’attivazione selettiva, dal modello adottato, dall’implementazione e dalla configurazione del dispositivo. 1
13
L’annuncio della NPU completa le anticipazioni Qualcomm su CPU e GPU della prossima piattaforma. La CPU Oryon a otto core avrà due core Prime fino a 5 GHz e sei core Performance. Con l’architettura FlexCache, core CPU eterogenei possono accedere a un pool di cache condiviso allocato dinamicamente in base al carico di lavoro. 21
22
Sul versante grafico, Qualcomm ha presentato gli Adreno Matrix Cores e 18 MB di Adreno High Performance Memory. La tecnologia Adreno Neural Fusion integra elaborazione neurale, super-risoluzione IA e generazione dei fotogrammi nella pipeline grafica. Qualcomm parla di un risparmio energetico fino al 40% nei carichi di rendering compatibili: è un dato dichiarato dal produttore, non un risultato verificato da benchmark indipendenti. 17
23
Il messaggio complessivo è un’IA locale distribuita tra componenti diversi:
Non significa che ogni funzione IA di uno smartphone verrà eseguita dalla NPU. Qualcomm descrive CPU, GPU e NPU come motori complementari, che i produttori potranno impiegare per parti differenti dell’esperienza sul dispositivo.
Quelle diffuse finora sono anticipazioni architetturali, non la scheda tecnica completa della piattaforma. Lo Snapdragon Summit è in programma dal 22 al 24 settembre a Maui, nelle Hawaii. 31
Fino a quell’evento, i dati vanno letti soprattutto come indicazione della strategia tecnica di Qualcomm. Restano ignoti, tra l’altro, la capacità assoluta della memoria condivisa e risultati completi e verificabili in modo indipendente su prestazioni ed efficienza della nuova NPU. 5 Gli annunci finali chiariranno inoltre come queste capacità saranno configurate nei prodotti Snapdragon effettivi e quanto incideranno sugli smartphone in commercio.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
La prossima Hexagon NPU aggiunge l’Element Accelerator per i transformer, il 50% in più di memoria condivisa e supporto a contesti fino a 32.000 token.
La prossima Hexagon NPU aggiunge l’Element Accelerator per i transformer, il 50% in più di memoria condivisa e supporto a contesti fino a 32.000 token. Qualcomm dichiara un prefill fino al 50% più veloce con modelli INT4: riguarda l’elaborazione iniziale del prompt, non necessariamente la velocità di generazione in ogni app.
Il riferimento a modelli MoE da 30 miliardi di parametri va letto con cautela: nell’esempio vengono attivati circa 3 miliardi di parametri per token.