Qualcomm vil have mere avanceret AI til at køre direkte på mobilen – også når opgaven kræver en længere samtalehistorik, flere datakilder og gentagne handlinger. Selskabets næste Hexagon-NPU er derfor rettet mod generativ og såkaldt agentisk AI, hvor en model kan arbejde med værktøjer og opgaver lokalt på enheden.
1
Kernen i ændringen er en ny Element Accelerator, der er målrettet transformer-arbejdsbelastninger. Transformer-modeller er grundlaget for mange sprog- og multimodale AI-systemer. Acceleratoren erstatter ikke NPU'ens eksisterende skalar-, vektor- og tensorressourcer, men supplerer dem.
1
11
Mere kontekst uden konstant adgang til systemhukommelsen
Qualcomm siger samtidig, at den delte NPU-hukommelse er blevet 50 % større end i den forrige konstruktion. Tanken er at holde ofte anvendte modeldata tæt på NPU'en, så systemet i mindre grad skal hente data fra telefonens almindelige hukommelse undervejs i en AI-opgave. Det er især relevant, når en agent håndterer lange kontekster, flere værktøjer eller samtidige opgaver. Den præcise mængde delt hukommelse er endnu ikke oplyst.
1
5
Den opdaterede arkitektur understøtter ifølge Qualcomm kontekster på op til 32.000 tokens og acceleration af key-value-cachen. I praksis kan en større kontekst give modellen mulighed for at holde fast i mere af indholdet fra en samtale, et dokument eller en opgavehistorik i samme lokale session.
11
12
Hurtigere start på svaret – ikke nødvendigvis hurtigere tekst hele vejen
Qualcomm oplyser også, at INT4-modeller kan få op til 50 % hurtigere prefill. Prefill er fasen, hvor modellen læser og bearbejder brugerens prompt, før den begynder at generere sit svar. Tallet er derfor ikke det samme som en garanti for, at hvert enkelt efterfølgende token genereres 50 % hurtigere i alle apps og modeller. NPU'en understøtter INT2, INT4, INT8, FP8 og FP16.
1
6
30 milliarder parametre kræver en vigtig fodnote
Et af Qualcomms mest opsigtsvækkende eksempler er understøttelse af Mixture-of-Experts-modeller (MoE) med op til 30 mia. parametre. I selskabets eksempel aktiveres omkring 3 mia. parametre pr. token.
6
Det er en afgørende forskel. En MoE-model vælger kun en del af sine specialiserede delmodeller for hvert token eller hver opgave. Påstanden betyder altså ikke, at en telefon behandler alle 30 mia. parametre for hvert token. Muligheden afhænger af den selektive aktivering, den konkrete model, implementeringen og enhedens konfiguration.
1
13
Tre motorer til lokal AI
NPU'en er den tredje del af Qualcomms forhåndsvisning af den kommende Snapdragon-platform. Oryon-CPU'en får otte kerner: to Prime-kerner med op til 5 GHz og seks Performance-kerner. Med FlexCache kan de forskellige CPU-kerner få adgang til en dynamisk fordelt fælles cache-pulje.
21
22
På grafikdelen har Qualcomm annonceret Adreno Matrix Cores og 18 MB Adreno High Performance Memory. Teknologien Adreno Neural Fusion samler neural behandling, AI-baseret opskalering og frame generation i grafikpipelinen. Qualcomm hævder, at den i relevante renderingsarbejdsbelastninger kan sænke strømforbruget med op til 40 %, men det er selskabets egen oplysning og ikke et uafhængigt benchmark.
17
23
Qualcomms budskab er dermed en arbejdsdeling mellem tre typer beregning:
- Hexagon-NPU: effektiv inferens til AI-modeller og agentlignende opgaver.
- Oryon-CPU: almindelig programafvikling, applikationslogik og opgaver, der ikke passer naturligt til en accelerator.
- Adreno-GPU: parallelt visuelt AI-arbejde og grafikfunktioner som AI-assisteret rendering.
Det betyder ikke, at alle AI-funktioner i en telefon nødvendigvis kører på NPU'en. Qualcomm lægger i stedet op til, at mobilproducenter kan fordele forskellige dele af en lokal AI-oplevelse mellem CPU, GPU og NPU.
Det mangler stadig at blive bekræftet
Der er tale om forhåndsvisninger af arkitekturen, ikke en komplet platformspecifikation. Snapdragon Summit afholdes 22.-24. september i Maui, Hawaii.
31
Indtil da bør oplysningerne ses som en teknisk retning snarere end et fuldt billede af ydelse og energieffektivitet. Qualcomm har endnu ikke opgivet den absolutte kapacitet for den delte NPU-hukommelse eller leveret komplette, uafhængigt verificerbare resultater for den nye NPU.
5 Først de endelige platforme og telefoner vil vise, hvordan funktionerne er konfigureret i praksis.