Qualcomms forhåndsvisning 9. september peker tydelig mot neste steg for premium-mobiler: KI som kan arbeide over lengre tid direkte på telefonen. Den nye Hexagon NPU-en er laget for generativ og såkalt agentbasert KI, med ny maskinvare for transformermodeller og mer lokalt tilgjengelig minne.
1
For brukeren kan dette på sikt bety KI-funksjoner som holder tråden gjennom lengre samtaler, dokumenter og oppgaver uten at alt nødvendigvis må sendes til en skytjeneste.
Ny akselerator for transformermodeller
Kjernen i oppgraderingen er Element Accelerator, en egen beregningsblokk rettet mot transformermodeller. Denne typen modeller ligger bak mange språkmodeller og multimodale KI-systemer. Akseleratoren erstatter ikke de eksisterende skalar-, vektor- og tensorressursene i NPU-en, men skal fungere sammen med dem.
1
11
Qualcomm sier også at NPU-ens delte minne er 50 prosent større enn i forrige løsning. Hensikten er å beholde modellinformasjon som brukes ofte, nær NPU-en, slik at systemet slipper gjentatte hentinger fra telefonens vanlige arbeidsminne mens en KI-agent håndterer lengre kontekst, flere verktøy eller parallelle oppgaver. Den faktiske minnekapasiteten er foreløpig ikke oppgitt.
1
5
Opptil 32 000 token i kontekst
Ifølge Qualcomm støtter den reviderte Hexagon-arkitekturen kontekstvinduer på opptil 32 000 token, samt akselerasjon av nøkkel-verdi-cache (KV-cache). En større kontekst gjør at modellen kan holde på mer av innholdet i en samtale, et dokument eller en oppgavehistorikk i løpet av en økt på mobilen.
11
12
Selskapet hevder dessuten opptil 50 prosent raskere prefill for INT4-modeller. Prefill er fasen der modellen leser og behandler den første forespørselen for å etablere arbeidskonteksten før den begynner å lage et svar. Tallet er derfor ikke en generell garanti for at alle apper eller modeller vil generere svar-token 50 prosent raskere. NPU-en støtter INT2, INT4, INT8, FP8 og FP16.
1
6
30 milliarder parametere – med et viktig forbehold
Qualcomm løfter fram støtte for Mixture-of-Experts-modeller (MoE) med opptil 30 milliarder parametere totalt. I eksempelet aktiveres omtrent 3 milliarder parametere per token.
6
Det er en vesentlig forskjell. I en MoE-modell velger en rutingsmekanisme bare deler av modellen for hvert token eller hver oppgave. Påstanden betyr altså ikke at en mobiltelefon kjører beregninger på alle 30 milliarder parametere for hvert token. Hvor praktisk dette blir, avhenger av modellen, implementeringen og den konkrete telefonkonfigurasjonen.
1
13
Tre motorer for KI på enheten
NPU-en er den siste av tre store Snapdragon-deler Qualcomm har forhåndsvist. Den kommende Oryon CPU-en får åtte kjerner: to Prime-kjerner på opptil 5 GHz og seks Performance-kjerner. FlexCache skal gi de ulike CPU-kjernene tilgang til en felles cache-pool som fordeles dynamisk etter arbeidsbelastningen.
21
22
På grafikksiden har Qualcomm presentert Adreno Matrix Cores og 18 MB Adreno High Performance Memory. Teknologien Adreno Neural Fusion samler nevrale beregninger, KI-basert oppskalering og bildegenerering i grafikkrørledningen. Qualcomm oppgir opptil 40 prosent lavere strømforbruk for relevante renderingsoppgaver, men dette er selskapets egen påstand og ikke et uavhengig benchmarkresultat.
17
23
Samlet beskriver dette en delt KI-strategi:
- Hexagon NPU: energieffektiv inferens for KI-modeller og agentlignende arbeidsflyter.
- Oryon CPU: generell programkjøring, applogikk og oppgaver som ikke passer godt i en spesialisert akselerator.
- Adreno GPU: parallelle visuelle KI-oppgaver og KI-assistert grafikk.
Poenget er dermed ikke at alle KI-funksjoner i en mobil skal kjøre på NPU-en. Qualcomm legger opp til at mobilprodusentene kan kombinere CPU, GPU og NPU, avhengig av oppgaven.
Det gjenstår fortsatt viktige detaljer
Dette er foreløpig arkitekturforhåndsvisninger, ikke en komplett plattformspesifikasjon. Qualcomm har lagt Snapdragon Summit til 22.–24. september i Maui på Hawaii.
31
Før arrangementet bør både kjøpere og utviklere se opplysningene som en retning heller enn et fullstendig ytelsesbilde. Qualcomm har fortsatt ikke oppgitt absolutt kapasitet for det delte minnet eller publisert komplette, uavhengig verifiserbare resultater for ytelse og energieffektivitet i den nye NPU-en.
5 Først når de endelige Snapdragon-produktene presenteres, blir det tydelig hvordan egenskapene er konfigurert – og hva de faktisk betyr i telefoner som kommer i salg.