Qualcomm v náhledu z 9. září naznačil, kam míří jeho příští prémiová platforma Snapdragon: k delším multimodálním úlohám generativní AI a AI agentům, které mají fungovat přímo v telefonu. Klíčovou součástí je přepracovaná jednotka Hexagon NPU, tedy specializovaný procesor pro úlohy umělé inteligence.
1
Co se v Hexagon NPU mění
Největší novinkou je Element Accelerator, samostatný blok určený pro výpočty modelů typu transformer. Právě na transformerech stojí velká část současných jazykových i multimodálních generativních modelů. Nový akcelerátor nenahrazuje dosavadní skalární, vektorové a tenzorové výpočetní části NPU, ale doplňuje je.
1
11
Qualcomm zároveň uvádí, že sdílená paměť NPU je proti předchozímu návrhu o 50 % větší. Smyslem je ponechat často používaná data modelu co nejblíže výpočetní jednotce, aby je agent při práci s delším kontextem, nástroji či souběžnými úlohami nemusel opakovaně načítat ze systémové paměti. Její absolutní kapacitu firma zatím nezveřejnila.
1
5
Delší kontext a svižnější začátek odpovědi
Podle Qualcommu nová architektura Hexagon podporuje kontext až 32 000 tokenů a urychluje práci s takzvanou key-value cache. V praxi delší kontext znamená, že si model během jedné lokální relace může držet větší část konverzace, dokumentu nebo historie řešeného úkolu.
11
12
Firma dále slibuje až o 50 % rychlejší prefill u modelů INT4. Prefill je úvodní fáze: model nejprve zpracuje zadání uživatele a připraví si pracovní kontext, teprve potom generuje odpověď. Neznamená to tedy automaticky o 50 % rychlejší vytváření každého dalšího tokenu ve všech aplikacích a modelech. NPU podporuje formáty od INT2, INT4 a INT8 po FP8 a FP16.
1
6
„30 miliard parametrů“ má důležitý háček
Qualcomm zmiňuje podporu modelů Mixture-of-Experts (MoE) s až 30 miliardami parametrů. V uvedeném příkladu se však pro každý token aktivují zhruba 3 miliardy parametrů.
6
To je podstatný rozdíl. MoE model prostřednictvím mechanismu směrování vybírá pro konkrétní token či úkol jen část svých „expertů“. Nejde tedy o to, že by telefon při každém tokenu počítal najednou se všemi 30 miliardami parametrů. Proveditelnost závisí na selektivní aktivaci expertů, konkrétním modelu, jeho implementaci i konfiguraci zařízení.
1
13
NPU je jen jedna část širšího návrhu Snapdragonu
Oznámení NPU navazuje na dřívější ukázky CPU a GPU budoucí platformy. Osmijádrové CPU Oryon má obsahovat dvě hlavní jádra s frekvencí až 5 GHz a šest výkonnostních jader. Architektura FlexCache umožňuje heterogenním CPU jádrům využívat společný fond dynamicky přidělované cache.
21
22
V grafické části Qualcomm představil Adreno Matrix Cores a 18 MB paměti Adreno High Performance Memory. Technologie Neural Fusion spojuje neuronové zpracování, AI superrozlišení a generování snímků přímo v grafickém řetězci. Qualcomm pro vhodné renderovací úlohy uvádí až o 40 % nižší spotřebu; jde ale o tvrzení výrobce, nikoli o nezávisle ověřený výsledek.
17
23
Zveřejněné informace tak popisují rozdělení lokální AI mezi tři vzájemně se doplňující části:
- Hexagon NPU: úsporná inference AI modelů a úlohy ve stylu AI agentů;
- Oryon CPU: běžný výpočet, aplikační logika a úlohy, které se nehodí pro specializovaný akcelerátor;
- Adreno GPU: paralelní vizuální a grafické AI výpočty včetně vykreslování s pomocí AI.
Podstatné je, že ne každá funkce telefonu poběží na NPU. Qualcomm prezentuje CPU, GPU a NPU jako tři různé motory, z nichž výrobci zařízení mohou skládat jednotlivé části lokální AI zkušenosti.
Co zatím nevíme
Jde o představení architektury, nikoli o kompletní specifikace platformy. Snapdragon Summit se má konat 22.–24. září v Maui na Havaji.
31
Do té doby je vhodné brát zveřejněné údaje hlavně jako ukázku technického směru. Qualcomm dosud neprozradil absolutní velikost sdílené paměti ani neposkytl úplné, nezávisle ověřitelné výsledky výkonu a energetické efektivity nové NPU.
5 Teprve finální oznámení ukážou, jak budou tyto schopnosti nastaveny v konkrétních produktech Snapdragon a jak se promítnou do telefonů v prodeji.