Apple přitom svou vlastní AI pro zařízení staví také s ohledem na omezenou paměť a výpočetní výkon telefonů. U jeho on-device modelů se používá mimo jiné řídká architektura, při níž se při jednom výpočtu aktivuje jen část všech parametrů. Podle dostupného srovnání má jeden z novějších modelů Applu přibližně 20 miliard parametrů, ale v daném okamžiku se využívá zhruba 1 až 4 miliardy z nich .
PrismML naopak tvrdí, že u komprimovaného Qwen 3.6 zůstává aktivních všech 27 miliard parametrů . To by mohlo znamenat vyšší kapacitu pro složitější úlohy, aniž by telefon musel pokaždé kontaktovat cloud.
Pro Apple by taková technologie mohla být strategická hned z několika důvodů:
Základem přístupu PrismML jsou takzvané ternární váhy. Každá váha neuronové sítě je omezena na jednu ze tří hodnot: −1, 0 nebo +1. Tím lze zakódovat přibližně 1,58 bitu informace na parametr .
Běžné modely často používají 16bitovou reprezentaci FP16, případně 8bitovou kvantizaci. Ty stále pracují s mnohem širším rozsahem čísel. Ternární model tedy není jen klasický model uložený v menším formátu: jeho síť je navržena tak, aby s výrazně omezenou reprezentací pracovala od začátku.
U běžné komprese se nejdříve vytvoří model s vyšší přesností a teprve poté se jeho váhy převedou do úspornějšího formátu. Tento dodatečný krok může vést ke ztrátě přesnosti nebo schopností.
PrismML tvrdí, že její modely jsou v 1bitové, respektive ternární podobě trénovány nativně od začátku. Kompresní princip tedy podle firmy není pouze „obal“ přidaný až po dokončení modelu, ale součást jeho architektury . Právě v tom startup vidí rozdíl oproti tradiční kvantizaci.
PrismML uvádí, že její model Bonsai 8B dokáže uložit 8,2 miliardy parametrů do přibližně 1,15 GB paměti. Ve srovnání s konvenčním 16bitovým modelem jde zhruba o čtrnáctinásobné zmenšení . Firma současně tvrdí, že model dosahuje konkurenceschopných výsledků ve standardních testech
.
U modelu Qwen 3.6 startup popisuje podobný princip ve větším měřítku: hustý model s 27 miliardami parametrů se má vejít do paměti iPhonu 17 Pro a běžet bez serverového připojení .
Podle tvrzení PrismML přináší ternární reprezentace přibližně pětkrát lepší energetickou efektivitu než modely s plnou přesností. Model Bonsai 8B má na iPhonu 17 Pro dosahovat rychlosti přes 40 tokenů za sekundu . Tyto údaje však vycházejí především z materiálů firmy a sekundárních zpráv, nikoli z rozsáhlého nezávislého srovnání.
Je důležité oddělit doložené skutečnosti od marketingových tvrzení. Zprávy o jednání Applu s PrismML vycházejí z reportingu, který citují další technologická média . Samotné technické výsledky — například zachování přesnosti, energetická efektivita nebo skutečný výkon při různých úlohách — ale dosud nemají široké nezávislé ověření.
PrismML se z utajení vynořila 31. března 2026 a své modely nabízí jako open source pod licencí Apache 2.0, což může usnadnit jejich kontrolu externími výzkumníky . Teprve další testy ukážou, zda výsledky prezentované startupem obstojí i mimo jeho vlastní demonstrační podmínky.
Význam rozhovorů s Applem proto není v tom, že by už potvrzovaly nasazení technologie v budoucích iPhonech. Naznačují ale, že Apple hledá způsob, jak překonat kompromis mezi velikostí modelu, výkonem telefonu, spotřebou energie a ochranou soukromí. Pokud PrismML své sliby skutečně naplní, mohla by ternární komprese představovat jednu z cest k výrazně schopnější AI přímo v kapse — bez nutnosti posílat každý požadavek do cloudu.