Apples egne utviklerverktøy fremhever allerede fordelene ved lokal AI. Når modellen kjører på enheten, kan brukerdata bli værende der, samtidig som man slipper serverkostnader, nettverksforsinkelse og avhengighet av en aktiv forbindelse .
Utfordringen er minne og strømforbruk. En større modell kan normalt gi bedre kapasitet, men er også tyngre å lagre og kjøre på en telefon. Apples rapporterte modell på rundt 20 milliarder parametere bruker en sparsom arkitektur, der bare rundt 1–4 milliarder parametere aktiveres under hver beregning . PrismMLs Qwen 3.6-oppsett skal derimot kunne ha alle 27 milliardene aktive samtidig
.
Det kan i teorien gi mer avanserte funksjoner i Siri, skriveverktøy og apper – uten at behandlingen må flyttes til skyen. Det betyr likevel ikke automatisk at modellen er bedre i praktisk bruk. Hastighet, kvalitet, varmeutvikling, batteribruk og hvor mye arbeidsminne som faktisk er tilgjengelig, vil være avgjørende.
PrismMLs tilnærming bygger på såkalte ternære vekter. Hver vekt i nevrale nettverket begrenses til én av tre verdier: −1, 0 eller +1 . Tre mulige tilstander kan representeres med omtrent 1,58 bit informasjon per parameter, derav betegnelsen «1-bit» eller «1,58-bit» i selskapets materiale.
Dette skiller seg fra vanlige modeller i FP16 eller 8-biters kvantisering, som fortsatt bruker et langt større spenn av tallverdier. Mindre representasjoner kan redusere både minnebehov og beregningskostnad, men kan også føre til tap av nøyaktighet dersom de brukes på en ferdigtrent modell.
Ifølge PrismML er hovedforskjellen at ternær logikk bygges inn i arkitekturen under treningen, i stedet for at en fullpresisjonsmodell først trenes og deretter komprimeres . Selskapet beskriver derfor metoden som en modell som er «født» i 1-bitformat, snarere enn en vanlig modell som er pakket om i etterkant.
PrismMLs Bonsai 8B-modell skal for eksempel få plass i rundt 1,15 GB minne, samtidig som selskapet hevder at den gir konkurransedyktige resultater mot langt større fullpresisjonsmodeller . PrismML oppgir også at modellen kan kjøre med over 40 token per sekund på en iPhone 17 Pro
. Et token er en liten tekstbestanddel som modellen behandler; tallet sier noe om hvor raskt den kan generere tekst.
Selskapet hevder dessuten rundt fem ganger bedre energieffektivitet enn fullpresisjonsmodeller . Slike tall bør imidlertid tolkes med varsomhet, fordi resultatene avhenger av maskinvare, programvare, modelloppgave og hvordan testene er gjennomført.
Det som er tydelig dokumentert i kildene, er Apples satsing på AI som kjører lokalt, samt PrismMLs lansering av åpne 1-bitmodeller . Rapporter fra juli 2026 hevder at Apple har hatt kontakt med selskapet, og at PrismML har fått Qwen 3.6 til å kjøre på iPhone 17 Pro
.
De mest oppsiktsvekkende ytelses- og nøyaktighetstallene kommer i stor grad fra PrismML selv eller fra sekundærkilder som omtaler selskapets kunngjøringer. PrismML kom ut av «stealth»-fasen 31. mars 2026 og skal være støttet av 16,25 millioner dollar fra Khosla Ventures og Cerberus Ventures . Modellene er gjort tilgjengelige som åpen kildekode under Apache 2.0, noe som kan gjøre ekstern testing mulig over tid
.
Konklusjonen: PrismMLs betydning for Apple ligger ikke bare i at en modell blir mindre. Det interessante er muligheten for å kjøre en tett, stor modell med alle parameterne aktive på en mobil enhet. Hvis uavhengige tester bekrefter selskapets påstander, kan teknologien bidra til mer kapabel, raskere og mer privat AI på iPhone – uten at hver forespørsel må innom en server.