Apple uppges ha träffat PrismML för att undersöka hur betydligt större AI modeller kan köras direkt på iPhone [1][5][6]. PrismML säger sig ha komprimerat Alibabas öppna språkmodell Qwen 3.6 med 27 miljarder parametrar så att den körs lokalt på en iPhone 17 Pro [5][6].
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact check with cited sources for What is the significance of Apple's reported discussions with PrismML regarding on device AI tech. Article summary: Significance of Apple's Discussions with PrismML Apple has held meetings with PrismML about using the startup's technology to run much larger AI models directly on iPhones, according to reporting from The Information [1]. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Apple uppges ha diskuterat med PrismML hur startupens teknik kan användas för att köra betydligt större AI-modeller direkt på iPhone . Det är strategiskt viktigt eftersom lokal AI kan ge kortare svarstider, fungera utan internet och låta känsliga uppgifter stanna på enheten. Apples egna utvecklarverktyg framhåller just att lokala modeller kan användas utan en server och utan att användardata behöver lämna enheten
.
PrismML har enligt egna uppgifter och rapportering lyckats komprimera Alibabas öppna språkmodell Qwen 3.6 – en tät modell med 27 miljarder parametrar – så att den körs helt på en iPhone 17 Pro . Om resultatet håller vid oberoende tester skulle det kunna höja ambitionsnivån för funktioner som Siri, skrivhjälp och smartare appfunktioner, utan att varje förfrågan måste skickas till molnet.
Skillnaden mot Apples modellarkitektur är central. Apples rapporterade modell på omkring 20 miljarder parametrar använder en gles arkitektur där bara cirka 1–4 miljarder parametrar aktiveras vid varje körning . PrismML:s Qwen-demonstration uppges i stället aktivera alla 27 miljarder parametrar samtidigt
. Det innebär inte automatiskt bättre kvalitet, men det visar en annan väg till större modeller på begränsad hårdvara.
PrismML:s kärnteknik bygger på att varje modellvikt begränsas till ett av tre värden: −1, 0 eller +1. Det kodar ungefär 1,58 bitar information per parameter . Vanliga modeller använder ofta 16-bitars flyttalstal, exempelvis FP16, eller 8-bitars kvantisering. Ternär representation är därför mycket mer begränsad – men kräver samtidigt betydligt mindre minne.
Det viktiga är att metoden enligt PrismML tillämpas på hela nätverket, snarare än att bara vissa lager komprimeras .
Traditionell kvantisering börjar vanligtvis med en modell i hög precision och pressar sedan ned den till ett mindre format. Det kan leda till försämrad noggrannhet. PrismML säger i stället att modellerna tränas som 1-bitarsmodeller från grunden, så att den ternära logiken byggs in i själva arkitekturen i stället för att läggas på i efterhand .
Det är denna kombination – mycket få möjliga viktvärden och träning anpassad till formatet – som företaget lyfter fram som sin särskilda metod.
PrismML uppger att modellen 1-bit Bonsai 8B packar 8,2 miljarder parametrar i omkring 1,15 GB minne. Företaget hävdar samtidigt konkurrenskraftiga resultat jämfört med betydligt större modeller i full precision . För en mobiltelefon är minnesåtgången avgörande: en mindre modell kan laddas och köras lokalt utan att konkurrera lika hårt med appar och operativsystem om enhetens resurser.
Företaget hävdar också att tekniken ger ungefär fem gånger bättre energieffektivitet än modeller i full precision. 8B-modellen ska kunna nå över 40 tokens per sekund på en iPhone 17 Pro .
Det är viktigt att skilja mellan Apples dokumenterade satsning på lokal AI och PrismML:s egna prestandaanspråk. Apple beskriver sina Foundation Models och utvecklarverktyg som lokala och integrerade i företagets plattformar . Uppgiften om att Apple har haft möten med PrismML kommer däremot från rapportering som återgivits av bland andra The Information och sekundära källor
.
PrismML blev offentligt i mars 2026 och har släppt sina modeller med öppen källkod under Apache 2.0, vilket gör det möjligt för externa forskare och utvecklare att granska och testa dem . Men företagets påståenden om att kvaliteten bibehålls, att hela 27-miljardersmodellen körs effektivt på iPhone och att energiförbrukningen minskar kraftigt bör tills vidare betraktas som lovande men ännu inte fullt oberoende verifierade.
För Apple skulle en fungerande lösning kunna innebära större och mer kapabla AI-funktioner utan motsvarande beroende av molnservrar. För användaren är den potentiella vinsten framför allt privat och snabb AI som fungerar även med dålig eller ingen uppkoppling. Men den verkliga betydelsen avgörs först när modellerna har jämförts med Apples egna system på ett reproducerbart sätt.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Apple uppges ha träffat PrismML för att undersöka hur betydligt större AI modeller kan köras direkt på iPhone [1][5][6].
Apple uppges ha träffat PrismML för att undersöka hur betydligt större AI modeller kan köras direkt på iPhone [1][5][6]. PrismML säger sig ha komprimerat Alibabas öppna språkmodell Qwen 3.6 med 27 miljarder parametrar så att den körs lokalt på en iPhone 17 Pro [5][6].
Till skillnad från Apples rapporterade glesa modell ska PrismML:s modell kunna ha samtliga 27 miljarder parametrar aktiva under beräkningen [6][11].