Apple har ifølge rapporter holdt møder med PrismML om at køre væsentligt større AI modeller direkte på iPhone [1][2][3]. PrismML siger, at virksomheden har komprimeret Alibabas open source model Qwen 3.6 med 27 milliarder parametre, så den kan køre lokalt på en iPhone 17 Pro [4][5].
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact check with cited sources for What is the significance of Apple's reported discussions with PrismML regarding on device AI tech. Article summary: Significance of Apple's Discussions with PrismML Apple has held meetings with PrismML about using the startup's technology to run much larger AI models directly on iPhones, according to reporting from The Information [1]. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Apple har ifølge rapporter holdt møder med PrismML om at bruge startupvirksomhedens teknologi til at køre langt større AI-modeller direkte på iPhone .
PrismML har demonstreret, at selskabet kan komprimere Alibabas open source-sprogmodel Qwen 3.6 – en tæt model med 27 milliarder parametre – så den kan køre fuldt ud på en iPhone 17 Pro. Det vil i så fald være den største AI-model, der er blevet kørt på en mobil enhed .
Det er vigtigt, fordi Apple står med en konkret begrænsning: On-device-modeller skal både være hurtige og passe inden for telefonens begrænsede hukommelse og strømforbrug. Apples egne foundation-modeller til enheden bruger en såkaldt sparse arkitektur, hvor kun en del af modellens parametre aktiveres ved hver forespørgsel. Ved WWDC 2026 præsenterede Apple en on-device-model med omkring 20 milliarder parametre, men kun 1–4 milliarder af dem er aktive ved den enkelte inferens .
PrismML's løsning skulle derimod kunne køre med alle 27 milliarder parametre aktive på samme hardware – uden at sende forespørgsler til en server. Hvis resultaterne holder, kan det gøre det muligt at tilbyde mere avanceret Siri, bedre skriveværktøjer og mere intelligente appfunktioner lokalt på telefonen. Det vil samtidig understøtte Apples fokus på privatliv, fordi brugerens data kan blive på enheden, uden cloudforbindelse eller løbende serveromkostninger .
Ifølge rapporteringen har Apple haft svært ved at komprimere sine egne interne AI-modeller til iPhone uden et markant tab af ydeevne. Derfor kan PrismML være strategisk interessant som en ekstern løsning på et problem, Apple endnu ikke ser ud til at have løst fuldt ud .
Kernen i PrismML's tilgang er en indbygget 1-bit- eller ternær repræsentation af modellens vægte. I stedet for at gemme hver vægt med mange mulige talværdier begrænses den til præcis tre muligheder: {-1, 0, +1}. Det svarer til cirka 1,58 bit information pr. parameter .
Det afgørende er, at teknikken ifølge PrismML anvendes på hele det neurale netværk – ikke kun på enkelte lag. Traditionelle modeller lagres ofte i eksempelvis 16-bit-formatet FP16 eller i 8-bit-format. De bruger stadig et større interval af flydende komma- eller heltalsværdier.
Med ternære vægte bliver modellen langt mindre og kræver mindre hukommelse. PrismML's 1-bit Bonsai 8B-model skulle eksempelvis presse 8,2 milliarder parametre ned i omkring 1,15 GB. Det er omtrent 14 gange mindre end en tilsvarende model i 16-bit-format .
En anden forskel er, at PrismML ikke blot tager en traditionel model i fuld præcision og komprimerer den bagefter. Virksomheden siger, at modellerne trænes direkte i 1-bit-præcision fra begyndelsen .
Det betyder ifølge selskabet, at den ternære logik er indbygget i selve netværksarkitekturen i stedet for at blive lagt oven på en færdig model som et sidste komprimeringstrin . Det er netop denne forskel, PrismML fremhæver som forklaringen på, at modellerne kan bevare en konkurrencedygtig nøjagtighed trods den kraftige reduktion i størrelse.
PrismML hævder desuden, at 1-bit-repræsentationen giver omkring fem gange bedre energieffektivitet end modeller i fuld præcision. Bonsai 8B skulle kunne generere over 40 tokens i sekundet på en iPhone 17 Pro – hurtigere end det, der normalt kræves for en flydende interaktion i realtid .
For Apple kan det være lige så vigtigt som selve modelstørrelsen. En større model er kun praktisk på en telefon, hvis den kan svare hurtigt uden at dræne batteriet eller få enheden til at blive for varm.
PrismML's resultater er endnu ikke uafhængigt bekræftet i stor skala af det bredere AI-forskningsmiljø. Virksomheden kom ud af stealth-fasen 31. marts 2026, har ifølge oplysninger modtaget 16,25 millioner dollar fra Khosla Ventures og Cerberus Ventures og har udgivet sine modeller som open source under Apache 2.0-licensen .
Den åbne udgivelse gør det muligt for eksterne forskere og udviklere at undersøge modellerne nærmere over tid. Indtil sådanne tests foreligger, bør påstande om rekordstørrelse, nøjagtighed, hastighed og energiforbrug dog forstås som virksomhedens egne eller rapporterede resultater – ikke som endeligt fastslåede branchefakta.
Hvis PrismML's metode alligevel viser sig at fungere som beskrevet, kan den give Apple en genvej til mere kapabel AI på selve enheden. Det vil ikke nødvendigvis erstatte cloudbaseret AI, men det kan flytte grænsen for, hvor meget intelligens en iPhone kan levere lokalt, privat og uden netforbindelse.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Apple har ifølge rapporter holdt møder med PrismML om at køre væsentligt større AI modeller direkte på iPhone [1][2][3].
Apple har ifølge rapporter holdt møder med PrismML om at køre væsentligt større AI modeller direkte på iPhone [1][2][3]. PrismML siger, at virksomheden har komprimeret Alibabas open source model Qwen 3.6 med 27 milliarder parametre, så den kan køre lokalt på en iPhone 17 Pro [4][5].
Modellen skulle have alle 27 milliarder parametre aktive under behandlingen, i modsætning til Apples sparsomme model, hvor kun en del af parametrene aktiveres ad gangen [4][6].