Według doniesień Apple spotykało się ze startupem PrismML, który opracował technologię uruchamiania znacznie większych modeli AI bezpośrednio na iPhonie [1][2][3]. PrismML twierdzi, że skompresował 27 miliardowy, gęsty model Qwen 3.6 firmy Alibaba tak, aby działał lokalnie na iPhonie 17 Pro [4][5].
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact check with cited sources for What is the significance of Apple's reported discussions with PrismML regarding on device AI tech. Article summary: Significance of Apple's Discussions with PrismML Apple has held meetings with PrismML about using the startup's technology to run much larger AI models directly on iPhones, according to reporting from The Information [1]. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Apple od lat rozwija sztuczną inteligencję działającą bezpośrednio na urządzeniach. Taki model może ograniczać opóźnienia, działać bez połączenia z internetem i — co szczególnie istotne — pozwalać zachować dane użytkownika na iPhonie. Apple udostępnia deweloperom narzędzia do budowania funkcji AI działających lokalnie, bez konieczności utrzymywania serwera i ponoszenia kosztów za każde zapytanie .
Problemem pozostaje jednak ograniczona pamięć i moc obliczeniowa smartfona. Modele uruchamiane na urządzeniach mobilnych są zwykle znacznie mniejsze niż systemy działające w centrach danych.
Według doniesień, Apple prowadziło rozmowy z PrismML na temat wykorzystania technologii startupu do uruchamiania większych modeli AI bezpośrednio na iPhone'ach . PrismML miało zademonstrować skompresowaną wersję Qwen 3.6 — otwartoźródłowego modelu językowego firmy Alibaba z 27 miliardami parametrów — działającą lokalnie na iPhonie 17 Pro
.
To istotne także w kontekście własnych modeli Apple. Firma zapowiedziała model działający na urządzeniu, liczący około 20 miliardów parametrów, ale wykorzystujący architekturę rzadką: podczas pojedynczego uruchomienia aktywna jest tylko część parametrów, według dostępnych informacji około 1–4 miliardów . W przypadku skompresowanego Qwen 3.6 wszystkie 27 miliardów parametrów ma być aktywne jednocześnie
.
Jeśli deklaracje się potwierdzą, Apple mogłoby uzyskać dostęp do bardziej zaawansowanych funkcji działających lokalnie — od nowej wersji Siri po inteligentne narzędzia w aplikacjach — bez konieczności stałego odwoływania się do chmury. Nie oznacza to jednak, że rozmowy przesądzają o współpracy ani że technologia PrismML trafi do przyszłych produktów Apple.
Sercem rozwiązania jest natywna reprezentacja ternarna, określana jako 1-bitowa lub około 1,58-bitowa. Każda waga sieci neuronowej może przyjąć wyłącznie jedną z trzech wartości: -1, 0 albo +1 . Pozwala to zapisać około 1,58 bitu informacji na parametr.
To inny sposób kompresji niż standardowe formaty FP16 i 8-bitowe kwantyzowanie. W typowym podejściu najpierw tworzy się model o wysokiej precyzji, a dopiero później zmniejsza precyzję jego parametrów. PrismML twierdzi natomiast, że jego modele są trenowane natywnie w takiej reprezentacji od początku, a logika ternarna jest elementem architektury, a nie jedynie późniejszym etapem pakowania modelu .
PrismML podaje, że jego model Bonsai 8B mieści 8,2 miliarda parametrów w około 1,15 GB pamięci — około 14 razy mniej niż porównywalny model zapisany w standardzie 16-bitowym . Firma deklaruje również konkurencyjną dokładność względem modeli o pełnej precyzji, choć te wyniki powinny zostać sprawdzone przez niezależnych badaczy.
Podobna metoda miała umożliwić umieszczenie 27-miliardowego Qwen 3.6 w pamięci iPhone'a 17 Pro . W praktyce oznaczałoby to, że telefon może uruchamiać model o skali dotychczas kojarzonej raczej z wydajniejszym sprzętem lub usługami chmurowymi.
Według materiałów PrismML reprezentacja 1-bitowa zapewnia około pięciokrotnie wyższą efektywność energetyczną w porównaniu z modelami o pełnej precyzji. Model Bonsai 8B miał osiągać na iPhonie 17 Pro ponad 40 tokenów na sekundę . To szybkość wystarczająca do płynnej interakcji tekstowej, przynajmniej według deklaracji firmy.
Najważniejsze informacje pochodzą z doniesień medialnych oraz materiałów samego PrismML. Startup wywodzący się z badań prowadzonych w Caltech wyszedł z fazy ukrytej 31 marca 2026 roku. Otrzymał 16,25 mln dolarów od Khosla Ventures i Cerberus Ventures, a jego modele udostępniono jako open source na licencji Apache 2.0 .
Otwartoźródłowy charakter projektu ułatwia późniejszą kontrolę wyników, ale nie zastępuje niezależnych testów. Na tym etapie nie ma podstaw, by traktować wszystkie deklaracje dotyczące rekordowej skali, braku utraty jakości czy efektywności jako szeroko potwierdzony fakt. Najostrożniejszy wniosek jest taki, że PrismML proponuje interesujący sposób zmniejszania modeli AI, a Apple może widzieć w nim rozwiązanie jednego ze swoich największych problemów: jak uruchamiać bardziej zaawansowaną AI lokalnie, bez rezygnacji z prywatności i wygody działania offline.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Według doniesień Apple spotykało się ze startupem PrismML, który opracował technologię uruchamiania znacznie większych modeli AI bezpośrednio na iPhonie [1][2][3].
Według doniesień Apple spotykało się ze startupem PrismML, który opracował technologię uruchamiania znacznie większych modeli AI bezpośrednio na iPhonie [1][2][3]. PrismML twierdzi, że skompresował 27 miliardowy, gęsty model Qwen 3.6 firmy Alibaba tak, aby działał lokalnie na iPhonie 17 Pro [4][5].
W odróżnieniu od architektur rzadkich, w których aktywna jest tylko część parametrów, rozwiązanie PrismML ma uruchamiać wszystkie 27 miliardów parametrów modelu jednocześnie [4][5].