PrismML заявляє, що стиснула відкриту мовну модель Alibaba Qwen 3.6 із 27 мільярдами параметрів так, щоб вона працювала на iPhone 17 Pro. За повідомленнями, це найбільша за кількістю параметрів модель, яку вдалося розгорнути на мобільному пристрої . Важливо й те, що йдеться про щільну модель: усі її параметри можуть бути активними під час обчислення, а не лише окрема частина.
Це відрізняється від підходу Apple до власних моделей. Компанія використовує компактні та розріджені архітектури, у яких під час конкретного запиту задіюється лише частина загальної кількості параметрів. У повідомленнях про нову приблизно 20-мільярдну модель Apple зазначалося, що активними під час одного обчислення є близько 1–4 мільярдів параметрів .
Якщо заяви PrismML підтвердяться, така технологія може дати Apple спосіб запускати на смартфоні потужніші версії Siri, інструменти для роботи з текстом і розумніші функції в застосунках — зберігаючи переваги локальної обробки. Apple уже надає розробникам доступ до он-device-моделей через Foundation Models і наголошує, що ці моделі працюють офлайн, а дані користувача можуть залишатися приватними .
Водночас переговори не означають, що Apple вже уклала угоду з PrismML або використає її технологію у своїх продуктах. Це радше свідчить про пошук способів подолати обмеження пам’яті та енергоспоживання, які заважають запускати великі моделі на смартфонах.
Основою технології є нативне 1-бітне, або тернарне, представлення ваг. Кожна вага може мати лише одне з трьох значень: -1, 0 або +1. Така схема кодує приблизно 1,58 біта інформації на параметр .
Це принципово інший підхід, ніж поширені формати FP16 або 8-бітна квантизація, у яких параметри зберігаються як ширший діапазон чисел із плаваючою комою або цілочисельних значень. Менша кількість можливих значень дає змогу істотно скоротити обсяг моделі та зменшити вимоги до пам’яті.
Звичайне стиснення часто відбувається після навчання повнорозмірної моделі: готові ваги переводять у формат із меншою точністю, що може призводити до втрати якості. PrismML стверджує, що її моделі навчаються в 1-бітному форматі від самого початку, а тернарна логіка закладається в архітектуру мережі, а не додається як фінальний етап пакування .
Саме це компанія вважає своєю ключовою відмінністю: модель не просто «стискають» після навчання, а проєктують під жорсткі обмеження пам’яті та обчислень із самого старту.
PrismML називає цей показник intelligence density — кількість корисної здатності моделі на одиницю її розміру. За даними компанії, її 1-бітна модель Bonsai 8B займає близько 1,15 ГБ пам’яті замість приблизно 16 ГБ для моделі такого самого розміру у форматі FP16, тобто приблизно у 14 разів менше . Компанія також заявляє про конкурентну точність на стандартних тестах.
Для 27-мільярдної версії Qwen 3.6 PrismML повідомляла про зменшення обсягу приблизно з 54 ГБ до менш ніж 4 ГБ, при цьому всі параметри моделі залишаються активними під час роботи .
За заявами PrismML, 1-бітне представлення забезпечує приблизно у п’ять разів кращу енергоефективність порівняно з повноформатними моделями. Bonsai 8B нібито генерує понад 40 токенів за секунду на iPhone 17 Pro, що перевищує швидкість, необхідну для багатьох сценаріїв роботи в реальному часі .
Гучні показники PrismML поки що переважно походять від самої компанії або публікацій, які переказують її заяви. Їх ще мають незалежно перевірити дослідники на широкому наборі тестів і різних пристроях.
PrismML, лабораторія, що виросла з досліджень Каліфорнійського технологічного інституту, вийшла з режиму stealth 31 березня 2026 року. Тоді ж компанія повідомила про залучення 16,25 мільйона доларів від Khosla Ventures і Cerberus Ventures та відкрила свої моделі за ліцензією Apache 2.0 . Відкритий код створює умови для зовнішнього аудиту, але сам по собі ще не доводить заявлену якість або продуктивність.
Тож значення переговорів Apple із PrismML — не в підтвердженому партнерстві, а в потенціалі технології. Якщо повністю активні великі моделі справді зможуть стабільно працювати на смартфоні без помітної втрати якості, це може послабити залежність мобільного ШІ від хмарних серверів і підняти планку можливостей локального ШІ.