Почему это критично для Apple? Собственные модели Apple (AFM 3 Core) используют разреженную архитектуру: из ~20 миллиардов параметров в каждый момент активно лишь 1–4 миллиарда . Технология PrismML, напротив, держит все 27 миллиардов параметров полностью активными на том же оборудовании — без обращения к серверу. Это может радикально расширить возможности Siri, инструментов для работы с текстом и других интеллектуальных функций, не жертвуя конфиденциальностью и не требуя подключения к облаку
. По сведениям инсайдеров, Apple испытывает трудности со сжатием собственных ИИ-моделей для iPhone без существенной деградации, что делает внешнее решение вроде PrismML особенно привлекательным
.
Прорыв PrismML основан на нативном 1-битном (троичном) представлении весов, применяемом ко всей нейросети, а не к отдельным слоям:
Троичные веса по всей сети. Каждый вес модели принимает ровно три значения: {-1, 0, +1}, что кодирует примерно 1,58 бита на параметр . Это коренным образом отличается от стандартного 16-битного (FP16) или даже 8-битного квантования, где всё ещё используются диапазоны чисел с плавающей точкой или целых чисел.
Обучение с нуля в 1-битном формате. В отличие от типичного сжатия, когда полную модель сначала обучают, а затем квантуют (часто с потерей точности), PrismML обучает модели сразу в 1-битной точности с нуля . Компания заявляет, что «троичная логика встроена в саму архитектуру сети», а не добавлена постфактум
.
Резкое увеличение плотности. Модель Bonsai 8B от PrismML сжимает 8,2 миллиарда параметров всего в 1,15 ГБ памяти — примерно в 14 раз меньше, чем обычная 16-битная модель, при этом заявляя о конкурентной точности на стандартных тестах . Сжатие 27-миллиардной Qwen 3.6 аналогично позволяет уместить плотную модель Alibaba целиком в память iPhone
.
Энергоэффективность. 1-битное представление обеспечивает примерно в 5 раз лучшую энергоэффективность по сравнению с полной точностью, а модель на 8 млрд параметров работает со скоростью более 40 токенов в секунду на iPhone 17 Pro — быстрее, чем требуется для типичного использования в реальном времени .
Важное примечание: Заявления PrismML пока не проверены независимо на масштабе широким научным сообществом. Стартап вышел из «тихого режима» 31 марта 2026 года при финансировании в $16,25 млн от Khosla Ventures и Cerberus Ventures, а его модели опубликованы с открытым исходным кодом под лицензией Apache 2.0, что со временем позволит провести независимую верификацию .