Der Hintergrund: Apples eigene On-Device-Foundation-Modelle basieren auf sparsamen Architekturen (sog. sparse architectures). Auf der WWDC 2026 stellte Apple ein On-Device-Modell mit rund 20 Milliarden Parametern vor – allerdings sind bei jeder Inferenz nur 1 bis 4 Milliarden Parameter gleichzeitig aktiv . PrismMLs Ansatz hingegen aktiviert alle 27 Milliarden Parameter vollständig auf derselben Hardware – ohne einen Server anrufen zu müssen. Dies könnte laut Analysten deutlich leistungsfähigere Funktionen für Siri, Schreibwerkzeuge und intelligente App-Erlebnisse ermöglichen, ohne die Privatsphäre zu gefährden oder eine Cloud-Verbindung vorauszusetzen
.
Apple selbst hat Berichten zufolge große Schwierigkeiten, seine eigenen internen KI-Modelle für das iPhone zu komprimieren, ohne dass es zu erheblichen Leistungseinbußen kommt. Eine externe Lösung wie die von PrismML wäre daher von hoher strategischer Bedeutung .
PrismMLs Durchbruch liegt in der nativen 1-Bit-Darstellung (ternäre Gewichte), die auf das gesamte neuronale Netzwerk angewendet wird – nicht nur auf ausgewählte Schichten:
Vollständig ternäre Gewichte: Jedes Gewicht im Modell wird auf genau drei Werte {-1, 0, +1} beschränkt, was etwa 1,58 Bit pro Parameter entspricht . Dies unterscheidet sich grundlegend von der standardmäßigen 16-Bit-(FP16)- oder sogar 8-Bit-Quantisierung, die weiterhin mit Gleitkomma- oder Ganzzahlbereichen arbeitet.
Von Grund auf in 1 Bit trainiert: Im Gegensatz zur typischen Kompression, die mit einem volldimensionalen Modell beginnt und dieses erst nachträglich quantisiert (oft mit Genauigkeitsverlusten), trainieren die Forscher von PrismML ihre Modelle von Anfang an in 1-Bit-Präzision . Das Unternehmen betont, dass diese ternäre Logik „durch die Netzwerkarchitektur selbst“ aufgebaut und nicht nachträglich eingefügt wird
.
Drastische Dichtesteigerung: PrismMLs 1-Bit-Modell Bonsai 8B komprimiert 8,2 Milliarden Parameter in nur 1,15 GB Speicher – etwa 14-mal kleiner als ein herkömmliches 16-Bit-Modell – und erreicht dabei laut eigenen Angaben eine mit volldimensionalen Alternativen vergleichbare Genauigkeit . Die Qwen-3.6-Kompression mit 27 Milliarden Parametern reduziert das Volumen des Modells von rund 54 GB auf weniger als 4 GB
.
Energieeffizienz: Die 1-Bit-Darstellung sorgt für eine etwa 5-mal bessere Energieeffizienz im Vergleich zu volldimensionalen Modellen. Das 8B-Modell erreicht auf einem iPhone 17 Pro über 40 Tokens pro Sekunde – schneller als für die meisten Echtzeitanwendungen nötig .
Einschränkung: Die Behauptungen von PrismML wurden bisher von der breiten KI-Forschungsgemeinschaft nicht unabhängig überprüft. Das Startup ist erst am 31. März 2026 aus der Stealth-Phase getreten, unterstützt durch 16,25 Millionen US-Dollar von Khosla Ventures und Cerberus Ventures. Die Modelle sind unter der Apache-2.0-Lizenz als Open Source veröffentlicht, was eine externe Validierung im Laufe der Zeit ermöglichen sollte .