Apple a rencontré la startup PrismML pour étudier l'utilisation de sa technologie afin de faire fonctionner des modèles d'IA beaucoup plus volumineux directement sur les iPhones, selon The Information [1][2][3]. PrismML a démontré qu'elle peut compresser Qwen 3.6 d'Alibaba — un modèle dense de 27 milliards de paramè...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: Search & fact check with cited sources for What is the significance of Apple's reported discussions with PrismML regarding on device AI tech. Article summary: Significance of Apple's Discussions with PrismML Apple has held meetings with PrismML about using the startup's technology to run much larger AI models directly on iPhones, according to reporting from The Information [1]. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Apple a tenu des réunions avec PrismML au sujet de l'utilisation de la technologie de cette startup pour faire fonctionner des modèles d'IA beaucoup plus grands directement sur les iPhones, selon un rapport de The Information . PrismML a démontré qu'elle pouvait compresser Qwen 3.6 d'Alibaba — un modèle dense de 27 milliards de paramètres — pour qu'il tourne entièrement sur un iPhone 17 Pro, établissant un record pour le plus grand modèle d'IA jamais déployé sur un appareil mobile
.
Cette avancée est cruciale car Apple est confronté à une contrainte majeure : ses propres modèles de fondation sur l'appareil utilisent des architectures creuses où seule une fraction des paramètres s'active à la fois. Lors de la WWDC 2026, Apple a annoncé un modèle sur l'appareil d'environ 20 milliards de paramètres, mais seulement 1 à 4 milliards de paramètres sont actifs par inférence . L'approche de PrismML fait fonctionner les 27 milliards de paramètres en entier de manière active sur le même matériel — aucun appel serveur n'est nécessaire — ce qui pourrait débloquer un Siri, des outils d'écriture et des expériences d'applications intelligentes bien plus performants, sans sacrifier la vie privée ni nécessiter une connexion au cloud
. Apple aurait eu du mal à compresser ses propres modèles d'IA internes pour l'iPhone sans une dégradation sévère des performances, ce qui rend une solution externe comme celle de PrismML hautement stratégique
.
La percée de PrismML repose sur une représentation des poids en 1-bit (ternaire) native, appliquée à l'ensemble du réseau neuronal — et non pas seulement à des couches sélectionnées :
Poids ternaires sur tout le réseau. Chaque poids du modèle est contraint à exactement trois valeurs {-1, 0, +1}, encodant environ 1,58 bits par paramètre . C'est fondamentalement différent de la quantification standard en 16 bits (FP16) ou même en 8 bits, qui utilisent encore des gammes de valeurs à virgule flottante ou entières.
Entraîné nativement en 1-bit dès le départ. Contrairement à la compression typique qui commence avec un modèle en pleine précision et le quantifie après coup (souvent avec une perte de précision), PrismML entraîne ses modèles nativement en précision 1-bit dès la base . La société affirme que cette "logique ternaire est construite à travers l'architecture du réseau elle-même", et non pas ajoutée après coup
.
Gains de densité spectaculaires. Le modèle 1-bit Bonsai 8B de PrismML compresse 8,2 milliards de paramètres dans seulement 1,15 Go de mémoire — environ 14 fois plus petit qu'un modèle 16 bits conventionnel — tout en revendiquant une précision compétitive par rapport aux alternatives en pleine précision sur des benchmarks standards . La compression du Qwen 3.6 27B de la société permet de loger le modèle dense d'Alibaba entièrement dans la mémoire de l'iPhone
.
Efficacité énergétique. La représentation 1-bit offre une efficacité énergétique environ 5 fois supérieure à celle des modèles en pleine précision, et le modèle 8B fonctionne à plus de 40 tokens par seconde sur un iPhone 17 Pro — plus rapide que les besoins typiques d'utilisation en temps réel .
Mise en garde : Les affirmations de PrismML n'ont pas encore été vérifiées de manière indépendante à grande échelle par la communauté de recherche en IA. La startup est sortie de la clandestinité le 31 mars 2026, soutenue par 16,25 millions de dollars de Khosla Ventures et Cerberus Ventures, et ses modèles sont publiés en open source sous licence Apache 2.0, ce qui devrait permettre une validation externe au fil du temps .
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Apple a rencontré la startup PrismML pour étudier l'utilisation de sa technologie afin de faire fonctionner des modèles d'IA beaucoup plus volumineux directement sur les iPhones, selon The Information [1][2][3].
Apple a rencontré la startup PrismML pour étudier l'utilisation de sa technologie afin de faire fonctionner des modèles d'IA beaucoup plus volumineux directement sur les iPhones, selon The Information [1][2][3]. PrismML a démontré qu'elle peut compresser Qwen 3.6 d'Alibaba — un modèle dense de 27 milliards de paramètres — pour qu'il tourne entièrement sur un iPhone 17 Pro, établissant un record pour le plus grand modèle d'IA...
L'enjeu est crucial car Apple est confronté à une contrainte majeure : ses propres modèles de fondation sur l'appareil utilisent des architectures creuses où seule une fraction des paramètres s'active à la fois.