這項技術對 Apple 至關重要,因為其自身的設備端模型正面臨嚴峻的效能瓶頸。在 WWDC 2026 上,Apple 發表了約 200 億參數的設備端模型,但採用稀疏架構,每次推論僅能啟動 10 億至 40 億參數 。PrismML 的解決方案則能讓全部 270 億參數同時活躍運作,完全不需要呼叫雲端伺服器。這意味著未來 Siri、寫作工具及各類智慧應用可以在不犧牲隱私、不依賴網路連線的情況下,實現大幅躍進的運算能力
。報導也指出,Apple 自身在壓縮內部 AI 模型時曾遭遇嚴重的效能衰退問題,因此 PrismML 這類外部解決方案對其具有高度戰略價值
。
PrismML 的技術突破核心為「原生 1-bit(三元)權重表示法」,且應用於整個神經網路,而非僅限特定層數:
全網路三元權重。 模型中的每個權重僅能是三種數值之一:{-1, 0, +1},每個參數僅編碼約 1.58 位元的資訊 。這與傳統的 16 位元(FP16)或 8 位元量化有本質上的不同,後者仍使用浮點數或整數的數值範圍。
從零原生訓練於 1-bit。 不同於常見的先訓練完整精度模型再進行量化的方法(往往伴隨精度損失),PrismML 從訓練之初就讓模型在原生的 1-bit 精度下學習。該公司表示,這種「三元邏輯是透過網路架構本身建立的」,而非事後改造 。
顯著的記憶體密度提升。 PrismML 的 1-bit Bonsai 8B 模型將 82 億個參數壓縮至僅 1.15 GB 的記憶體——約為傳統 16-bit 模型的 1/14——同時在標準基準測試中宣稱能達到與全精度模型競爭的準確度 。其對 27B Qwen 3.6 的壓縮同樣讓阿里巴巴的密集模型完整塞進 iPhone 的記憶體中
。
能源效率提升。 1-bit 表示法相較於全精度模型可帶來約 5 倍的能源效率提升。其 8B 模型在 iPhone 17 Pro 上運行速度超過每秒 40 個 tokens,遠高於一般即時使用需求 。
備註: PrismML 的相關聲明目前尚未經更廣泛的 AI 研究社群獨立驗證。這家公司於 2026 年 3 月 31 日脫離隱身模式,獲得 Khosla Ventures 和 Cerberus Ventures 共 1625 萬美元投資。其模型已於 Apache 2.0 授權下開源釋出,外界應有機會在未來進行獨立驗證 。