หากทำได้ตามที่บริษัทอ้าง นี่อาจเป็นการขยับเพดานของ AI บนอุปกรณ์เคลื่อนที่อย่างมีนัยสำคัญ เพราะโมเดลที่มีพารามิเตอร์มากขึ้นโดยทั่วไปสามารถรองรับงานที่ซับซ้อนขึ้นได้ แม้จำนวนพารามิเตอร์จะไม่ใช่ตัวชี้วัดคุณภาพเพียงอย่างเดียวก็ตาม
Apple เองวางยุทธศาสตร์ให้โมเดลทำงานบนอุปกรณ์เพื่อช่วยรักษาความเป็นส่วนตัว ลดความหน่วง และทำให้ฟีเจอร์บางอย่างใช้งานได้โดยไม่ต้องเชื่อมต่อคลาวด์ อย่างไรก็ตาม โมเดลบนอุปกรณ์ของ Apple ใช้สถาปัตยกรรมแบบ sparse ซึ่งหมายความว่า แม้โมเดลจะมีพารามิเตอร์รวมราว 20 พันล้านตัว แต่มีเพียงประมาณ 1–4 พันล้านตัวที่ถูกเปิดใช้งานในการประมวลผลแต่ละครั้ง
ในทางกลับกัน PrismML ระบุว่าโมเดล Qwen 3.6 ที่บีบอัดแล้วสามารถเปิดใช้งานพารามิเตอร์ทั้ง 27 พันล้านตัวพร้อมกันบนฮาร์ดแวร์เดียวกัน ความแตกต่างนี้อาจช่วยให้ Apple พัฒนา Siri ที่ทำงานได้ฉลาดขึ้น เครื่องมือช่วยเขียนที่มีความสามารถมากขึ้น และฟีเจอร์อัจฉริยะภายในแอปต่าง ๆ โดยยังคงเก็บข้อมูลไว้บน iPhone
ดังนั้น ความสนใจของ Apple ไม่ได้หมายความว่าบริษัทตัดสินใจซื้อหรือผนวกเทคโนโลยีของ PrismML แล้ว แต่สะท้อนว่า การบีบอัดโมเดลให้มีขนาดเล็กลงโดยไม่เสียความสามารถมากเกินไปกำลังเป็นโจทย์เชิงกลยุทธ์ สำหรับการผลักดัน AI แบบ on-device
เทคโนโลยีของ PrismML ใช้การแทนค่าน้ำหนักแบบ 1 บิตเชิงตรรกะ หรือประมาณ 1.58 บิตต่อพารามิเตอร์ โดยจำกัดค่าน้ำหนักแต่ละตัวให้เหลือเพียงสามค่า ได้แก่ -1, 0 และ +1
แนวทางนี้แตกต่างจากโมเดลทั่วไปที่มักใช้ความละเอียด FP16 หรือ 16 บิต รวมถึงการควอนไทซ์เป็น 8 บิต ซึ่งยังคงใช้ช่วงค่าตัวเลขที่ละเอียดกว่ามาก การใช้เพียงสามค่าช่วยลดพื้นที่จัดเก็บและภาระการคำนวณ แต่ก็ทำให้การฝึกโมเดลมีความท้าทายสูงขึ้น
การบีบอัดโมเดลส่วนใหญ่มักเริ่มจากโมเดลความละเอียดสูง แล้วจึงลดความละเอียดของน้ำหนักภายหลัง กระบวนการดังกล่าวอาจทำให้ความแม่นยำลดลง
PrismML ระบุว่าโมเดลของบริษัทถูกฝึกด้วยค่าน้ำหนักระดับ 1 บิตตั้งแต่ต้น ไม่ใช่การนำโมเดลเต็มรูปแบบมาบีบอัดในขั้นตอนสุดท้าย บริษัทอธิบายว่าโครงสร้างแบบ ternary ถูกสร้างไว้ในสถาปัตยกรรมของโครงข่ายเอง
บริษัทระบุว่าโมเดล 1-bit Bonsai 8B ซึ่งมี 8.2 พันล้านพารามิเตอร์ ใช้หน่วยความจำประมาณ 1.15 กิกะไบต์ หรือเล็กกว่าโมเดลขนาดเดียวกันที่ใช้ความละเอียด 16 บิตประมาณ 14 เท่า พร้อมอ้างว่าทำคะแนนได้ใกล้เคียงกับโมเดลความละเอียดสูงในชุดทดสอบมาตรฐาน
PrismML ยังอ้างว่าแนวทางเดียวกันช่วยให้โมเดล Qwen 3.6 ขนาด 27 พันล้านพารามิเตอร์ทำงานภายในหน่วยความจำของ iPhone 17 Pro ได้
PrismML ระบุว่าการแทนค่าน้ำหนักแบบ 1 บิตให้ประสิทธิภาพด้านพลังงานดีกว่าโมเดลความละเอียดสูงประมาณ 5 เท่า ขณะที่ Bonsai 8B สามารถสร้างข้อความได้มากกว่า 40 โทเคนต่อวินาทีบน iPhone 17 Pro ซึ่งสูงกว่าความเร็วที่ผู้ใช้ส่วนใหญ่ต้องการสำหรับการโต้ตอบแบบเรียลไทม์
ตัวเลขทั้งหมดข้างต้นควรอ่านในฐานะ คำกล่าวอ้างของ PrismML และรายงานจากแหล่งข่าวที่เกี่ยวข้อง มากกว่าจะถือเป็นข้อสรุปที่ผ่านการตรวจสอบอย่างเป็นอิสระแล้ว เทคโนโลยีดังกล่าวเพิ่งเปิดตัวจากช่วงการดำเนินงานแบบเงียบ ๆ เมื่อวันที่ 31 มีนาคม 2026 และโมเดลของบริษัทเผยแพร่แบบโอเพนซอร์สภายใต้สัญญาอนุญาต Apache 2.0
การเปิดซอร์สอาจช่วยให้นักวิจัยและนักพัฒนาภายนอกทดสอบขนาดโมเดล ความแม่นยำ ความเร็ว และการใช้พลังงานได้ละเอียดขึ้นในอนาคต แต่ในเวลานี้ยังเร็วเกินไปที่จะสรุปว่าโมเดล ternary ของ PrismML จะให้คุณภาพเทียบเท่าโมเดลความละเอียดสูงในงานจริงทุกประเภท
กล่าวโดยสรุป การหารือกับ PrismML มีความสำคัญต่อ Apple เพราะอาจเสนอทางเลือกใหม่ในการนำโมเดล AI ที่ใหญ่และมีความสามารถสูงขึ้นมาใช้งานบน iPhone โดยตรง หากคำกล่าวอ้างได้รับการยืนยัน เทคโนโลยีนี้อาจช่วยให้ AI แบบ on-device ก้าวจากฟีเจอร์เฉพาะทางไปสู่ผู้ช่วยและแอปที่ทำงานซับซ้อนได้มากขึ้น โดยไม่ต้องแลกกับความเป็นส่วนตัวหรือการพึ่งพาเซิร์ฟเวอร์ทุกครั้ง