ในการเปรียบเทียบโมเดล MoE ที่มีพารามิเตอร์รวม 80B และใช้งานราว 3B ต่อโทเค็น HySparse2 ใช้ FLOPs สำหรับประมวลผลอินพุตเริ่มต้นน้อยกว่า Hybrid SWA 5.02 เท่าที่บริบท 1 ล้านโทเค็น และใช้แคช KV 2.69 GB เทียบกับ 12.09 GB [6]... จุดสำคัญคือให้ self decoder ประมวลผลอินพุตยาว แล้วให้ชั้นใน cross decoder ใช้ข้อมูล KV และผลการเ...
เผยแพร่โดยแก้ไขด้วย GPT-6 Solรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
เมื่อเอเจนต์ AI ทำงานหลายรอบ บันทึกการสนทนาเดิมอาจยาวอยู่แล้ว ก่อนจะมีผลลัพธ์จากเครื่องมือเพิ่มเข้ามาอีกเป็นจำนวนมาก ทุกครั้งที่ต้องประมวลผลอินพุตยาวนั้น ขั้นตอน prefill หรือการประมวลผลอินพุตเริ่มต้นย่อมมีต้นทุนสูงขึ้น HySparse2 คือสถาปัตยกรรมที่ Xiaomi เสนอเพื่อลดต้นทุนดังกล่าว โดยยังเปิดทางให้โมเดลเข้าถึงทั้งโทเค็นล่าสุดและข้อมูลที่อยู่ไกลในบริบท งานที่เผยแพร่เป็นงานวิจัยสถาปัตยกรรมซึ่งเกี่ยวข้องกับแผนสำหรับ MiMo-V3 ไม่ใช่การเปิดตัวน้ำหนักโมเดล MiMo-V3 รุ่นใหม่ 3
4
HySparse2 แบ่งโมเดลตามแนวคิด YOCO เป็น self-decoder ซึ่งประมวลผลอินพุตยาว และ cross-decoder ซึ่งทำงานต่อจากนั้น กลไก KV Bridging ให้ชั้นที่ใช้ full attention ใน cross-decoder สร้างค่า key และ value (KV) จากสถานะภายในที่ self-decoder คำนวณไว้ เมื่อ KV ของส่วนหลังได้มาจากส่วนแรก การทำ prefill กับบริบทเดิมจึงจบได้หลัง self-decoder โดยไม่ต้องส่งบริบทยาวทั้งหมดผ่าน cross-decoder อีกครั้ง แต่ cross-decoder ยังคงมีส่วนร่วมเมื่อโมเดลสร้างโทเค็นใหม่ 4
6
15
อีกระดับหนึ่งคือ KV Reuse: ภายในแต่ละกลุ่มชั้นแบบผสม ชั้นที่ใช้ sparse attention จะใช้แคช KV และดัชนีโทเค็นที่เลือกจากชั้น full attention ก่อนหน้าร่วมกัน HySparse2 เลือกข้อมูลเป็นรายโทเค็นแทนการเลือกเป็นกลุ่ม และบังคับรวมโทเค็นที่อยู่ใกล้ที่สุดไว้ในชุดที่เลือก วิธีนี้ใช้แทนแขนง sliding-window attention ที่แยกต่างหาก ทำให้ข้อมูลล่าสุดกับข้อมูลที่เลือกจากระยะไกลใช้แคชเดียวกันได้ เป้าหมายจึงไม่ใช่แค่ลดการเก็บแคชและการเลือกข้อมูลซ้ำ แต่ยังรักษาทางเข้าถึงบริบทใกล้ตัวไว้ด้วย 4
6
15
ในการเปรียบเทียบโมเดลแบบ mixture-of-experts (MoE) ที่มีพารามิเตอร์รวม 80B และใช้งานประมาณ 3B ต่อโทเค็น เมื่อบริบทยาว 1 ล้านโทเค็น HySparse2 ใช้ FLOPs สำหรับ prefill น้อยกว่า Hybrid SWA 5.02 เท่า ส่วนแคช KV ที่รายงานอยู่ที่ 2.69 GB เทียบกับ 12.09 GB หรือเล็กลงราว 4.5 เท่า Xiaomi ยังรายงานคะแนนการค้นคืนข้อมูล MRCRv2 และ RULER-v2 ที่สูงขึ้น พร้อมค่า AgentPPL และ LongPPL ที่ต่ำลง โดยรายงานการประเมินระบุว่า HySparse2 นำทั้ง HySparse และ Hybrid SWA ในการทดสอบค้นคืนข้อมูลบริบทยาวที่ประเมิน 6
15
ผลทดสอบแบบเปลี่ยนองค์ประกอบทีละอย่างชุดหนึ่งช่วยชี้ให้เห็นประโยชน์ของ การเลือกรายโทเค็น: เมื่อคงโครงสร้างหลักและงบการคำนวณ attention ไว้เท่าเดิม แล้วเปลี่ยนเฉพาะจากการเลือกเป็นกลุ่มมาเป็นรายโทเค็น ผลทดสอบที่ความยาว ไม่เกิน 32,000 โทเค็น เพิ่มขึ้น 6.57 จุดเปอร์เซ็นต์ใน RULER-v2, 8.14 จุดเปอร์เซ็นต์ใน MRCR-v2 แบบสองเบาะแส และ 5.55 จุดเปอร์เซ็นต์ใน GraphWalks ผลนี้สนับสนุนการเลือกที่ละเอียดขึ้นในเงื่อนไขดังกล่าว แต่ไม่ได้แยกวัดผลของ KV Bridging, KV Reuse หรือการบังคับรวมโทเค็นล่าสุดแต่ละอย่าง 6
ข้อควรระวังในการอ่านผล: หลักฐานที่มีไม่ได้ระบุตัวเลขเปรียบเทียบ HySparse กับ HySparse2 ที่ 1 ล้านโทเค็น ไม่ได้แจกแจงผลเพิ่มจากทุกกลไกแยกกัน และยังไม่ยืนยันว่าผลจากโมเดลที่นำมาเทียบกันนี้คงอยู่เมื่อขยายไปสู่โมเดลขนาดใหญ่กว่า ข้อความอ้างอิงที่มีไม่ได้ระบุความละเอียดของข้อมูลเบื้องหลังตัวเลขแคช 2.69 GB จึงไม่ควรเรียกตัวเลขนี้ว่าเป็นผลวัดแคชแบบ FP8 ที่ตรวจสอบยืนยันแล้ว อีกทั้ง FLOPs และขนาดแคชก็ไม่ใช่ตัวเลขความหน่วงที่วัดจากระบบให้บริการจริง 6
15
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
ในการเปรียบเทียบโมเดล MoE ที่มีพารามิเตอร์รวม 80B และใช้งานราว 3B ต่อโทเค็น HySparse2 ใช้ FLOPs สำหรับประมวลผลอินพุตเริ่มต้นน้อยกว่า Hybrid SWA 5.02 เท่าที่บริบท 1 ล้านโทเค็น และใช้แคช KV 2.69 GB เทียบกับ 12.09 GB [6]...
ในการเปรียบเทียบโมเดล MoE ที่มีพารามิเตอร์รวม 80B และใช้งานราว 3B ต่อโทเค็น HySparse2 ใช้ FLOPs สำหรับประมวลผลอินพุตเริ่มต้นน้อยกว่า Hybrid SWA 5.02 เท่าที่บริบท 1 ล้านโทเค็น และใช้แคช KV 2.69 GB เทียบกับ 12.09 GB [6]... จุดสำคัญคือให้ self decoder ประมวลผลอินพุตยาว แล้วให้ชั้นใน cross decoder ใช้ข้อมูล KV และผลการเลือกโทเค็นร่วมกัน โดยบังคับรวมโทเค็นล่าสุดไว้ด้วย [4][6][15]
นี่เป็นผลงานวิจัยด้านสถาปัตยกรรมที่เกี่ยวข้องกับแผนสำหรับ MiMo V3 ไม่ใช่หลักฐานว่ามีการปล่อยน้ำหนักโมเดล MiMo V3 รุ่นใหม่แล้ว [3][4]