Pada konfigurasi MoE pembanding dengan total 80 miliar parameter dan sekitar 3 miliar parameter aktif per token, HySparse2 dilaporkan membutuhkan FLOPs prapemrosesan 5,02 kali lebih sedikit daripada Hybrid SWA pada 1... Self decoder menangani input panjang; cross decoder memakai kembali data KV dan hasil pemilihan t...
Diterbitkan olehDiedit dengan GPT-6 SolGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Bayangkan agen AI yang harus membaca hasil alat, dokumen, dan riwayat percakapan yang terus bertambah, lalu mencari kembali satu informasi dari jauh sebelumnya. Tantangannya bukan hanya menampung konteks panjang, melainkan memprosesnya berulang kali tanpa membuat kebutuhan komputasi dan memori membengkak. HySparse2 adalah rancangan arsitektur Xiaomi untuk mengatasi masalah itu. Karya yang dirilis merupakan riset arsitektur yang dikaitkan dengan rencana MiMo-V3, bukan bukti bahwa bobot terbuka model MiMo-V3 baru telah dirilis. 3
4
HySparse2 membagi model menjadi dua bagian bergaya YOCO: self-decoder yang memproses input panjang dan cross-decoder yang menggunakannya. Melalui KV Bridging, lapisan perhatian penuh di cross-decoder membangun pasangan key dan value (KV) dari representasi yang dihasilkan self-decoder. Karena data KV bagian kedua berasal dari bagian pertama, tahap pemrosesan awal input—prefill—dapat selesai setelah self-decoder, tanpa harus menjalankan ulang seluruh konteks lama melalui cross-decoder. Cross-decoder tetap bekerja ketika model menghasilkan token baru. 4
6
15
Penghematan berikutnya terjadi di dalam cross-decoder. Dengan KV Reuse, lapisan perhatian selektif memakai kembali cache KV serta indeks token pilihan dari lapisan perhatian penuh sebelumnya. Pemilihan dilakukan per token, bukan per blok. HySparse2 juga selalu memasukkan token terbaru ke dalam pilihan tersebut, menggantikan cabang perhatian berjendela geser yang terpisah. Dengan begitu, token dekat dan token jauh yang terpilih dapat menggunakan cache yang sama. 4
6
15
Dalam perbandingan yang dilaporkan untuk konfigurasi mixture-of-experts (MoE) dengan total 80 miliar parameter dan sekitar 3 miliar parameter aktif per token, pada konteks 1 juta token, FLOPs prefill HySparse2 5,02 kali lebih rendah daripada Hybrid SWA. Ukuran cache KV yang dilaporkan adalah 2,69 GB berbanding 12,09 GB, atau sekitar 4,5 kali lebih kecil. Xiaomi juga melaporkan skor temu-kembali MRCRv2 dan RULER-v2 yang lebih tinggi serta AgentPPL dan LongPPL yang lebih rendah. Menurut laporan evaluasi, HySparse2 mengungguli HySparse dan Hybrid SWA pada pengujian temu-kembali konteks panjang yang dinilai. 6
15
Satu uji ablation memberi gambaran lebih khusus tentang pemilihan token. Ketika struktur dasar model dan anggaran perhatian dibuat sama, mengganti pemilihan per blok dengan pemilihan per token pada pengujian hingga 32 ribu token meningkatkan RULER-v2 sebesar 6,57 poin persentase, MRCR-v2 dua petunjuk sebesar 8,14 poin, dan GraphWalks sebesar 5,55 poin. Hasil itu mendukung pemilihan yang lebih rinci dalam kondisi uji tersebut, tetapi tidak mengukur secara terpisah sumbangan KV Bridging, KV Reuse, atau kewajiban memasukkan token terbaru. 6
Batasnya penting: bukti yang tersedia belum menetapkan angka perbandingan HySparse versus HySparse2 pada 1 juta token, besarnya kontribusi masing-masing mekanisme, atau apakah peningkatan pada model pembanding itu bertahan di skala model yang lebih besar. Cuplikan sumber juga tidak menyebut presisi penyimpanan di balik angka cache 2,69 GB, sehingga angka itu tidak boleh disebut sebagai hasil FP8 yang telah terverifikasi. FLOPs dan ukuran cache pun bukan pengukuran latensi pada layanan nyata. 6
15
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Pada konfigurasi MoE pembanding dengan total 80 miliar parameter dan sekitar 3 miliar parameter aktif per token, HySparse2 dilaporkan membutuhkan FLOPs prapemrosesan 5,02 kali lebih sedikit daripada Hybrid SWA pada 1...
Pada konfigurasi MoE pembanding dengan total 80 miliar parameter dan sekitar 3 miliar parameter aktif per token, HySparse2 dilaporkan membutuhkan FLOPs prapemrosesan 5,02 kali lebih sedikit daripada Hybrid SWA pada 1... Self decoder menangani input panjang; cross decoder memakai kembali data KV dan hasil pemilihan token.