Dalam perbandingan model MoE dengan 80 bilion parameter keseluruhan dan kira kira 3 bilion yang aktif bagi setiap token, HySparse2 mencatat 5,02 kali kurang FLOPs prapengisian berbanding Hybrid SWA pada sejuta token. Input panjang diproses oleh penyahkod kendiri; penyahkod silang menggunakan semula data KV dan hasil...
Diterbitkan olehDisunting dengan GPT-6 SolImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Apabila ejen AI berulang kali menerima output alat yang panjang, setiap pusingan menambah sejarah yang perlu diproses. HySparse2 ialah cadangan seni bina Xiaomi untuk mengurangkan kos memproses konteks yang semakin besar itu sambil mengekalkan akses kepada maklumat terkini dan maklumat yang jauh di belakang. Setakat bukti yang tersedia, ini ialah penyelidikan seni bina yang dikaitkan dengan rancangan MiMo-V3, bukan pengumuman keluaran baharu pemberat terbuka MiMo-V3. 3
4
HySparse2 membahagikan model kepada penyahkod kendiri (self-decoder) dan penyahkod silang (cross-decoder), mengikut pendekatan YOCO. Penyahkod kendiri memproses input panjang terlebih dahulu. Melalui KV Bridging, lapisan perhatian penuh dalam penyahkod silang membina pasangan key dan value (KV) daripada keadaan tersembunyi yang dihasilkan oleh penyahkod kendiri. Oleh sebab data KV itu datang daripada peringkat pertama, prapengisian konteks sedia ada boleh tamat selepas penyahkod kendiri, tanpa perlu menjalankan keseluruhan input panjang melalui penyahkod silang sekali lagi. Penyahkod silang masih digunakan apabila model menjana token baharu. 4
6
15
Di dalam setiap blok hibrid penyahkod silang, KV Reuse membolehkan lapisan perhatian jarang menggunakan semula cache KV dan indeks pemilihan token daripada lapisan perhatian penuh sebelumnya. HySparse2 memilih token individu, bukan blok token. Ia juga mewajibkan token terkini masuk dalam pemilihan jarang, menggantikan cabang perhatian tetingkap gelongsor yang berasingan. Dengan itu, token berdekatan dan token jauh yang dipilih boleh menggunakan cache yang sama. 4
6
15
Dalam perbandingan konfigurasi MoE yang dilaporkan — 80 bilion parameter keseluruhan, dengan kira-kira 3 bilion aktif bagi setiap token — FLOPs prapengisian HySparse2 pada sejuta token adalah 5,02 kali lebih rendah daripada Hybrid SWA. Saiz cache KV yang dilaporkan ialah 2,69 GB berbanding 12,09 GB, atau kira-kira 4,5 kali lebih kecil. Xiaomi turut melaporkan skor perolehan semula maklumat MRCRv2 dan RULER-v2 yang lebih tinggi, serta AgentPPL dan LongPPL yang lebih rendah. Menurut laporan penilaian, HySparse2 mengatasi HySparse dan Hybrid SWA dalam ujian perolehan semula konteks panjang yang dinilai. 6
15
Satu ujian pengasingan komponen mengekalkan struktur asas model dan peruntukan perhatian, tetapi menukar pemilihan mengikut blok kepada mengikut token. Pada ujian sepanjang 32 ribu token atau kurang, pemilihan mengikut token meningkatkan RULER-v2 sebanyak 6,57 mata peratusan, MRCR-v2 dua petunjuk sebanyak 8,14 mata peratusan, dan GraphWalks sebanyak 5,55 mata peratusan. Dapatan ini menyokong pemilihan yang lebih terperinci dalam keadaan ujian tersebut; ia tidak mengukur sumbangan KV Bridging, KV Reuse atau tetingkap token terkini secara berasingan. 6
Angka yang tersedia belum menetapkan perbandingan berangka HySparse dengan HySparse2 pada sejuta token, keuntungan setiap mekanisme secara berasingan, atau sama ada peningkatan pada model padanan ini kekal pada skala model yang lebih besar. Petikan sumber juga tidak menyatakan ketepatan angka yang digunakan untuk mengira cache 2,69 GB; maka angka itu tidak wajar dilabel sebagai ukuran khusus FP8 yang telah disahkan. FLOPs dan saiz cache pula bukan ukuran langsung kependaman dalam penggunaan sebenar. 6
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Dalam perbandingan model MoE dengan 80 bilion parameter keseluruhan dan kira kira 3 bilion yang aktif bagi setiap token, HySparse2 mencatat 5,02 kali kurang FLOPs prapengisian berbanding Hybrid SWA pada sejuta token.
Dalam perbandingan model MoE dengan 80 bilion parameter keseluruhan dan kira kira 3 bilion yang aktif bagi setiap token, HySparse2 mencatat 5,02 kali kurang FLOPs prapengisian berbanding Hybrid SWA pada sejuta token. Input panjang diproses oleh penyahkod kendiri; penyahkod silang menggunakan semula data KV dan hasil pemilihan token.