Bildirilen eşdeğer model karşılaştırmasında HySparse2, 1 milyon tokenda Hybrid SWA’ya göre 5,02 kat daha az ön işleme hesabı kullanıyor; KV önbelleği 12,09 GB yerine 2,69 GB yer kaplıyor. Mimari, uzun girdiyi ilk çözücü bölümünde işliyor; sonraki bölüm KV verisini ve token seçim sonuçlarını yeniden kullanıyor.
YayımlayanGPT-6 Sol ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Bir yapay zekâ ajanı, uzun bir konuşma geçmişine yeni araç çıktıları ekledikçe yanıt üretmeden önce işlemesi gereken girdi de büyür. Xiaomi’nin HySparse2 mimarisi bu ön işleme (prefill) yükünü ve anahtar-değer (KV) önbelleğinin kapladığı alanı azaltmayı amaçlıyor. Çalışma, MiMo-V3 planlarıyla ilişkilendirilen bir mimari araştırması; yeni bir MiMo-V3 açık ağırlık sürümünün duyurusu değil. 3
4
HySparse2, modeli YOCO yaklaşımını izleyen iki bölüme ayırıyor: uzun girdiyi işleyen self-decoder ve token üretiminde de görev alan cross-decoder. KV Bridging mekanizmasında cross-decoder’ın tam dikkat katmanları, anahtar ve değerlerini self-decoder’ın ürettiği gizli durumlardan oluşturuyor. Böylece mevcut uzun bağlamın ön işlemesi self-decoder tamamlandığında bitebiliyor; aynı girdinin ayrıca cross-decoder boyunca işlenmesi gerekmiyor. Yeni tokenlar üretilirken cross-decoder çalışmaya devam ediyor. 4
6
15
İkinci paylaşım düzeyi olan KV Reuse ise her karma blokta seyrek dikkat katmanlarının, önceki tam dikkat katmanının KV önbelleğini ve token seçim indekslerini yeniden kullanmasını sağlıyor. Seçim, büyük metin blokları yerine tek tek tokenlar düzeyinde yapılıyor. Yakın tokenlar seçime zorunlu olarak katıldığı için ayrı bir kayan pencere dikkat koluna ihtiyaç kalmıyor; yakın bağlam ile uzaktan seçilen tokenlar aynı önbelleği kullanabiliyor. 4
6
15
Toplam 80 milyar parametreli, token başına yaklaşık 3 milyar parametresi etkinleşen eşdeğer uzmanlar karışımı (MoE) model karşılaştırmasında, HySparse2’nin 1 milyon token için ön işleme hesaplama miktarı, FLOPs cinsinden, Hybrid SWA’nınkinden 5,02 kat düşük. Bildirilen KV önbelleği boyutları 2,69 GB ve 12,09 GB; bu da yaklaşık 4,5 katlık bir fark. Xiaomi ayrıca MRCRv2 ve RULER-v2 uzun bağlamdan bilgi bulma testlerinde daha yüksek puanlar, AgentPPL ve LongPPL ölçümlerinde daha düşük değerler bildiriyor. Değerlendirmeyi aktaran bir habere göre HySparse2, incelenen uzun bağlamdan bilgi bulma testlerinde hem HySparse’ı hem Hybrid SWA’yı geride bırakıyor. 6
15
Bir bileşen karşılaştırmasında modelin temel yapısı ve dikkat için ayrılan hesaplama bütçesi sabit tutulup blok düzeyinde seçim token düzeyinde seçimle değiştiriliyor. 32 bin token ve altındaki testlerde token düzeyinde seçim; RULER-v2’de 6,57, iki ipuçlu MRCR-v2’de 8,14, GraphWalks’ta 5,55 yüzde puanı artış sağlıyor. Bu sonuç, söz konusu koşullarda daha ince seçim yapmanın katkısını gösteriyor; KV Bridging, KV Reuse veya yakın tokenları zorunlu seçmenin etkisini ayrı ayrı ölçmüyor. 6
Eldeki kaynaklar, 1 milyon tokenda HySparse ile HySparse2 arasındaki sayısal farkı ya da aynı kazanımların daha büyük model ölçeğinde sürüp sürmediğini ortaya koymuyor. Ayrıca 2,69 GB değerinin hangi sayısal hassasiyetle ölçüldüğü belirtilmediğinden bu rakam doğrulanmış bir FP8 KV önbelleği ölçümü olarak sunulmamalı. FLOPs ve önbellek boyutu da üretim ortamında ölçülmüş yanıt gecikmesiyle aynı şey değil. 6
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Bildirilen eşdeğer model karşılaştırmasında HySparse2, 1 milyon tokenda Hybrid SWA’ya göre 5,02 kat daha az ön işleme hesabı kullanıyor; KV önbelleği 12,09 GB yerine 2,69 GB yer kaplıyor.
Bildirilen eşdeğer model karşılaştırmasında HySparse2, 1 milyon tokenda Hybrid SWA’ya göre 5,02 kat daha az ön işleme hesabı kullanıyor; KV önbelleği 12,09 GB yerine 2,69 GB yer kaplıyor. Mimari, uzun girdiyi ilk çözücü bölümünde işliyor; sonraki bölüm KV verisini ve token seçim sonuçlarını yeniden kullanıyor.
Bunlar bir mimari araştırmasının bildirilen sonuçları; yeni bir MiMo V3 açık ağırlık sürümünün veya üretim ortamında ölçülmüş gecikme kazanımının kanıtı değil.