У порівнянні моделей MoE з 80 млрд параметрів загалом і приблизно 3 млрд активних на токен HySparse2 потребує у 5,02 раза менше операцій на етапі початкової обробки контексту в мільйон токенів, ніж Hybrid SWA. Довгий вхід обробляє перша частина моделі, а наступні шари спільно використовують KV дані та результати виб...
ОпублікувавВідредаговано за допомогою GPT-6 SolЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Коли ШІ-агент багаторазово звертається до інструментів, їхні об’ємні відповіді додаються до історії розмови. Перед наступною відповіддю моделі доводиться опрацьовувати дедалі довший контекст — цей початковий етап називають prefill. HySparse2 — запропонована дослідниками Xiaomi архітектура, покликана зменшити такі витрати й водночас зберегти здатність знаходити потрібне як у свіжих, так і в давніх фрагментах. Ідеться про дослідження архітектури, пов’язане з планами щодо MiMo-V3, а не про випуск нової моделі MiMo-V3 з відкритими вагами. 3
4
За підходом YOCO HySparse2 поділяє модель на self-decoder, який опрацьовує довгий вхід, і cross-decoder. Завдяки механізму KV Bridging шари повної уваги в другій частині формують свої ключі та значення — K і V — з прихованих станів першої. Тому початкову обробку вже наявного контексту можна завершити після self-decoder, не пропускаючи весь цей контекст ще й через cross-decoder. Під час генерації нових токенів cross-decoder продовжує працювати. 4
6
15
Є й другий рівень спільного використання даних — KV Reuse. У кожному змішаному блоці розріджені шари повторно використовують KV-кеш попереднього шару повної уваги та індекси відібраних токенів. Відбір відбувається на рівні окремих токенів, а не цілих блоків. При цьому недавні токени примусово включаються до вибірки: окрема гілка уваги з ковзним вікном більше не потрібна, а близький і відібраний віддалений контекст можуть користуватися одним кешем. 4
6
15
Для зіставної конфігурації MoE — 80 млрд параметрів загалом і близько 3 млрд активних на токен — заявлена кількість операцій на етапі prefill для HySparse2 за довжини мільйон токенів у 5,02 раза менша, ніж для Hybrid SWA. Обсяг KV-кешу становить 2,69 ГБ проти 12,09 ГБ, тобто приблизно у 4,5 раза менше. Xiaomi також повідомляє про вищі результати в тестах пошуку інформації MRCRv2 і RULER-v2 та нижчі показники AgentPPL і LongPPL. Згідно з оглядом оцінювання, у перевірених тестах пошуку в довгому контексті HySparse2 випереджає і HySparse, і Hybrid SWA. 6
15
В одному з експериментів дослідники залишили незмінними основу моделі та обсяг обчислень для механізму уваги, замінивши лише відбір блоків на відбір окремих токенів. На тестах із контекстом до 32 тисяч токенів результат зріс на 6,57 відсоткового пункта в RULER-v2, на 8,14 пункта в MRCR-v2 із двома шуканими фрагментами та на 5,55 пункта в GraphWalks. Це свідчить на користь точнішого відбору в таких умовах, але не показує окремий внесок KV Bridging, KV Reuse чи примусового включення недавніх токенів. 6
Межі висновків важливі: доступні дані не дають числового порівняння HySparse2 з HySparse саме на мільйоні токенів і не підтверджують, що такий самий виграш збережеться для більшої моделі. Наведені джерела також не уточнюють формат зберігання для показника 2,69 ГБ, тож називати його перевіреним результатом саме для FP8 не можна. Кількість операцій і розмір кешу — не те саме, що виміряний час відповіді в робочому сервісі. 6
15
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
У порівнянні моделей MoE з 80 млрд параметрів загалом і приблизно 3 млрд активних на токен HySparse2 потребує у 5,02 раза менше операцій на етапі початкової обробки контексту в мільйон токенів, ніж Hybrid SWA.
У порівнянні моделей MoE з 80 млрд параметрів загалом і приблизно 3 млрд активних на токен HySparse2 потребує у 5,02 раза менше операцій на етапі початкової обробки контексту в мільйон токенів, ніж Hybrid SWA. Довгий вхід обробляє перша частина моделі, а наступні шари спільно використовують KV дані та результати вибору токенів.