В сравнении MoE моделей с 80 млрд параметров, из которых на токен активируются около 3 млрд, HySparse2 требует в 5,02 раза меньше операций при предварительной обработке миллиона токенов, чем Hybrid SWA. Длинный ввод обрабатывает первая часть модели; вторая строит из её состояний данные для внимания.
ОпубликовалОтредактировано с помощью GPT-6 SolИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Когда ИИ-агент многократно обращается к инструментам, к его истории добавляются длинные ответы — например, результаты поиска или содержимое файлов. Перед следующим ответом модели приходится обрабатывать всё более объёмный контекст. HySparse2 — предложенная Xiaomi архитектура, призванная уменьшить затраты на эту предварительную обработку, или prefill, сохранив возможность обращаться и к недавним, и к далёким фрагментам истории. Опубликована работа об архитектуре, связанной с планами для MiMo-V3; она не означает выпуск новых открытых весов MiMo-V3. 3
4
HySparse2 делит модель по принципу YOCO на self-decoder и cross-decoder. Первая часть обрабатывает длинный ввод. Благодаря механизму KV Bridging слои полного внимания во второй части строят пары «ключ — значение» (K/V) из внутренних состояний первой. Поэтому предварительную обработку уже имеющегося длинного контекста можно завершить после self-decoder, не пропуская его повторно через cross-decoder. При генерации новых токенов вторая часть продолжает работать. 4
6
15
Есть и второй уровень совместного использования — KV Reuse. В каждом гибридном блоке разреженные слои используют KV-кеш предшествующего слоя полного внимания и уже полученные индексы выбранных токенов. Выбор идёт по отдельным токенам, а не по целым блокам. При этом недавние токены обязательно включаются в выборку: так модель сохраняет доступ к ближайшему контексту без отдельной ветки внимания со скользящим окном (SWA). Близкие и выбранные далёкие токены используют один кеш. 4
6
15
В опубликованном сравнении конфигураций MoE — моделей, где на каждый токен задействуется лишь часть параметров, — речь идёт о 80 млрд параметров всего и примерно 3 млрд активных на токен. При длине контекста 1 млн токенов HySparse2 требует в 5,02 раза меньше операций prefill, чем Hybrid SWA. Указанный объём KV-кеша составляет 2,69 ГБ против 12,09 ГБ, то есть примерно в 4,5 раза меньше. Также сообщается о более высоких результатах поиска по длинному контексту в MRCR-v2 и RULER-v2 и более низких показателях AgentPPL и LongPPL. По описанию оценки, в проверенных тестах поиска HySparse2 опережает и HySparse, и Hybrid SWA. 6
15
Отдельный эксперимент помогает оценить пользу выбора отдельных токенов: при неизменных базовой архитектуре и бюджете внимания замена выбора блоков на выбор токенов дала на тестах с контекстом до 32 тыс. токенов включительно прирост на 6,57 процентного пункта в RULER-v2, 8,14 пункта в двухигольном MRCR-v2 и 5,55 пункта в GraphWalks. Этот результат не позволяет по отдельности оценить вклад KV Bridging, KV Reuse или обязательного включения недавних токенов. 6
У приведённых данных есть границы: они не дают численного сравнения HySparse и HySparse2 именно на миллионе токенов и не подтверждают сохранение выигрыша при большем масштабе модели. В доступных описаниях также не указана точность хранения, на которой получено значение 2,69 ГБ, — называть его подтверждённым результатом для FP8 нельзя. Наконец, число операций и объём кеша не равны измеренному времени ответа в работающем сервисе. 6
15
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
В сравнении MoE моделей с 80 млрд параметров, из которых на токен активируются около 3 млрд, HySparse2 требует в 5,02 раза меньше операций при предварительной обработке миллиона токенов, чем Hybrid SWA.
В сравнении MoE моделей с 80 млрд параметров, из которых на токен активируются около 3 млрд, HySparse2 требует в 5,02 раза меньше операций при предварительной обработке миллиона токенов, чем Hybrid SWA. Длинный ввод обрабатывает первая часть модели; вторая строит из её состояний данные для внимания.
Речь об исследовании архитектуры для будущей MiMo V3, а не о выпуске новых открытых весов модели.