에이전트가 대화 도중 웹페이지나 코드 실행 결과를 받아오면, 짧은 답을 내기 전에 이미 쌓인 긴 기록과 새로 들어온 내용을 처리해야 한다. 샤오미의 HySparse2는 이 과정의 사전 처리(prefill) 비용을 줄이면서도, 최근 대화와 오래전 정보 모두를 검색할 수 있도록 설계한 아키텍처다. 공개된 것은 MiMo-V3에 적용할 계획과 관련된 아키텍처 연구이며, 새로운 MiMo-V3 오픈웨이트 모델의 공개를 입증하는 자료는 아니다.
3
4
긴 입력을 왜 앞단에서만 처리할 수 있나
HySparse2는 YOCO 방식과 유사하게 모델을 **셀프 디코더(self-decoder)**와 **크로스 디코더(cross-decoder)**로 나눈다. 긴 입력은 먼저 셀프 디코더가 처리한다. 이어 ‘KV 브리징(KV Bridging)’을 통해 크로스 디코더의 전체 어텐션 층이 셀프 디코더의 은닉 상태에서 키와 값(KV)을 만든다. 덕분에 기존의 긴 문맥을 크로스 디코더에 다시 통과시키지 않고, 셀프 디코더가 끝난 지점에서 그 입력의 사전 처리를 마칠 수 있다. 다만 새 토큰을 생성할 때는 크로스 디코더도 동작한다.
4
6
15
크로스 디코더 내부에서도 중복을 줄인다. ‘KV 재사용(KV Reuse)’은 각 혼합 블록의 희소 어텐션 층이 앞선 전체 어텐션 층의 KV 캐시와 토큰 선택 인덱스를 함께 쓰도록 한다. 여기서 KV 캐시는 이전 토큰을 참조하는 데 필요한 키·값 데이터를 저장한 공간이다. HySparse2는 여러 토큰을 묶은 블록이 아니라 개별 토큰 단위로 참조 대상을 고른다. 또 최근 토큰을 선택 대상에 강제로 포함해, 별도의 슬라이딩 윈도 어텐션 분기 없이 가까운 문맥과 선택된 먼 문맥이 같은 캐시를 사용하도록 한다.
4
6
15
비교 수치가 말해주는 것
보고된 비교는 총 800억 매개변수 중 토큰당 약 30억 개를 활성화하는 MoE(전문가 혼합) 구성을 기준으로 한다. 문맥 길이가 100만 토큰일 때 HySparse2의 사전 처리 연산량(FLOPs)은 Hybrid SWA의 5.02분의 1이었다. 보고된 KV 캐시 크기는 각각 2.69GB와 12.09GB로, HySparse2 쪽이 약 4.5배 작다. 샤오미는 MRCRv2·RULER-v2 검색 점수가 더 높고 AgentPPL·LongPPL은 더 낮다고 밝혔다. 평가를 전한 보도에 따르면 테스트한 긴 문맥 검색 과제에서 HySparse2는 HySparse와 Hybrid SWA보다 앞섰다.
6
15
구성 요소를 바꿔 비교한 실험에서는 모델의 기본 구조와 어텐션 예산을 고정하고 블록 단위 선택만 토큰 단위 선택으로 변경했다. 3만 2,000토큰 이하의 테스트에서 RULER-v2는 6.57%포인트, 두 개의 단서를 찾는 MRCR-v2는 8.14%포인트, GraphWalks는 5.55%포인트 올랐다고 보고됐다. 이는 해당 조건에서 더 세밀한 선택이 유리했다는 근거이지만, KV 브리징·KV 재사용·최근 토큰 강제 포함이 각각 얼마나 기여했는지를 따로 증명하지는 않는다.
6
해석에는 선을 그을 필요가 있다. 제공된 근거만으로는 100만 토큰에서 HySparse와 HySparse2의 수치 차이, 각 장치의 개별 효과, 더 큰 모델에서도 같은 개선이 유지되는지를 확정할 수 없다. 또한 2.69GB라는 캐시 수치에 적용된 저장 정밀도가 제시되지 않아 이를 검증된 FP8 캐시 측정값이라고 부를 수 없다. 사전 처리 FLOPs와 캐시 크기 역시 실제 서비스의 응답 지연 시간을 측정한 결과는 아니다.
6
15