Trong phép so sánh mô hình MoE cùng cấu hình, với 80 tỷ tham số tổng và khoảng 3 tỷ tham số hoạt động trên mỗi token, HySparse2 cần ít FLOPs tiền xử lý hơn 5,02 lần ở 1 triệu token so với Hybrid SWA; bộ nhớ đệm KV đượ... HySparse2 cho phần self decoder xử lý đầu vào dài, rồi để các lớp phía sau dùng chung dữ liệu KV...
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How does Xiaomi’s HySparse2 architecture use a YOCO-style self-decoder and cross-decoder, KV Bridging, and token-level KV Reuse with a force. Article summary: HySparse2 is an architecture proposal for long, repeatedly extended agent contexts—not a new MiMo-V3 open-weight release. Its central idea is to avoid running every long prompt through every decoder layer while retaining. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Một tác nhân AI có thể chỉ trả lời vài dòng nhưng lại phải đọc thêm cả trang kết quả từ công cụ, mã nguồn hoặc nhật ký ở mỗi lượt. Khi lịch sử trao đổi phình to, bước tiền xử lý đầu vào (prefill) và bộ nhớ đệm key-value (KV) trở nên tốn kém. HySparse2 là kiến trúc Xiaomi đề xuất để giảm gánh nặng đó mà vẫn cho mô hình tiếp cận thông tin ở cả gần lẫn xa trong ngữ cảnh. Công trình được công bố là nghiên cứu kiến trúc liên quan đến kế hoạch cho MiMo-V3, không phải một bản phát hành trọng số mở mới của MiMo-V3. 3
4
Theo cách chia lấy cảm hứng từ YOCO, HySparse2 gồm self-decoder ở phía trước và cross-decoder ở phía sau. Self-decoder xử lý đầu vào dài. Nhờ cơ chế KV Bridging, các lớp chú ý toàn phần trong cross-decoder tạo key và value từ trạng thái ẩn của self-decoder. Vì dữ liệu KV của phần sau bắt nguồn từ phần trước, bước prefill cho ngữ cảnh đã có có thể kết thúc khi self-decoder chạy xong, thay vì đưa toàn bộ ngữ cảnh qua cross-decoder lần nữa. Cross-decoder vẫn tham gia khi mô hình sinh token mới. 4
6
15
HySparse2 còn tiết kiệm ở bên trong cross-decoder. Với KV Reuse, các lớp chú ý thưa trong cùng một khối dùng lại bộ nhớ đệm KV và các chỉ số chọn token của lớp chú ý toàn phần ngay trước đó. Kiến trúc chọn từng token thay vì chọn cả khối token. Nó cũng bắt buộc đưa những token gần nhất vào tập được chọn, thay cho một nhánh chú ý cửa sổ trượt riêng: thông tin mới và các token ở xa được chọn có thể dùng chung bộ nhớ đệm. Những thay đổi này nhằm giảm việc lưu trữ và chọn lọc lặp lại mà không gạt bỏ ngữ cảnh gần. 4
6
15
Trong phép so sánh được báo cáo với các mô hình MoE cùng cấu hình, có 80 tỷ tham số tổng và khoảng 3 tỷ tham số hoạt động trên mỗi token, HySparse2 cần ít FLOPs prefill hơn 5,02 lần so với Hybrid SWA ở ngữ cảnh 1 triệu token. Dung lượng bộ nhớ đệm KV được báo cáo là 2,69 GB so với 12,09 GB, tức nhỏ hơn khoảng 4,5 lần. Xiaomi cũng báo cáo điểm truy xuất MRCRv2 và RULER-v2 cao hơn, còn AgentPPL và LongPPL thấp hơn; bản tường thuật kết quả đánh giá cho biết HySparse2 dẫn trước cả HySparse lẫn Hybrid SWA trên các bài kiểm tra truy xuất ngữ cảnh dài được thực hiện. 6
15
Một phép thử loại trừ yếu tố khác giữ nguyên cấu trúc nền và ngân sách chú ý, chỉ đổi cách chọn theo khối sang theo token. Ở các bài kiểm tra có độ dài không quá 32.000 token, báo cáo ghi nhận mức tăng 6,57 điểm phần trăm trên RULER-v2, 8,14 điểm trên MRCR-v2 hai manh mối và 5,55 điểm trên GraphWalks. Kết quả ủng hộ việc chọn lọc chi tiết hơn trong thiết lập đó, nhưng không tách riêng hiệu quả của KV Bridging, KV Reuse hay cửa sổ token gần nhất. 6
Các nguồn được dẫn chưa đủ để xác lập mức chênh lệch bằng số giữa HySparse và HySparse2 ở 1 triệu token, mức đóng góp riêng của từng cơ chế, hoặc liệu kết quả trên mô hình cùng cấu hình có duy trì ở quy mô lớn hơn hay không. Chúng cũng không nêu rõ độ chính xác lưu trữ đằng sau con số 2,69 GB, nên không thể gọi đây là phép đo bộ nhớ đệm KV dùng FP8 đã được xác minh. FLOPs và dung lượng bộ nhớ đệm là các chỉ số chi phí tính toán, không phải số đo độ trễ khi vận hành thực tế. 6
15
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Trong phép so sánh mô hình MoE cùng cấu hình, với 80 tỷ tham số tổng và khoảng 3 tỷ tham số hoạt động trên mỗi token, HySparse2 cần ít FLOPs tiền xử lý hơn 5,02 lần ở 1 triệu token so với Hybrid SWA; bộ nhớ đệm KV đượ...
Trong phép so sánh mô hình MoE cùng cấu hình, với 80 tỷ tham số tổng và khoảng 3 tỷ tham số hoạt động trên mỗi token, HySparse2 cần ít FLOPs tiền xử lý hơn 5,02 lần ở 1 triệu token so với Hybrid SWA; bộ nhớ đệm KV đượ... HySparse2 cho phần self decoder xử lý đầu vào dài, rồi để các lớp phía sau dùng chung dữ liệu KV và kết quả chọn token; các token gần nhất được bắt buộc giữ lại để không bỏ sót ngữ cảnh mới.
Đây là nghiên cứu kiến trúc gắn với kế hoạch cho MiMo V3, không phải thông báo phát hành bộ trọng số mở của một mô hình MiMo V3 mới.