Xiaomi đang công khai một phần telemetry của hai đợt huấn luyện RL chưa hoàn tất, MiMo V2.6 Pro và MiMo V2.6 Flash: khoảng 2 tỷ token mỗi bước, với 1.568 prompt × 16 rollout. Điểm đáng chú ý là hãng cho biết đang mở rộng đồng thời năng lực tính toán, môi trường tác tử đa nhiệm và năng lực chấm điểm dựa trên test cas...
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Xiaomi’s public MiMo-V2.6 reinforcement-learning post-training livestream at mimo.xiaomi.com/rl/, what does it reveal about the para. Article summary: Xiaomi’s MiMo-V2.6 page is an unusual public dashboard for *ongoing* RL post-training, not a release of a finished model. It exposes selected trainer-log telemetry for parallel unreleased Pro and Flash runs—reward and be. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Xiaomi đang công khai một phần vốn thường chỉ xuất hiện sau khi mô hình đã hoàn tất: telemetry trong giai đoạn hậu huấn luyện bằng học tăng cường (reinforcement learning, RL) của hai mô hình chưa phát hành là MiMo-V2.6-Pro và MiMo-V2.6-Flash. Thay vì chỉ đưa ra bảng benchmark cuối cùng, dashboard hiển thị các đường cong phần thưởng (reward), số rollout, thời gian mỗi bước, chi phí tính toán lũy kế, kết quả đánh giá và một số sự kiện hạ tầng. 1
8
Điều đáng chú ý nhất không phải là dashboard này đã chứng minh MiMo-V2.6 mạnh đến đâu. Nó cho thấy Xiaomi đang coi việc vận hành RL quy mô lớn cho tác tử AI — tạo rollout, chạy môi trường, xác minh kết quả, chấm điểm, cập nhật mô hình, xử lý lỗi và kiểm soát chi phí — là một quy trình đủ quan trọng để mở cho công chúng theo dõi.
Theo các báo cáo về trang này, hai đợt chạy Pro và Flash bắt đầu từ ngày 15/9/2026. Dashboard theo dõi tiến độ trong lúc mô hình vẫn đang huấn luyện; Xiaomi chưa công bố cấu hình cuối cùng, giá, API hay thời điểm người dùng có thể sử dụng hai mô hình. 1
8
Cấu hình batch được công bố khá lớn: 1.568 prompt, mỗi prompt có 16 rollout, tương đương khoảng 25.000 rollout; mỗi bước RL xử lý khoảng 2 tỷ token. Xiaomi cho biết hệ thống vận hành theo cơ chế bất đồng bộ hoàn toàn. 24
Luo Fuli, người đứng đầu nhóm MiMo, mô tả ba chiều mở rộng của đợt huấn luyện:
Diễn giải đơn giản, mô hình không chỉ tạo câu trả lời rồi nhận đánh giá kiểu thích/không thích. Nó có thể sinh các hành động hoặc lời giải, thực thi trong môi trường tác vụ, nhận phản hồi từ bộ kiểm tra hay rubric, rồi được cập nhật dựa trên phản hồi đó. Ở quy mô này, năng lực tạo rollout và chạy bộ đánh giá có thể quan trọng về mặt vận hành không kém bộ tối ưu hóa mô hình.
Trong hệ thống RL bất đồng bộ hoàn toàn, các công đoạn tạo rollout, thực thi môi trường, chấm điểm và cập nhật mô hình có thể diễn ra đồng thời, thay vì cả hệ thống phải chờ tác vụ chậm nhất. Cách làm này đặc biệt phù hợp với tải công việc tác tử hỗn hợp: có tác vụ kết thúc nhanh, nhưng cũng có tác vụ cần dùng công cụ lâu hơn hoặc tốn chi phí chấm điểm cao hơn.
Việc Xiaomi nhấn mạnh compute cho grader cũng đáng lưu ý. Với tác vụ tác tử, kết quả cuối cùng thường đến từ một chuỗi hành động chứ không phải một câu trả lời đơn lẻ. Vấn đề xác định hành động nào đã đóng góp vào kết quả tốt — điều Xiaomi gọi là phân bổ công trạng trong nhóm cho tác tử — trở thành một phần của chính hệ thống huấn luyện. 24
Bài học vận hành ở đây là: mở rộng RL cho tác tử không đơn thuần là bổ sung GPU huấn luyện. Hệ thống còn cần đủ năng lực môi trường, rollout và xác minh để liên tục cung cấp phản hồi có ích cho vòng lặp học.
Các báo cáo ban đầu dựa trên dashboard cho biết tổng chi tiêu hiển thị đã vượt 1,08 triệu USD trong khoảng 36 giờ sau khi Pro bắt đầu, tương đương trung bình khoảng 30.000 USD mỗi giờ cho cả hai đợt chạy. 4 Một ảnh chụp khác ghi nhận khoảng 830.000 USD cho Pro và 360.000 USD cho Flash; Pro từng khởi động lại do VRAM của node, còn Flash khởi động lại sau lỗi dữ liệu ở bước 15.
9
Đây là những con số gây chú ý, nhưng cần được hiểu thận trọng:
Dù vậy, bộ đếm này truyền tải một điểm khá rõ: Xiaomi đang mô tả đây là nỗ lực RL trực tuyến, nặng về hạ tầng và chi phí, chứ không phải một thử nghiệm hậu huấn luyện quy mô nhỏ.
Dashboard được cho là có reward curve và đánh giá lập trình giữa quá trình huấn luyện. Một ảnh chụp báo cáo điểm DeepSWE v1.1 là 63,72 cho Pro và 60,77 cho Flash. 9
Đây là các tín hiệu chẩn đoán hữu ích, không phải tuyên bố cuối cùng về năng lực. Reward tăng có thể phù hợp với việc mô hình hoàn thành tác vụ tốt hơn, nhưng cũng có thể chịu tác động bởi thay đổi hỗn hợp tác vụ, độ biến động, cách grader hoạt động, việc tối ưu theo phần thưởng hoặc mức độ mô hình đã tiếp xúc với benchmark. Tương tự, điểm benchmark giữa đợt chạy chưa thể là kết quả cuối cùng nếu chưa công bố giao thức đánh giá, thiết lập lấy mẫu, biện pháp kiểm soát nhiễm benchmark và cách chọn checkpoint cuối.
Cách đọc hợp lý là: livestream cho phép người quan sát theo dõi tín hiệu huấn luyện biến động thế nào. Nó không tự thân chứng minh một MiMo-V2.6 hoàn chỉnh sẽ tổng quát hóa tốt ra sao ngoài thiết lập đánh giá đang hiển thị.
Luo Fuli cho biết nhóm đã dành gần nửa năm nghiên cứu một câu hỏi: RL có thể mở rộng đến mức nào. Bà nói MiMo-V2.6 vẫn đang ở giữa đợt RL và Xiaomi sẽ mở mã nguồn các chi tiết “từng phần” trong những tuần tới. 24
Đây là cam kết đáng chú ý về việc công bố thêm thông tin kỹ thuật. Tuy nhiên, không nên hiểu nó là lời hứa về một gói tái lập hoàn chỉnh. Phát biểu này chưa cam kết công bố toàn bộ dữ liệu huấn luyện, prompt, trọng số grader, triển khai môi trường, trạng thái optimizer, mọi checkpoint hay log đầy đủ của cụm máy.
Tính minh bạch của MiMo-V2.6 tập trung vào khả năng quan sát quy trình: Xiaomi đang phơi bày một phần telemetry vận hành từ đợt hậu huấn luyện mô hình ngôn ngữ và tác tử đang diễn ra.
Trong khi đó, Xiaomi-Robotics-U0 là dự án khác và có kiểu cởi mở khác. Đây được mô tả là mô hình nền tảng thế giới tự hồi quy, đa phương thức, quy mô 38 tỷ tham số cho trí tuệ hiện thân; mô hình hợp nhất các tác vụ như tạo ảnh từ văn bản, chỉnh sửa ảnh, tạo cảnh hiện thân, chuyển giao hiện thân và tạo video hiện thân. 25
34 Kho lưu trữ công khai của Xiaomi mô tả các tài liệu mô hình và framework đã phát hành cho dự án này.
32
Có thể phân biệt ngắn gọn như sau:
Cả hai đều có giá trị, nhưng không hình thức nào tự động cung cấp mọi thứ cần thiết để tái lập toàn bộ kết quả từ đầu.
Livestream MiMo tiết lộ nhiều hơn thông báo benchmark sau khi hoàn tất, nhưng vẫn còn các bất định quan trọng.
Một dashboard công khai có thể gần thời gian thực nhưng vẫn có cập nhật trễ, dữ liệu được bổ sung sau, chỉnh sửa số liệu, tạm dừng, khởi động lại hoặc can thiệp thủ công. Sự tồn tại của nó là bằng chứng cho mức độ công khai bất thường, không phải bằng chứng mật mã về một tiến trình liên tục không gián đoạn.
Số lượng prompt, rollout, token và chi phí công khai không chứng minh rằng không có đầu ra từ mô hình giáo viên, dữ liệu độc quyền, dữ liệu con người đã lọc, tiếp xúc benchmark không công bố hoặc đầu vào ngoài dashboard.
Nếu chưa có harness đánh giá được công bố đầy đủ, bộ test cố định, thiết lập lấy mẫu, các seed lặp lại và tái lập độc lập, reward curve lẫn điểm DeepSWE tạm thời đều không thể kết luận năng lực tổng quát cuối cùng của mô hình.
Dashboard có thể cho thấy tiến độ và sự cố, nhưng không nhất thiết tiết lộ đầy đủ hỗn hợp tác vụ, trọng số phần thưởng, độ tin cậy của grader, danh mục phần cứng, phương pháp tính chi phí, nguồn gốc dữ liệu hay tiêu chí chọn checkpoint cuối cùng.
Dashboard MiMo-V2.6 là một thử nghiệm hiếm thấy về khả năng quan sát công khai đối với RL tác tử quy mô lớn. Cấu hình được Xiaomi công bố — khoảng 2 tỷ token mỗi bước, 1.568 prompt, 16 rollout bất đồng bộ cho mỗi prompt, môi trường hỗn hợp và phần chấm điểm tốn đáng kể năng lực tính toán — cho thấy hãng đang xem việc mở rộng RL là bài toán hệ thống, không chỉ là bài toán huấn luyện mô hình. 24
Chi phí hiển thị, reward curve, ảnh chụp benchmark và các lỗi được ghi nhận khiến quy trình này dễ kiểm tra hơn một bài đăng ra mắt chỉ có số liệu cuối. Nhưng đây vẫn là telemetry được chọn lọc và tự báo cáo từ các đợt chạy chưa hoàn tất. Dashboard là bằng chứng mạnh cho tính minh bạch vận hành, chứ chưa phải xác nhận độc lập về tính liên tục của livestream, nguồn gốc đầy đủ của dữ liệu huấn luyện hay chất lượng cuối cùng của mô hình.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Xiaomi đang công khai một phần telemetry của hai đợt huấn luyện RL chưa hoàn tất, MiMo V2.6 Pro và MiMo V2.6 Flash: khoảng 2 tỷ token mỗi bước, với 1.568 prompt × 16 rollout.
Xiaomi đang công khai một phần telemetry của hai đợt huấn luyện RL chưa hoàn tất, MiMo V2.6 Pro và MiMo V2.6 Flash: khoảng 2 tỷ token mỗi bước, với 1.568 prompt × 16 rollout. Điểm đáng chú ý là hãng cho biết đang mở rộng đồng thời năng lực tính toán, môi trường tác tử đa nhiệm và năng lực chấm điểm dựa trên test case तथा rubric.
Dashboard giúp quá trình vận hành dễ quan sát hơn, kể cả một số lỗi hạ tầng; nhưng các đường cong và số liệu giữa chừng không chứng minh nguồn gốc dữ liệu, tính liên tục “live” hay chất lượng cuối cùng của mô hình.