Thay vì chỉ công bố kết quả sau khi huấn luyện xong, Xiaomi mở một bảng theo dõi để người xem quan sát hai đợt học tăng cường sau huấn luyện của MiMo-V2.6 Pro và Flash khi chúng đang chạy. Đây là góc nhìn hiếm có về tiến độ và vận hành, nhưng vẫn là dữ liệu do Xiaomi công bố: nó không cho thấy giai đoạn tiền huấn luyện hay mọi công việc diễn ra trên hạ tầng của hãng.
1
18
Trên bảng theo dõi có gì?
Người xem có thể thấy số bước cập nhật mô hình đã hoàn tất, các lượt tạo lời giải (rollout) đang chạy, lượng token, đường biểu diễn phần thưởng, tỷ lệ hoàn thành nhiệm vụ, thời gian mỗi bước, chi phí lũy kế và điểm đánh giá tác vụ lập trình giữa quá trình. Bộ đếm bước huấn luyện có thể không trùng bộ đếm rollout, vì các lượt tạo lời giải diễn ra bất đồng bộ với việc cập nhật mô hình.
1
18
22
Bảng theo dõi còn cho thấy một số sự cố vận hành. Các bài tường thuật ghi nhận những lần khởi động lại, lỗi GPU hết bộ nhớ và vấn đề dữ liệu. Xiaomi cũng định nghĩa chỉ số phân biệt lượt thử thất bại vì nhiệm vụ với lượt bị hỏng do hạ tầng. Điều đó hữu ích khi đọc biểu đồ, song không chứng minh mọi sự cố đều đã được hiển thị.
18
23
Ở một thời điểm đầu quá trình, cả hai mô hình đã hoàn tất bước huấn luyện thứ 10 trong khi lượt rollout thứ 16 đang diễn ra. Ảnh chụp số liệu khi ấy ghi nhận khoảng 2,2 tỷ token mỗi bước ở Pro, 2,6 tỷ ở Flash; chi phí lũy kế tương ứng khoảng 741.000 USD và 322.000 USD. Đây không phải hóa đơn cuối cùng, cũng không phải mức chi cố định theo ngày.
25
Một bước huấn luyện được tổ chức ra sao?
Mỗi lần cập nhật dùng 1.568 yêu cầu đầu vào, mỗi yêu cầu có 16 lượt thử — tức tối đa 25.088 quỹ đạo thử nghiệm theo cấu hình. Các khâu tạo lời giải, thực hiện tác vụ, chấm điểm và cập nhật mô hình có thể gối lên nhau. Đợt huấn luyện trộn nhiều loại nhiệm vụ dành cho AI tác nhân, gồm lập trình, tác vụ tổng quát, xử lý hình ảnh và an ninh mạng, qua nhiều môi trường điều phối (harness) thay vì chỉ một dạng bài.
4
10
19
Việc chấm điểm không dừng ở đạt hay trượt. Theo phương pháp được mô tả, kết quả kiểm thử được kết hợp với tiêu chí riêng của nhiệm vụ và so sánh các lượt thử trong cùng nhóm, nhờ đó những lời giải cùng vượt qua bài kiểm thử vẫn có thể được đánh giá khác nhau về chất lượng. Khâu chấm cũng tốn tài nguyên tính toán: một bài phân tích báo cáo kỹ thuật ước tính nó chiếm khoảng 12,7% chi phí RL của Pro.
44
47
Con số ban đầu “khoảng 2 tỷ token mỗi bước” chỉ mô tả quy mô, không phải hạn mức cố định; các bài tường thuật về giai đoạn sau ghi nhận lượng token mỗi bước cao hơn.
4
19
20
Hiểu điểm thưởng, DeepSWE và tổng chi phí thế nào?
Phần thưởng huấn luyện phản ánh các quỹ đạo được dùng để cập nhật mô hình, không phải một phép kiểm tra năng lực độc lập. Theo định nghĩa trên bảng, dynsam/avg@n lấy tỷ lệ lượt thử thành công của từng yêu cầu được chọn trong bước đó rồi tính trung bình. Biến thể _no_infra loại các lượt thất bại vì hạ tầng. Đặt hai chỉ số cạnh nhau giúp tránh quy lỗi hệ thống cho mô hình, nhưng không chỉ số nào đại diện cho mọi tác vụ có thể gặp.
18
Ở ảnh chụp đầu quá trình, điểm DeepSWE v1.1 là 62,24 cho Pro và 60,77 cho Flash. Đây là đánh giá của các phiên bản trung gian. Xiaomi sau đó báo cáo kết quả cuối đợt khoảng 72,6 và 65,7 tương ứng. Các điểm này cần được hiểu trong thiết lập đánh giá của Xiaomi, không nên coi là kết quả trên bảng xếp hạng công khai đã được bên ngoài tái lập.
25
17
45
Theo Xiaomi, mỗi mô hình hoàn tất 30 bước trong chưa đầy sáu ngày, với chi phí RL khoảng 2,62 triệu USD cho Pro và 850.000 USD cho Flash — cộng lại khoảng 3,47 triệu USD. Phép tính 25.088 lượt thử tiềm năng mỗi bước × 30 bước = 752.640 lượt cho mỗi mô hình, giải thích vì sao con số khoảng 750.000 quỹ đạo nên được đọc là mỗi đợt chạy, không phải gộp cả hai. Chi phí được báo cáo không bao gồm tiền huấn luyện và toàn bộ công việc phát triển mô hình khác.
2
4
44
45
Công khai hơn, nhưng chưa phải toàn cảnh
Điểm khác biệt của bảng theo dõi là chuỗi số liệu huấn luyện và vận hành được đưa ra khi các đợt chạy đang diễn ra, thay vì chỉ công bố mô hình sau khi hoàn tất. Xiaomi sau đó thông báo công khai trọng số của Pro và Flash, một mô hình chưng cất 9B, báo cáo kỹ thuật, hơn 7.000 môi trường tác vụ RL, một bộ công cụ RL xuyên suốt và các mini-harness có thể kết hợp.
1
15
Tuy vậy, những nguồn hiện có không xác minh độc lập rằng luồng dữ liệu đã liên tục và không bị lọc, cũng không cho thấy mọi hoạt động chạy song song trên hạ tầng. Việc Xiaomi phát hành mô hình chưng cất 9B không đủ để kết luận có tác vụ chưng cất không được công bố chạy phía sau Pro và Flash, hoặc chi phí đó nằm trong số tiền của hai đợt RL được hiển thị.
18
15
2