Dashboard publik MiMo-V2.6 memberi kesempatan melihat dua proses pelatihan lanjutan dengan reinforcement learning (RL, atau pembelajaran penguatan) ketika masih berjalan. Yang ditampilkan adalah proses untuk model Pro dan Flash, bukan pelatihan awal model atau seluruh pekerjaan di infrastruktur Xiaomi.
1
18
Angka apa saja yang ditampilkan?
Pengunjung dapat melihat langkah pelatihan yang selesai, proses pembuatan dan pengujian respons (rollout) yang masih berlangsung, jumlah token, kurva reward, tingkat keberhasilan tugas, waktu per langkah, biaya terakumulasi, serta hasil sementara evaluasi pemrograman. Penghitung langkah pelatihan dan rollout tidak harus sama: pembuatan respons berjalan secara asinkron, sehingga dapat berlanjut sementara pembaruan model diproses.
1
18
22
Ada pula petunjuk tentang kondisi operasional. Laporan atas dashboard menyebut sejumlah restart, masalah memori GPU, dan persoalan dataset. Definisi metrik Xiaomi membedakan percobaan yang gagal mengerjakan tugas dari percobaan yang terganggu masalah infrastruktur. Namun, tampilan tersebut tidak membuktikan bahwa setiap insiden tercatat di sana.
18
23
Dalam satu cuplikan awal, kedua model telah menyelesaikan langkah pelatihan ke-10, sementara rollout berada pada langkah ke-16. Cuplikan itu mencatat sekitar 2,2 miliar token per langkah untuk Pro dan 2,6 miliar untuk Flash; biaya yang terkumpul saat itu masing-masing sekitar US$741.000 dan US$322.000. Itu angka pada satu titik waktu, bukan biaya akhir ataupun tarif harian yang tetap.
25
Bagaimana proses pelatihan dan penilaiannya?
Setiap pembaruan memakai 1.568 prompt dengan 16 percobaan per prompt—setara 25.088 potensi lintasan per langkah. Pengaturan asinkron memungkinkan pembuatan respons dan pengerjaan tugas berlangsung beriringan dengan penilaian serta pembaruan model. Tugasnya beragam, mencakup pemrograman, agen umum, visual, dan keamanan siber, dengan beberapa perangkat pengujian (harness) dalam satu proses pelatihan.
4
10
19
Penilaiannya tidak berhenti pada lulus atau gagal. Pendekatan yang dijelaskan Xiaomi menggabungkan hasil tes yang dapat dijalankan, rubrik khusus tiap tugas, dan perbandingan antarpencobaan untuk tugas yang sama. Dengan begitu, dua jawaban yang sama-sama berhasil masih dapat dinilai berbeda kualitasnya. Proses penilaian ini juga membutuhkan komputasi: menurut sebuah ulasan atas laporan teknis Xiaomi, porsinya sekitar 12,7% dari biaya RL Pro.
44
47
Penyebutan awal “sekitar 2 miliar token per langkah” adalah gambaran skala, bukan jatah token yang tetap. Laporan berikutnya mencatat jumlah token per langkah yang lebih tinggi.
4
19
20
Bagaimana membaca reward, skor DeepSWE, dan biaya akhir?
Reward pelatihan merangkum lintasan yang digunakan untuk memperbarui model; ia bukan uji kemampuan yang independen. Xiaomi mendefinisikan dynsam/avg@n sebagai rata-rata, di seluruh prompt yang dipilih, dari proporsi percobaan yang berhasil pada tiap prompt. Versi _no_infra mengeluarkan percobaan yang gagal karena masalah infrastruktur. Membandingkan keduanya membantu agar rollout yang terganggu tidak langsung dianggap sebagai kegagalan model, tetapi tidak satu pun mengukur kemampuan pada semua jenis tugas.
18
Cuplikan awal mencatat skor DeepSWE v1.1 sebesar 62,24 untuk Pro dan 60,77 untuk Flash. Itu hasil evaluasi sementara. Xiaomi kemudian melaporkan hasil akhir sekitar 72,6 untuk Pro dan 65,7 untuk Flash. Angka tersebut tetap perlu dibaca dalam konteks pengaturan evaluasi Xiaomi, bukan sebagai hasil papan peringkat publik yang telah direproduksi secara independen.
25
17
45
Menurut Xiaomi, Pro dan Flash masing-masing menyelesaikan 30 langkah dalam waktu kurang dari enam hari. Biaya RL yang dilaporkan sekitar US$2,62 juta untuk Pro dan US$850.000 untuk Flash, atau sekitar US$3,47 juta jika digabung. Penyebutan sekitar 750.000 lintasan paling masuk akal dibaca per model: 25.088 potensi lintasan per langkah dikalikan 30 menghasilkan 752.640 untuk tiap proses. Pengeluaran itu tidak mencakup pelatihan awal maupun seluruh pekerjaan pengembangan model.
2
4
44
45
Seberapa jauh transparansinya?
Berbeda dari pengumuman yang hanya memperlihatkan model jadi, dashboard ini membuka data pelatihan dan operasional dari waktu ke waktu. Xiaomi juga telah mengumumkan bobot model Pro dan Flash, model hasil distilasi 9B, laporan teknis, lebih dari 7.000 lingkungan tugas RL, kerangka kerja RL menyeluruh, dan perangkat pengujian mini yang dapat digabungkan.
1
15
Tetap ada batasnya: sumber yang tersedia tidak memverifikasi secara independen bahwa tayangan berlangsung tanpa jeda atau penyaringan, ataupun memperlihatkan semua pekerjaan lain yang berjalan bersamaan. Keberadaan model distilasi 9B juga tidak membuktikan bahwa proses distilasinya tersembunyi di balik pekerjaan Pro dan Flash yang ditampilkan atau masuk dalam biaya yang dilaporkan.
18
15
2