Papan pemuka awam MiMo-V2.6 memberi peluang melihat latihan pengukuhan (RL) selepas pralatihan bagi dua model Xiaomi, Pro dan Flash, ketika proses itu berjalan. Ia menunjukkan lebih daripada sekadar skor akhir. Namun, paparan tersebut ialah rekod yang diterbitkan oleh Xiaomi bagi dua sesi latihan ini—bukan pandangan menyeluruh terhadap pralatihan atau semua kerja pada infrastrukturnya.
1
18
Apa yang boleh dilihat?
Paparan Pro dan Flash menjejak langkah latihan yang selesai, percubaan atau rollout yang masih berjalan, jumlah token, graf ganjaran, kadar kejayaan tugasan, tempoh setiap langkah, kos terkumpul dan penilaian pengekodan sementara. Kaunter langkah latihan tidak semestinya seiring dengan kaunter rollout kerana penjanaan percubaan berjalan secara tak segerak dengan kemas kini model.
1
18
22
Laporan mengenai papan pemuka itu turut menyebut permulaan semula terpilih, ralat kehabisan memori GPU dan masalah set data. Takrif metriknya membezakan kegagalan menyelesaikan tugasan daripada percubaan yang terganggu akibat masalah infrastruktur. Maklumat itu berguna, tetapi tidak membuktikan bahawa setiap insiden dipaparkan.
18
23
Dalam satu tangkapan awal, kedua-dua model berada pada langkah latihan ke-10, sementara langkah rollout ke-16 sedang berjalan. Ketika itu, angka yang dilaporkan ialah kira-kira 2.2 bilion token bagi setiap langkah Pro dan 2.6 bilion bagi Flash, dengan kos terkumpul sekitar AS$741,000 dan AS$322,000. Itu angka pada satu ketika, bukannya kos akhir atau kadar perbelanjaan harian yang tetap.
25
Bagaimana latihan dan pemarkahan dijalankan?
Setiap kemas kini menggunakan 1,568 arahan, dengan 16 percubaan bagi setiap arahan—bersamaan 25,088 trajektori berpotensi. Susunan tak segerak membolehkan penjanaan jawapan dan pelaksanaan tugasan bertindih dengan proses pemarkahan serta kemas kini model. Latihan itu mencampurkan tugasan ejen, termasuk pengekodan, tugasan umum, visual dan keselamatan siber, menggunakan beberapa harness atau rangka kerja pelaksanaan tugasan.
4
10
19
Pemarkahan pula bukan sekadar lulus atau gagal. Pendekatan yang diterangkan Xiaomi menggabungkan keputusan ujian yang boleh dijalankan dengan rubrik khusus tugasan dan perbandingan antara percubaan bagi tugasan yang sama. Dengan itu, dua jawapan yang sama-sama berjaya masih boleh dinilai berbeza dari segi kualiti. Pemarkahan turut menggunakan sumber pengkomputeran: satu huraian laporan teknikal Xiaomi menganggarkannya sekitar 12.7% daripada kos RL Pro.
44
47
Anggaran awal “kira-kira 2 bilion token setiap langkah” menunjukkan skala latihan, bukan had token yang tetap. Laporan kemudian mencatat jumlah token per langkah yang lebih tinggi.
4
19
20
Cara membaca ganjaran, DeepSWE dan kos akhir
Ganjaran latihan merujuk kepada trajektori yang digunakan untuk mengemas kini model; ia bukan ujian keupayaan bebas. Xiaomi mentakrifkan dynsam/avg@n sebagai purata pecahan percubaan yang berjaya bagi setiap arahan yang disampel. Versi _no_infra mengecualikan percubaan yang gagal atas sebab infrastruktur. Membandingkan kedua-duanya membantu mengelakkan gangguan sistem daripada disalah anggap sebagai kelemahan model, tetapi kedua-dua metrik itu juga tidak mengukur prestasi bagi semua kemungkinan tugasan.
18
Tangkapan awal tadi merekodkan skor DeepSWE v1.1 sebanyak 62.24 untuk Pro dan 60.77 untuk Flash—penilaian sementara, bukan keputusan akhir. Xiaomi kemudian melaporkan sekitar 72.6 untuk Pro dan 65.7 untuk Flash pada akhir latihan. Skor tersebut masih perlu dibaca mengikut kaedah penilaian Xiaomi, bukan sebagai keputusan papan kedudukan awam yang telah dihasilkan semula secara bebas.
25
17
45
Menurut Xiaomi, kedua-dua model menamatkan 30 langkah setiap satu dalam kurang enam hari, dengan kos RL sekitar AS$2.62 juta untuk Pro dan AS$850,000 untuk Flash—kira-kira AS$3.47 juta keseluruhannya. Angka kira-kira 750,000 trajektori paling munasabah dibaca sebagai jumlah bagi setiap model: 25,088 trajektori berpotensi setiap langkah didarab 30 menghasilkan 752,640 bagi setiap sesi latihan. Kos yang dilaporkan itu tidak merangkumi pralatihan atau semua kerja pembangunan model yang lain.
2
4
44
45
Apa yang masih tidak diketahui?
Keistimewaan papan pemuka ini ialah data latihan dan operasi dipaparkan dari semasa ke semasa, ketika sesi latihan masih berlangsung, bukan hanya selepas model siap. Xiaomi kemudiannya mengumumkan penerbitan pemberat model Pro dan Flash, model tersuling 9B, laporan teknikal, lebih 7,000 persekitaran tugasan RL, rangka kerja RL hujung ke hujung serta mini-harness yang boleh digabungkan.
1
15
Namun, sumber yang tersedia tidak mengesahkan secara bebas bahawa siaran data itu berterusan tanpa gangguan atau tapisan, mahupun menunjukkan semua aktiviti infrastruktur yang berjalan serentak. Kewujudan model tersuling 9B juga bukan bukti bahawa trafik penyulingan yang tidak didedahkan berjalan di sebalik dua sesi latihan yang dipaparkan, atau bahawa kosnya termasuk dalam angka Pro dan Flash.
18
15
2