Xiaomi menyiarkan telemetri terpilih daripada dua latihan RL MiMo V2.6 yang belum selesai, iaitu Pro dan Flash, dengan kira kira 2 bilion token bagi setiap langkah merentas 1,568 prom dan 16 rollout bagi setiap prom. Isyarat teknikal utama ialah Xiaomi bukan sekadar meningkatkan kuasa pengiraan model, tetapi juga pe...
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Xiaomi’s public MiMo-V2.6 reinforcement-learning post-training livestream at mimo.xiaomi.com/rl/, what does it reveal about the para. Article summary: Xiaomi’s MiMo-V2.6 page is an unusual public dashboard for *ongoing* RL post-training, not a release of a finished model. It exposes selected trainer-log telemetry for parallel unreleased Pro and Flash runs—reward and be. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Pasukan MiMo Xiaomi telah membuka satu bahagian yang jarang dilihat oleh orang ramai dalam pembangunan model AI: sebuah dashboard untuk latihan lanjutan pembelajaran pengukuhan (reinforcement learning, RL) bagi dua model belum dikeluarkan, MiMo-V2.6-Pro dan MiMo-V2.6-Flash. Daripada hanya menerbitkan jadual penanda aras selepas semuanya siap, laman itu memaparkan telemetri terpilih seperti lengkung ganjaran, jumlah rollout, masa setiap langkah, anggaran kos pengiraan terkumpul, keputusan penilaian dan insiden infrastruktur. 1
8
Perkara paling penting bukanlah dashboard ini membuktikan keputusan akhir model. Sebaliknya, ia menunjukkan Xiaomi menganggap operasi RL ejen pada skala besar—termasuk rollout, persekitaran tugasan, pengesahan, pemarkahan, kemas kini, kegagalan dan perbelanjaan—sebagai sesuatu yang wajar diperhatikan secara terbuka.
Laporan mengenai laman awam itu menyatakan kedua-dua latihan Pro dan Flash bermula pada 15 September 2026. Dashboard menjejak perkembangan ketika model masih dilatih; Xiaomi belum mengumumkan spesifikasi akhir, harga atau ketersediaan awam bagi mana-mana model tersebut. 1
8
Konfigurasi kelompok yang didedahkan adalah besar: 1,568 prom dengan 16 rollout bagi setiap prom, bersamaan kira-kira 25,000 rollout, serta sekitar 2 bilion token bagi setiap langkah RL. Xiaomi menyatakan sistem itu beroperasi secara asinkron sepenuhnya. 24
Ini bukan gambaran gelung pengoptimuman keutamaan yang mudah ke atas pasangan teks statik. Luo Fuli, ketua pasukan MiMo, menerangkan tiga dimensi penskalaan:
Secara praktikal, huraian ini membayangkan saluran kerja yang membolehkan model menghasilkan tindakan atau penyelesaian, melaksanakannya dalam persekitaran tugasan, menerima maklum balas daripada pengesah atau rubrik, kemudian dikemas kini berdasarkan maklum balas itu. Pada skala ini, menjana rollout dan menjalankan penilaian boleh menjadi sama penting dengan proses pengoptimuman model itu sendiri.
Sistem RL yang asinkron sepenuhnya membolehkan penjanaan rollout, pelaksanaan dalam persekitaran, pemarkahan dan kemas kini model berjalan serentak, tanpa semua komponen perlu menunggu tugasan paling lambat. Reka bentuk sebegini sangat relevan untuk beban kerja ejen bercampur, apabila ada tugasan selesai pantas tetapi ada yang memerlukan penggunaan alat lebih panjang atau pemarkahan lebih mahal.
Penekanan Xiaomi terhadap pengiraan penilai juga signifikan. Dalam tugasan ejen, hasil akhir boleh bergantung pada satu rentetan tindakan, bukannya satu jawapan sahaja. Menentukan bahagian tindakan yang patut menerima ganjaran—yang disebut Xiaomi sebagai agihan kredit dalam kumpulan ejen—menjadi sebahagian daripada sistem latihan, bukan kerja sampingan. 24
Jadi, dashboard ini membawa satu pengajaran operasi: menskalakan RL untuk ejen bukan sekadar menambah GPU latihan. Ia juga memerlukan kapasiti persekitaran, rollout dan pengesah yang mencukupi agar gelung latihan terus menerima maklum balas berguna.
Laporan awal berdasarkan dashboard awam itu meletakkan gabungan perbelanjaan pada lebih AS$1.08 juta dalam kira-kira 36 jam selepas latihan Pro bermula, iaitu purata sekitar AS$30,000 sejam bagi kedua-dua latihan. 4 Rakaman lain melaporkan kira-kira AS$830,000 untuk Pro dan AS$360,000 untuk Flash; latihan Pro dilaporkan dimulakan semula kerana VRAM nod, manakala Flash dimulakan semula selepas ralat set data pada langkah ke-15.
9
Angka ini memang besar, tetapi perlu dibaca dengan berhati-hati:
Namun, satu perkara jelas: Xiaomi menggambarkan usaha ini sebagai RL dalam talian yang mahal dan berat dari sudut infrastruktur, bukannya eksperimen latihan lanjutan yang kecil.
Dashboard itu dilaporkan memaparkan lengkung ganjaran dan penilaian pengekodan ketika latihan masih berjalan. Satu rakaman melaporkan skor DeepSWE v1.1 sebanyak 63.72 untuk Pro dan 60.77 untuk Flash. 9
Ini ialah diagnostik yang berguna, bukan tuntutan keupayaan akhir. Lengkung ganjaran yang menaik mungkin selaras dengan penyelesaian tugasan yang lebih baik, tetapi ia juga boleh berubah disebabkan campuran tugasan, variasi, tingkah laku penilai, pengoptimuman terhadap fungsi ganjaran atau pendedahan kepada penanda aras. Begitu juga, skor penanda aras pertengahan latihan bukan keputusan akhir melainkan protokol penilaian, tetapan pensampelan, kawalan pencemaran data dan proses memilih titik semak akhir didokumenkan serta diperiksa secara bebas.
Bacaan yang lebih tepat ialah: siaran ini membolehkan pemerhati melihat isyarat latihan berubah dari semasa ke semasa. Ia tidak dengan sendirinya menunjukkan sejauh mana model MiMo-V2.6 yang siap kelak akan membuat generalisasi di luar tetapan penilaian yang dipaparkan.
Luo Fuli berkata pasukannya menghabiskan hampir setengah tahun meneliti satu soalan: sejauh mana RL boleh diskalakan. Beliau menyifatkan MiMo-V2.6 masih berada di tengah-tengah latihan RL dan berkata Xiaomi akan membuka sumber butiran teknikal itu secara berperingkat dalam beberapa minggu berikutnya. 24
Itu ialah komitmen yang bermakna untuk pendedahan teknikal lanjut, tetapi ia tidak harus dianggap sebagai janji pelepasan lengkap yang boleh dihasilkan semula. Kenyataan itu sendiri tidak menjanjikan semua data latihan, prom, pemberat penilai, pelaksanaan persekitaran, keadaan pengoptimum, setiap titik semak atau log kluster penuh.
Ketelusan MiMo-V2.6 tertumpu pada keterlihatan proses. Xiaomi memaparkan telemetri operasi terpilih daripada latihan lanjutan bahasa dan ejen yang sedang berlangsung.
Xiaomi-Robotics-U0 pula ialah projek berbeza dengan bentuk keterbukaan yang lain. Model robotik itu diterangkan sebagai model asas dunia autoregresif 38 bilion parameter untuk kecerdasan berjasad, yang menyatukan tugas termasuk penjanaan teks-ke-imej, penyuntingan imej, penjanaan pemandangan berjasad, pemindahan berjasad dan penjanaan video berjasad. 25
34 Repositori awam Xiaomi menerangkan bahan model dan rangka kerja yang dikeluarkan untuk kerja tersebut.
32
Perbezaannya mudah:
Kedua-duanya boleh bernilai, tetapi kedua-duanya tidak secara automatik memberikan segala yang diperlukan untuk menghasilkan semula keputusan penuh dari awal.
Siaran MiMo lebih mendedahkan berbanding pengumuman penanda aras akhir biasa, tetapi beberapa ketidakpastian penting masih ada.
Dashboard awam boleh hampir masa nyata, namun masih mungkin mempunyai kemas kini tertunda, nilai yang dimasukkan kemudian, pembetulan data, jeda, mula semula atau campur tangan manual. Kewujudannya ialah bukti pendedahan yang luar biasa, bukan bukti kriptografi bahawa latihan berjalan tanpa putus.
Jumlah prom, rollout, token dan kos yang dipaparkan tidak membuktikan ketiadaan output model guru yang tidak didedahkan, data proprietari, data manusia yang ditapis, pendedahan tersembunyi kepada penanda aras atau input luar dashboard yang lain.
Tanpa harness penilaian yang diterbitkan sepenuhnya, set ujian yang dibekukan, tetapan pensampelan, benih ulangan dan penghasilan semula oleh pihak bebas, lengkung ganjaran serta keputusan DeepSWE sementara tidak dapat menentukan keupayaan umum akhir model.
Dashboard boleh menunjukkan kemajuan dan insiden tanpa mendedahkan keseluruhan campuran tugasan, pemberat ganjaran, kebolehpercayaan penilai, inventori perkakasan, metodologi kos tepat, asal-usul data atau kriteria pemilihan titik semak akhir.
Dashboard MiMo-V2.6 Xiaomi ialah eksperimen kebolehlihatan awam yang jarang berlaku untuk RL ejen berskala besar. Konfigurasi yang didedahkan—sekitar 2 bilion token setiap langkah, 1,568 prom, 16 rollout asinkron bagi setiap prom, persekitaran bercampur dan kerja pemarkahan yang besar—menunjukkan Xiaomi melihat penskalaan RL sebagai masalah sistem, bukan sekadar masalah melatih model. 24
Perbelanjaan yang dilaporkan, lengkung ganjaran, rakaman penanda aras dan kegagalan yang kelihatan menjadikan proses ini lebih mudah diperiksa berbanding pengumuman selepas pelancaran. Namun, semuanya masih telemetri terpilih dan dilaporkan sendiri daripada latihan yang belum siap. Dashboard itu ialah bukti kukuh tentang ketelusan operasi—bukan bukti bebas bahawa latihan berlangsung tanpa gangguan, asal-usul latihan lengkap diketahui, atau kualiti model akhir telah disahkan.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Xiaomi menyiarkan telemetri terpilih daripada dua latihan RL MiMo V2.6 yang belum selesai, iaitu Pro dan Flash, dengan kira kira 2 bilion token bagi setiap langkah merentas 1,568 prom dan 16 rollout bagi setiap prom.
Xiaomi menyiarkan telemetri terpilih daripada dua latihan RL MiMo V2.6 yang belum selesai, iaitu Pro dan Flash, dengan kira kira 2 bilion token bagi setiap langkah merentas 1,568 prom dan 16 rollout bagi setiap prom. Isyarat teknikal utama ialah Xiaomi bukan sekadar meningkatkan kuasa pengiraan model, tetapi juga persekitaran ejen berbilang tugasan serta pengiraan penilai yang menggunakan ganjaran berasaskan kes ujian dan rubrik.
Dashboard ini luar biasa telus tentang kemajuan operasi dan beberapa kegagalan, namun graf terbuka itu tidak membuktikan kesinambungan latihan secara langsung, asal usul data yang bersih, atau keupayaan akhir yang dis...