Xiaomi membuka Xiaomi Robotics U0 pada 15 Juli 2026: model dunia multimodal autoregresif 38 miliar parameter untuk membuat serta memodifikasi data latih robot sintetis, bukan kebijakan pengendali robot. Rilisnya mencakup bobot model, kode inferensi, demo Gradio, serta backend AR dan FlashAR di bawah lisensi Apache 2.0.
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Tanggal dalam pertanyaan awal tampaknya mencampurkan dua pembaruan. Rilis skala penuh Xiaomi-Robotics-U0 dilaporkan terjadi pada 15 Juli 2026. Pada September, repositorinya mengumumkan bobot tambahan 4B dan model sequence, serta kode pelatihan FSDP. 7
9
Xiaomi-Robotics-U0 pada dasarnya adalah sistem generatif terbuka untuk memproduksi data sintetis yang dapat dikendalikan bagi robotika. Sistem ini dapat membuat atau mengubah skenario visual dari sudut pandang robot, sambil berupaya mempertahankan unsur yang penting untuk pelatihan—misalnya observasi robot, konteks manipulasi, perspektif kamera, dan konsistensi adegan. U0 bukan kebijakan aksi robot yang langsung menerjemahkan pengamatan menjadi gerakan. 1
6
Model unggulan U0 disebut sebagai model fondasi dunia multimodal autoregresif dengan 38 miliar parameter. Rilis terbukanya mencakup bobot model, kode sumber dan inferensi, konfigurasi komposabel, titik masuk Gradio, serta patch untuk inferensi autoregresif dan FlashAR/vLLM. Repositori tersebut menggunakan lisensi Apache-2.0. 2
4
9
Pada September, Xiaomi juga mencantumkan tiga rilis tambahan: Xiaomi-Robotics-U0-4B, Xiaomi-Robotics-U0-Sequence, dan Xiaomi-Robotics-U0-4B-Sequence, bersama kode pelatihan FSDP. Jadi, U0 kini lebih tepat dipahami sebagai keluarga model yang berkembang, bukan sekadar satu checkpoint skala penuh. 9
Gagasan utama U0 adalah menyatukan sejumlah tugas dalam satu arsitektur. Xiaomi menyatakan model ini mendukung:
Kegunaan paling menonjolnya adalah augmentasi data. Tim dapat memulai dari lintasan atau observasi robot, lalu memvariasikan latar, pencahayaan, material, maupun objek untuk menghasilkan contoh latihan baru tanpa harus mengulang setiap pengambilan data di dunia nyata. 3
7
Inilah perbedaannya dengan generator gambar biasa yang terutama mengejar satu gambar menarik. Nilai yang dituju U0 adalah variasi yang terkendali sembari mempertahankan geometri dan konteks interaksi yang penting bagi robot. 3
7
U0 adalah model visual autoregresif. Alih-alih memakai proses penghilangan derau bertahap yang lazim pada sistem gambar berbasis difusi, U0 menghasilkan token visual secara berurutan. Laporan menyebut fondasinya menggabungkan EMU3.5 dan Qwen-3-32B, serta memakai tokenizer visual diskret bersama untuk tugas-tugas yang didukungnya. 4
7
Pendekatan autoregresif membuat gambar, observasi, dan urutan waktu lebih mudah diperlakukan sebagai aliran token. Namun, pembuatan gambar beresolusi tinggi menjadi mahal karena token perlu dihasilkan secara berurutan. Batas komputasi inilah yang mendorong Xiaomi memasangkan U0 dengan jalur inferensi khusus. 1
5
FlashAR+ adalah metode akselerasi Xiaomi untuk dekode token visual. Teknik ini menggunakan pembuatan paralel secara anti-diagonal, bukan mengeluarkan setiap token visual satu per satu secara ketat. Di atasnya, vLLM dipakai untuk menangani awalan kondisional, pemrosesan batch, dan pengelolaan paged KV-cache, sambil mempertahankan aturan dekode FlashAR+. 1
9
Xiaomi melaporkan FlashAR dengan vLLM dapat menghasilkan satu gambar dalam 5,44 detik pada satu GPU H20. Angka itu diklaim 82,86× lebih cepat daripada implementasi AR eager awal miliknya, serta 3,04× lebih cepat daripada FlashAR eager. 7
Catatan pentingnya: perbandingan tersebut memakai baseline autoregresif eager milik Xiaomi sendiri dalam pengaturan yang mereka laporkan. Ini bukan bukti bahwa U0 83× lebih cepat daripada generator gambar berbasis difusi, seluruh pipeline data robot kompetitor, atau sistem video generatif terdepan. Perangkat keras, pengaturan gambar, batching, jalur model, dan jenis beban kerja semuanya dapat memengaruhi throughput nyata. 1
7
Repositori mendukung backend eager dan vLLM untuk inferensi AR maupun FlashAR. Namun, itu tidak otomatis berarti semua kemampuan memiliki dukungan atau performa yang sama pada setiap mesin inferensi. Tim yang memakai alur kerja temporal atau multimodal khusus perlu memvalidasi checkpoint dan jalur inferensi yang benar-benar akan digunakan. 9
| Jenis sistem | Tujuan utama | Posisi U0 |
|---|---|---|
| Kebijakan robot | Mengubah observasi menjadi aksi robot | U0 berada di hulu sebagai model pembuatan dan augmentasi data, bukan pengganti kebijakan. Nilai hilir yang dilaporkan adalah peningkatan pelatihan kebijakan ketika menghadapi perubahan distribusi data. |
| Model dunia atau data berpusat pada robot | Membuat adegan, observasi, lintasan, atau data mirip simulasi untuk robot | Pembeda yang diklaim U0 adalah satu model untuk sintesis adegan, transfer, penyuntingan gambar, dan rollout berorientasi video. |
| Generator gambar umum | Kreasi dan penyuntingan teks/gambar yang luas | U0 mendukung text-to-image dan image-to-image, tetapi Xiaomi menekankan konsistensi untuk lingkungan berwujud, bukan klaim luas sebagai pemimpin kualitas gambar secara keseluruhan. |
| Generator video umum | Pembuatan video sinematik untuk beragam kebutuhan | Kapabilitas video U0 berorientasi robot. Ini tidak dapat dianggap sebagai bukti bahwa U0 melampaui model video umum terdepan untuk kualitas video terbuka. |
Xiaomi melaporkan U0 menempati peringkat pertama pada WorldArena, dengan 126 model peserta dalam evaluasi yang dilaporkan, serta menyoroti kepatuhan terhadap instruksi, kualitas interaksi, dan konsistensi multi-sudut pandang. Halaman proyek resmi Xiaomi juga menyebut model tersebut berada di peringkat pertama di antara lebih dari 100 model. 7
10
Untuk robotika hilir, Xiaomi melaporkan penambahan data sintetis buatan U0 meningkatkan keberhasilan robot nyata pada kondisi out-of-distribution (OOD)—yakni kondisi yang berbeda dari data latih—dari 36,9% menjadi 63,2%. Perubahan yang diuji antara lain pencahayaan dan latar yang tidak familier. 6
7
Hasil ini menjadi argumen terkuat bagi U0 sebagai alat augmentasi data sintetis. Namun, hasil tersebut tetap merupakan laporan dari proyek. Peringkat WorldArena saja tidak membuktikan keunggulan untuk setiap robot, kebijakan, tugas, simulator, atau benchmark gambar/video umum. Reproduksi independen memerlukan versi model, prompt, konfigurasi sampling, protokol evaluasi, pengaturan penilaian, dan versi pembanding yang persis sama. 7
10
Lisensi Apache-2.0 untuk repositori, bobot, dan perangkat inferensi membuat U0 relatif mudah diakses bagi pengembang yang memiliki komputasi memadai. Meski demikian, implementer tetap perlu memeriksa lisensi dan dokumentasi untuk tiap checkpoint, serta meninjau asal-usul dan penggunaan yang diizinkan bagi data sumber maupun data latihan yang dihasilkan. 4
9
Pembuatan video termasuk dalam daftar kemampuan terpadu yang dinyatakan. Akan tetapi, materi rilis yang tersedia tidak membuktikan bahwa checkpoint video, jalur akselerasi, data pelatihan, dan prosedur evaluasinya sudah sama lengkap dan mudah direproduksi untuk seluruh fungsi saat peluncuran awal Juli. Alur kerja gambar dan transfer adalah fokus penerapan yang paling jelas terdokumentasi; verifikasi alur video tertentu sebelum menjadikannya fondasi proyek. 4
6
Arti penting Xiaomi-Robotics-U0 bukan karena ia menggantikan kendali robot atau model media tujuan umum. Nilainya terletak pada pembukaan pipeline autoregresif besar dan terpadu untuk menghasilkan data visual sintetis yang dapat dikendalikan serta relevan bagi robot. Model unggulan 38B, bobot susulan yang lebih kecil, perangkat publik, dan jalur FlashAR+/vLLM memberi peneliti maupun tim robotika titik awal praktis untuk augmentasi data. 7
9
Klaim paling pentingnya—perbandingan inferensi internal hingga 82,86×, posisi puncak WorldArena, dan lonjakan keberhasilan kebijakan OOD dari 36,9% ke 63,2%—terlihat menjanjikan. Namun, semuanya sebaiknya diuji terhadap robot, beban kerja, perangkat keras, dan protokol evaluasi yang menjadi sasaran sebelum digeneralisasi. 7
10
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Xiaomi membuka Xiaomi Robotics U0 pada 15 Juli 2026: model dunia multimodal autoregresif 38 miliar parameter untuk membuat serta memodifikasi data latih robot sintetis, bukan kebijakan pengendali robot.
Xiaomi membuka Xiaomi Robotics U0 pada 15 Juli 2026: model dunia multimodal autoregresif 38 miliar parameter untuk membuat serta memodifikasi data latih robot sintetis, bukan kebijakan pengendali robot. Rilisnya mencakup bobot model, kode inferensi, demo Gradio, serta backend AR dan FlashAR di bawah lisensi Apache 2.0.
Klaim peringkat teratas WorldArena dan kenaikan keberhasilan OOD robot nyata dari 36,9% menjadi 63,2% menjanjikan, tetapi masih merupakan hasil yang dilaporkan proyek dan perlu diuji ulang pada robot serta skenario ta...