SenseNova U1.5 menggabungkan pemahaman, penalaran, pembuatan, dan penyuntingan gambar dalam model Mixture of Transformers berparameter 8 miliar, tanpa enkoder visual eksternal atau VAE. Gambar direpresentasikan sebagai token untuk area 32 × 32 piksel.
Diterbitkan olehDiedit dengan GPT-6 SolGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 dirancang agar satu model dapat membaca sekaligus membuat gambar. Model Mixture-of-Transformers (MoT) berparameter 8 miliar dari SenseTime ini menangani pemahaman visual, penalaran, pembuatan, dan penyuntingan gambar. Alih-alih memakai enkoder visual eksternal untuk membaca gambar dan variational autoencoder (VAE) untuk menguraikan hasil generasi, U1.5 menggunakan antarmuka visual bersama dan merekonstruksi keluaran langsung sebagai piksel RGB. SenseTime menyebut pendekatan ini memungkinkan kemampuan memahami gambar tetap dipertahankan sambil meningkatkan pembuatan gambar hingga resolusi 4K. 1
3
U1.5 merepresentasikan area gambar melalui token visual berukuran 32 × 32 piksel. Dengan begitu, model memproses urutan visual yang lebih ringkas tanpa menyerahkan tugas tersebut kepada enkoder visual terpisah. Saat membuat gambar, keadaan visual di dalam model diubah menjadi piksel RGB, bukan menjadi representasi laten yang kemudian harus diuraikan oleh VAE. Antarmuka inilah yang menghubungkan tugas memahami, menalar, dan menciptakan visual dalam satu arsitektur. 1
21
Perbedaan penting dari U1 terletak pada cara hasil gambar disusun kembali. Pada U1, sebuah kepala multilayer perceptron (MLP) memprediksi setiap potongan gambar secara terpisah. Di resolusi tinggi, batas antarpotongan itu bisa tampak sebagai garis sambungan atau pola kisi. U1.5 mengembalikan keadaan token visual ke susunan dua dimensi, lalu memakai dekoder spasial ringan dengan Pixel Shuffle bertahap dan konvolusi 3 × 3. Dengan cara ini, bagian yang bersebelahan dapat saling memengaruhi saat direkonstruksi, alih-alih dihasilkan secara terisolasi. 1
3
22
Untuk keluaran hingga 4.096 × 4.096 piksel, SenseTime juga menjelaskan pengondisian noise yang sadar resolusi: representasi skala noise yang bergantung pada resolusi digabungkan dengan tahapan proses generasi. Tujuannya agar model dapat menyesuaikan diri ketika perilaku noise berubah seiring ukuran gambar. Dekoder spasial menangani kesinambungan antarpotongan, sedangkan pengondisian noise menangani perubahan skala. Keduanya ditujukan untuk membantu menstabilkan generasi 4K, bukan menjamin hasil tanpa artefak. 1
3
29
Strategi pascapelatihan SenseTime dapat diringkas sebagai spesialisasi, lalu penyatuan. Perusahaan mengoptimalkan model-model ahli untuk estetika visual, tampilan teks berbahasa Mandarin dan Inggris, infografik, serta penyuntingan gambar. Kemampuan mereka kemudian dikonsolidasikan melalui multi-expert on-policy distillation, yaitu proses yang memindahkan kemampuan para spesialis ke model terpadu. Para ahli itu merupakan bagian dari pelatihan; pengguna tidak perlu menjalankan empat model spesialis untuk setiap permintaan. 1
29
Dibandingkan U1, SenseTime melaporkan detail resolusi tinggi dan kesinambungan spasial yang lebih baik, beserta peningkatan pada tampilan teks, tata letak, dan penyuntingan. Rancangan yang menyatukan pemahaman dan generasi tanpa enkoder visual eksternal maupun VAE tetap dipertahankan. Skor U1.5 yang dilaporkan mencakup 0,92 pada GenEval, 0,948 pada CVTG-2K, dan 4,59 pada ImgEdit. Angka-angka ini adalah hasil evaluasi yang dilaporkan, bukan bukti independen bahwa U1.5 unggul pada setiap tugas visual. 1
3
28
Laporan teknis U1.5 telah tersedia untuk umum. Di Hugging Face, halaman resmi juga mencantumkan checkpoint bernama SenseNova-U1.5-8B-MoT. Halaman model penuh tersebut berbeda dari SenseNova-U1.5-8B-MoT-Preview dan rilis U1.5-Lite-Preview yang diumumkan secara terpisah oleh SenseTime. Karena itu, aset versi Preview atau Lite Preview tidak boleh disamakan dengan checkpoint model penuh. 1
31
22
13
SenseTime menyatakan akan membuka kode pelatihan untuk supervised fine-tuning, reinforcement learning, dan on-policy distillation. Keberadaan laporan teknis serta halaman model belum cukup untuk menyimpulkan bahwa seluruh kode pelatihan yang dijanjikan itu sudah tersedia. 1
3
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
SenseNova U1.5 menggabungkan pemahaman, penalaran, pembuatan, dan penyuntingan gambar dalam model Mixture of Transformers berparameter 8 miliar, tanpa enkoder visual eksternal atau VAE.
SenseNova U1.5 menggabungkan pemahaman, penalaran, pembuatan, dan penyuntingan gambar dalam model Mixture of Transformers berparameter 8 miliar, tanpa enkoder visual eksternal atau VAE. Gambar direpresentasikan sebagai token untuk area 32 × 32 piksel. Dekoder spasialnya dirancang untuk mengurangi garis sambungan antarpotongan gambar yang dapat muncul pada U1.
Laporan teknis dan halaman checkpoint U1.5 tersedia. Namun, janji SenseTime untuk membuka kode pelatihan tidak berarti seluruh kode tersebut sudah tersedia.