SenseNova U1.5 menggabungkan pemahaman, penaakulan, penjanaan dan penyuntingan imej tanpa pengekod visual luaran atau VAE. Penyahkod ruang baharunya direka untuk mengurangkan garisan sambungan antara bahagian imej yang boleh kelihatan pada output U1, khususnya pada resolusi tinggi.
Diterbitkan olehDisunting dengan GPT-6 SolImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 ialah model Mixture-of-Transformers (MoT) dengan kira-kira 8 bilion parameter daripada SenseTime. Ia direka untuk memahami dan menaakul kandungan visual, kemudian menjana atau menyunting imej dalam satu seni bina. Model ini tidak menyerahkan pembacaan imej kepada pengekod visual luaran, dan tidak menggunakan variational autoencoder (VAE) untuk menyahkod imej yang dijana; outputnya dibina semula sebagai piksel RGB. 1
3
U1.5 mewakili kawasan imej sebagai token visual berukuran 32×32 piksel. Perwakilan ini memberikan model jujukan visual yang lebih ringkas untuk diproses. Apabila menjana imej, model menukar keadaan visualnya kembali kepada piksel RGB melalui antara muka visual yang sama. 1
21
Perubahan utama berbanding U1 terletak pada cara imej akhir dibina semula. U1 menggunakan kepala multilayer perceptron (MLP) yang meramal setiap bahagian imej secara berasingan; pada resolusi tinggi, sempadan antara bahagian itu boleh kelihatan seperti garisan sambungan atau corak grid. U1.5 menyusun semula keadaan visual dalam grid dua dimensi, kemudian menggunakan penyahkod ruang ringan dengan Pixel Shuffle berperingkat dan konvolusi 3×3. Dengan itu, kawasan berjiran boleh saling mempengaruhi semasa pembinaan semula, bukannya dihasilkan secara terasing. 1
3
22
Untuk penjanaan sehingga 4096×4096 piksel, SenseTime turut menerangkan pelarasan hingar mengikut resolusi: maklumat tentang skala hingar bagi resolusi sasaran digabungkan dengan langkah masa penjanaan. Penyahkod ruang menangani kesinambungan antara bahagian imej, manakala pelarasan hingar mengambil kira perubahan apabila saiz output meningkat. Kedua-duanya bertujuan menstabilkan penjanaan 4K, bukan menjamin setiap imej bebas daripada kecacatan visual. 1
3
29
Pendekatan SenseTime ialah khususkan dahulu, kemudian satukan. Dalam latihan lanjutan, pakar dioptimumkan untuk estetika visual, paparan teks bahasa Cina dan Inggeris, infografik serta penyuntingan imej. Keupayaan mereka kemudian digabungkan melalui penyulingan on-policy berbilang pakar. Pakar-pakar itu ialah sebahagian daripada proses latihan; ia tidak bermaksud empat model khusus perlu dijalankan untuk setiap permintaan pengguna. 1
29
SenseTime melaporkan butiran resolusi tinggi dan kesinambungan ruang yang lebih baik berbanding U1, di samping peningkatan pada teks, susun atur dan penyuntingan. Reka bentuk tanpa pengekod visual luaran dan tanpa VAE untuk memahami serta menjana imej dikekalkan. Skor yang dilaporkan termasuk 0.92 pada GenEval, 0.948 pada CVTG-2K dan 4.59 pada ImgEdit. Ini ialah keputusan penilaian yang dilaporkan, bukan bukti bebas bahawa U1.5 lebih baik dalam setiap tugasan visual. 1
3
28
Laporan teknikal U1.5 telah diterbitkan. Halaman rasmi Hugging Face turut menyenaraikan titik semak SenseNova-U1.5-8B-MoT. Senarai model penuh itu berbeza daripada halaman U1.5-8B-MoT-Preview dan keluaran U1.5-Lite-Preview yang diumumkan secara berasingan; aset pratonton tidak wajar dianggap sebagai titik semak model penuh. 1
31
22
13
SenseTime menyatakan bahawa ia akan membuka sumber kod latihan untuk penalaan halus terselia, pembelajaran pengukuhan dan penyulingan on-policy. Kewujudan laporan serta halaman model sahaja tidak mengesahkan bahawa keseluruhan kod latihan yang dijanjikan sudah tersedia. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5 menggabungkan pemahaman, penaakulan, penjanaan dan penyuntingan imej tanpa pengekod visual luaran atau VAE.
SenseNova U1.5 menggabungkan pemahaman, penaakulan, penjanaan dan penyuntingan imej tanpa pengekod visual luaran atau VAE. Penyahkod ruang baharunya direka untuk mengurangkan garisan sambungan antara bahagian imej yang boleh kelihatan pada output U1, khususnya pada resolusi tinggi.
Laporan teknikal dan halaman model penuh U1.5 tersedia; halaman Preview dan Lite Preview ialah keluaran berasingan.