SenseNova U1.5 yhdistää kuvien ymmärtämisen, visuaalisen päättelyn, luomisen ja muokkauksen 8 miljardin parametrin Mixture of Transformers malliin. Uusi tilallinen dekooderi ottaa vierekkäiset kuva alueet huomioon ja pyrkii vähentämään edeltäjässä näkyneitä ruudukkomaisia saumoja.
JulkaisijaMuokattu mallilla GPT-6 SolKuvat luotu mallilla GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5:n keskeinen ajatus on yksinkertainen: saman mallin pitäisi sekä ymmärtää kuvaa että luoda sitä. SenseTimen 8 miljardin parametrin Mixture-of-Transformers- eli MoT-malli käsittelee myös visuaalista päättelyä ja kuvien muokkausta. Se ei käytä erillistä kuvaenkooderia kuvien tulkintaan eikä variatiivista autoenkooderia (VAE) luotujen kuvien purkamiseen, vaan tuottaa kuvan RGB-pikseliavaruuteen. SenseTimen mukaan rakenne säilyttää kuvien ymmärtämiskyvyn ja tukee luomista jopa 4K-tarkkuudella. 1
3
U1.5 esittää kuvan alueet 32 × 32 pikselin visuaalisina tokeneina. Näin kuva muuttuu mallille käsiteltäväksi sarjaksi ilman erillistä kuvaenkooderia. Kuvan luomisessa malli rekonstruoi lopputuloksen RGB-pikseleiksi ilman VAE:n purkamaa väliesitystä. 1
21
Suurin muutos edeltävään U1-malliin on rekonstruktiossa. U1 ennusti kuva-alueet toisistaan riippumatta monikerroksisella perseptronilla (MLP). Suuressa kuvassa alueiden rajat saattoivat siksi näkyä saumoina tai ruudukkona. U1.5 palauttaa visuaaliset esitykset kaksiulotteiseen ruudukkoon ja käyttää kevyttä tilallista dekooderia, jossa Pixel Shuffle -vaiheet ja 3 × 3 -konvoluutiot rakentavat kuvaa asteittain. Vierekkäiset alueet voivat siten vaikuttaa toistensa lopputulokseen. 1
3
22
Jopa 4096 × 4096 pikselin kuvien luomista varten SenseTime kuvaa lisäksi resoluution huomioivan kohinaehdollistuksen. Malli yhdistää kuvan koosta riippuvan kohinaskaalaa kuvaavan upotteen generoinnin aika-askeleeseen, jotta se voi huomioida kohinan käyttäytymisen muuttumisen tarkkuuden kasvaessa. Tilallinen dekooderi tähtää alueiden jatkuvuuteen, kohinaehdollistus taas kuvakoon vaikutukseen. Kumpikaan ei tarkoita, että jokainen 4K-kuva olisi virheetön. 1
3
29
SenseTimen koulutustapa on erikoistu ensin, yhdistä sitten. Jälkikoulutuksessa optimoidaan asiantuntijamalleja kuvan estetiikkaan, kiinan- ja englanninkielisen tekstin esittämiseen, infografiikkaan sekä kuvankäsittelyyn. Niiden osaaminen yhdistetään yhteen malliin usean asiantuntijan on-policy-tislauksella. Asiantuntijat ovat siis osa koulutusta, eivät neljä erillistä mallia, joita jokainen käyttäjän pyyntö edellyttäisi. 1
29
SenseTime raportoi U1:een verrattuna parempaa suurten kuvien yksityiskohtaisuutta ja alueiden välistä jatkuvuutta sekä edistystä tekstissä, asetteluissa ja muokkauksessa. Samalla U1.5 säilyttää arkkitehtuurin, jossa kuvien ymmärtäminen ja luominen tapahtuvat ilman erillistä kuvaenkooderia ja VAE:ta. Raportoidut tulokset ovat GenEval 0,92, CVTG-2K 0,948 ja ImgEdit 4,59. Ne ovat ilmoitettuja testituloksia, eivät riippumaton näyttö parannuksesta kaikissa kuvatehtävissä. 1
3
28
U1.5:n tekninen raportti on julkinen. Hugging Facessa on lisäksi virallinen SenseNova-U1.5-8B-MoT-mallin sivu. Se on eri listaus kuin U1.5-8B-MoT-Preview; SenseTime on myös ilmoittanut erikseen U1.5-Lite-Preview-julkaisusta. Esiversioita ei pidä sekoittaa täyden mallin listaukseen. 1
31
22
13
SenseTime sanoo aikovansa julkaista avoimena koulutuskoodia ohjattuun hienosäätöön, vahvistusoppimiseen ja on-policy-tislaukseen. Raportti ja mallien sivut eivät yksin osoita, että koko luvattu koulutuskoodi olisi jo julkaistu. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5 yhdistää kuvien ymmärtämisen, visuaalisen päättelyn, luomisen ja muokkauksen 8 miljardin parametrin Mixture of Transformers malliin.
SenseNova U1.5 yhdistää kuvien ymmärtämisen, visuaalisen päättelyn, luomisen ja muokkauksen 8 miljardin parametrin Mixture of Transformers malliin. Uusi tilallinen dekooderi ottaa vierekkäiset kuva alueet huomioon ja pyrkii vähentämään edeltäjässä näkyneitä ruudukkomaisia saumoja.
Täyden U1.5 mallin listaus on erillinen Preview ja Lite Preview versioista. SenseTime lupaa julkaista koulutuskoodia, mutta lupaus ei vielä vahvista sen olevan kokonaisuudessaan saatavilla.