SenseNova U1.5 kombinerer bildeforståelse, visuell resonnering, generering og redigering uten en separat bildekoder eller VAE. En romlig dekoder lar naboområder påvirke hverandre når bildet bygges opp, og skal redusere synlige skjøter mellom bildeutsnitt.
Publisert avRedigert med GPT-6 SolBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 er SenseTimes KI-modell for både å forstå og skape bilder. Den har rundt 8 milliarder parametere og bruker en såkalt Mixture-of-Transformers-arkitektur (MoT). Modellen skal kunne tolke bilder, resonnere om det den ser, generere nye bilder og redigere eksisterende bilder. I motsetning til løsninger som bruker en separat komponent til å lese bilder og en VAE til å dekode genererte bilder, samler U1.5 oppgavene i én visuell arkitektur og bygger opp resultatet direkte som RGB-piksler. 1
3
Modellen deler bilder inn i visuelle enheter som dekker 32 × 32 piksler. Slik får den en mer håndterlig sekvens å arbeide med, uten en ekstern bildekoder. Når den lager et bilde, gjenskapes pikslene fra modellens visuelle representasjon i stedet for fra et VAE-kodet bilde. 1
21
Den viktigste endringen fra forgjengeren U1 ligger i hvordan pikslene settes sammen. U1 brukte et flerlags perseptron, ofte kalt MLP, som gjenskapte hvert bildeutsnitt for seg. Ved høy oppløsning kunne grensene mellom utsnittene bli synlige som skjøter eller rutemønstre. U1.5 legger i stedet de visuelle representasjonene tilbake i et todimensjonalt rutenett. En lett romlig dekoder, med trinnvis Pixel Shuffle og 3 × 3-konvolusjoner, lar naboområder påvirke hverandre under rekonstruksjonen. 1
3
22
For bilder opptil 4096 × 4096 piksler beskriver SenseTime også oppløsningsavhengig støytilpasning. Modellen kombinerer informasjon om støynivået ved den valgte oppløsningen med genereringstrinnet. Hensikten er å tilpasse prosessen når bildestørrelsen endres, mens den romlige dekoderen skal gi bedre sammenheng på tvers av bildeutsnitt. Dette er tiltak for mer stabil 4K-generering, ikke en garanti mot bildefeil. 1
3
29
SenseTime beskriver treningen som «spesialiser først, samle etterpå». Selskapet optimaliserer egne eksperter for visuell estetikk, gjengivelse av kinesisk og engelsk tekst, infografikk og bilderedigering. Deretter samles ferdighetene i én modell gjennom det som kalles multi-expert on-policy distillation. Ekspertene hører altså til treningsprosessen; beskrivelsen innebærer ikke at fire spesialistmodeller må kjøres for hver forespørsel. 1
29
Sammenlignet med U1 rapporterer SenseTime bedre detaljer og romlig sammenheng ved høy oppløsning, samt forbedringer i tekstgjengivelse, layout og redigering. Samtidig skal modellen beholde den felles arkitekturen for bildeforståelse og generering uten ekstern bildekoder eller VAE. SenseTime oppgir resultatene 0,92 på GenEval, 0,948 på CVTG-2K og 4,59 på ImgEdit. Dette er rapporterte testresultater, ikke uavhengig dokumentasjon på forbedring i enhver visuell oppgave. 1
3
28
Den tekniske rapporten om U1.5 er offentlig. På Hugging Face finnes også en egen offisiell oppføring for SenseNova-U1.5-8B-MoT. Den må ikke forveksles med oppføringen for U1.5-8B-MoT-Preview eller den separat annonserte U1.5-Lite-Preview. Forhåndsversjonene er ikke det samme som den fullstendige modelloppføringen. 1
31
22
13
SenseTime sier at selskapet vil gjøre treningskode åpen for veiledet finjustering, forsterkningslæring og on-policy-distillering. At rapporten og modelloppføringene er publisert, dokumenterer ikke i seg selv at all denne treningskoden allerede er tilgjengelig. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5 kombinerer bildeforståelse, visuell resonnering, generering og redigering uten en separat bildekoder eller VAE.
SenseNova U1.5 kombinerer bildeforståelse, visuell resonnering, generering og redigering uten en separat bildekoder eller VAE. En romlig dekoder lar naboområder påvirke hverandre når bildet bygges opp, og skal redusere synlige skjøter mellom bildeutsnitt.
Den fullstendige U1.5 modellen har en egen oppføring, atskilt fra Preview og Lite Preview.