SenseNova U1.5 er SenseTimes Mixture of Transformers model med omkring 8 milliarder parametre til billedforståelse, visuel ræsonnement, generering og redigering. Modellen arbejder med billedområder på 32 × 32 pixels.
Udgivet afRedigeret med GPT-6 SolBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 skal kunne både forstå et billede og skabe et nyt i én arkitektur. SenseTime beskriver den som en Mixture-of-Transformers-model (MoT) med omkring 8 milliarder parametre, der håndterer billedforståelse, visuel ræsonnement, generering og redigering. Den bruger ikke en separat billedkoder til input eller en variational autoencoder (VAE) til at afkode et genereret billede: output rekonstrueres i stedet som RGB-pixels. Målet er at bevare evnen til at forstå billeder og samtidig forbedre generering ved opløsninger op til 4K. 1
3
U1.5 repræsenterer billeder med visuelle tokens, der hver dækker 32 × 32 pixels. Det giver modellen en kortere sekvens af billedområder at arbejde med, uden at den behøver en ekstern billedkoder. Når den skaber et billede, omsættes dens visuelle tilstande til RGB-pixels frem for først at blive afkodet fra et VAE-latent. Det fælles billedinterface er grundlaget for at samle forståelse og generering. 1
21
Den væsentligste ændring fra U1 ligger i måden, billedet samles på. U1 forudsagde hvert billedområde for sig med et MLP-outputlag, hvilket ved høj opløsning kunne give synlige samlinger eller et gittermønster. U1.5 placerer i stedet de visuelle tilstande i et todimensionelt gitter og bruger en let rumlig dekoder med trinvis Pixel Shuffle og 3 × 3-konvolutioner. Dermed kan naboområder påvirke hinanden under rekonstruktionen. 1
3
22
Til generering ved op til 4096 × 4096 pixels beskriver SenseTime også en opløsningsafhængig styring af støj: En indlejring af støjniveauet, som afhænger af opløsningen, kombineres med trinnet i genereringsprocessen. Dekoderen skal skabe bedre sammenhæng på tværs af billedområder, mens støjstyringen skal tilpasse processen til billedets størrelse. Det er tiltag, der skal understøtte mere stabil 4K-generering – ikke en garanti for billeder uden fejl. 1
3
29
SenseTimes fremgangsmåde er at specialisere først og samle bagefter. Under eftertræningen optimeres eksperter til visuel æstetik, gengivelse af kinesisk og engelsk tekst, infografik og billedredigering. Deres færdigheder samles derefter i én model ved hjælp af multi-expert on-policy distillation, hvor specialisternes resultater bruges i den videre træning. Eksperterne er altså en del af træningsmetoden, ikke fire modeller, der skal køres for hver brugerforespørgsel. 1
29
Sammenlignet med U1 rapporterer SenseTime bedre detaljer og sammenhæng i billeder med høj opløsning samt forbedringer i tekstgengivelse, layout og redigering. Modellen fastholder samtidig det fælles design til billedforståelse og generering uden ekstern billedkoder eller VAE. De rapporterede resultater omfatter 0,92 på GenEval, 0,948 på CVTG-2K og 4,59 på ImgEdit. Det er evalueringsresultater fra de angivne kilder, ikke uafhængigt bevis for forbedringer på alle billedopgaver. 1
3
28
Den tekniske rapport om U1.5 er offentlig, og en officiel side på Hugging Face har en særskilt opføring for SenseNova-U1.5-8B-MoT. Den skal holdes adskilt fra siden for U1.5-8B-MoT-Preview og den separat annoncerede U1.5-Lite-Preview. Preview-udgivelserne er ikke i sig selv dokumentation for, hvad der følger med den fulde model. 1
31
22
13
SenseTime skriver, at virksomheden vil frigive træningskode til superviseret finjustering, forstærkningslæring og on-policy-distillation. Den offentliggjorte rapport og modelopføringerne fastslår ikke i sig selv, at hele den lovede træningskode allerede er frigivet. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5 er SenseTimes Mixture of Transformers model med omkring 8 milliarder parametre til billedforståelse, visuel ræsonnement, generering og redigering.
SenseNova U1.5 er SenseTimes Mixture of Transformers model med omkring 8 milliarder parametre til billedforståelse, visuel ræsonnement, generering og redigering. Modellen arbejder med billedområder på 32 × 32 pixels. En rumlig dekoder skal mindske de synlige overgange mellem billedområder, som kunne opstå i forgængeren U1.
Den fulde U1.5 model har sin egen listeopføring på Hugging Face og må ikke forveksles med Preview eller Lite Preview.