SenseNova U1.5 kombinerar bildförståelse, visuellt resonemang, generering och redigering utan en separat bildkodare eller VAE. En ny rumslig avkodare ska minska de synliga skarvar mellan bilddelar som kunde uppstå med föregångaren U1.
Publicerad avRedigerad med GPT-6 SolBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 är SenseTimes modell för att både förstå och skapa bilder inom samma arkitektur. Den har omkring åtta miljarder parametrar och bygger på Mixture of Transformers (MoT). Till skillnad från upplägg där en separat bildkodare tolkar indata och en variational autoencoder, VAE, avkodar genererade bilder, använder U1.5 ett gemensamt visuellt gränssnitt och återskapar utdata som RGB-pixlar. Enligt SenseTimes tekniska rapport ska det ge bättre bildgenerering, upp till 4 096 × 4 096 pixlar, utan att ge upp bildförståelsen. 1
3
Modellen delar in bilder i visuella token som motsvarar ytor på 32 × 32 pixlar. Det ger den en mer hanterlig följd av bilddelar att arbeta med, utan en extern bildkodare. När modellen skapar en bild omvandlas dess visuella representation i stället till RGB-pixlar, utan att gå via en VAE-kodad bildrepresentation. 1
21
Den viktigaste förändringen jämfört med U1 ligger i hur bilddelarna sätts ihop. U1 lät ett utdatahuvud av typen MLP, ett flerskiktsperceptron, förutsäga varje bilddel för sig. I hög upplösning kunde gränserna mellan delarna bli synliga som skarvar eller rutmönster. U1.5 placerar tillbaka de visuella representationerna i ett tvådimensionellt rutnät och använder en lättare rumslig avkodare med stegvis Pixel Shuffle och 3 × 3-konvolutioner. Då kan närliggande områden påverka varandra när bilden återskapas. 1
3
22
För generering upp till 4 096 × 4 096 pixlar beskriver SenseTime också en metod som anpassar brusbehandlingen efter upplösningen. En upplösningsberoende representation av brusnivån kombineras med steget i genereringsprocessen. Den rumsliga avkodaren är tänkt att förbättra övergångarna mellan bilddelar; brusanpassningen ska hjälpa modellen att hantera den större bildskalan. Det är en beskrivning av hur företaget försöker stabilisera 4K-generering, inte en garanti för felfria bilder. 1
3
29
SenseTime beskriver metoden som att först specialisera, sedan förena. Under efterträningen optimeras experter för bildestetik, text på kinesiska och engelska, infografik samt bildredigering. Deras förmågor förs därefter samman genom multi-expert on-policy distillation, en träningsmetod där specialistmodellerna vägleder en gemensam modell. Experterna ingår alltså i träningsprocessen; upplägget innebär inte att fyra separata specialistmodeller måste köras för varje användarfråga. 1
29
Jämfört med U1 rapporterar SenseTime bättre detaljer och sammanhang i högupplösta bilder samt förbättringar i textåtergivning, layout och redigering. Samtidigt behålls grundidén: en modell som både förstår och genererar bilder utan separat bildkodare eller VAE. Företaget redovisar resultaten 0,92 i GenEval, 0,948 i CVTG-2K och 4,59 i ImgEdit. Det är rapporterade testresultat, inte ett oberoende belägg för förbättring på varje tänkbar bilduppgift. 1
3
28
Den tekniska rapporten om U1.5 är offentlig. Det finns också en officiell Hugging Face-sida för kontrollpunkten SenseNova-U1.5-8B-MoT – en modellversion med sparade vikter. Den har en egen listning och ska inte förväxlas med U1.5-8B-MoT-Preview eller den separat presenterade U1.5-Lite-Preview. En förhandsversion är inte i sig belägg för vad som ingår i den fullständiga modellversionen. 1
31
22
13
SenseTime säger att företaget kommer att öppna träningskod för övervakad finjustering, förstärkningsinlärning och on-policy-distillation. Den formuleringen är ett löfte om en kommande publicering – rapporten och modellistningarna visar inte på egen hand att all utlovad träningskod redan har släppts. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5 kombinerar bildförståelse, visuellt resonemang, generering och redigering utan en separat bildkodare eller VAE.
SenseNova U1.5 kombinerar bildförståelse, visuellt resonemang, generering och redigering utan en separat bildkodare eller VAE. En ny rumslig avkodare ska minska de synliga skarvar mellan bilddelar som kunde uppstå med föregångaren U1.
Den fullständiga U1.5 modellen har en egen listning, skild från Preview och Lite Preview.