SenseNova U1.5 combineert beeldbegrip, visueel redeneren, generatie en bewerking zonder aparte visuele encoder of VAE. Een ruimtelijke decoder moet de zichtbare naden tussen beeldblokken verminderen die bij voorganger U1 konden ontstaan.
Gepubliceerd doorBewerkt met GPT-6 SolAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 is SenseTimes Mixture-of-Transformers-model (MoT) met ongeveer 8 miljard parameters. Het kan beelden begrijpen, erover redeneren en ze genereren of bewerken binnen één architectuur. Daarvoor gebruikt het geen aparte visuele encoder om beelden in te lezen en geen variational autoencoder (VAE) om gegenereerde beelden te decoderen: de uitvoer wordt als RGB-pixels opgebouwd. Volgens het technische rapport is generatie mogelijk tot 4096 × 4096 pixels. 1
3
Het model vertegenwoordigt beeldgebieden met visuele tokens van 32 × 32 pixels. Zo kan het met een compacte reeks tokens werken, terwijl de visuele verwerking deel blijft van dezelfde architectuur. Het belangrijkste verschil met voorganger U1 zit aan de uitvoerkant. U1 voorspelde elk beeldblok afzonderlijk met een MLP-laag, waardoor op hoge resolutie naden of een rasterpatroon zichtbaar konden worden. 1
21
22
U1.5 zet de visuele representaties terug in een tweedimensionaal raster. Een lichte, ruimtelijke decoder reconstrueert het beeld vervolgens stapsgewijs met Pixel Shuffle en 3 × 3-convoluties. Aangrenzende gebieden kunnen zo invloed op elkaar hebben, in plaats van los van elkaar te worden getekend. 1
3
22
Voor uitvoer tot 4096 × 4096 pixels beschrijft SenseTime daarnaast resolutiebewuste ruisconditionering: een van de resolutie afhankelijke representatie van de ruisschaal wordt gecombineerd met de tijdstap van het generatieproces. De decoder richt zich op de overgangen tussen beeldblokken; deze conditionering helpt het model rekening te houden met de gekozen uitvoergrootte. Dat moet 4K-generatie stabieler maken, maar garandeert geen beelden zonder artefacten. 1
3
29
SenseTime kiest na de basistraining voor specialiseren en daarna verenigen. Het bedrijf optimaliseert experts voor beeldesthetiek, het weergeven van Chinese en Engelse tekst, infographics en beeldbewerking. Via multi-expert on-policy distillation worden die vaardigheden vervolgens samengebracht in één model. De experts zijn dus onderdeel van de training; voor elke aanvraag hoeven niet vier afzonderlijke modellen te draaien. 1
29
Vergeleken met U1 meldt SenseTime meer detail en ruimtelijke samenhang op hoge resolutie, plus verbeteringen bij tekst, lay-outs en bewerking. Het ontwerp zonder aparte encoder of VAE blijft behouden. De gerapporteerde scores zijn 0,92 op GenEval, 0,948 op CVTG-2K en 4,59 op ImgEdit. Dat zijn evaluatieresultaten uit het rapport, geen onafhankelijk bewijs dat U1.5 op iedere visuele taak beter presteert. 1
3
28
Het technische rapport is openbaar. Op Hugging Face staat ook een officiële vermelding van het volledige SenseNova-U1.5-8B-MoT-checkpoint. Die is te onderscheiden van de pagina voor U1.5-8B-MoT-Preview en de apart aangekondigde U1.5-Lite-Preview: previewversies zijn niet zonder meer gelijk aan het volledige model. 1
31
22
13
SenseTime zegt trainingscode voor supervised fine-tuning, reinforcement learning en on-policy distillation open source te zullen maken. Uit die toezegging en de beschikbare modelvermeldingen volgt niet dat alle beloofde trainingscode al beschikbaar is. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5 combineert beeldbegrip, visueel redeneren, generatie en bewerking zonder aparte visuele encoder of VAE.
SenseNova U1.5 combineert beeldbegrip, visueel redeneren, generatie en bewerking zonder aparte visuele encoder of VAE. Een ruimtelijke decoder moet de zichtbare naden tussen beeldblokken verminderen die bij voorganger U1 konden ontstaan.
Het technische rapport en een vermelding van het volledige model zijn openbaar; SenseTime zegt de trainingscode later open source te maken.