SenseNova U1.5 vereint Bildverständnis, visuelles Schlussfolgern, Generierung und Bearbeitung in einem Mixture of Transformers Modell mit rund acht Milliarden Parametern. Ein räumlicher Decoder soll sichtbare Übergänge zwischen Bildbereichen verringern; eine an die Auflösung angepasste Rauschverarbeitung unterstützt...
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Ein Bild analysieren, Fragen dazu beantworten und anschließend selbst eines erzeugen: SenseNova U1.5 soll diese Aufgaben in einer gemeinsamen Architektur übernehmen. SenseTime beschreibt das Modell als „8B-MoT“ – ein Mixture of Transformers mit rund acht Milliarden Parametern. Es benötigt laut technischem Bericht weder einen externen Bild-Encoder für das Verständnis noch einen variationalen Autoencoder (VAE), der erzeugte Bilder aus einer komprimierten Repräsentation decodiert. Stattdessen erfolgt die Ausgabe im RGB-Pixelraum. 1
3
U1.5 verarbeitet Bildbereiche über visuelle Tokens für jeweils 32 × 32 Pixel. So kann das Modell Bilder als Folge kompakter Einheiten bearbeiten, ohne einen separaten Vision-Encoder einzusetzen. Für die Generierung werden die visuellen Zustände anschließend wieder in RGB-Pixel umgesetzt. 1
21
Der wichtigste Unterschied zum Vorgänger U1 liegt in diesem letzten Schritt: Dessen MLP-Ausgabekomponente berechnete Bildbereiche unabhängig voneinander. Bei hoher Auflösung konnten dadurch sichtbare Kanten, Rastermuster oder Brüche in Texturen entstehen. U1.5 ordnet die visuellen Zustände wieder auf einem zweidimensionalen Raster an. Ein leichter räumlicher Decoder baut das Bild dann schrittweise mit Pixel Shuffle und 3 × 3-Faltungen auf. Benachbarte Bereiche können sich bei der Rekonstruktion gegenseitig beeinflussen. 1
3
22
Für Ausgaben mit bis zu 4096 × 4096 Pixeln beschreibt SenseTime außerdem eine auflösungsabhängige Rauschkonditionierung: Eine von der Zielauflösung abhängige Einbettung der Rauschskala wird mit dem Zeitschritt der Generierung kombiniert. Während der Decoder Übergänge zwischen Bildbereichen verbessern soll, berücksichtigt dieser zweite Mechanismus, dass sich das Rauschverhalten mit der Ausgabegröße ändert. Beides soll die native 4K-Generierung stabilisieren – fehlerfreie Bilder sind damit nicht garantiert. 1
3
29
Beim Nachtraining verfolgt SenseTime den Ansatz „spezialisieren, dann vereinen“. Zunächst werden Spezialisten für Bildästhetik, die Darstellung chinesischer und englischer Schrift, Infografiken sowie Bildbearbeitung optimiert. Ihre Fähigkeiten fließen anschließend durch Multi-Expert On-Policy Distillation in ein gemeinsames Modell ein. Die Spezialisten sind damit Teil des Trainingsverfahrens; für eine einzelne Anfrage müssen laut diesem Konzept nicht vier getrennte Modelle betrieben werden. 1
29
Gegenüber U1 meldet SenseTime bessere Details und räumliche Kontinuität bei hoher Auflösung sowie Fortschritte bei Schrift, Layouts und Bearbeitung. Das gemeinsame Verständnis-und-Generierungskonzept ohne externen Vision-Encoder und VAE bleibt erhalten. Als Testergebnisse nennt das Unternehmen 0,92 bei GenEval, 0,948 bei CVTG-2K und 4,59 bei ImgEdit. Diese Werte sind berichtete Evaluationsergebnisse, kein unabhängiger Nachweis für Verbesserungen bei jeder visuellen Aufgabe. 1
3
28
Der technische Bericht zu U1.5 ist öffentlich. Auf Hugging Face gibt es zudem einen eigenen offiziellen Eintrag für den SenseNova-U1.5-8B-MoT-Checkpoint. Er ist vom Eintrag U1.5-8B-MoT-Preview und von der separat angekündigten Version U1.5-Lite-Preview zu unterscheiden: Eine Preview-Veröffentlichung allein belegt nicht die Verfügbarkeit des vollständigen Modells. 1
31
22
13
SenseTime kündigt außerdem an, Trainingscode für überwachtes Feintraining, Reinforcement Learning und On-Policy-Destillation als Open Source zu veröffentlichen. Aus dem Bericht und den Modelleinstiegen allein geht jedoch nicht hervor, dass dieses vollständige angekündigte Codepaket bereits verfügbar ist. 1
3
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
SenseNova U1.5 vereint Bildverständnis, visuelles Schlussfolgern, Generierung und Bearbeitung in einem Mixture of Transformers Modell mit rund acht Milliarden Parametern.
SenseNova U1.5 vereint Bildverständnis, visuelles Schlussfolgern, Generierung und Bearbeitung in einem Mixture of Transformers Modell mit rund acht Milliarden Parametern. Ein räumlicher Decoder soll sichtbare Übergänge zwischen Bildbereichen verringern; eine an die Auflösung angepasste Rauschverarbeitung unterstützt die Generierung mit bis zu 4096 × 4096 Pixeln.
Der technische Bericht und ein eigener Eintrag für das vollständige U1.5 Modell sind verfügbar.