SenseNova U1.5 comprende, interpreta, genera e modifica immagini in un’architettura Mixture of Transformers da 8 miliardi di parametri, senza encoder visivo esterno né VAE. Il decoder spaziale ricostruisce insieme le regioni vicine dell’immagine, per ridurre le giunture che potevano comparire nelle immagini prodotte...
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 prova a risolvere una difficoltà concreta: usare lo stesso modello per capire un’immagine e crearne una, senza delegare la lettura a un encoder visivo esterno o la ricostruzione dell’output a un autoencoder variazionale (VAE). SenseTime lo presenta come un modello Mixture-of-Transformers (MoT) da 8 miliardi di parametri, capace anche di ragionamento visivo e modifica delle immagini, con generazione fino a 4K. 1
3
U1.5 rappresenta le immagini attraverso token visivi corrispondenti a regioni di 32 × 32 pixel. Questa rappresentazione consente di trattare le informazioni visive come una sequenza gestibile dal modello. Quando genera un’immagine, il sistema ricostruisce direttamente i pixel RGB, anziché passare da un’immagine latente decodificata da un VAE. 1
21
Il cambiamento più importante riguarda l’ultimo passaggio. In U1, una rete MLP ricostruiva ogni porzione d’immagine separatamente: ad alta risoluzione, i confini tra porzioni potevano diventare visibili come una griglia o come interruzioni nelle texture. U1.5 dispone invece gli stati visivi su una griglia bidimensionale e impiega un decoder spaziale con Pixel Shuffle progressivo e convoluzioni 3 × 3. Le regioni adiacenti possono così influenzarsi durante la ricostruzione. L’obiettivo è ottenere transizioni più continue, non semplicemente aumentare il numero di pixel. 1
3
22
Per arrivare fino a 4.096 × 4.096 pixel, SenseTime descrive anche un condizionamento del rumore sensibile alla risoluzione: un’informazione sulla scala del rumore, dipendente dalla risoluzione, viene combinata con la fase del processo di generazione. Il decoder affronta la continuità tra regioni; questo secondo accorgimento adatta il processo al cambiamento di dimensioni dell’immagine. Sono soluzioni pensate per rendere più stabile la generazione nativa a 4K, non una garanzia che ogni risultato sia privo di difetti. 1
3
29
La strategia di post-addestramento è specializzare, poi riunire. SenseTime ottimizza esperti per l’estetica delle immagini, la resa del testo in cinese e inglese, le infografiche e la modifica delle immagini. Ne integra poi le capacità mediante una distillazione on-policy multi-esperto. Gli esperti appartengono dunque al percorso di addestramento: il risultato descritto è un modello unificato, non quattro modelli specialistici da eseguire per ogni richiesta. 1
29
Rispetto a U1, SenseTime riferisce miglioramenti nei dettagli ad alta risoluzione, nella continuità spaziale, nella resa del testo, nei layout e nell’editing, mantenendo l’impostazione che combina comprensione e generazione senza encoder esterno né VAE. I risultati comunicati comprendono 0,92 su GenEval, 0,948 su CVTG-2K e 4,59 su ImgEdit. Sono punteggi riportati nelle valutazioni del modello, non la prova indipendente di un miglioramento in ogni compito visivo. 1
3
28
Il rapporto tecnico di U1.5 è pubblico. Su Hugging Face compare inoltre una pagina ufficiale per il checkpoint SenseNova-U1.5-8B-MoT, distinta da quella di SenseNova-U1.5-8B-MoT-Preview e dall’uscita U1.5-Lite-Preview annunciata separatamente da SenseTime. Per valutare le risorse disponibili, queste versioni non vanno confuse tra loro. 1
31
22
13
SenseTime afferma che pubblicherà il codice di addestramento relativo a fine-tuning supervisionato, apprendimento per rinforzo e distillazione on-policy. Il rapporto e le pagine dei modelli, da soli, non dimostrano che l’intero codice promesso sia già disponibile. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5 comprende, interpreta, genera e modifica immagini in un’architettura Mixture of Transformers da 8 miliardi di parametri, senza encoder visivo esterno né VAE.
SenseNova U1.5 comprende, interpreta, genera e modifica immagini in un’architettura Mixture of Transformers da 8 miliardi di parametri, senza encoder visivo esterno né VAE. Il decoder spaziale ricostruisce insieme le regioni vicine dell’immagine, per ridurre le giunture che potevano comparire nelle immagini prodotte da U1 ad alta risoluzione.
Il checkpoint U1.5 completo ha una pagina distinta dalle versioni Preview e Lite Preview.