SenseNova U1.5 combine compréhension, raisonnement visuel, génération et retouche dans un modèle Mixture of Transformers de 8 milliards de paramètres, sans encodeur visuel externe ni VAE. Son décodeur spatial vise à atténuer les raccords visibles entre les blocs d’image qui pouvaient apparaître avec U1, notamment en...
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Avec SenseNova U1.5, SenseTime cherche à faire tenir dans une même architecture deux usages souvent séparés : interpréter une image et en produire une. Ce modèle Mixture of Transformers (MoT) de 8 milliards de paramètres couvre aussi le raisonnement visuel et la retouche. Il n’utilise ni encodeur visuel externe pour lire les images, ni autoencodeur variationnel (VAE) pour décoder les images générées : la sortie est reconstruite en pixels RGB. 1
3
U1.5 représente les régions d’une image par des jetons visuels correspondant chacun à 32 × 32 pixels. Cette représentation compacte alimente le modèle pour les tâches de compréhension comme de génération. 1
21
La différence majeure avec U1 se situe à la sortie. Son ancien composant MLP reconstruisait chaque bloc d’image indépendamment, au risque de laisser apparaître des raccords ou un quadrillage en haute résolution. U1.5 replace les représentations visuelles sur une grille à deux dimensions, puis utilise un décodeur spatial léger associant Pixel Shuffle progressif et convolutions 3 × 3. Les régions voisines peuvent ainsi contribuer ensemble à la reconstruction. 1
3
22
Pour atteindre 4 096 × 4 096 pixels, SenseTime ajoute aussi un conditionnement du bruit adapté à la résolution : une information sur l’échelle de bruit liée à la taille de l’image est combinée à l’étape de génération. Le décodeur s’attaque donc à la continuité entre blocs, tandis que ce conditionnement prend en compte le changement d’échelle. Il s’agit de mécanismes destinés à stabiliser la génération en 4K, et non d’une garantie d’images sans défaut. 1
3
29
SenseTime décrit une méthode consistant à spécialiser, puis réunir. Des experts sont optimisés pour l’esthétique, le rendu du texte chinois et anglais, les infographies et la retouche. Leurs capacités sont ensuite consolidées par une distillation multi-experts on-policy, c’est-à-dire réalisée à partir des sorties produites pendant l’entraînement. Ces experts interviennent dans la préparation du modèle : l’objectif annoncé n’est pas de faire fonctionner quatre modèles spécialisés à chaque demande. 1
29
Par rapport à U1, SenseTime fait état de meilleurs détails en haute résolution et d’une meilleure continuité spatiale, ainsi que de progrès sur le texte, la mise en page et la retouche. L’architecture sans encodeur visuel externe ni VAE conserve, elle, son ambition de réunir compréhension et génération. Les scores communiqués pour U1.5 sont 0,92 sur GenEval, 0,948 sur CVTG-2K et 4,59 sur ImgEdit. Ce sont des résultats rapportés par les sources, pas la preuve d’un progrès sur toutes les tâches visuelles. 1
3
28
Le rapport technique est public et une page officielle Hugging Face présente le checkpoint SenseNova-U1.5-8B-MoT. Celui-ci possède sa propre fiche, distincte de U1.5-8B-MoT-Preview et de la version U1.5-Lite-Preview annoncée séparément par SenseTime. Il ne faut donc pas confondre les ressources des versions d’essai avec celles du modèle complet. 1
31
22
13
SenseTime indique qu’elle publiera le code d’entraînement couvrant notamment l’affinage supervisé, l’apprentissage par renforcement et la distillation on-policy. Le rapport et les fiches des modèles ne suffisent toutefois pas, à eux seuls, à établir que l’intégralité de ce code promis est déjà disponible. 1
3
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
SenseNova U1.5 combine compréhension, raisonnement visuel, génération et retouche dans un modèle Mixture of Transformers de 8 milliards de paramètres, sans encodeur visuel externe ni VAE.
SenseNova U1.5 combine compréhension, raisonnement visuel, génération et retouche dans un modèle Mixture of Transformers de 8 milliards de paramètres, sans encodeur visuel externe ni VAE. Son décodeur spatial vise à atténuer les raccords visibles entre les blocs d’image qui pouvaient apparaître avec U1, notamment en haute résolution.
Une page Hugging Face présente le modèle U1.5 complet, distinct des versions Preview et Lite Preview.