SenseNova U1.5 reúne comprensión, razonamiento, generación y edición de imágenes sin un codificador visual externo ni un VAE. Su decodificador espacial busca reducir las uniones visibles entre bloques que podían aparecer en imágenes de alta resolución generadas por U1.
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
La propuesta de SenseNova U1.5 es usar una misma arquitectura para interpretar una imagen y crear otra. El modelo de SenseTime tiene unos 8.000 millones de parámetros y emplea una arquitectura Mixture of Transformers (MoT). No necesita un codificador visual externo para leer imágenes ni un autoencoder variacional —VAE, por sus siglas en inglés— para convertir una representación latente en la imagen final: reconstruye la salida en píxeles RGB. Según su informe técnico, este diseño permite combinar comprensión, razonamiento, generación y edición visual, con salidas de hasta 4096 × 4096 píxeles. 1
3
U1.5 representa regiones de la imagen mediante tokens visuales de 32 × 32 píxeles. Así puede trabajar con una secuencia visual compacta dentro de la misma arquitectura. Pero el cambio más importante respecto de U1 aparece al generar la imagen: el modelo anterior predecía cada bloque por separado mediante una cabeza MLP —una red neuronal multicapa—, lo que a alta resolución podía dejar uniones, cuadrículas o discontinuidades en las texturas. 1
21
22
U1.5 vuelve a organizar los estados visuales en una cuadrícula bidimensional y los pasa por un decodificador espacial ligero que combina Pixel Shuffle progresivo con convoluciones de 3 × 3. En lugar de reconstruir cada bloque de forma aislada, permite que las zonas vecinas influyan en el resultado. Es una solución pensada para mejorar la continuidad de la imagen, no una garantía de que desaparezcan todos los artefactos. 1
3
22
Para generar hasta 4K, SenseTime añade un acondicionamiento del ruido según la resolución: combina una representación de la escala de ruido, dependiente del tamaño de salida, con el paso temporal de generación. El decodificador atiende a la continuidad entre bloques; este otro mecanismo adapta el proceso al cambio de resolución. 1
3
29
En el entrenamiento posterior, SenseTime optimiza expertos para estética visual, representación de texto en chino e inglés, infografías y edición de imágenes. Después reúne esas capacidades mediante destilación de múltiples expertos con datos generados por la política del propio modelo (on-policy distillation). Los especialistas forman parte del entrenamiento: la propuesta final es un modelo unificado, no cuatro modelos que deban ejecutarse para cada solicitud. 1
29
Frente a U1, SenseTime comunica mejoras en detalle a alta resolución, continuidad espacial, texto, composición de diseños y edición, sin abandonar la capacidad de comprender imágenes ni el diseño sin codificador visual externo ni VAE. El informe presenta puntuaciones de 0,92 en GenEval, 0,948 en CVTG-2K y 4,59 en ImgEdit. Son resultados comunicados para esas evaluaciones, no una prueba independiente de que U1.5 mejore en todas las tareas visuales. 1
3
28
El informe técnico es público y hay una ficha oficial en Hugging Face para el checkpoint SenseNova-U1.5-8B-MoT. Esa ficha corresponde a un modelo distinto de SenseNova-U1.5-8B-MoT-Preview y de la versión U1.5-Lite-Preview anunciada por separado; no conviene confundir los activos preliminares con los del modelo completo. 1
31
22
13
SenseTime afirma que publicará el código de entrenamiento para ajuste fino supervisado, aprendizaje por refuerzo y destilación on-policy. Ni el informe ni las fichas del modelo demuestran por sí solos que todo ese código prometido esté ya disponible. 1
3
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
SenseNova U1.5 reúne comprensión, razonamiento, generación y edición de imágenes sin un codificador visual externo ni un VAE.
SenseNova U1.5 reúne comprensión, razonamiento, generación y edición de imágenes sin un codificador visual externo ni un VAE. Su decodificador espacial busca reducir las uniones visibles entre bloques que podían aparecer en imágenes de alta resolución generadas por U1.
El informe técnico y la ficha del modelo U1.5 completo son públicos. Las versiones Preview y Lite Preview son distintas; SenseTime aún plantea la publicación del código de entrenamiento como un compromiso futuro.