O SenseNova U1.5 é um modelo Mixture of Transformers de cerca de 8 bilhões de parâmetros que reúne compreensão, raciocínio, geração e edição de imagens sem codificador visual externo nem VAE. Tokens correspondentes a regiões de 32 × 32 pixels alimentam um decodificador espacial criado para reduzir as emendas entre b...
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
O SenseNova U1.5 tenta resolver um desafio prático: fazer o mesmo modelo analisar uma imagem, raciocinar sobre ela e criar ou editar outra, sem depender de um codificador visual externo para a entrada nem de um autoencoder variacional (VAE) para decodificar a saída. A SenseTime descreve essa arquitetura Mixture of Transformers (MoT), com cerca de 8 bilhões de parâmetros, como uma interface visual compartilhada que reconstrói imagens diretamente no espaço de pixels RGB. 1
3
O modelo representa a imagem por tokens visuais correspondentes a regiões de 32 × 32 pixels. Isso transforma o conteúdo visual em uma sequência que a arquitetura pode processar tanto em tarefas de compreensão quanto de criação. Na geração, o resultado é reconstruído como pixels RGB, sem passar pela decodificação de uma representação latente feita por um VAE. 1
21
A principal mudança em relação ao U1 está na etapa final da imagem. Antes, uma rede do tipo MLP previa cada bloco separadamente; em resoluções altas, os limites entre blocos podiam aparecer como emendas ou padrões de grade. No U1.5, os estados visuais voltam a uma organização bidimensional e passam por um decodificador espacial com Pixel Shuffle progressivo e convoluções de 3 × 3. Assim, regiões vizinhas podem influenciar a reconstrução umas das outras. 1
3
22
Para gerar imagens de até 4096 × 4096 pixels, a SenseTime também descreve um condicionamento de ruído sensível à resolução: uma representação da escala de ruído dependente do tamanho da imagem é combinada com a etapa de geração. O decodificador procura melhorar a continuidade entre blocos; o condicionamento procura adaptar o processo à resolução escolhida. São mecanismos voltados a dar mais estabilidade à geração em 4K, não uma garantia de imagens sem artefatos. 1
3
29
A estratégia de pós-treinamento é especializar e depois unificar. A SenseTime otimiza especialistas para estética visual, reprodução de texto em chinês e inglês, infográficos e edição de imagens. Em seguida, reúne essas capacidades por meio de destilação on-policy com múltiplos especialistas — uma etapa de treinamento, não a exigência de executar quatro modelos separados a cada pedido. 1
29
Segundo a empresa, o U1.5 melhora os detalhes em alta resolução, a continuidade espacial, a reprodução de texto, os layouts e a edição em relação ao U1, mantendo a proposta de compreensão e geração sem codificador visual externo nem VAE. Os resultados divulgados incluem 0,92 no GenEval, 0,948 no CVTG-2K e 4,59 no ImgEdit. Esses números são resultados reportados pela SenseTime; não demonstram, por si só, melhora em toda tarefa visual. 1
3
28
O relatório técnico do U1.5 é público. No Hugging Face, há uma página oficial para o checkpoint SenseNova-U1.5-8B-MoT, distinta da página U1.5-8B-MoT-Preview e do lançamento separado U1.5-Lite-Preview. Portanto, os materiais das versões preliminares não devem ser confundidos com os do checkpoint completo. 1
31
22
13
A SenseTime afirma que abrirá o código de treinamento para ajuste fino supervisionado, aprendizado por reforço e destilação on-policy. A existência do relatório e das páginas dos modelos não confirma, por si só, que todo esse código prometido já tenha sido publicado. 1
3
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O SenseNova U1.5 é um modelo Mixture of Transformers de cerca de 8 bilhões de parâmetros que reúne compreensão, raciocínio, geração e edição de imagens sem codificador visual externo nem VAE.
O SenseNova U1.5 é um modelo Mixture of Transformers de cerca de 8 bilhões de parâmetros que reúne compreensão, raciocínio, geração e edição de imagens sem codificador visual externo nem VAE. Tokens correspondentes a regiões de 32 × 32 pixels alimentam um decodificador espacial criado para reduzir as emendas entre blocos que podiam aparecer nas imagens do U1.
Há uma página para o checkpoint U1.5 completo, distinta das versões Preview e Lite Preview.