SenseNova U1.5 объединяет понимание, визуальное рассуждение, генерацию и редактирование изображений без отдельного визуального энкодера и VAE. Новый пространственный декодер учитывает соседние участки изображения — в отличие от U1, где они восстанавливались независимо и могли образовывать видимую сетку.
ОпубликовалОтредактировано с помощью GPT-6 SolИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 — мультимодальная модель SenseTime на 8 млрд параметров с архитектурой Mixture of Transformers (MoT). Она работает с изображениями в обе стороны: анализирует их, решает визуальные задачи, создаёт и редактирует. По описанию разработчика, для этого ей не нужны отдельный визуальный энкодер на входе и вариационный автоэнкодер (VAE) для декодирования результата: изображение на выходе восстанавливается в пространстве RGB-пикселей. 1
3
Модель представляет изображение последовательностью визуальных токенов, каждый из которых соответствует области размером 32×32 пикселя. Так она получает компактное представление для анализа и генерации, не передавая входное изображение внешнему визуальному энкодеру. 1
21
Ключевое отличие U1.5 от предыдущей U1 — как токены превращаются обратно в пиксели. В U1 небольшой модуль на основе многослойного перцептрона (MLP) восстанавливал каждый участок независимо. При высоком разрешении границы между участками могли проступать в виде швов или сетки. В U1.5 состояния токенов возвращаются в двумерную сетку, а лёгкий пространственный декодер последовательно восстанавливает изображение с помощью Pixel Shuffle и свёрток 3×3. Соседние участки теперь влияют друг на друга, что должно делать переходы между ними плавнее. 1
3
22
Для генерации вплоть до 4096×4096 пикселей SenseTime также использует настройку уровня шума с учётом разрешения: представление масштаба шума, зависящее от размера изображения, объединяется с шагом генерации. Пространственный декодер решает проблему стыков между участками, а эта настройка помогает учитывать изменение поведения шума при увеличении размера результата. Речь о средствах повышения устойчивости генерации, а не о гарантии изображения без артефактов. 1
3
29
После основного обучения команда отдельно оптимизирует компоненты под визуальную эстетику, отображение китайского и английского текста, инфографику и редактирование. Затем их возможности объединяются методом multi-expert on-policy distillation — дистилляции на данных, получаемых при работе обучаемой модели. Специализация здесь относится к этапу обучения: она не означает, что для каждого пользовательского запроса нужно запускать четыре отдельные модели. 1
29
По данным SenseTime, относительно U1 новая версия лучше передаёт детали на высоком разрешении, сохраняет пространственную связность, работает с текстом и компоновкой элементов, а также редактирует изображения. При этом она сохраняет объединённый подход к анализу и генерации без внешнего визуального энкодера и VAE. Компания приводит результаты 0,92 на GenEval, 0,948 на CVTG-2K и 4,59 на ImgEdit. Это опубликованные оценки, а не доказательство превосходства во всех визуальных задачах. 1
3
28
Доступен технический отчёт U1.5, а на платформе моделей Hugging Face есть отдельная официальная страница контрольной точки SenseNova-U1.5-8B-MoT. Её не следует путать со страницей SenseNova-U1.5-8B-MoT-Preview или с отдельно объявленной U1.5-Lite-Preview: материалы предварительных версий не равнозначны полному релизу. 1
31
22
13
SenseTime заявляет, что планирует открыть обучающий код для контролируемой донастройки, обучения с подкреплением и on-policy-дистилляции. Наличие отчёта и страниц моделей само по себе не подтверждает, что весь обещанный обучающий код уже доступен. 1
3
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
SenseNova U1.5 объединяет понимание, визуальное рассуждение, генерацию и редактирование изображений без отдельного визуального энкодера и VAE.
SenseNova U1.5 объединяет понимание, визуальное рассуждение, генерацию и редактирование изображений без отдельного визуального энкодера и VAE. Новый пространственный декодер учитывает соседние участки изображения — в отличие от U1, где они восстанавливались независимо и могли образовывать видимую сетку.
У полной U1.5 есть отдельная страница модели на Hugging Face. Обещание открыть обучающий код не означает, что весь этот код уже опубликован.