SenseNova U1.5 — модель SenseTime на 8 млрд параметрів, що поєднує розуміння зображень, візуальне міркування, генерацію та редагування без окремого візуального енкодера й VAE. Зображення поділяється на ділянки 32 × 32 пікселі; просторовий декодер має зменшувати помітні стики між ними під час генерації.
ОпублікувавВідредаговано за допомогою GPT-6 SolЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 — спроба SenseTime навчити одну модель і «читати» зображення, і створювати їх. Вона використовує архітектуру Mixture of Transformers (MoT) на 8 млрд параметрів для візуального розуміння, міркування, генерації та редагування. На відміну від підходів з окремим візуальним енкодером для аналізу й варіаційним автоенкодером (VAE) для декодування результату, U1.5 працює через спільний візуальний інтерфейс і відтворює вихідне зображення в просторі RGB-пікселів. 1
3
Зображення представлене послідовністю візуальних токенів, кожен із яких відповідає ділянці 32 × 32 пікселі. Так модель отримує компактне представлення для роботи із зображенням без окремого візуального енкодера. Під час генерації її вихідні візуальні стани перетворюються на RGB-пікселі без декодування через VAE. 1
21
Головна зміна порівняно з U1 — спосіб відтворення пікселів. У попередній версії вихідний модуль MLP будував кожен фрагмент окремо. На великих зображеннях межі між такими фрагментами могли ставати помітними як шви або сітка. U1.5 повертає візуальні стани на двовимірну сітку й застосовує легкий просторовий декодер із послідовними етапами Pixel Shuffle та згортками 3 × 3. Завдяки цьому сусідні ділянки можуть впливати одна на одну під час відтворення. 1
3
22
Для генерації до 4096 × 4096 пікселів SenseTime також описує механізм урахування роздільності під час роботи з шумом: представлення масштабу шуму, залежне від розміру зображення, поєднується з кроком генерації. Просторовий декодер має поліпшувати цілісність зображення на межах фрагментів, а цей механізм — пристосовувати генерацію до роздільності. Це технічні рішення для стабільнішої роботи в 4K, а не гарантія відсутності дефектів. 1
3
29
У післянавчанні SenseTime застосовує принцип «спочатку спеціалізувати, потім об’єднати». Компанія оптимізує окремі експертні моделі для візуальної естетики, відтворення китайського й англійського тексту, інфографіки та редагування. Потім їхні можливості зводять в одну модель через багатoекспертну дистиляцію on-policy — метод передавання навичок під час навчання. Це не означає, що для кожного запиту користувача потрібно запускати чотири окремі моделі. 1
29
SenseTime повідомляє про кращу деталізацію й просторову цілісність у високій роздільності, а також поліпшення роботи з текстом, макетами та редагуванням порівняно з U1. При цьому зберігається підхід, що поєднує розуміння й генерацію без окремого візуального енкодера та VAE. Наведені результати U1.5 — 0,92 на GenEval, 0,948 на CVTG-2K і 4,59 на ImgEdit — є опублікованими оцінками, а не незалежним підтвердженням переваги в кожному завданні. 1
3
28
Технічний звіт U1.5 опубліковано. На Hugging Face також є окрема сторінка повної моделі SenseNova-U1.5-8B-MoT. Її не слід плутати зі сторінкою U1.5-8B-MoT-Preview чи окремо анонсованою U1.5-Lite-Preview: попередні версії не є підтвердженням наявності всіх матеріалів повного випуску. 1
31
22
13
SenseTime заявляє, що відкриє навчальний код для контрольованого донавчання, навчання з підкріпленням і дистиляції on-policy. Наявність звіту та сторінок моделей сама по собі не доводить, що весь обіцяний навчальний код уже опубліковано. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5 — модель SenseTime на 8 млрд параметрів, що поєднує розуміння зображень, візуальне міркування, генерацію та редагування без окремого візуального енкодера й VAE.
SenseNova U1.5 — модель SenseTime на 8 млрд параметрів, що поєднує розуміння зображень, візуальне міркування, генерацію та редагування без окремого візуального енкодера й VAE. Зображення поділяється на ділянки 32 × 32 пікселі; просторовий декодер має зменшувати помітні стики між ними під час генерації.
Для повної U1.5 є окрема сторінка моделі, відмінна від Preview і Lite Preview. SenseTime обіцяє відкрити навчальний код, але сама обіцянка не підтверджує його повної доступності.