SenseNova U1.5 to model SenseTime z rodziny Mixture of Transformers, o około 8 mld parametrów. Model opisuje obraz tokenami odpowiadającymi obszarom 32 × 32 piksele.
Opublikowane przezEdytowane za pomocą GPT-6 SolObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 ma wykonywać zadania, które często rozdziela się między różne elementy systemu: rozpoznawać zawartość obrazu, analizować ją, tworzyć nowe obrazy i edytować istniejące. SenseTime opisuje go jako model Mixture of Transformers (MoT) o około 8 mld parametrów. Nie korzysta on z zewnętrznego enkodera obrazu ani z wariacyjnego autoenkodera (VAE) do odtwarzania wygenerowanego obrazu; wynik powstaje w przestrzeni pikseli RGB. Według raportu technicznego architektura ta obsługuje generowanie do 4096 × 4096 pikseli. 1
3
U1.5 reprezentuje fragmenty obrazu za pomocą tokenów wizualnych odpowiadających obszarom 32 × 32 piksele. Dzięki temu może pracować na sekwencji reprezentacji obrazu bez osobnego enkodera wizyjnego. Gdy tworzy obraz, jego stany wizualne są przekształcane w piksele RGB, zamiast przechodzić przez dekoder VAE. To wspólny punkt wyjścia dla analizy obrazu i jego generowania. 1
21
Najważniejsza zmiana względem U1 dotyczy odtwarzania obrazu z tych reprezentacji. Poprzedni model przewidywał każdy fragment niezależnie za pomocą głowicy MLP, czyli sieci wielowarstwowej. Przy wysokiej rozdzielczości granice fragmentów mogły ujawniać się jako szwy lub wzór siatki. U1.5 układa stany wizualne z powrotem w dwuwymiarowej siatce, a następnie używa lekkiego dekodera przestrzennego z kolejnymi etapami Pixel Shuffle i splotami 3 × 3. Sąsiadujące obszary mogą więc wpływać na siebie podczas rekonstrukcji. 1
3
22
Przy generowaniu obrazu do 4096 × 4096 pikseli dochodzi drugi mechanizm: warunkowanie szumu zależne od rozdzielczości. Model łączy informację o skali szumu właściwej dla docelowego rozmiaru obrazu z etapem generowania. Dekoder przestrzenny ma poprawiać ciągłość między fragmentami, a warunkowanie szumu pomaga dostosować proces do rozdzielczości. To rozwiązania służące stabilniejszemu generowaniu w 4K, nie gwarancja obrazu pozbawionego artefaktów. 1
3
29
SenseTime stosuje podejście „najpierw specjalizacja, potem połączenie”. W dalszym treningu rozwija wyspecjalizowane modele do estetyki obrazu, tworzenia czytelnego tekstu po chińsku i angielsku, infografik oraz edycji zdjęć. Następnie łączy ich umiejętności w jednym modelu przez destylację on-policy z wielu ekspertów. Nie oznacza to, że przy każdym poleceniu trzeba uruchamiać cztery osobne modele. 1
29
Według SenseTime U1.5 poprawia względem U1 szczegółowość obrazów o wysokiej rozdzielczości, spójność przestrzenną, odwzorowanie tekstu, układy graficzne i edycję. Zachowuje przy tym zdolność zarówno rozumienia, jak i generowania obrazów w architekturze bez zewnętrznego enkodera wizji i VAE. Podane wyniki to 0,92 w GenEval, 0,948 w CVTG-2K i 4,59 w ImgEdit. Są to raportowane rezultaty testów, a nie dowód niezależnie potwierdzonej przewagi w każdym zadaniu wizualnym. 1
3
28
Publicznie dostępny jest raport techniczny U1.5. Na Hugging Face istnieje też oficjalna strona checkpointu SenseNova-U1.5-8B-MoT. Należy odróżnić ją od strony SenseNova-U1.5-8B-MoT-Preview oraz osobno ogłoszonego wydania U1.5-Lite-Preview: materiały wersji próbnych nie są tym samym co strona pełnego modelu. 1
31
22
13
SenseTime deklaruje, że udostępni kod treningowy obejmujący nadzorowane dostrajanie, uczenie przez wzmacnianie i destylację on-policy. Publikacja raportu oraz stron modeli nie wystarcza jednak, by uznać, że cały zapowiedziany kod treningowy jest już dostępny. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5 to model SenseTime z rodziny Mixture of Transformers, o około 8 mld parametrów.
SenseNova U1.5 to model SenseTime z rodziny Mixture of Transformers, o około 8 mld parametrów. Model opisuje obraz tokenami odpowiadającymi obszarom 32 × 32 piksele. Przy generowaniu dekoder przestrzenny pomaga ograniczać widoczne granice między odtwarzanymi fragmentami.
Publiczny raport i strona pełnego checkpointu są odrębne od wydań Preview oraz Lite Preview.