SenseNova U1.5 je model společnosti SenseTime s přibližně 8 miliardami parametrů pro porozumění obrazům, vizuální uvažování, generování a úpravy. Obraz zpracovává po oblastech 32 × 32 pixelů.
PublikovalUpraveno pomocí GPT-6 SolObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5 od společnosti SenseTime má ambici zvládnout dvě úlohy v jednom modelu: vyznat se v obrázku a zároveň nový obrázek vytvořit či upravit. Jde o architekturu Mixture of Transformers (MoT) s přibližně 8 miliardami parametrů. Podle technické zprávy nepotřebuje externí obrazový enkodér pro zpracování vstupu ani variační autoenkodér (VAE) pro dekódování výstupu: výsledný obraz rekonstruuje v prostoru RGB pixelů. 1
3
Model pracuje s obrazovými tokeny odpovídajícími oblastem 32 × 32 pixelů. Díky tomu může s obrázkem zacházet jako se sledem oblastí, aniž by jeho zpracování předával samostatnému obrazovému enkodéru. Zásadní novinkou U1.5 je ale způsob, jakým z těchto oblastí znovu sestavuje výsledný obraz. 1
21
Starší U1 předpovídal každý výřez zvlášť pomocí výstupní vrstvy typu MLP, tedy vícevrstvého perceptronu. Ve vysokém rozlišení se proto mohly objevit viditelné hranice, mřížka nebo nesouvislé textury. U1.5 místo toho vrací obrazové stavy do dvourozměrné mřížky a používá lehký prostorový dekodér s postupným zvětšováním pomocí Pixel Shuffle a konvolucemi 3 × 3. Při rekonstrukci tak mohou sousední oblasti ovlivňovat jedna druhou. 1
3
22
Pro generování až do 4096 × 4096 pixelů SenseTime popisuje také podmiňování šumu podle rozlišení: informaci o škále šumu závislé na velikosti obrázku kombinuje s krokem generování. Prostorový dekodér řeší návaznost mezi oblastmi, zatímco toto podmiňování má pomoci přizpůsobit generování cílovému rozlišení. Cílem je stabilnější tvorba ve 4K, nikoli záruka obrázků bez vad. 1
3
29
Při následném trénování SenseTime nejprve optimalizuje specializované experty pro vizuální estetiku, vykreslování čínského a anglického textu, infografiky a úpravy obrázků. Jejich schopnosti pak spojuje do jednoho modelu pomocí víceexpertní on-policy destilace. Specialisté jsou tedy součástí trénovacího postupu, nikoli čtyři modely, které by bylo nutné spouštět při každém požadavku. 1
29
SenseTime oproti U1 uvádí lepší detaily a prostorovou souvislost ve vysokém rozlišení i pokrok při tvorbě textu, rozvržení a úpravách obrázků. Zachována má být schopnost obraz analyzovat i vytvářet bez externího enkodéru a VAE. Mezi zveřejněné výsledky patří 0,92 v GenEval, 0,948 v CVTG-2K a 4,59 v ImgEdit. Jde o výsledky uváděné autory, ne o nezávislý důkaz zlepšení ve všech obrazových úlohách. 1
3
28
K dispozici je technická zpráva U1.5 a samostatná oficiální stránka checkpointu SenseNova-U1.5-8B-MoT na platformě Hugging Face. Tu je potřeba odlišovat od stránky U1.5-8B-MoT-Preview i od zvlášť oznámené verze U1.5-Lite-Preview: předběžná verze sama o sobě není plným checkpointem. 1
31
22
13
SenseTime říká, že zveřejní trénovací kód pro řízené dolaďování, posilované učení a on-policy destilaci. Z existence zprávy a stránek modelů však neplyne, že už je celý slíbený trénovací kód dostupný. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5 je model společnosti SenseTime s přibližně 8 miliardami parametrů pro porozumění obrazům, vizuální uvažování, generování a úpravy.
SenseNova U1.5 je model společnosti SenseTime s přibližně 8 miliardami parametrů pro porozumění obrazům, vizuální uvažování, generování a úpravy. Obraz zpracovává po oblastech 32 × 32 pixelů. Nový prostorový dekodér má při tvorbě obrázku omezit švy mezi těmito oblastmi, které se mohly objevovat u předchozí verze U1.
Technická zpráva i samostatná stránka plné verze U1.5 jsou veřejné. Verze Preview a Lite Preview jsou odlišné; SenseTime zveřejnění kompletního trénovacího kódu teprve slibuje.