SenseNova U1.5; görsel anlama, akıl yürütme, üretme ve düzenleme işlerini harici görsel kodlayıcı veya VAE kullanmadan tek bir 8 milyar parametreli modelde topluyor. Yeni uzamsal çözücü, U1’de yüksek çözünürlükte görülebilen görüntü parçası sınırlarını azaltmayı hedefliyor; çözünürlüğe duyarlı gürültü koşullandırmas...
YayımlayanGPT-6 Sol ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SenseTime’s SenseNova U1.5, and how does its 8B-parameter Mixture-of-Transformers architecture unify visual understanding, reasoning. Article summary: SenseNova U1.5 is SenseTime’s 8B-parameter Mixture-of-Transformers (MoT) model for visual understanding, reasoning, image generation, and editing. Its central design is to learn from image patches and generate in pixel s. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
SenseNova U1.5’in çıkış noktası şu: Bir yapay zekâ modeli, görseli anlamak ve yeni bir görsel üretmek için ayrı sistemlere ihtiyaç duymadan ikisini de yapabilir mi? SenseTime’ın teknik raporu, 8 milyar parametreli Mixture-of-Transformers (MoT) modelini bu hedefle tanımlıyor. U1.5; görsel anlama, görseller hakkında akıl yürütme, üretim ve düzenlemeyi aynı mimaride birleştiriyor. Harici bir görsel kodlayıcıya ya da üretilen görüntüyü çözmek için VAE’ye —değişken otokodlayıcıya— dayanmıyor; çıktıyı RGB piksel uzayında yeniden oluşturuyor. 1
3
U1.5, görüntü bölgelerini 32×32 piksellik görsel belirteçlerle temsil ediyor. Böylece görsel, modelin işleyebileceği bir diziye dönüşüyor. Üretim aşamasında ise modelin görsel durumları, bir VAE’nin ara gösterimini çözmek yerine RGB piksellere dönüştürülüyor. Görseli yorumlama ile görsel oluşturmayı buluşturan ortak arayüz bu. 1
21
U1’e göre belirleyici değişiklik, görüntünün yeniden oluşturulma biçiminde. Önceki model, her görüntü parçasını çok katmanlı algılayıcı (MLP) aracılığıyla bağımsız olarak tahmin ediyordu. Yüksek çözünürlükte bu yöntem, parçaların birleştiği yerlerde çizgi veya ızgara izleri bırakabiliyordu. U1.5 ise görsel durumları yeniden iki boyutlu bir düzene yerleştiriyor; Pixel Shuffle aşamaları ve 3×3 evrişimler kullanan hafif bir uzamsal çözücüyle komşu bölgeleri birbirini dikkate alarak oluşturuyor. Amaç, parça sınırlarında daha tutarlı bir görüntü elde etmek. 1
3
22
4096×4096 piksele kadar üretim için ikinci bir düzenleme de var: çözünürlüğe duyarlı gürültü koşullandırması. Teknik rapora göre çözünürlüğe bağlı bir gürültü ölçeği gösterimi, üretim sürecinin zaman adımıyla birleştiriliyor. Uzamsal çözücü parça sınırlarına, bu koşullandırma ise çıktı boyutu değiştiğinde gürültünün davranışına odaklanıyor. İkisi birlikte doğal 4K üretimi daha kararlı hâle getirmeyi hedefliyor; her görselin kusursuz çıkacağını garanti etmiyor. 1
3
29
SenseTime’ın yaklaşımı önce uzmanlaştırmak, sonra birleştirmek. Eğitim sonrası aşamada görsel estetik, Çince ve İngilizce metin oluşturma, infografik üretimi ve görsel düzenleme için uzmanlar geliştiriliyor. Ardından bu yetenekler, çoklu uzmanlı on-policy distillation yöntemiyle tek modelde bir araya getiriliyor. Başka bir deyişle uzmanlar eğitim sürecinin parçası; her kullanıcı isteğinde dört ayrı modelin çalıştırılması gerekmiyor. 1
29
SenseTime, U1.5’in U1’e kıyasla yüksek çözünürlüklü ayrıntılarda ve görüntü parçaları arasındaki süreklilikte ilerleme sağladığını; metin oluşturma, yerleşim ve düzenlemede de iyileştiğini bildiriyor. Model, görseli hem anlama hem üretme yeteneğini ve harici görsel kodlayıcı ile VAE kullanmayan tasarımını koruyor. Açıklanan değerlendirme sonuçları GenEval’de 0,92, CVTG-2K’de 0,948 ve ImgEdit’te 4,59. Bunlar raporlanan test sonuçlarıdır; her görsel görevde bağımsız olarak doğrulanmış bir üstünlük anlamına gelmez. 1
3
28
U1.5 teknik raporu kamuya açık. Hugging Face’te ayrıca tam model için SenseNova-U1.5-8B-MoT adlı ayrı bir model sayfası bulunuyor. Bu sayfa, U1.5-8B-MoT-Preview sayfasından ve SenseTime’ın ayrıca duyurduğu U1.5-Lite-Preview sürümünden farklı; önizleme varlıklarını tam modelle karıştırmamak gerekiyor. 1
31
22
13
SenseTime, denetimli ince ayar, pekiştirmeli öğrenme ve on-policy distillation için eğitim kodunu açık kaynak olarak yayımlayacağını söylüyor. Teknik raporun ve model sayfalarının mevcut olması, vaat edilen eğitim kodunun tamamının hâlihazırda erişilebilir olduğunu tek başına göstermiyor. 1
3
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
SenseNova U1.5; görsel anlama, akıl yürütme, üretme ve düzenleme işlerini harici görsel kodlayıcı veya VAE kullanmadan tek bir 8 milyar parametreli modelde topluyor.
SenseNova U1.5; görsel anlama, akıl yürütme, üretme ve düzenleme işlerini harici görsel kodlayıcı veya VAE kullanmadan tek bir 8 milyar parametreli modelde topluyor. Yeni uzamsal çözücü, U1’de yüksek çözünürlükte görülebilen görüntü parçası sınırlarını azaltmayı hedefliyor; çözünürlüğe duyarlı gürültü koşullandırması ise 4096×4096 piksele kadar üretimi destekliyor.
Tam U1.5 modelinin ayrı bir Hugging Face sayfası var. Preview ve Lite Preview sürümleri ondan farklı; SenseTime’ın eğitim kodunu açma sözü, kodun tamamının şimdiden yayımlandığı anlamına gelmiyor.