Yerleşik çok modluluk, ajanların ekran görüntüsünü, kodu ve görevin amacını aynı çalışma döngüsünde tutarak üretme, görüntüleme, denetleme ve düzeltme yapmasını hedefliyor. Kimi K3, Arena’nın Frontend Code Arena sıralamasında 1.679 puanla ilk sıraya çıktı; Qwen3.8 Max ise görsel anlayışın planlama, yürütme ve doğrul...
Research answer

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Bir modelin görsel alabilmesi ile görsel kanıtı ajanın muhakeme döngüsünde birinci sınıf bilgi olarak kullanması arasında giderek daha önemli bir fark oluşuyor.
Moonshot AI’nin Kimi K3 modeli, uzun soluklu kodlama, bilgi çalışması, görsel anlama ve muhakeme için yerleşik çok modlu, ajan odaklı bir model olarak konumlandırılıyor. Alibaba ise Qwen3.8-Max’te görsel anlayışın planlama, yürütme ve doğrulama aşamalarının tamamında çalıştığını belirtiyor. 17
35 Pratik hedef basit: Ajan bir şey geliştirir, sonucu ekranda görür, hatayı fark eder ve görsel gözlemi ara bir metin raporuna bütünüyle indirgemeden iyileştirme yapar.
Metin öncelikli genel modeller; kod üretimi, uzun bağlamlı analiz, araç çağrıları ve girdileriyle başarı ölçütleri zaten metin olarak tanımlanmış görevlerde hâlâ son derece kullanışlı. Tipik bir araç tabanlı kurulumda ajan OCR çağırabilir, DOM’u ya da erişilebilirlik ağacını inceleyebilir, koordinat isteyebilir veya ekran görüntüsünü ayrı bir görüntü-dil modeline gönderebilir. Belge çıkarma, yapılandırılmış arayüz incelemesi ya da tek seferlik bir görsel soru için bu mimari gayet makul olabilir.
Yerleşik çok modlu eğitim ise farklı bir yaklaşımı temsil ediyor. Amaç; metin, görsel, video, kod ve ajan durumunu ortaklaşa ele alarak görsel bilginin planlama ve revizyonu doğrudan etkileyebilmesi. Çinli model pazarına dair bir değerlendirme, Moonshot, Alibaba ve ByteDance’in bu yöne ilerlediğini; o dönemde DeepSeek, Zhipu ve Hunyuan’ın genel amaçlı sürümlerinin görece metin merkezli kaldığını aktardı. 15
Ancak bu tabloyu şirketler arasında kalıcı bir ayrım gibi okumamak gerekir. DeepSeek’in V4 Flash ve V4 Pro modelleri başlangıçta yalnızca metin destekliyordu; ardından şirket deneysel DeepSeek-V4-Flash-Vision-Exp modelini duyurdu. 13
4 Model aileleri hızla değişiyor. Ayrıca mevcut kaynaklar, özellikle ByteDance, Zhipu ve Tencent’in tercihleri için kesin bir kurum içi gerekçe ortaya koymuyor.
Bir web sayfası yalnızca metinlerden ve DOM yapısından ibaret değildir. Hiyerarşi, boşluklar, hizalama, kontrast, tipografi, kırpılma, görseller ve bileşenlerin birbirleriyle ilişkisi de deneyimin parçasıdır. Bir ajan referans tasarıma uygun bir arayüz üretmekle görevlendirildiğinde, kabul kriterleri çoğu zaman tam olarak bu ayrıntılardır.
Görsel geri bildirimin döngüye dâhil olduğu bir iş akışı şöyle ilerleyebilir:
Qwen3.8-Max bu kapalı döngüyü açıkça tarif ediyor: Yerleşik görsel anlayış, uzun soluklu işlerde planlama, yürütme ve doğrulama boyunca kullanılıyor. Barındırılan model görüntü, metin ve video girdilerini; metin çıktısını destekliyor. 35 Kimi K3 de tek bir model içinde metin, görüntü ve videoyu anlayabildiğini ve 1 milyon token bağlam penceresi sunduğunu belirtiyor.
25
Avantaj yalnızca “model görüyor” olması değil. Aynı ajanın istekleri, kodu, görsel sonucu ve gelişen planını yinelenen çalışma sırasında birlikte taşıyabilmesi.
Harici algı araçları çoğu durumda etkilidir; fakat görme ile eyleme geçme arasına bir arayüz katmanı ekler.
OCR seçicidir. Ekrandaki yazıları çıkarabilir; ancak bir düğmenin kırpılıp kırpılmadığını, düzenin dengesiz olup olmadığını, bir pencerenin içeriği kapatıp kapatmadığını ya da görsel hiyerarşinin referanstan ayrılıp ayrılmadığını metin çıkarımı tek başına bütünüyle anlatamaz.
Koordinatlar yapılandırılmıştır ama dardır. “Öğe x/y konumunda” bilgisi otomasyon için yararlıdır. Buna karşılık öğenin görsel önemi, biçimsel özellikleri, başka bir öğeyle çakışıp çakışmadığı veya ekranda gerçekten doğru nesne olup olmadığı konusunda yeterli bağlam vermeyebilir.
Tekrarlanan çeviri, uzun zincirleri karmaşıklaştırabilir. Çok adımlı işlerde ekran görüntüsünden açıklamaya ya da koordinata her geçiş bağlam kaybına yol açabilir veya ajanın bağlamı yeniden kurmasını gerektirebilir. Eksik bir açıklamaya dayanarak yapılan düzeltme yeni bir görsel sorun doğurabilir; bu da yeni bir gözlem turu demektir.
Yerleşik çok modlu bir model hataları ortadan kaldırmaz. Ancak ekran görüntüsünü yalnızca metinsel özeti üzerinden değerlendirmek yerine, görseli uygulama bağlamı ve kodla birlikte ele alabilir. Ön yüz geliştirme, grafik arayüz otomasyonu, görsel regresyon hatalarının ayıklanması, görsel düzenleme ve video iş akışları için çekicilik tam da burada.
Kimi K3’ün kamuya açık sonuçları, geliştiricilerin neden bu alana dikkat kesildiğini gösteriyor. Arena, Kimi K3’ün Frontend Code Arena’da 1.679 puanla zirveye çıktığını; bunun Kimi K2.6’ya kıyasla 17 basamaklık yükseliş olduğunu bildirdi. Model, listelenen yedi ön yüz alanının altısında ilk sırayı aldı. 32 Ayrı bir haberde ise Puter’ın testinde Kimi K3’ün hedef web sayfası ile işlenmiş sürüm arasına kasıtlı olarak yerleştirilen beş görsel farkı yanlış pozitif üretmeden saptadığı aktarıldı.
28
Bunlar görsel doğrulamanın anlamlı gösterimleri. Yine de bu sonuçların tek başına yerleşik görme yeteneğinden kaynaklandığını kanıtlamazlar. Model ölçeği, eğitim verisi, eğitim sonrası iyileştirme, istem tasarımı, tarayıcı araçları, ajan altyapısı ve benchmark’ın yapısı performansı etkileyebilir. Daha isabetli sonuç şudur: Görsel geri bildirim, yalnızca metin tabanlı testlerin kaçırabileceği gerçek bir hata sınıfını hedefler.
Görev, tekrar eden gözlem ve düzeltme gerektiriyorsa ve görsel doğruluk “tamamlandı” tanımının parçasıysa yerleşik çok modlu bir ajan tercih edilebilir:
Düşük maliyetli çıkarma, toplu işleme veya yalnızca yapılandırılmış metin ve arayüz durumu gerektiren akışlarda modüler OCR ya da harici görüntü-dil modeli hattı daha uygun olmaya devam edebilir. Asıl karar, görmenin popüler olup olmadığı değil; ajanın şu soruyu tekrar tekrar yanıtlamasının gerekip gerekmediğidir: Bu çıktı gerçekten doğru görünüyor mu?
Bu tür işler için yerleşik çok modluluk, algıyı ara sıra çağrılan bir araç olmaktan çıkarıp ajanın çalışma döngüsünün parçası yapıyor. Kimi K3 ve Qwen3.8-Max’in açıkça izlediği yön de bu. 17
35
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Yerleşik çok modluluk, ajanların ekran görüntüsünü, kodu ve görevin amacını aynı çalışma döngüsünde tutarak üretme, görüntüleme, denetleme ve düzeltme yapmasını hedefliyor.
Yerleşik çok modluluk, ajanların ekran görüntüsünü, kodu ve görevin amacını aynı çalışma döngüsünde tutarak üretme, görüntüleme, denetleme ve düzeltme yapmasını hedefliyor. Kimi K3, Arena’nın Frontend Code Arena sıralamasında 1.679 puanla ilk sıraya çıktı; Qwen3.8 Max ise görsel anlayışın planlama, yürütme ve doğrulama boyunca kullanıldığını söylüyor.