Ling 3.0 flash VL, Ant Group bünyesindeki inclusionAI tarafından MIT lisansıyla yayımlanan; metin, görsel ve video girdilerini işleyebilen açık ağırlıklı bir modeldir. Seyrek MoE yapısı toplam 124 milyar parametre barındırırken token başına yaklaşık 5,5 milyar parametreyi devreye alır; bu, yoğun 124B modellere kıyas...
YayımlayanGPT-5.6 Terra ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ling-3.0-flash-VL, inclusionAI ve Ant Group tarafından geliştirilen, Ling-3.0-flash muhakeme ailesi üzerine kurulu açık ağırlıklı bir görüntü-dil modeli. Teknik açıdan en dikkat çekici tarafı, seyrek uzman karışımı (Mixture of Experts / MoE) mimarisi: Modelin toplamda 124 milyar parametresi var, ancak her token işlenirken yaklaşık 5,5 milyar parametre etkinleşiyor. Amaç, çok büyük bir modelin kapasitesini korurken token başına hesaplama yükünü aynı büyüklükteki yoğun bir modele göre azaltmak. 3
12
Fakat modeli asıl ayıran iddia, bir görsel ajan olarak tasarlanması. Ling-3.0-flash-VL yalnızca bir görseli tanımlayıp soruyu yanıtlamayı hedeflemiyor; ekranı ya da belgeyi inceleyebiliyor, haricî bir araç üzerinden eylem gerçekleştirebiliyor, yeni görsel durumu tekrar denetleyebiliyor ve gerekirse sonraki adımını düzeltebiliyor. Ant Group bu yaklaşımı görsel geri bildirimli kapalı döngü olarak tanımlıyor. 12
Ling-3.0-flash-VL; metin, görsel ve video girdilerini kabul ediyor, çıktıyı metin olarak üretiyor. Bildirilen bağlam penceresi 256K token seviyesinde. Bu kapasite; uzun belgeler, uzatılmış çoklu ortam sohbetleri ve işlem geçmişini koruması gereken ajan iş akışları için tasarlanmış durumda. 3
4
Mevcut teknik açıklamalarda, Kimi Delta Attention ile kapılı çok başlı gizil dikkat (gated multi-head latent attention) katmanlarını birleştiren hibrit bir omurgadan söz ediliyor. Video tarafında ise kareler arasındaki zamansal bilgiyi korumayı amaçlayan VideoRoPE konumsal kodlaması kullanılıyor. 1
6
Bu ayrıntı önemli: Geliştiriciler, görsel içeriği metin modeline sonradan eklenen bir özellik olarak değil, muhakeme akışının parçası olarak konumlandırıyor. Modelin “yerleşik çoklu ortamlı” (native multimodal) olarak tanıtılmasının temelinde de bu var. 1
12
MoE modellerinde, farklı görevlerde uzmanlaşmış çok sayıda parametre grubu bulunur. Bir yönlendirme mekanizması, her token için bunların yalnızca bir bölümünü seçer. Ling-3.0-flash-VL için bildirilen değerler 124 milyar toplam parametre ve token başına yaklaşık 5,5 milyar etkin parametre şeklinde. 3
12
Bu ayrım pratikte şunu ifade ediyor:
Bu, altyapı ihtiyacını önemsiz hâle getirmiyor. Büyük açık ağırlıkları barındırmak hâlâ ciddi bellek, donanım ve sistem mühendisliği gerektirir. Ancak toplam parametre sayısına rağmen modelin neden “flash” sınıfında konumlandırıldığını açıklıyor. 3
5
Klasik bir görüntü-dil sistemi tek seferlik işlerde yararlı olabilir: Bir fotoğrafı açıklamak, fişteki metni çıkarmak veya grafiğe dair soru yanıtlamak gibi. Ling-3.0-flash-VL ise daha uzun bir döngüyü hedefliyor:
Bu tasarım, özellikle grafik kullanıcı arayüzü (GUI) otomasyonu ve görsel yazılım görevleri için anlam taşıyor. Örneğin model bir arayüzün mevcut durumunu inceleyip işlem seçebilir, değişen ekranı yeniden değerlendirebilir ve hedefe ulaşıp ulaşmadığına karar verebilir. Bununla birlikte model tek başına tarayıcının, araç izinlerinin veya iş akışı güvenlik sınırlarının yerine geçmez; fiilen neler yapabileceğini bu çevre sistemler belirler.
Ant Group ve ilgili haberlerde hedef kullanım alanları arasında ön yüz üretimi, GUI otomasyonu ve tıbbi rapor yorumlama sayılıyor. 12 Tıbbi rapor yorumlamayı, otonom klinik güvenilirlik ya da güvenlik kanıtı olarak değil, insan denetimli yardımcı iş akışı örneği olarak değerlendirmek gerekir.
Model ağırlıkları MIT lisansıyla yayımlandı. BF16 ve FP8 sürümlerinin mevcut olduğu bildirildi; ilk dönem haberlerinde FP4 ve INT4 derlemelerinin de planlandığı veya yakında sunulacağı belirtildi. 3
4
Sunum için SGLang ile Ling’e uyarlanmış bir vLLM yolu anılıyor. 3
4 Ancak bunlar üretim ortamı için otomatik uyumluluk garantisi değil, başlangıç noktası olarak görülmeli. Operatörlerin kullanacakları model revizyonu, nicemleme biçimi, çoklu ortam ön işleme yöntemi, bağlam uzunluğu, donanım ve çerçeve sürümünü kendi ortamlarında test etmesi gerekir.
Haberlerde Artificial Analysis Intelligence Index için iki farklı değer yer alıyor:
Endeksin sürümü değiştiği için bu sonuçlar çelişkili olmak zorunda değil. Ancak aynı ölçekte alınmış puanlarmış gibi doğrudan karşılaştırılmamalılar. Bu verilerden çıkarılabilecek daha sınırlı sonuç, modelin etkin parametre sayısına kıyasla rekabetçi bir verimlilik iddiası taşıdığıdır. Bu durum, modelin her ajan tabanlı, üretim veya klinik iş akışında güvenilir olacağını tek başına göstermez. 3
4
Önemli olan yalnızca Ling ailesine görsel ve video girdisinin eklenmiş olması değil. Ling-3.0-flash-VL, Ling serisinde görüşü yinelemeli planlama, eylem, görsel kontrol ve düzeltme döngüsüne dahil eden ilk açık model olarak sunuluyor. Seyrek MoE yapısı da bu çoklu ortamlı ajan yaklaşımını, benzer ölçekli yoğun modellere göre daha düşük hesaplama maliyetiyle mümkün kılmayı hedefliyor. 3
12
Geliştiriciler açısından en inandırıcı senaryo; görsel kanıtın önemli olduğu, araç eylemlerinin sınırlandığı ve her adımın doğrulanabildiği iş akışlarıdır. Örneğin oluşturulmuş bir web sayfasını tasarım referansıyla karşılaştırmak, denetimli bir arayüzde gezinmek veya belgeler arasında bilgi çıkarıp çapraz kontrol yapmak. Demo ve üretici tarafından bildirilen değerlendirmeler olumlu sinyaller veriyor; ancak güvenilir kullanım için göreve özel testler, izin denetimleri, hata yönetimi ve insan gözetimi şart olmaya devam ediyor.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash VL, Ant Group bünyesindeki inclusionAI tarafından MIT lisansıyla yayımlanan; metin, görsel ve video girdilerini işleyebilen açık ağırlıklı bir modeldir.
Ling 3.0 flash VL, Ant Group bünyesindeki inclusionAI tarafından MIT lisansıyla yayımlanan; metin, görsel ve video girdilerini işleyebilen açık ağırlıklı bir modeldir. Seyrek MoE yapısı toplam 124 milyar parametre barındırırken token başına yaklaşık 5,5 milyar parametreyi devreye alır; bu, yoğun 124B modellere kıyasla çıkarım maliyetini düşürmeyi amaçlar.
Modelin öne çıkan iddiası, görsel bilgiyi tek seferlik yorumlamak yerine «gözlemle → eyleme geç → doğrula → düzelt» döngüsünde kullanmasıdır.