Ling 3.0 flash VL je otevřený model od inclusionAI a Ant Group pod licencí MIT; přijímá text, obrázky i video a vrací textový výstup. Architektura MoE má celkem 124 miliard parametrů, ale na jeden token aktivuje přibližně 5,5 miliardy, což má snížit výpočetní nároky při inferenci oproti hustému modelu stejné velikosti.
PublikovalUpraveno pomocí GPT-5.6 TerraObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ling-3.0-flash-VL je otevřený vision-language model laboratoře inclusionAI ze skupiny Ant Group. Staví na jazykově a reasoningově zaměřené řadě Ling-3.0-flash, ale přidává nativní práci s obrázky a videem. Jeho technicky nejvýraznější vlastností je řídká architektura Mixture of Experts (MoE): model má celkem 124 miliard parametrů, pro zpracování jednoho tokenu však aktivuje zhruba 5,5 miliardy. Cílem je spojit velkou celkovou kapacitu s nižšími výpočetními náklady na token než u hustého modelu se 124 miliardami parametrů. 3
12
Podstatnější než samotné číslo parametrů je ovšem zaměření modelu na vizuální agenty. Nemá jen jednorázově popsat obrázek nebo odpovědět na otázku nad snímkem. Ant Group jej prezentuje jako systém, který může obrazové vstupy využívat v celém průběhu úkolu: prohlédnout si obrazovku či dokument, provést akci prostřednictvím nástroje, zkontrolovat nový stav a případně postup opravit. Jde o tzv. uzavřenou smyčku vizuální zpětné vazby. 12
Ling-3.0-flash-VL přijímá text, obrázky a video; výstupem je text. Uváděné kontextové okno dosahuje až 256K tokenů, takže model míří i na dlouhé dokumenty, rozsáhlé multimodální konverzace a agentní pracovní postupy, kde je nutné držet v paměti větší část historie úkolu. 3
4
Dostupné popisy architektury mluví o hybridním základu kombinujícím Kimi Delta Attention a vrstvy gated multi-head latent attention. Pro video využívá poziční kódování VideoRoPE, které má zachovávat časové souvislosti napříč snímky. 1
6
Tvůrci tím zdůrazňují, že vizuální data nemají být pouze doplňkem připojeným k textovému modelu na konci zpracování. Mají vstupovat do samotného toku uvažování, což je základ označení „nativně multimodální“ model. 1
12
V modelu typu MoE jsou parametry rozděleny do více specializovaných skupin, takzvaných expertů. Směrovací mechanismus pro daný token vybírá jen část z nich. U Ling-3.0-flash-VL se uvádí 124 miliard parametrů celkem a přibližně 5,5 miliardy aktivních parametrů na token. 3
12
V praxi je rozdíl důležitý:
To samozřejmě neznamená, že provoz bude nenáročný. Hostování velkých otevřených vah stále vyžaduje značnou paměť a pečlivě navrženou infrastrukturu. Vysvětluje to však, proč je model navzdory celkové velikosti označován jako „flash“ varianta. 3
5
Běžný vision-language systém umí dobře jednorázové úlohy: popsat fotografii, vytěžit text z účtenky nebo odpovědět na otázku nad grafem. Ling-3.0-flash-VL je zamýšlen pro delší pracovní cyklus:
To je relevantní zejména pro automatizaci grafických rozhraní. Model může například vyhodnotit aktuální stav aplikace, zvolit akci, prohlédnout si změněnou obrazovku a rozhodnout, zda se dostal do požadovaného stavu. Sám model ale nenahrazuje prohlížeč, oprávnění k nástrojům ani bezpečnostní pravidla pracovního procesu. Právě okolní systém určuje, co skutečně smí a dokáže vykonat.
Ant Group a související reporty uvádějí jako cílové scénáře generování front-endu, GUI automatizaci a interpretaci lékařských zpráv. 12 Poslední z nich je však třeba chápat jako asistivní použití, nikoli jako důkaz autonomní klinické spolehlivosti či bezpečnosti.
Model byl vydán jako otevřené váhy pod licencí MIT. Dostupné mají být varianty vah BF16 a FP8; v raném pokrytí vydání byly verze FP4 a INT4 označeny jako připravované. 3
4
Pro nasazení se uvádí podpora SGLang a cesta přes vLLM upravené pro Ling. 3
4 Pro produkční provoz jde ale spíše o výchozí bod než o záruku kompatibility. Je vhodné otestovat konkrétní revizi modelu, kvantizaci, multimodální předzpracování, délku kontextu, použitý hardware i verzi frameworku.
V pokrytí vydání se objevují dvě hodnoty z indexu Artificial Analysis Intelligence Index:
Čísla si nutně neprotiřečí, pokud se změnila verze samotného indexu. Není ale správné je porovnávat, jako by šlo o skóre ze stejné testovací škály. Střízlivý závěr zní: podle reportovaných výsledků model dosahuje konkurenceschopné efektivity vzhledem k počtu aktivních parametrů. Samo o sobě to však nedokládá spolehlivost ve všech agentních, produkčních ani klinických scénářích. 3
4
Nejde jen o to, že řada Ling získala vstup z obrázků a videa. Ling-3.0-flash-VL je prezentován jako první otevřený model této řady, který začleňuje vizuální informace do opakovaného plánování, jednání, vizuální kontroly a opravy. Řídká MoE architektura má tento multimodální agentní přístup umožnit s nižším výpočtem na token než u obdobně velkého hustého modelu. 3
12
Pro vývojáře dává největší smysl v omezených procesech, kde jsou vizuální důkazy důležité a každou akci nástroje lze ověřit: například při kontrole vykreslené stránky proti návrhu, navigaci v kontrolovaném rozhraní nebo vytěžování a křížové kontrole informací z dokumentů. Dema a hodnocení uváděná dodavatelem jsou slibným signálem, spolehlivé nasazení ale stále vyžaduje testování na konkrétním úkolu, řízení oprávnění, ošetření chyb a lidský dohled.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash VL je otevřený model od inclusionAI a Ant Group pod licencí MIT; přijímá text, obrázky i video a vrací textový výstup.
Ling 3.0 flash VL je otevřený model od inclusionAI a Ant Group pod licencí MIT; přijímá text, obrázky i video a vrací textový výstup. Architektura MoE má celkem 124 miliard parametrů, ale na jeden token aktivuje přibližně 5,5 miliardy, což má snížit výpočetní nároky při inferenci oproti hustému modelu stejné velikosti.
Model má kontextové okno až 256K tokenů a je navržen pro smyčku „pozorovat → jednat → ověřit → opravit“, například v GUI automatizaci nebo při kontrole generovaného front endu.