Ling 3.0 flash VL er en åpen vektsmodell under MIT lisensen fra Ant Groups inclusionAI. Modellen har 124 milliarder parametere totalt, men aktiverer rundt 5,5 milliarder per token, og støtter en kontekst på opptil 256K token.
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ling-3.0-flash-VL er inclusionAI og Ant Groups åpne modell for språk og syn, bygget på resonneringsfamilien Ling-3.0-flash. Den tekniske overskriften er en sparsom mixture-of-experts-arkitektur (MoE): Modellen har 124 milliarder parametere totalt, men omtrent 5,5 milliarder aktiveres for hvert token. Målet er å kombinere kapasiteten i en stor modell med lavere beregningsbehov per token enn i en tett modell med 124 milliarder parametere. 3
12
Det viktigste er likevel hvordan modellen er posisjonert: som en visuell agent. I stedet for bare å beskrive et bilde eller svare på et spørsmål om det, skal Ling-3.0-flash-VL kunne bruke visuell informasjon gjennom hele oppgaven: undersøke en skjerm eller et dokument, utføre en handling via et eksternt verktøy, se på den nye tilstanden og deretter kontrollere eller rette resultatet. Ant Group omtaler dette som en lukket sløyfe for visuell tilbakemelding. 12
Ling-3.0-flash-VL tar imot tekst, bilder og video og gir tekst som utdata. Den oppgitte kontekstgrensen er opptil 256K token, noe som er rettet mot lange dokumenter, utvidede multimodale samtaler og agentarbeidsflyter som må bevare mye oppgavehistorikk. 3
4
Rapportene beskriver en hybridarkitektur som kombinerer Kimi Delta Attention med lag av gated multi-head latent attention. For video brukes VideoRoPE-posisjonskoding, som er ment å bevare tidsinformasjon på tvers av videobilder. 1
6
Dette er relevant fordi skaperne presenterer visuelt innhold som en del av selve resonneringsstrømmen, ikke bare som en funksjon lagt på en tekstmodell til slutt. Det er grunnlaget for modellens posisjonering som «naturlig multimodal». 1
12
MoE-modeller inneholder flere spesialiserte parametergrupper, ofte kalt eksperter. En rutemekanisme velger bare noen av dem for et gitt token. For Ling-3.0-flash-VL oppgis 124 milliarder parametere totalt og omtrent 5,5 milliarder aktive parametere per token. 3
12
Forskjellen har en praktisk betydning:
Det betyr ikke at driften er enkel: Å kjøre store, åpne modellvekter krever fortsatt mye minne og solid systemarbeid. Men det forklarer hvorfor modellen markedsføres i en «flash»-klasse, til tross for den totale størrelsen. 3
5
Et vanlig syns- og språkmodell-system kan være nyttig til engangsoppgaver, som å beskrive et foto, hente tekst fra en kvittering eller svare på spørsmål om et diagram. Ling-3.0-flash-VL er i stedet rettet mot en lengre arbeidsrunde:
Dette er særlig relevant for automatisering i grafiske brukergrensesnitt og andre visuelle programvareoppgaver. En modell kan for eksempel undersøke gjeldende grensesnitt, velge en handling, se på skjermen etter endringen og vurdere om ønsket tilstand er nådd. Selve modellen erstatter imidlertid ikke nettleseren, verktøytillatelsene eller sikkerhetsmekanismene rundt arbeidsflyten; disse avgjør hva den faktisk kan gjøre.
Ant Group og omtale av lanseringen peker på frontend-generering, GUI-automatisering og tolkning av medisinske rapporter som bruksområder. 12 Tolkning av medisinske rapporter bør forstås som et mulig støtteverktøy i en arbeidsflyt, ikke som dokumentasjon på selvstendig klinisk pålitelighet eller sikkerhet.
Modellen er utgitt med åpne vekter under MIT-lisensen. Det er rapportert at BF16- og FP8-versjoner er tilgjengelige, mens FP4- og INT4-varianter ble omtalt som planlagt eller kommende i tidlig dekning. 3
4
Det er også rapportert veiledning for kjøring med SGLang og en Ling-tilpasset variant av vLLM. 3
4 For produksjon bør dette ses som et utgangspunkt, ikke en kompatibilitetsgaranti: Operatører må teste den konkrete modellrevisjonen, kvantiseringen, multimodal forbehandling, kontekstlengde, maskinvaren og rammeverksversjonen de faktisk skal bruke.
Dekningen omtaler to tall fra Artificial Analysis Intelligence Index:
Tallene er ikke nødvendigvis motstridende dersom selve indeksversjonen er endret. Men de må ikke sammenlignes som om de kommer fra samme testskala. Den mer avgrensede konklusjonen er at modellen har rapportert konkurransedyktig effektivitet relativt til antallet aktive parametere. Det er ikke i seg selv bevis på at den vil være pålitelig i enhver agentbasert produksjonsløsning eller klinisk arbeidsflyt. 3
4
Poenget er ikke bare at Ling nå kan ta imot bilder og video. Ling-3.0-flash-VL presenteres som den første åpne modellen i Ling-serien som integrerer syn i en gjentakende prosess for planlegging, handling, visuell kontroll og korrigering. Den sparsomme MoE-utformingen skal gjøre denne multimodale agenttilnærmingen mer beregningseffektiv enn en tett modell av tilsvarende størrelse. 3
12
For utviklere er den mest troverdige bruken en avgrenset arbeidsflyt der visuelle bevis betyr noe, og hver verktøyhandling kan etterprøves: å sammenligne en rendret nettside med et design, navigere i et kontrollert grensesnitt eller hente ut og krysssjekke informasjon fra dokumenter. Demonstrasjonene og leverandørrapporterte evalueringene er lovende signaler, men en pålitelig utrulling krever fortsatt oppgavespesifikk evaluering, tilgangskontroll, feilbehandling og menneskelig oppfølging.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash VL er en åpen vektsmodell under MIT lisensen fra Ant Groups inclusionAI.
Ling 3.0 flash VL er en åpen vektsmodell under MIT lisensen fra Ant Groups inclusionAI. Modellen har 124 milliarder parametere totalt, men aktiverer rundt 5,5 milliarder per token, og støtter en kontekst på opptil 256K token.
Nøkkelideen er en visuell tilbakemeldingssløyfe: observere, handle, kontrollere og korrigere.