Ling 3.0 flash VL er en MIT licenseret open weight model fra Ant Groups inclusionAI, der kan modtage tekst, billeder og video. Modellen har et kontekstvindue på op til 256K tokens og tilbydes i BF16 og FP8 vægtudgaver; FP4 og INT4 blev omtalt som kommende varianter.
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ling-3.0-flash-VL er inclusionAI og Ant Groups open-weight-model til vision og sprog, baseret på ræsonnementsfamilien Ling-3.0-flash. Det mest opsigtsvækkende på specifikationslisten er en sparsom mixture-of-experts-arkitektur (MoE): Modellen rummer i alt 124 mia. parametre, men bruger kun cirka 5,5 mia. parametre for hver token. Målet er stor modelkapacitet med lavere beregning pr. token end i en tæt model med 124 mia. parametre. 3
12
Det centrale er dog modellens rolle som visuel agent. I stedet for blot at beskrive et billede eller besvare et enkelt spørgsmål om det, er Ling-3.0-flash-VL udviklet til at bruge det visuelle input gennem hele en opgave: Den kan inspicere en skærm eller et dokument, udføre en handling gennem et eksternt værktøj, se den nye tilstand og derefter kontrollere eller rette resultatet. Ant Group kalder det en lukket visuel feedbacksløjfe. 12
Ling-3.0-flash-VL tager imod tekst, billeder og video og leverer tekst som output. Det angivne kontekstvindue er på op til 256K tokens, hvilket er relevant for lange dokumenter, omfattende multimodale samtaler og agentforløb, hvor modellen skal huske meget af opgavens historik. 3
4
De tilgængelige beskrivelser omtaler en hybridarkitektur med Kimi Delta Attention og lag med gated multi-head latent attention. Til video bruges VideoRoPE-positionering, som skal bevare tidslig information på tværs af videoframes. 1
6
Pointen med arkitekturen er ifølge skaberne, at visuelt indhold indgår i selve ræsonnementsstrømmen frem for blot at være et ekstra lag oven på en tekstmodel. Det er grundlaget for betegnelsen “native multimodal”. 1
12
I en MoE-model findes flere specialiserede parametergrupper, ofte kaldet eksperter. En router vælger kun en delmængde af dem for den enkelte token. For Ling-3.0-flash-VL angives 124 mia. parametre i alt og cirka 5,5 mia. aktive parametre pr. token. 3
12
Forskellen er vigtig i drift:
Det gør ikke modellen let at hoste lokalt: Åbne vægte i denne størrelse kræver fortsat betydelig hukommelse og omhyggelig systemoptimering. Men det forklarer, hvorfor den markedsføres som en “flash”-model på trods af den samlede størrelse. 3
5
Et almindeligt vision-language-system kan løse enkeltstående opgaver som at beskrive et foto, udtrække tekst fra en kvittering eller forklare et diagram. Ling-3.0-flash-VL er derimod rettet mod en længere arbejdscyklus:
Det er særligt relevant ved GUI-automatisering og visuelt softwarearbejde. Modellen kan eksempelvis aflæse den aktuelle tilstand i en brugerflade, vælge en handling, undersøge skærmen efter ændringen og vurdere, om den ønskede tilstand er nået.
Modellen erstatter imidlertid ikke browseren, værktøjsrettighederne eller sikkerhedsreglerne omkring arbejdsgangen. Det er de omgivende systemer, der afgør, hvad agenten reelt kan foretage sig.
Ant Group og omtale af modellen fremhæver front-end-generering, GUI-automatisering og fortolkning af medicinske rapporter som tiltænkte anvendelser. 12 Fortolkning af medicinske rapporter bør dog forstås som en assisterende arbejdsgang – ikke som dokumentation for selvstændig klinisk pålidelighed eller sikkerhed.
Modellen blev udgivet som åbne vægte under MIT-licensen. Der findes rapporteret vægtudgaver i BF16 og FP8, mens FP4- og INT4-varianter i den tidlige dækning blev beskrevet som planlagte eller kommende. 3
4
Der er rapporteret serveringsvejledninger til SGLang og en Ling-tilpasset vLLM-vej. 3
4 I produktion er det dog kun et udgangspunkt: Man bør teste den konkrete modelrevision, kvantisering, multimodale forbehandling, kontekstvindue, hardware og framework-version, man faktisk vil anvende.
Dækningen nævner to resultater fra Artificial Analysis Intelligence Index:
Tallene er ikke nødvendigvis modstridende, fordi indeksversionen har ændret sig. Men de må ikke sammenlignes som resultater på præcis samme skala. Den mere begrænsede konklusion er, at modellen har rapporteret konkurrencedygtig effektivitet i forhold til sit antal aktive parametre. Det er ikke i sig selv et bevis på, at den er driftssikker i alle agentiske produktionsmiljøer eller kliniske arbejdsgange. 3
4
Det nye er ikke kun, at Ling nu kan tage imod billeder og video. Ling-3.0-flash-VL fremstilles som den første åbne model i Ling-serien, der integrerer syn i iterativ planlægning, handling, visuel kontrol og korrektion. Den sparsomme MoE-konstruktion skal gøre denne multimodale agenttilgang mere beregningseffektiv end en tæt model af tilsvarende størrelse. 3
12
For udviklere er den mest troværdige brugssag en afgrænset arbejdsgang, hvor visuelle beviser betyder noget, og hver værktøjshandling kan efterprøves: eksempelvis at sammenholde en gengivet side med et design, navigere i en kontrolleret grænseflade eller udtrække og krydstjekke oplysninger på tværs af dokumenter.
Demoer og leverandørrapporterede evalueringer er lovende signaler, men stabil anvendelse kræver stadig opgavespecifik evaluering, adgangskontrol, fejlhåndtering og menneskelig overvågning.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash VL er en MIT licenseret open weight model fra Ant Groups inclusionAI, der kan modtage tekst, billeder og video.
Ling 3.0 flash VL er en MIT licenseret open weight model fra Ant Groups inclusionAI, der kan modtage tekst, billeder og video. Modellen har et kontekstvindue på op til 256K tokens og tilbydes i BF16 og FP8 vægtudgaver; FP4 og INT4 blev omtalt som kommende varianter.
De rapporterede benchmarkscorer på 42 og 25 stammer fra forskellige versioner af Artificial Analysis Intelligence Index og kan derfor ikke sammenlignes direkte.