Ling 3.0 flash VL är en öppen modell med MIT licens från Ant Groups inclusionAI och tar emot text, bilder och video. Modellen har 124 miljarder parametrar totalt, men aktiverar omkring 5,5 miljarder per token genom en gles MoE arkitektur.
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ling-3.0-flash-VL är inclusionAI och Ant Groups öppna vision-språkmodell, byggd på resonemangsfamiljen Ling-3.0-flash. Det tekniska huvudnumret är en gles mixture-of-experts-arkitektur, eller MoE: modellen har totalt 124 miljarder parametrar, men ungefär 5,5 miljarder används för varje token. Tanken är att behålla kapaciteten hos en mycket stor modell utan att varje token kräver beräkningar som motsvarar en tät modell med 124 miljarder parametrar. 3
12
Det mest utmärkande är dock positioneringen som en visuell agent. I stället för att bara analysera en bild en gång – exempelvis skriva en bildtext eller svara på en fråga om ett diagram – är modellen avsedd att använda visuella intryck under hela arbetsflödet. Den kan granska en skärm eller ett dokument, utföra en åtgärd via ett externt verktyg, se det nya läget och sedan kontrollera eller korrigera sitt arbete. Ant Group kallar upplägget en sluten visuell återkopplingsloop. 12
Ling-3.0-flash-VL tar emot text, bilder och video och ger text som utdata. Det angivna kontextfönstret är upp till 256K token, vilket gör modellen tänkt för långa dokument, utdragna multimodala dialoger och agentflöden där mycket av uppgiftshistoriken behöver finnas kvar. 3
4
Enligt tillgängliga beskrivningar använder modellen en hybridarkitektur med Kimi Delta Attention och lager med gated multi-head latent attention. För video används positionskodningen VideoRoPE, som är avsedd att bevara tidsmässig information mellan bildrutor. 1
6
Poängen med den konstruktionen är, enligt modellens skapare, att visuellt innehåll ska ingå i själva resonemanget och inte bara läggas till som en separat funktion i slutet av en textmodell. Det är grunden för benämningen ”native multimodal”. 1
12
I en MoE-modell finns flera specialiserade parametergrupper, ofta kallade experter. En router väljer ut bara en del av dem för en viss token. För Ling-3.0-flash-VL anges 124 miljarder parametrar totalt och cirka 5,5 miljarder aktiva parametrar per token. 3
12
Skillnaden har praktisk betydelse:
Det innebär inte att driften blir enkel. Att köra öppna vikter i den här storleksklassen kräver fortfarande mycket minne och noggrann systemoptimering. Men det förklarar varför modellen marknadsförs som en ”flash”-variant trots den stora totalsiffran. 3
5
Ett vanligt vision-språksystem kan fungera väl för engångsuppgifter: beskriva ett foto, läsa text från ett kvitto eller svara på en fråga om ett diagram. Ling-3.0-flash-VL är i stället avsedd för en längre cykel:
Det är särskilt relevant för GUI-automation, alltså automatisering i grafiska användargränssnitt. En modell kan exempelvis bedöma var i ett gränssnitt den befinner sig, välja en åtgärd, granska vad som förändrades på skärmen och avgöra om målet nåddes.
Modellen ersätter däremot inte webbläsaren, verktygsbehörigheterna eller skyddsräcken i det omgivande systemet. Det är dessa delar som i praktiken avgör vilka åtgärder en agent får och kan utföra.
Ant Group och rapportering om modellen nämner front-end-generering, GUI-automation och tolkning av medicinska rapporter som användningsområden. 12 Att tolka medicinska rapporter bör dock förstås som ett stöd i arbetsflödet – inte som belägg för att modellen är kliniskt tillförlitlig eller säker att använda autonomt.
Modellen har släppts som öppna vikter under MIT-licens. Versioner i BF16 och FP8 har rapporterats vara tillgängliga, medan FP4- och INT4-varianter beskrevs som planerade eller kommande i den tidiga rapporteringen. 3
4
Det finns rapporterad vägledning för drift med SGLang och en Ling-anpassad väg via vLLM. 3
4 För produktion är det dock en utgångspunkt, inte en kompatibilitetsgaranti. Den som ska driftsätta modellen bör testa exakt modellrevision, kvantisering, multimodal förbehandling, kontextlängd, hårdvara och ramverksversion som ska användas.
Två siffror från Artificial Analysis Intelligence Index förekommer i rapporteringen:
Siffrorna behöver inte motsäga varandra om indexets version och skala har ändrats. Men de får inte jämföras som om de kom från samma testskala. Den mer begränsade slutsatsen är att modellen har rapporterats vara konkurrenskraftigt effektiv i förhållande till antalet aktiva parametrar. Det är inte i sig ett bevis på att den fungerar tillförlitligt i varje agentbaserat produktionsflöde eller medicinskt sammanhang. 3
4
Nyheten är alltså inte bara att Ling nu kan ta emot bilder och video. Ling-3.0-flash-VL presenteras som den första öppna Ling-modellen där synintegreras i en iterativ process för planering, handling, visuell kontroll och korrigering. Den glesa MoE-designen ska göra det multimodala agentupplägget mer beräkningseffektivt än en tät modell av jämförbar total storlek. 3
12
För utvecklare är det mest trovärdiga användningsfallet ett tydligt avgränsat arbetsflöde där visuella belägg spelar roll och där varje verktygsåtgärd kan kontrolleras: att jämföra en renderad webbsida med en designskiss, navigera i ett kontrollerat gränssnitt eller extrahera och korsverifiera information mellan dokument. Demonstrationer och leverantörsrapporterade utvärderingar är intressanta signaler, men en tillförlitlig driftsättning kräver fortfarande uppgiftsspecifika tester, behörighetskontroller, felhantering och mänsklig översyn.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash VL är en öppen modell med MIT licens från Ant Groups inclusionAI och tar emot text, bilder och video.
Ling 3.0 flash VL är en öppen modell med MIT licens från Ant Groups inclusionAI och tar emot text, bilder och video. Modellen har 124 miljarder parametrar totalt, men aktiverar omkring 5,5 miljarder per token genom en gles MoE arkitektur.
Dess centrala idé är en visuell återkopplingsloop: observera, agera, kontrollera resultatet och korrigera vid behov.