Ling 3.0 flash VL is een open weightmodel onder de MIT licentie van inclusionAI, onderdeel van Ant Group, voor tekst , beeld en videoinvoer. Het MoE model heeft 124 miljard parameters in totaal, maar activeert naar verluidt circa 5,5 miljard parameters per token; de contextlengte bedraagt maximaal 256K tokens.
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ling-3.0-flash-VL is het open-weight vision-language-model van inclusionAI, de AI-organisatie van Ant Group. Het bouwt voort op de Ling-3.0-flash-familie en is opgezet als een sparse mixture-of-experts-model (MoE): 124 miljard parameters in totaal, waarvan ongeveer 5,5 miljard per token actief zijn. Het doel daarvan is de capaciteit van een zeer groot model te combineren met minder rekenwerk per token dan bij een dicht model van 124 miljard parameters. 3
12
De kernclaim is echter niet alleen schaal of efficiëntie. Ant Group positioneert Ling-3.0-flash-VL als een visuele AI-agent: een model dat beeldinformatie niet uitsluitend gebruikt om één keer een vraag over een afbeelding te beantwoorden, maar die informatie tijdens een taak blijft benutten. Het kan een scherm of document bekijken, via een externe tool een handeling uitvoeren, het gewijzigde resultaat opnieuw bekijken en zo nodig corrigeren. Ant Group noemt dit een visuele feedbacklus. 12
Het model accepteert tekst, afbeeldingen en video als invoer en genereert tekst als uitvoer. De opgegeven contextlengte is maximaal 256K tokens. Dat maakt het vooral interessant voor lange documenten, uitgebreide multimodale gesprekken en agent-workflows waarin veel eerdere stappen behouden moeten blijven. 3
4
Volgens de beschikbare technische beschrijvingen gebruikt het model een hybride architectuur met Kimi Delta Attention en gated multi-head latent attention-lagen. Voor video gebruikt het VideoRoPE-positionering, bedoeld om tijdsrelaties tussen videoframes te behouden. 1
6
Waarom dat relevant is: de makers presenteren visuele informatie als onderdeel van dezelfde redeneerketen als tekst, niet als een losse toevoeging achteraf aan een taalmodel. Daarop rust de positionering als ‘native multimodaal’ model. 1
12
Bij een MoE-model bestaan de parameters uit meerdere gespecialiseerde onderdelen, vaak ‘experts’ genoemd. Een routeringsmechanisme kiest per token slechts een deel daarvan. Voor Ling-3.0-flash-VL wordt een omvang van 124 miljard totale parameters en circa 5,5 miljard actieve parameters per token gemeld. 3
12
Dat verschil is praktisch belangrijk:
Dat betekent niet dat het model eenvoudig lokaal te hosten is: open weights van deze omvang vragen nog steeds veel geheugen en zorgvuldig systeembeheer. Maar het verklaart wel waarom het als een ‘flash’-model wordt gepresenteerd, ondanks het totale aantal parameters. 3
5
Een conventioneel vision-language-model kan prima zijn voor een eenmalige taak, zoals het beschrijven van een foto, het uitlezen van een bonnetje of het beantwoorden van een vraag over een grafiek. Ling-3.0-flash-VL is bedoeld voor een langere cyclus:
Dat is vooral relevant voor GUI-automatisering: automatisering van grafische gebruikersinterfaces zoals websites en softwarevensters. Een model kan bijvoorbeeld de huidige interface inspecteren, een actie kiezen, het volgende scherm beoordelen en vaststellen of de gewenste toestand is bereikt.
Het model vervangt daarbij niet de browser, toegangsrechten of veiligheidsregels rond de gebruikte tools. Juist die omliggende systemen bepalen welke handelingen een AI-agent daadwerkelijk mag uitvoeren.
Ant Group en gerelateerde berichtgeving noemen front-endgeneratie, GUI-automatisering en interpretatie van medische rapporten als beoogde toepassingen. 12 Die laatste toepassing moet worden gezien als ondersteuning in een workflow, niet als bewijs dat het model zelfstandig klinisch betrouwbaar of veilig is.
Ling-3.0-flash-VL is als open weights uitgebracht onder de MIT-licentie. Er zijn volgens de berichtgeving gewichtsversies in BF16 en FP8 beschikbaar; FP4- en INT4-varianten werden in vroege publicaties als gepland of aanstaand genoemd. 3
4
Voor serving worden SGLang en een voor Ling afgestemde route via vLLM genoemd. 3
4 Voor productiegebruik is dat een vertrekpunt, geen garantie. Beheerders doen er goed aan om precies de beoogde modelrevisie, kwantisatie, multimodale voorverwerking, contextlengte, hardware en frameworkversie zelf te testen.
In de berichtgeving verschijnen twee scores op de Artificial Analysis Intelligence Index:
Die cijfers hoeven elkaar niet tegen te spreken, omdat de onderliggende indexversie veranderde. Ze mogen echter niet worden gelezen als scores op exact dezelfde schaal. De voorzichtige conclusie is dat het model competitieve efficiëntie claimt ten opzichte van zijn aantal actieve parameters. Dat bewijst op zichzelf niet dat het betrouwbaar is voor elke agent-taak, productieomgeving of medische workflow. 3
4
De betekenis van Ling-3.0-flash-VL is niet slechts dat de Ling-reeks nu afbeeldingen en video kan verwerken. Het wordt gepresenteerd als het eerste open model in die reeks dat visuele informatie integreert in een herhaald proces van plannen, handelen, visueel controleren en corrigeren. De sparse MoE-opzet moet die multimodale-agentbenadering rekenkundig efficiënter maken dan een dicht model met een vergelijkbare totale omvang. 3
12
Voor ontwikkelaars ligt de meest geloofwaardige toepassing in afgebakende workflows waarin visueel bewijs ertoe doet en iedere toolactie controleerbaar is: een gerenderde pagina naast een ontwerp leggen, een gecontroleerde interface doorlopen of gegevens uit documenten extraheren en kruiselings controleren. Demo’s en door de leverancier gemelde evaluaties zijn interessante signalen, maar betrouwbare inzet blijft afhankelijk van tests voor de specifieke taak, toegangscontroles, foutafhandeling en menselijk toezicht.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash VL is een open weightmodel onder de MIT licentie van inclusionAI, onderdeel van Ant Group, voor tekst , beeld en videoinvoer.
Ling 3.0 flash VL is een open weightmodel onder de MIT licentie van inclusionAI, onderdeel van Ant Group, voor tekst , beeld en videoinvoer. Het MoE model heeft 124 miljard parameters in totaal, maar activeert naar verluidt circa 5,5 miljard parameters per token; de contextlengte bedraagt maximaal 256K tokens.
Het onderscheidende idee is een visuele feedbacklus: observeren, handelen, controleren en corrigeren, bijvoorbeeld bij interface automatisering of front endwerk.