Ling 3.0 flash har 124 milliarder parametere totalt, men bruker omtrent 5,1 milliarder per token. Modellen er særlig rettet mot koding, verktøykall og agentarbeidsflyter, der mange små steg og gjentakelser kan drive tokenforbruket kraftig opp.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
Ant Groups Ling-3.0-flash illustrerer et skifte i hvordan KI bør vurderes i produksjon: Ved gjentatt koding, verktøykall og automatiserte arbeidsflyter er spørsmålet ofte ikke «hvilken modell har flest parametere?», men «hvilken modell leverer god nok kvalitet med lavest mulig ventetid og inferenskostnad?»
Modellen har 124 milliarder parametere totalt, men aktiverer om lag 5,1 milliarder parametere per token. Ant beskriver den som en kostnadseffektiv hybrid resonneringsmodell for oppgaver med høy frekvens. Den har et innebygd kontekstvindu på 256 000 tokens, som kan utvides til 1 million.
Ling-3.0-flash bygger på en mixture-of-experts-modell (MoE). I stedet for å bruke alle parameterne for hvert token, rutes arbeidet til et lite utvalg spesialiserte «eksperter». Modellen kan dermed ha en stor samlet lagret kapasitet, mens den faktiske beregningen for hver generering er langt mindre.
Ifølge Ant har Ling-3.0-flash rundt 12,4 prosent av de samlede parameterne og 8,1 prosent av de aktive parameterne i selskapets Ring-2.6-1T-modell i 1T-klassen. Utgivelsesmaterialet beskriver også en hybrid arkitektur med lineær oppmerksomhet, som veksler mellom KDA- og MLA-lag, kombinert med sparsom MoE-ruting.
Det betyr ikke at totalt parameterantall er uviktig. Samlet kapasitet kan fortsatt påvirke hva en modell kan representere, og kvaliteten på rutingen avgjør om en MoE faktisk utnytter potensialet sitt. Men sparsom aktivering endrer kostnadsbildet: Hastighet og kostnad ved drift henger tettere sammen med parameterne og oppmerksomhetsberegningen som brukes per token, enn med alle vektene som er lagret i modellen.
Ant opplyser at Ling-3.0-flash matcher eller overgår Ring-2.6-1T i de fleste benchmark-sammenligningene selskapet har publisert. En samtidig post fra Ants Ling-konto beskrev resultatet som at modellen matcher eller slår 1T-flaggskipet i de fleste testene, med omtrent én åttedel av de samlede parameterne og én tolvedel av de aktive parameterne.
Det er en relevant intern sammenligning, særlig fordi modellen er posisjonert for KI-agenter i produksjon. Men det er ikke dokumentasjon på at Ling-3.0-flash er bedre enn alle større generellmodeller på enhver oppgave.
Det er tre viktige forbehold:
For team som skal vurdere modellen, er den riktige testen en representativ arbeidsbelastning: reelle verktøyskjemaer, faktisk repository-kontekst, krav til responstid, oppførsel ved nye forsøk og kostnaden ved feil.
Modellkortet fremhever evalueringer som SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas og SkillsBench. Det lister også støtte i agentorienterte miljøer som Claude Code, Kilo Code, Qwen Code, Hermes Agent og OpenClaw. 1
Dette er relevante mål fordi agentsystemer kan bruke svært store mengder tokens. En arbeidsflyt som leser filer, kaller verktøy, mottar resultater, reviderer en plan og prøver igjen, kan konsumere langt mer enn ett enkelt chatsvar. Da kan en rimeligere modell som håndterer rutinemessige utførelsessteg pålitelig, være mer verdifull enn å bruke en dyr generellmodell i hvert eneste steg.
En fornuftig løsning kan derfor være en modelltrapp:
Ant oppgir et innebygd kontekstvindu på 256 000 tokens, som kan utvides til 1 million tokens. Det kan være nyttig for store kodebaser, lange spor fra verktøykall eller vedvarende arbeidsminne.
OpenRouter oppgir et tilgjengelig kontekstvindu på 262 144 tokens for modellen. 6
Lang kontekst bør likevel ikke forveksles med dokumentert overlegenhet i multiagent-systemer. Den kan gjøre det enklere å beholde felles informasjon gjennom en arbeidsflyt, men robuste fleragentløsninger avhenger også av orkestrering, minnearkitektur, verktøytillatelser, overlevering mellom agenter og evaluering. Kildene dokumenterer lang kontekst og en agentorientert posisjonering, men ikke en kvantifisert fordel mot konkurrenter i multiagent-distribusjoner.
Ling-3.0-flash ble presentert 24. juli 2026. Ifølge Ants utgivelsespost var API-tilgang gratis i en begrenset periode på OpenRouter og Ants egen plattform frem til 3. august. Modellen er også tilgjengelig på Hugging Face, der prosjektet fremhever benchmarkresultater og fokus på agentrammeverk. 1
På OpenRouter er oppført pris 0,021 dollar per million input-tokens og 0,063 dollar per million output-tokens, med et kontekstvindu på 262 144 tokens. 6 Prisene gjør det praktisk mulig å teste modellen i arbeidsflyter med høyt volum, men faktisk kostnad, ventetid, tilgjengelighet og kvalitet vil kunne variere mellom leverandører og driftsoppsett.
OpenRouters modelloversikt oppgir separate persentiler for intelligens, koding og agentoppgaver på henholdsvis 49, 56 og 54. Det illustrerer hvorfor én enkel totalrangering er et svakt beslutningsgrunnlag for en modell laget for utførelsesoppgaver. 12
Utgivelsen falt sammen med Jensen Huangs første innlegg på X. Der delte Nvidia-sjefen et brev som argumenterte for at åpne modeller styrker sikkerhet og cybersikkerhet, fremskynder innovasjon og spredning, og støtter teknologisk selvbestemmelse ved siden av lukkede frontier-modeller.
Tidspunktet gjorde Ling-3.0-flash til et treffende eksempel i debatten om KI med åpne vekter: Utviklere kan i større grad inspisere, drifte, tilpasse og integrere modeller direkte når vektene er tilgjengelige. Men hendelsene dokumenterer ikke noe partnerskap eller en teknisk kobling mellom Nvidia og Ant Group.
Ling-3.0-flash er mest interessant som et eksempel på en strategi for kostnadsjusterte utførelsesmodeller. En sparsom MoE kan kombinere bred lagret kapasitet med langt mindre aktivering per token. Det kan gjøre hyppige agentløkker både raskere og billigere, uten at man nødvendigvis må akseptere begrensningene til en svært liten modell.
Påstandene om ytelse bør etterprøves uavhengig, og modellen bør ikke behandles som en universell erstatter for de største generellmodellene. Likevel gir spesifikasjonene, de agentorienterte evalueringene, den lange konteksten og den lave oppførte API-prisen gode grunner til å teste spesialiserte, sparsomme modeller der inferenskostnad og responstid er avgjørende. 1
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash har 124 milliarder parametere totalt, men bruker omtrent 5,1 milliarder per token.
Ling 3.0 flash har 124 milliarder parametere totalt, men bruker omtrent 5,1 milliarder per token. Modellen er særlig rettet mot koding, verktøykall og agentarbeidsflyter, der mange små steg og gjentakelser kan drive tokenforbruket kraftig opp.
Ant Groups sammenligning med Ring 2.6 1T er interessant, men den kommer fra leverandøren selv.