Ling 3.0 flash har 124 mia. parametre, men aktiverer cirka 5,1 mia. Ant Group siger, at modellen matcher eller overgår selskabets 1T flagskib i de fleste offentliggjorte benchmarks, men påstanden kommer fra udviklerens egne målinger.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
For virksomheder, der kører AI-agenter i stor skala, er det ikke nødvendigvis den største model, der er mest attraktiv. Det afgørende er ofte, om modellen leverer tilstrækkelig kvalitet hurtigt nok – og til en pris, der kan holde, når den skal læse filer, kalde værktøjer, rette fejl og prøve igen.
Det er netop argumentet bag Ant Groups Ling-3.0-flash. Modellen har 124 mia. parametre i alt, men aktiverer omkring 5,1 mia. parametre pr. token. Ant beskriver den som en omkostningseffektiv hybrid ræsonneringsmodel til hyppige opgaver med et indbygget kontekstvindue på 256K tokens, der kan udvides til 1 mio. tokens.
Ling-3.0-flash benytter en mixture-of-experts-arkitektur, ofte forkortet MoE. I stedet for at lade alle modellens parametre arbejde på hvert eneste token, sender systemet opgaven videre til et mindre udvalg af specialiserede "eksperter".
Det betyder ikke, at det samlede parameterantal er ligegyldigt. Den samlede kapacitet har fortsat betydning for, hvad modellen kan repræsentere, og kvaliteten af routing – altså valget af eksperter – er afgørende. Men ved inferens er det især den del, der aktiveres pr. token, samt opmærksomhedsberegningerne, der påvirker hastighed og marginalomkostning.
Ifølge Ant har Ling-3.0-flash omkring 12,4 % af det samlede parameterantal og 8,1 % af de aktive parametre i forhold til selskabets 1T-model Ring-2.6-1T. Udgivelsesmaterialet beskriver desuden en hybrid lineær attention-arkitektur med skiftevis KDA- og MLA-lag sammen med sparsom MoE-routing.
Ant oplyser, at Ling-3.0-flash matcher eller overgår Ring-2.6-1T i størstedelen af de benchmark-sammenligninger, selskabet selv har offentliggjort. Ants Ling-konto på X beskrev det som resultater på niveau med eller over 1T-flagskibet på de fleste viste benchmarks, trods cirka en ottendedel af de samlede parametre og en tolvtedel af de aktive parametre.
Det er en relevant intern sammenligning, særligt fordi modellen er udviklet til produktionsrettede agentarbejdsgange. Men det dokumenterer ikke, at Ling-3.0-flash er bedre end alle større generelle modeller på alle typer opgaver.
Der er tre væsentlige forbehold:
Den rigtige test for et udviklingsteam er derfor en realistisk pilot: egne værktøjsskemaer, faktisk repository-kontekst, krav til svartid, fejl- og retry-adfærd samt prisen på et forkert svar.
Modellens kort på Hugging Face fremhæver evalueringer som SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas og SkillsBench. Det nævner også brug i agentorienterede miljøer som Claude Code, Kilo Code, Qwen Code, Hermes Agent og OpenClaw. 1
Det er logisk, fordi agentforløb kan generere meget store tokenmængder. En agent, der læser filer, kalder en API, modtager output, reviderer sin plan og prøver igen, bruger langt flere tokens end et enkelt chatsvar. Her kan en billigere model, som pålideligt løser de rutineprægede trin, være mere værd end at lade en dyr topmodel håndtere hver eneste vending i arbejdsgangen.
En praktisk modelstrategi kan derfor være opdelt i niveauer:
Ant angiver et naturligt kontekstvindue på 256K tokens, der kan udvides til 1 mio. tokens. Det kan være nyttigt ved store kodebaser, lange spor af værktøjskald eller vedvarende arbejdsstatus i et længere forløb.
OpenRouter angiver et leveret kontekstvindue på 262.144 tokens for modellen. 6
Det er dog vigtigt ikke at forveksle lang kontekst med dokumenteret styrke i multi-agent-systemer. En stor kontekst kan hjælpe med at bevare fælles information, men pålidelig koordinering mellem flere agenter afhænger også af orkestrering, hukommelsesdesign, værktøjstilladelser, overleveringer og løbende evaluering. Kilderne understøtter modellens lange kontekst og agentfokus, men ikke en kvantificeret påstand om, at den slår konkurrenter i multi-agent-implementeringer.
Ling-3.0-flash blev præsenteret 24. juli 2026. Ant tilbød i en begrænset periode gratis API-adgang via OpenRouter og Ants egen platform frem til 3. august. Modellen findes også på Hugging Face, hvor projektet fremhæver benchmarkresultater og kompatibilitet med agentrammer. 1
På OpenRouter er den angivne pris 0,021 dollar pr. mio. inputtokens og 0,063 dollar pr. mio. outputtokens, med et kontekstvindue på 262.144 tokens. 6 Det gør det realistisk at teste modellen i token-tunge arbejdsgange, selv om den faktiske pris, svartid, tilgængelighed og kvalitet kan variere mellem udbydere og implementeringer.
OpenRouters modeloversigt angiver desuden separate percentiler for intelligens, kode og agentopgaver: henholdsvis 49, 56 og 54. 12 Det understreger, hvorfor én samlet rangplacering er for grov en måde at vurdere en model, der er optimeret til eksekvering.
Udgivelsen faldt sammen med Jensen Huangs første opslag på X. Her delte Nvidias topchef et brev, der argumenterede for, at åbne modeller kan styrke sikkerhed og cybersikkerhed, fremskynde innovation og udbredelse samt understøtte teknologisk suverænitet ved siden af lukkede frontier-modeller.
Timingen gjorde Ling-3.0-flash til et oplagt eksempel i debatten om åbne modelvægte: Når vægtene er tilgængelige, kan udviklere lettere undersøge, hoste, tilpasse og integrere modeller. Men sammenfaldet dokumenterer hverken et partnerskab eller en teknisk forbindelse mellem Nvidia og Ant Group.
Ling-3.0-flash er mest overbevisende som et eksempel på en omkostningsjusteret strategi for eksekveringsmodeller. En sparsom MoE-model kan kombinere bred lagret kapacitet med langt mindre aktivering pr. token. Det kan gøre hyppige agentloops hurtigere og billigere uden at tvinge virksomheder til at vælge en helt lille model.
Præstationspåstandene bør bekræftes af uafhængige målinger, og modellen bør ikke ses som en universel erstatning for de største generelle AI-systemer. Men kombinationen af agentrettede evalueringer, lang kontekst og lav API-pris gør Ling-3.0-flash til en oplagt kandidat til afprøvning, når inferensomkostning og responstid er centrale begrænsninger. 1
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash har 124 mia. parametre, men aktiverer cirka 5,1 mia.
Ling 3.0 flash har 124 mia. parametre, men aktiverer cirka 5,1 mia. Ant Group siger, at modellen matcher eller overgår selskabets 1T flagskib i de fleste offentliggjorte benchmarks, men påstanden kommer fra udviklerens egne målinger.
Med 256K tokens som standardkontekst, fokus på agentarbejde og en lav API listepris er modellen især interessant til kode, værktøjskald og gentagne arbejdsgange.