Ling 3.0 flash har 124 miljarder parametrar totalt, men aktiverar ungefär 5,1 miljarder per token – ett exempel på hur MoE modeller kan sänka kostnaden i frekventa AI flöden. Modellen är inriktad på kodning, verktygsanrop och agentuppgifter, med ett inbyggt kontextfönster på 256 000 tokens som enligt Ant kan utökas...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
För organisationer som kör AI i många små steg är den viktigaste frågan ofta inte vilken modell som har flest parametrar. Det avgörande är snarare vilken modell som ger tillräckligt bra resultat till lägst svarstid och inferenskostnad.
Ant Groups Ling-3.0-flash illustrerar den förskjutningen. Modellen har 124 miljarder parametrar totalt, men aktiverar bara omkring 5,1 miljarder parametrar per token. Ant beskriver den som en kostnadseffektiv hybridmodell för resonemang och högfrekventa uppgifter, med ett inbyggt kontextfönster på 256 000 tokens som kan utökas till 1 miljon.
Ling-3.0-flash bygger på mixture-of-experts, eller MoE. I stället för att använda hela modellens parameteruppsättning för varje token väljer systemet en mindre grupp specialiserade experter. Det gör att modellen kan behålla en stor samlad kapacitet, medan varje generering använder en betydligt mindre aktiv del.
Enligt Ant motsvarar Ling-3.0-flash ungefär 12,4 procent av det totala parameterantalet och 8,1 procent av de aktiva parametrarna i företagets Ring-2.6-1T-modell i 1T-klassen. I lanseringsmaterialet beskrivs också en hybridarkitektur med linjär uppmärksamhet, där KDA- och MLA-lager varvas tillsammans med gles MoE-routning.
Det betyder inte att det totala antalet parametrar saknar betydelse. Det påverkar fortfarande vad modellen kan representera, och kvaliteten på routningen avgör om en MoE-modell faktiskt utnyttjar sin potential. Men gles aktivering förändrar kalkylen: kostnad och hastighet vid drift är närmare kopplade till de parametrar och den attention-beräkning som används per token än till hela modellens lagrade storlek.
Ant uppger att Ling-3.0-flash matchar eller överträffar Ring-2.6-1T i de flesta jämförelser som företaget publicerat. Ants Ling-konto beskrev samtidigt resultatet som att modellen matchar eller slår 1T-flaggskeppet i de flesta benchmarktester, trots ungefär en åttondel av det totala parameterantalet och en tolftedel av de aktiva parametrarna.
Det är en relevant intern jämförelse, särskilt eftersom modellen uttryckligen riktas mot agentarbetsflöden i produktion. Men det är inte belägg för att Ling-3.0-flash är bättre än alla större generella modeller på alla typer av uppgifter.
Det finns tre tydliga förbehåll:
För ett team som utvärderar modellen är det därför viktigare att prova den med representativa arbetsuppgifter: faktiska verktygsscheman, kodbasens kontext, krav på svarstid, omförsök och konsekvenserna när modellen gör fel.
Modellkortet lyfter tester som SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas och SkillsBench. Det nämner även användning med agentinriktade miljöer som Claude Code, Kilo Code, Qwen Code, Hermes Agent och OpenClaw. 1
Det är relevanta mål eftersom agentbaserade system kan generera mycket stora tokenvolymer. Ett arbetsflöde som läser filer, anropar verktyg, tar emot resultat, reviderar planen och försöker igen kan använda långt fler tokens än ett enskilt chatsvar. I det läget kan en billigare modell som tillförlitligt klarar rutinmässiga exekveringssteg vara mer värdefull än att använda en kostsam generell modell i varje tur.
En rimlig strategi är därför en uppdelning i nivåer:
Ant anger ett inbyggt kontextfönster på 256 000 tokens, med möjlighet att utöka det till 1 miljon tokens. Det kan vara värdefullt för stora kodbaser, omfattande verktygsloggar eller långvarigt arbetsminne.
OpenRouter listar ett tillhandahållet kontextfönster på 262 144 tokens för modellen. 6
Men lång kontext ska inte förväxlas med bevisad kapacitet för system med flera AI-agenter. Den kan underlätta att bevara gemensam information under ett arbetsflöde, men stabila multiagentsystem kräver även orkestrering, minnesdesign, behörighetsstyrning för verktyg, överlämningar och utvärdering. Källorna styrker modellens specifikationer för lång kontext och dess agentinriktning, men inte ett kvantifierat övertag gentemot konkurrenter i multiagentdrift.
Ling-3.0-flash presenterades den 24 juli 2026. Enligt Ants lanseringsinlägg erbjöds tidsbegränsad kostnadsfri API-åtkomst via OpenRouter och Ants egen plattform till den 3 augusti. Modellen finns också på Hugging Face, där projektet lyfter benchmarktester och stöd för agentramverk. 1
På OpenRouter anges priset till 0,021 dollar per miljon indatatokens och 0,063 dollar per miljon utdatatokens, med ett kontextfönster på 262 144 tokens. 6 Det gör modellen möjlig att testa i tokenintensiva arbetsflöden, även om faktisk kostnad, latens, tillgänglighet och kvalitet kan variera mellan leverantörer och driftsmiljöer.
OpenRouters modellsida redovisar separata percentiler för intelligens, kodning och agentförmåga: 49, 56 respektive 54. Det visar varför en enda totalrankning är ett trubbigt mått på en modell som främst ska utföra praktiska exekveringsuppgifter. 12
Lanseringen skedde samma dag som Nvidia-chefen Jensen Huang gjorde sitt första inlägg på X. Där delade han ett brev som argumenterade för att öppna modeller stärker säkerhet och cybersäkerhet, snabbar på innovation och spridning samt kan stödja teknologisk självständighet vid sidan av slutna toppmodeller.
Tidpunkten gjorde Ling-3.0-flash till ett talande exempel i debatten om modeller med öppna vikter: utvecklare kan lättare granska, köra, anpassa och integrera modeller när vikterna är tillgängliga. Men händelserna i sig bevisar varken ett partnerskap eller någon teknisk koppling mellan Nvidia och Ant Group.
Ling-3.0-flash är främst ett argument för en kostnadsjusterad strategi med exekveringsmodeller. En gles MoE kan kombinera bred lagrad kapacitet med långt mindre aktivering per token. Det kan göra återkommande agentloopar både billigare och snabbare, utan att organisationer måste nöja sig med begränsningarna hos en mycket liten modell.
Prestationspåståendena behöver oberoende replikering, och modellen bör inte ses som en generell ersättare för de största systemen. Men specifikationerna, de agentinriktade utvärderingsmålen, den långa kontexten och det låga listpriset för API:et gör Ling-3.0-flash till en stark kandidat att testa där inferenskostnad och svarstid är avgörande. 1
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash har 124 miljarder parametrar totalt, men aktiverar ungefär 5,1 miljarder per token – ett exempel på hur MoE modeller kan sänka kostnaden i frekventa AI flöden.
Ling 3.0 flash har 124 miljarder parametrar totalt, men aktiverar ungefär 5,1 miljarder per token – ett exempel på hur MoE modeller kan sänka kostnaden i frekventa AI flöden. Modellen är inriktad på kodning, verktygsanrop och agentuppgifter, med ett inbyggt kontextfönster på 256 000 tokens som enligt Ant kan utökas till 1 miljon.
Ants jämförelser med den större Ring 2.6 1T är intressanta, men är utvecklarens egna resultat och bör testas mot verkliga arbetsflöden innan modellen används brett.