Ling 3.0 flashissa on 124 miljardia parametria, mutta se aktivoi tokenia kohden noin 5,1 miljardia. Malli on suunnattu erityisesti koodaukseen, työkalukutsuihin ja agenttityönkulkuihin, joissa useat vaiheet, uudelleenyritykset ja työkalujen tulosteet kasvattavat tokenimäärää nopeasti.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
Ant Groupin Ling-3.0-flash havainnollistaa muutosta tekoälyn käyttöönoton painopisteissä. Toistuvissa koodaus-, työkalukutsu- ja työnkulkutehtävissä olennaisin kysymys ei usein ole, millä mallilla on eniten parametreja, vaan mikä malli tuottaa riittävän hyvän lopputuloksen pienimmällä viiveellä ja inferenssikustannuksella.
Mallissa on 124 miljardia parametria, mutta se aktivoi tokenia kohden noin 5,1 miljardia parametria. Ant kuvaa sitä kustannustehokkaaksi hybridipäättelymalliksi paljon toistuville tehtäville. Sen natiivi konteksti-ikkuna on 256 000 tokenia, ja sitä voidaan laajentaa miljoonaan tokeniin.
Ling-3.0-flash käyttää mixture-of-experts- eli MoE-arkkitehtuuria. Kaikkia mallin parametreja ei käytetä jokaisen tokenin käsittelyyn, vaan reititys valitsee pienen joukon asiantuntijaosia kulloiseenkin laskentaan. Käytännössä malli voi hyödyntää laajaa opittua kapasiteettia, vaikka yksittäinen generointi perustuu selvästi pienempään aktiiviseen osaan.
Antin mukaan Ling-3.0-flashin kokonaisparametrien määrä on noin 12,4 % ja aktiivisten parametrien määrä 8,1 % yhtiön 1T-luokan Ring-2.6-1T-mallista. Julkaisumateriaaleissa kuvataan myös hybridinen lineaarinen attention-arkkitehtuuri, jossa KDA- ja MLA-kerrokset vuorottelevat harvan MoE-reitityksen kanssa.
Kokonaisparametrien määrä ei silti muutu merkityksettömäksi. Se vaikuttaa yhä siihen, mitä malli voi oppia ja esittää, ja MoE-mallin todellinen suorituskyky riippuu myös siitä, miten hyvin reititys toimii. Harva aktivointi kuitenkin muuttaa taloudellista yhtälöä: palvelun nopeus ja kustannus ovat läheisemmin sidoksissa tokenia kohden käytettävään aktiiviseen laskentaan kuin kaikkien tallennettujen parametrien määrään.
Antin mukaan Ling-3.0-flash vastaa Ring-2.6-1T:tä tai ylittää sen useimmissa yhtiön julkaisemissa vertailuissa. Antin Ling-tilin samanaikainen julkaisu kuvasi tulosta niin, että malli ylsi 1T-luokan lippulaivamallin tasolle tai sen ohi useimmissa testeissä, vaikka kokonaisparametreja oli noin kahdeksasosa ja aktiivisia parametreja noin kahdestoistaosa.
Tämä on merkittävä mallikehittäjän sisäinen vertailu etenkin siksi, että malli on suunnattu tuotantokäytön agenttityönkulkuihin. Se ei kuitenkaan todista, että Ling-3.0-flash olisi joka tehtävässä parempi kuin kaikki suuremmat yleiskäyttöiset mallit.
Keskeiset varaukset ovat selviä:
Tiimin kannattaa siis testata mallia omalla edustavalla kuormallaan: oikeilla työkaluskeemoilla, repositorion kontekstilla, viivevaatimuksilla, uudelleenyrityksillä sekä virheiden todellisilla kustannuksilla.
Mallikortissa nostetaan esiin muun muassa SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas ja SkillsBench. Lisäksi mallia kuvataan käytettäväksi agenttipainotteisissa ympäristöissä, kuten Claude Code, Kilo Code, Qwen Code, Hermes Agent ja OpenClaw. 1
Nämä ovat luontevia kohteita, koska agenttijärjestelmä voi kuluttaa hyvin suuren määrän tokeneita. Työnkulku, joka lukee tiedostoja, kutsuu työkaluja, vastaanottaa tuloksia, muokkaa suunnitelmaa ja yrittää uudelleen, voi käyttää moninkertaisesti tokeneita verrattuna yhteen keskusteluvastaukseen. Tällöin edullisempi malli, joka hoitaa rutiininomaiset suoritusvaiheet luotettavasti, voi olla arvokkaampi kuin kalliimpi yleismalli jokaisella vuorolla.
Käytännöllinen ratkaisu on usein porrastettu:
Ant dokumentoi mallille 256 000 tokenin natiivin konteksti-ikkunan, jonka voi laajentaa miljoonaan tokeniin. Tästä voi olla hyötyä suurissa koodikannoissa, pitkissä työkalujäljissä ja pysyvässä työtilassa.
OpenRouter ilmoittaa palvelussa käytettäväksi konteksti-ikkunaksi 262 144 tokenia. 6
Pitkää kontekstia ei silti pidä sekoittaa todennettuun moniagenttikyvykkyyteen. Se voi helpottaa yhteisen tiedon säilyttämistä työnkulussa, mutta luotettava moniagenttijärjestelmä vaatii lisäksi orkestrointia, muistiratkaisuja, työkalujen käyttöoikeuksien hallintaa, tehtävien luovutuksia ja arviointia. Lähteet tukevat pitkän kontekstin teknisiä tietoja ja agenttipainotusta, eivät määrällistä väitettä kilpailijoita paremmasta suoriutumisesta moniagenttikäytössä.
Ling-3.0-flash esiteltiin 24.7.2026. Antin julkaisun mukaan OpenRouterissa ja Antin omalla alustalla tarjottiin rajatun ajan maksuttomia API-kutsuja 3.8. asti. Malli on saatavilla myös Hugging Facessa, jossa hankkeen painopisteeksi kuvataan benchmarkit ja agenttikehykset. 1
OpenRouterin listahinta on 0,021 dollaria miljoonalta syötetokenilta ja 0,063 dollaria miljoonalta tulostokenilta. Konteksti-ikkunaksi ilmoitetaan 262 144 tokenia. 6 Hinnat tekevät suuren volyymin työnkulkujen testaamisesta mahdollisen, mutta todelliset kustannukset, viiveet, saatavuus ja tulosten laatu voivat vaihdella palveluntarjoajan ja käyttöolosuhteiden mukaan.
OpenRouterin mallihakemisto listaa Ling-3.0-flashille erilliset prosenttipisteet älykkyydelle, koodaukselle ja agenttisuoriutumiselle: 49, 56 ja 54. Tämäkin havainnollistaa, miksi yksi otsikkosijoitus ei riitä suoritusmallin arviointiin. 12
Julkaisu osui samalle päivälle kuin Jensen Huangin ensimmäinen X-julkaisu. Nvidia-johtaja jakoi kirjeen, jonka mukaan avoimet mallit vahvistavat turvallisuutta ja kyberturvaa, nopeuttavat innovaatioita ja käyttöönottoa sekä tukevat teknologista omavaraisuutta suljettujen huippumallien rinnalla.
Ajallinen yhteys teki Ling-3.0-flashista osuvan esimerkin avoimista mallipainoista käytävään keskusteluun: kehittäjät voivat tarkastella, isännöidä, hienosäätää ja integroida malleja suoremmin, kun painot ovat saatavilla. Tapahtumat eivät kuitenkaan osoita kumppanuutta tai teknistä yhteyttä Nvidian ja Ant Groupin välillä.
Ling-3.0-flash on vahvimmillaan esimerkkinä kustannussuhteutetusta suoritusmallistrategiasta. Harva MoE voi yhdistää laajan tallennetun kapasiteetin huomattavasti pienempään tokenikohtaiseen aktivointiin. Se voi tehdä toistuvista agenttisilmukoista nopeampia ja halvempia ilman, että on tyydyttävä pienen mallin rajoituksiin.
Suorituskykyväitteet tarvitsevat riippumatonta toistoa, eikä mallia pidä pitää yleispätevänä korvaajana suurimmille yleiskäyttöisille järjestelmille. Sen tekniset ominaisuudet, agentteihin kohdistuvat arviointitavoitteet, pitkä konteksti ja alhainen listattu API-hinta muodostavat silti vahvan perusteen kokeilla erikoistuneita harvoja malleja tilanteissa, joissa inferenssin kustannus ja viive ovat keskeisiä rajoitteita. 1
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flashissa on 124 miljardia parametria, mutta se aktivoi tokenia kohden noin 5,1 miljardia.
Ling 3.0 flashissa on 124 miljardia parametria, mutta se aktivoi tokenia kohden noin 5,1 miljardia. Malli on suunnattu erityisesti koodaukseen, työkalukutsuihin ja agenttityönkulkuihin, joissa useat vaiheet, uudelleenyritykset ja työkalujen tulosteet kasvattavat tokenimäärää nopeasti.
Antin omien vertailujen tulokset ovat kiinnostavia, mutta ne eivät osoita mallin olevan yleispätevästi paras.