Qwen julkaisi mallin 26. elokuuta 2026. Mallissa on 125 miljardin parametrin pääverkko ja lisäksi 51 miljardin parametrin N gram embeddings komponentti, mutta tokenia kohden aktivoituu vain noin 6 miljardia parametria.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba-yhtiö Qwen julkaisi Qwen3.8-Flash-Nextin 26. elokuuta 2026, ja julkaisua käsiteltiin laajemmin seuraavana päivänä. Avoimet painot sisältävä malli ei ole lopullinen Qwen4-lippulaiva, vaan varhainen ja tutkittavissa oleva katsaus arkkitehtuuriin, jonka Qwen kertoo muodostavan Qwen4-tuoteperheen perustan. 1
2
15
Mallin kiinnostavin piirre on sen mittakaavan ja laskennan yhdistelmä: pääverkossa on 125 miljardia parametria, ja sen rinnalla toimii vielä 51 miljardin parametrin N-gram-embeddings-komponentti. Silti jokaista tokenia käsiteltäessä aktivoituu vain noin 6 miljardia parametria. Tavoitteena on säilyttää suuren mallin kapasiteetti ilman, että koko parametrimäärä on laskettava läpi jokaisella tokenilla. 4
15
Nimi Qwen3.8-Flash-Next viittaa Qwenin avoimesti julkaisemaan malliin. Läheinen Qwen3.8-Flash puolestaan tarkoittaa tuotantokäyttöön suunnattua mallia ja API-palvelua. Open-weight-versio on siis ennen kaikkea arkkitehtuurin esikatselu ja kehittäjille tarkoitettu kokeilualusta.
Qwen kuvaa julkaisua multimodaaliseksi mixture-of-experts- eli MoE-malliksi. MoE-arkkitehtuurissa kaikki mallin osat eivät osallistu jokaisen syötteen käsittelyyn, mikä voi pienentää laskentakustannuksia. Qwen3.8-Flash-Nextissä yhdistyvät tekstin ja visuaalisen tiedon käsittely sekä Qwen4-sarjaan suunniteltu uusi järjestelmärakenne. 1
2
15
Oleellinen rajaus on tämä: mallin julkaisu ei tarkoita, että koko Qwen4-perhe olisi jo julkaistu. Sen sijaan tutkijat ja kehittäjät voivat tutkia rakennetta, valmistella työkalujaan ja antaa palautetta ennen varsinaisen tuoteperheen saapumista. 2
3
15
Miljoonan tokenin lukua ei pidä sekoittaa mallin natiiviseen konteksti-ikkunaan. Tavallinen palvelinkonfiguraatio on 262 144 tokenia; suurempi ikkuna perustuu YaRN-laajennukseen, joten sitä on järkevää arvioida erillisenä laajennettuna käyttötapana. 1
4
16
Qwen3.8-Flash-Next yhdistää Gated DeltaNetin eli GDN:n ja Qwen Sparse Attentionin eli QSA:n. GDN on suunniteltu tiivistämään aiemmasta kontekstista saatavaa tietoa. QSA puolestaan käyttää kevyttä indeksiä tunnistaakseen olennaisia pieniä kontekstijaksoja sen sijaan, että koko historia käsiteltäisiin samalla tavalla täydellä attention-laskennalla. 4
Tavoitteena on hidastaa pitkien syötteiden käsittelyn kustannusten kasvua. Qwen ilmoittaa jopa 7,6-kertaisen nopeutuksen esitäytössä ja 4,9-kertaisen nopeutuksen dekoodauksessa miljoonan tokenin sekvensseillä. Luvut ovat valmistajan ilmoittamia, ja niihin vaikuttavat muun muassa laitteisto, ohjelmistototeutus, sekvenssin rakenne ja testiasetukset. Niitä ei siksi pidä tulkita kaikissa käyttöympäristöissä saavutettaviksi tuloksiksi. 4
Erillinen N-gram-embeddings-komponentti kasvattaa mallin esityskykyä ilman, että koko parametrimäärä täytyy käsitellä aktiivisesti jokaisen tokenin yhteydessä. Qwenin suunnitelmassa embeddings-taulukko voidaan myös siirtää isäntäkoneen muistiin. Dataa voidaan esiladata asynkronisesti, jolloin muistisiirtoja ja mallin laskentaa voidaan tehdä limittäin. 4
Suuria malleja operoiville tämä on käytännössä merkittävä suunta. Mallin koko ei yksin ratkaise kustannuksia: yhtä tärkeitä voivat olla muistipaikka, tiedonsiirto ja se, kuinka tehokkaasti pitkät dokumentit tai suuret erät saadaan käsiteltyä.
Julkaisu sisältää muutoksia myös optimointiin ja mallin skaalaukseen. Qwen kertoo käyttäneensä Muon-optimointia, säätäneensä sen suhdetta AdamW-optimointiin ja parametrien käsittelyyn sekä sovittaneensa arkkitehtuurille uuden scaling law -skaalauslain. 4
Kyse ei siis ole vain uudella attention-lohkolla varustetusta tarkistuspisteestä. Qwen julkaisee samalla julkiseen tarkasteluun laajemman tavan rakentaa malleja, joissa kokonaiskapasiteetti on suuri mutta aktiivinen laskenta pysyy suhteellisen pienenä.
Qwen kertoo, että Qwen3.8-Flashin kouluttaminen vaati noin yhdeksäsosan Qwen3.7-Plusin koulutuskustannuksista ja että samalla koodaus- ja toimistotehtävien suorituskyky parani. Reuters raportoi erikseen yhtiön väitteistä, joiden mukaan malli saavutti vahvempia tuloksia näissä tehtävissä pienemmillä koulutuskustannuksilla. 1
4
Julkaisun yhteydessä mainitaan tulokset 58,7 DeepSWE 1.1 -testissä, 62,5 SWE-bench Pro -testissä ja 84,5 AndroidWorld-testissä. Qwen asettaa tulokset DeepSeek V4 Flashia paremmiksi niin sanotussa value-segmentissä. Vertailut ovat kuitenkin yhtiön ilmoittamia, eikä käytettävissä oleva aineisto osoita, että ne olisi riippumattomasti toistettu täysin vastaavissa arviointiolosuhteissa. 4
Tuotantokäyttöön tarkoitetun Qwen3.8-Flash-palvelun ilmoitettu API-hinta on 1 yuan miljoonaa syötemallia eli input-tokenia kohden ja 3 yuania miljoonaa output-tokenia kohden. Julkaisumateriaali ei kuvaa erillistä ruuhka-ajan ja hiljaisen ajan hinnoittelua. Hintoja verrattaessa on silti huomioitava malliversio, välimuistialennukset, kontekstin pituus, palvelutaso ja tarvittava vastauslaatu. 1
4
Avoimet painot tekevät Qwen3.8-Flash-Nextistä käytännöllisen kokeilualustan ennen Qwen4:n saapumista. Kehittäjät voivat valmistella päättely- ja palvelutyökaluja, testata kvantisointia ja tutkia mallin toimintaa omilla aineistoillaan sen sijaan, että heidän pitäisi odottaa lopullista Qwen4-toteutusta. 2
3
15
Mallin rakenne on erityisen relevantti tehtävissä, joissa kontekstin pituus tai tokenikustannukset muodostavat pullonkaulan, kuten:
Nämä ovat mallin pitkän kontekstin ja aktiivisten parametrien rakenteesta johdettavia mahdollisia käyttötapoja, eivät lupauksia siitä, että se päihittäisi tuotannossa kaikki tiheät tai täyden attentionin mallit. Todelliseen talouteen vaikuttavat muun muassa käytettävä laitteisto, palvelinohjelmistot, kvantisoinnin laatu, tiedonhaku ja työkuorman koostumus.
Qwen3.8-Flash-Next on merkittävä ennen kaikkea siksi, että se paljastaa Alibaban arkkitehtuurisuunnan varhaisessa vaiheessa. Se tarjoaa yhteisölle konkreettisen tavan selvittää, voivatko harva ja tiivistetty attention, suuret oheisembeddings-rakenteet ja vähäinen aktiivinen parametrimäärä tuottaa parempaa pitkän kontekstin kustannustehokkuutta ilman kohtuutonta laadun heikkenemistä.
Julkaisun vahvimmat luvut – nopeutukset, testitulokset, koulutuskustannusten lasku ja kilpailukykyä koskevat väitteet – ovat kuitenkin suurelta osin peräisin Qweniltä tai Qwenin ilmoituksiin perustuvasta raportoinnista. Riippumattomia testejä tarvitaan vielä eri laitteistoilla, kielillä, kontekstipituuksilla, multimodaalisilla tehtävillä ja tuotantotason agenttityönkuluilla.
Varovaisin ja perustelluin johtopäätös ei siis ole, että Qwen3.8-Flash-Next voittaisi kaikki kilpailijansa. Se on avoin, multimodaalinen MoE-tekninen esikatselu, joka antaa kehittäjille poikkeuksellisen varhaisen näkymän siihen järjestelmäarkkitehtuuriin, jota Alibaba valmistelee Qwen4:ää varten – sekä testattavan suunnitelman erittäin pitkän kontekstin tekoälyn tehostamiseen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen julkaisi mallin 26. elokuuta 2026.
Qwen julkaisi mallin 26. elokuuta 2026. Mallissa on 125 miljardin parametrin pääverkko ja lisäksi 51 miljardin parametrin N gram embeddings komponentti, mutta tokenia kohden aktivoituu vain noin 6 miljardia parametria.
Mallin natiivinen konteksti ikkuna on 262 144 tokenia, ja YaRN laajennuksella sitä voi kasvattaa miljoonaan tokeniin.