VUI Labsin Luna TTS saavutti elokuussa 2026 Hugging Facen TTS Arenassa ykkössijan, mutta Artificial Analysisin 1. Mallin keskeinen idea on generoida puhetokeneita rinnakkain maskatun diffuusion avulla sen sijaan, että ne ennustettaisiin yksi kerrallaan.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS on kiinalaisen puheentekoäly-yhtiö VUI Labsin monikielinen tekstistä puheeksi -malliperhe. Siihen kuuluu äänenlaatuun painottuva perusversio sekä reaaliaikaiseen vuorovaikutukseen suunniteltu Realtime-versio. VUI Labs perustettiin vuoden 2025 alussa, ja julkisten tietojen mukaan sen perustajia ovat Shanghain Jiao Tong -yliopiston professori Qian Yanmin sekä sarjayrittäjä Mei Jie.
Luna-TTS:n kiinnostavuus ei perustu vain yhteen ranking-sijoitukseen. Sen keskeinen tekninen ratkaisu on muuttaa puheen generointitapaa: perinteisen token kerrallaan etenevän autoregressiivisen mallin sijaan se tuottaa suuren määrän puhetokeneita rinnakkain, useissa maskin täyttämisen kierroksissa. Tavoitteena on yhdistää luonnollinen ääni, ilmeikkyys ja pieni viive.1
3
Luna-TTS:n sijoitusta kannattaa tarkastella aina tietyn listan ja ajankohdan yhteydessä. Yksinkertainen väite pitkäaikaisesta maailman ykkössijasta ei saa nykyisistä lähteistä riittävää tukea.
Erot eivät välttämättä tarkoita, että jokin lähde olisi yksiselitteisesti väärässä. Kuuntelutestien tuloksiin vaikuttavat esimerkiksi malliversio, testikieli, äänenväri, kehotteet, otoskoko ja äänestysten ajankohta. Varovaisin johtopäätös on, että Luna-TTS on noussut merkittäväksi kärkikandidaatiksi ja saavuttanut joissakin ajanjaksoissa ykkös- tai kolmossijan.
Julkiset lähteet eivät myöskään anna luotettavaa, suoraan vertailukelpoista sijoitusta Luna-TTS:n suhteesta ByteDance Seediin tai Zhipun malleihin. Siksi näiden mallien keskinäisestä kokonaiskilpailusta ei pidä esittää varmaa voittajaa.
Luna-TTS perustuu esikoulutettuun Qwen3-0.6B-kielimalliin, jota on jatkokoulutettu puhetokenien käsittelyyn.2 Perinteinen autoregressiivinen tekstistä puheeksi -malli ennustaa yleensä seuraavan codec-tokenin askel askeleelta. Luna-TTS käsittelee sen sijaan koko RVQ-tokenverkon ja korjaa satunnaisesti peitettyjä kohtia useissa rinnakkaisissa kierroksissa.
1
4
Tämä muuttaa generoinnin logiikkaa olennaisesti. Se ei enää riipu täysin puhesarjan aiemmasta etuliitteestä, vaan voi käsitellä useita sijainteja samalla kierroksella. Näin pitkien puhesekvenssien peräkkäisestä tuotannosta johtuva viive voi pienentyä, ja yhden virheen ketjuttuminen koko loppusarjaan voi vähentyä.1
3
Luna-TTS käyttää yhtiön omaa Luna-Codec-koodekkia, joka muuntaa äänen kielellisen mallin käsiteltäviksi diskreeteiksi esityksiksi. Julkisissa kuvauksissa mainitaan 24 kHz:n näytteenottotaajuus, 25 Hz:n kuvataajuus ja kahdeksan koodikirjaa.8
9
Koodekki ei ole vain tekninen pakkausvaihe. Se määrittää, kuinka paljon puheinformaatiota mallin on ennustettava, kuinka monta kehystä sekunnissa käsitellään ja millainen kompromissi äänenlaadun ja nopeuden välillä on mahdollinen. Luna-TTS:n tapauksessa kielimalli, puhekoodekki ja diffuusiopohjainen näytteenotto on suunniteltu toimimaan yhtenä kokonaisuutena.
Koko lausuman käsittely rinnakkain sopii hyvin valmiiksi kirjoitettuun tekstiin, mutta reaaliaikaisessa keskustelussa ääntä pitäisi alkaa kuulua jo ennen kuin käyttäjä on saanut koko lauseen sanottua. Siksi Luna-TTS Realtime käyttää kompromissia: lohkot tuotetaan peräkkäin, mutta jokainen lohko kohinanpoistetaan rinnakkain.1
4
Yksi lohko sisältää 32 codec-kehystä eli 1,28 sekuntia ääntä. Realtime-versio käyttää KV-välimuistia kontekstin säilyttämiseen ja alkaa toimittaa seuraavia äänilohkoja sen jälkeen, kun ensimmäinen lohko on valmis.1 Siksi sitä ei ole täsmällistä kutsua täysin epäautoregressiiviseksi. Tarkempi kuvaus on: lohkot riippuvat toisistaan autoregressiivisesti, mutta kunkin lohkon sisällä generointi tapahtuu rinnakkain diffuusion avulla.
Tekninen raportti kuvaa myös maskattuun diskreettiin diffuusioon sovitettua GRPO-vahvistusoppimiseen perustuvaa jälkikoulutusta sekä tunteiden ja ei-kielellisten ääntelyiden ohjausta.1
5 Tavoitteena ei ole ainoastaan ymmärrettävä puhe, vaan myös luonnollisempi, ilmaisuvoimaisempi ja käyttäjän mieltymyksiä paremmin vastaava esitystapa.
Raportin mukaan puheen muokkaus ja nollanäytteen äänenkloonaus voidaan toteuttaa puhetokenverkon täyttämisenä tai uudelleenkirjoittamisena.1
4 Käytännön kloonauslaatu, tarvittavan vertailuäänen pituus ja eri kielten vakaus on kuitenkin arvioitava testeillä. Pelkkä arkkitehtuuri ei todista näitä ominaisuuksia automaattisesti.
Luna-TTS Realtime -raportissa ilmoitetaan lämmitetyssä paikallisessa palvelutestissä 0,024:n reaaliaikakerroin eli RTF (real-time factor). Ensimmäinen 1,28 sekunnin dekoodattu äänilohko toimitettiin 41,6 millisekunnissa.1
5
Muiden raporttien mukaan Realtime-versio käyttää tavallisesti 8–16 kohinanpoistovaihetta, ja testit tehtiin kahdella H20-grafiikkasuorittimella.7 Mallin laskennan näkökulmasta luvut viittaavat korkeaan läpimenoon.
41,6 millisekuntia ei kuitenkaan ole sama asia kuin jokaisen käyttäjän kokema pilvipalvelun ensimmäisen äänipaketin viive. Testi perustui tiettyyn laitteistoon, rinnakkaisajoon, lämmitettyyn palveluun ja paikalliseen palveluprotokollaan. Verkkosiirto, jonotus, tekstin esikäsittely, äänen dekoodaus ja tuotantoympäristön kuormitus voivat kaikki pidentää odotusta. Luku kannattaa siksi tulkita kontrolloidun testin ensimmäisen lohkon toimitusajaksi, ei yleispäteväksi API-palvelulupaukseksi.
Tekijät ilmoittavat, että Luna-TTS:n esikoulutuksessa käytettiin noin miljoona tuntia kiinan-, englannin-, japanin- ja koreankielistä puhedataa.1
2 Monikielinen aineisto voi tarjota laajempaa kattavuutta ääntämiseen, prosodiaan ja kieltenväliseen äänimallinnukseen.
Julkinen tiivistelmä ei kuitenkaan kerro riittävästi datan alkuperästä, puhdistusmenetelmistä, kielikohtaisista osuuksista tai tekijänoikeuksien noudattamisesta, jotta väitteet voisi arvioida itsenäisesti. Miljoona tuntia on siis raportissa ilmoitettu harjoittelun mittakaava, mutta siitä ei voi päätellä, että malli olisi yhtä vahva kaikissa kielissä, aksenteissa tai käyttötapauksissa.
Julkisten tietojen perusteella VUI Labs ei rakenna Luna-TTS:stä vain yksittäistä puhesynteesimallia. Yhtiö kehittää samanaikaisesti mallien ja API-palvelujen kokonaisuutta, sisällöntuottajille suunnattuja äänityökaluja sekä puheeseen perustuvia agenttisovelluksia.
Tässä mallissa äänenlaatu on vain yksi osa kaupallista arvoa. Ratkaisevia voivat olla myös äänen kloonaus, tunnetilan ohjaus, keskustelun orkestrointi, viive, käyttökustannukset ja toimialakohtainen integraatio.
Toimialaraporttien mukaan VUI Labsin ratkaisuja on käytetty logistiikan ohjauksessa, verkko- ja digivakuutuksissa sekä matkailu- ja ravintola-alan ohjelmistopalveluissa. Useiden asiakkaiden kerrotaan käyneen yhteensä yli miljoona liiketoimintakeskustelua.6 Kyse on kuitenkin mediassa julkaistusta yhtiön tai käyttöönotosta vastaavan tahon väitteestä, ei riippumattomasti auditoidusta mittarista. Asiakaslistaa, keskustelujen määritelmää, aktiivista ajanjaksoa tai vertailua muihin toimittajiin ei ole kattavasti julkaistu.
Perustajatiimi yhdistää akateemisen tutkimusjohdon ja kaupallistamisen: Qian Yanmin vastaa puhe- ja tekoälytutkimuksen suunnasta, kun taas Mei Jie on lähteissä kuvattu sarjayrittäjäksi. Rakenne voi helpottaa tutkimusmallin nopeaa viemistä API-palveluksi, toimialaratkaisuiksi ja puheagenteiksi. Pitkän aikavälin kilpailukyky riippuu silti esimerkiksi datan palautesilmukasta, asiakasuskollisuudesta, laskentakustannuksesta ja kansainvälisestä toimituskyvystä.
Teknisten raporttien ja ranking-tietojen perusteella Luna-TTS:n vahvuudet tiivistyvät neljään kohtaan:
Nämä ratkaisut auttavat selittämään, miksi Luna-TTS on noussut nopeasti korkeille sijoille joissakin sokkokuuntelutesteissä. Ne eivät kuitenkaan vielä todista, että se olisi kokonaisuutena parempi hinnassa, pitkien tekstien vakaudessa, äänenvärin yhdenmukaisuudessa, tekijänoikeusturvassa, API:n saatavuudessa tai kaikissa kielissä.
Luna-TTS:n ydintarina on teknisesti uskottava. VUI Labs on yhdistänyt Qwen3:sta johdetun kielimallin, diskreetin puhekoodekin, maskatun diffuusiogeneroinnin, vahvistusoppimiseen perustuvan jälkikoulutuksen ja lohkoittaisen reaaliaikaisen päättelyn yhdeksi tekstistä puheeksi -järjestelmäksi.1
Luna-TTS oli elokuussa 2026 julkaistujen tietojen mukaan Hugging Facen TTS Arenan ykkönen ja Artificial Analysisin vastaavan ajankohdan Speech Arenassa kolmas. Syyskuun 1. päivän ranking-tilanne sijoitti sen kuitenkin viidenneksi.8 Siksi tarkin arvio ei ole, että Luna-TTS olisi pysyvästi päihittänyt kaikki kilpailijat, vaan että siitä on tullut yksi globaalin TTS-kilpailun merkittävistä kärkimalleista.
Kehittäjälle yksittäistä kokonaisrankingia tärkeämpää on testata juuri oma käyttötapaus: kohdekieli, äänen kloonaus, tunneohjaus, ensimmäisen äänipaketin viive, pitkän tekstin johdonmukaisuus ja todellinen API-hinta.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
VUI Labsin Luna TTS saavutti elokuussa 2026 Hugging Facen TTS Arenassa ykkössijan, mutta Artificial Analysisin 1.
VUI Labsin Luna TTS saavutti elokuussa 2026 Hugging Facen TTS Arenassa ykkössijan, mutta Artificial Analysisin 1. Mallin keskeinen idea on generoida puhetokeneita rinnakkain maskatun diffuusion avulla sen sijaan, että ne ennustettaisiin yksi kerrallaan.
Teknisessä raportissa ilmoitetaan 41,6 millisekunnin ensimmäisen lohkon viive ja 0,024:n reaaliaikakerroin lämmitetyssä paikallisessa testissä.