Luna TTS er en flerspråklig tekst til tale familie fra VUI Labs. Modellen ble omtalt som nummer én på Hugging Face TTS Arena i august 2026, men sto på femteplass hos Artificial Analysis 1.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS er en familie av flerspråklige tekst-til-tale-modeller fra den kinesiske oppstartsbedriften VUI Labs. Familien består av en standardmodell som først og fremst er utviklet for lydkvalitet, og en Realtime-utgave for strømming og samtaler.
VUI Labs ble etablert tidlig i 2025. Offentlig tilgjengelige omtaler knytter selskapet til professor Qian Yanmin ved Shanghai Jiao Tong-universitetet og seriegründeren Mei Jie.
Det som har gjort Luna-TTS interessant, er ikke bare en plassering på en toppliste. Modellen forsøker å endre selve måten syntetisk tale blir generert på: fra sekvensiell token-for-token-produksjon til en prosess som minner mer om diffusjonsmodeller, der mange deler av lydsekvensen kan behandles samtidig.1
3
Det korte svaret er at Luna-TTS har vært helt i toppen, men at det blir misvisende å kalle modellen en permanent global ener.
Resultatene trenger ikke å være motstridende. Slike blindlyttingstester påvirkes av modellversjon, språk, stemme, tekstinstruksjoner, antall prøver og når stemmene ble avgitt. Den mest presise konklusjonen er derfor at Luna-TTS har vært blant de ledende modellene i flere TTS-evalueringer, og i enkelte perioder har nådd første- eller tredjeplass.
Det finnes derimot ikke tilstrekkelig sammenlignbare data til å fastslå en nøyaktig plassering mot ByteDance Seed eller Zhipu. Kildene dokumenterer heller ikke at Luna-TTS over tid slår alle modeller fra Qwen, Cartesia eller ElevenLabs.
Luna-TTS bygger videre på den forhåndstrente språkmodellen Qwen3-0.6B, som er tilpasset for å arbeide med taletokens.2
I tradisjonelle autoregressive TTS-systemer forutsier modellen normalt neste codec-token basert på det som allerede er generert. Det skaper en lang, sekvensiell kjede: En senere del av lyden må vente på den forrige.
Luna-TTS gjør noe annet. Først konverteres talen til et rutenett av diskrete RVQ-tokens. Deretter maskeres deler av rutenettet, og modellen fyller inn de manglende posisjonene gjennom flere parallelle forbedringsrunder.1
4
Fordelen er at genereringsrekkefølgen ikke er like strengt bundet til lydsekvensens begynnelse. Flere posisjoner kan behandles i samme runde, noe som kan redusere forsinkelsen ved lange sekvenser og begrense risikoen for at en tidlig feil forplanter seg gjennom resten av uttalen.1
3
Modellfamilien bruker den egenutviklede lydkodeken Luna-Codec. Offentlig tilgjengelig materiale beskriver en konstruksjon med 24 kHz samplingsfrekvens, 25 Hz bildefrekvens og åtte kodebøker.8
9
Dette gjør lydsignalet om til et kompakt, diskret tokenformat som en språkmodell kan behandle. Samtidig skal representasjonen bevare tilstrekkelig akustisk informasjon til å gjenskape naturlig tale.
Kodeken er derfor mer enn et enkelt komprimeringsledd. Den bestemmer hvor mye taleinformasjon modellen må forutsi, hvor mange rammer som skal behandles per sekund, og hvor godt systemet kan balansere lydkvalitet mot hastighet. I Luna-TTS er språkmodell, codec og diffusjonsbasert sampling utviklet som deler av samme system.
Standardutgaven kan generere en hel ytring som en samlet, ikke-autoregressiv sekvens. I en samtale må imidlertid systemet begynne å spille av lyd før brukeren eller språkmodellen er ferdig med hele setningen.
Realtime-versjonen bruker derfor en mellomløsning. Den genererer sekvensielt fra blokk til blokk, men utfører parallell avstøyings- eller diffusjonsgenerering internt i hver blokk.1
4
Hver blokk består av 32 codec-rammer, tilsvarende 1,28 sekunder med lyd. KV-cache brukes til å ta vare på konteksten, og nye lydblokker sendes ut fortløpende etter at den første er klar.1
Det betyr at det ikke er helt presist å omtale Realtime som «fullstendig ikke-autoregressiv». Mer nøyaktig er det å si at modellen har autoregressive avhengigheter mellom blokkene, mens innholdet i hver blokk genereres parallelt.
Den tekniske rapporten beskriver også en ettertreningsfase med GRPO, en metode for forsterkningslæring som er tilpasset den diskrete, maskerte diffusjonsprosessen.1
5
Målet er ikke bare at talen skal være forståelig. Systemet skal også kunne håndtere følelser og ikke-verbale uttrykk, som ulike vokale lyder og andre nyanser i fremføringen. Slike kontrollmuligheter kan være viktige i stemmeassistenter, kundedialog og innholdsproduksjon.
Rapporten beskriver dessuten stemmeredigering og nullskudds-stemmekloning som varianter av å fylle ut eller skrive om deler av tokenrutenettet.1
4 Det sier likevel ikke alene noe sikkert om klonekvalitet, hvor langt referanseopptaket må være, eller hvor stabilt systemet fungerer på ulike språk og dialekter. Det må testes i praksis.
Luna-TTS Realtime-rapporten oppgir en real-time factor, eller RTF, på 0,024 etter oppvarming. Den første lydblokken på 1,28 sekunder skal ha blitt sendt videre etter 41,6 millisekunder i den lokale testoppsettingen.1
5
Med en RTF på 0,024 tar det i denne målingen rundt 24 millisekunder å generere ett sekund tale. Omtaler av systemet oppgir også vanligvis åtte til 16 diffusjonstrinn, med testing på to H20-GPU-er.7
Tallene er imidlertid ikke det samme som en garanti for hva en bruker opplever gjennom en nettbasert API-tjeneste. Testene ble gjort med bestemt maskinvare, parallellisering, oppvarmet tjeneste og en lokal serverprotokoll. Nettverk, kø, tekstforbehandling, lyddekoding og belastning i produksjon kan alle øke den faktiske ventetiden.
41,6 millisekunder bør derfor forstås som tiden til første blokk under kontrollerte testbetingelser – ikke nødvendigvis som en universell ende-til-ende-forsinkelse for alle kunder.
Forfatterne oppgir at Luna-TTS er forhåndstrent på rundt én million timer med tale på kinesisk, engelsk, japansk og koreansk.1
2
Et så stort flerspråklig datagrunnlag kan gi bedre dekning av uttale, prosodi og variasjoner mellom språk. Samtidig gir de offentlige sammendragene ikke nok informasjon til at man uavhengig kan vurdere hvor dataene kommer fra, hvordan de er renset, hvor stor andel hvert språk utgjør, eller hvordan opphavsrett og samtykke er håndtert.
Påstanden om én million timer kan derfor gjengis som en beskrivelse av treningsomfanget. Den bør ikke automatisk tolkes som dokumentasjon på at modellen er best på hvert enkelt språk, hver aksent eller alle bruksområder.
Offentlige omtaler tyder på at VUI Labs ikke ser Luna-TTS som et frittstående synteseprodukt. Selskapet arbeider også med modell- og API-tjenester, verktøy for innholdsprodusenter og løsninger for stemmeagenter.
Det er en viktig forskjell. I et kommersielt produkt er lydkvalitet bare én del av regnestykket. Stemmekloning, følelseskontroll, dialogflyt, responstid, driftskostnader og integrasjon i kundenes systemer kan være minst like avgjørende.
Bransjeomtaler hevder at teknologien er tatt i bruk innen logistikk, nettbasert forsikring og programvare for reiseliv og hotell, og at flere kunder samlet har gjennomført over én million forretningssamtaler.6 Dette er imidlertid et tall som er gjengitt fra medie- eller selskapsomtale, ikke en uavhengig revidert nøkkelindikator. Kildene offentliggjør heller ikke en fullstendig kundeliste, en entydig definisjon av «samtale» eller en sammenligning med andre leverandører.
Grunnleggerteamet kombinerer akademisk fagledelse med produkt- og kommersialiseringserfaring: Qian Yanmin forbindes med forskningsretningen innen tale og kunstig intelligens, mens Mei Jie omtales som seriegründer. En slik kombinasjon kan gjøre det lettere å flytte forskning raskt over i API-er, bransjeløsninger og stemmeagenter. Den langsiktige konkurransekraften vil likevel avhenge av blant annet datatilbakemeldinger, kundelojalitet, kostnad per genererte lydsekund og evnen til å levere internasjonalt.
Sett under ett peker kildene særlig på fire mulige styrker:
Dette kan forklare hvorfor Luna-TTS raskt har gjort det godt i enkelte blindlyttingstester. Men arkitekturen beviser ikke automatisk at modellen er best på pris, lange tekster, stemmekonsistens, rettighetskontroll, API-stabilitet eller alle språk.
Den tekniske kjernen i Luna-TTS fremstår som reell og interessant. VUI Labs har satt sammen en Qwen3-basert språkmodell, en diskret lydcodec, maskert diffusjonsgenerering, ettertrening med forsterkningslæring og blokkvis strømming til et samlet TTS-system.1
Modellen ble omtalt som nummer én på Hugging Face TTS Arena i august 2026 og som nummer tre i Artificial Analysis’ samtidige omtale. I øyeblikksbildet fra 1. september var Luna TTS imidlertid på femteplass.8
Det mest edruelige bildet er derfor ikke at Luna-TTS har slått alle konkurrenter for godt. Snarere er modellen blitt en viktig utfordrer i det globale TTS-feltet, med en parallell diffusjonsarkitektur og en sanntidsløsning som fortjener videre oppmerksomhet.
For utviklere som skal velge leverandør, er det klokere å teste mer enn én samlet ranking. Sammenlign målspråk, stemmekloning, følelseskontroll, tid til første lydblokk, stabilitet i lange tekster og faktisk API-kostnad i det konkrete bruksområdet.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Luna TTS er en flerspråklig tekst til tale familie fra VUI Labs. Modellen ble omtalt som nummer én på Hugging Face TTS Arena i august 2026, men sto på femteplass hos Artificial Analysis 1.
Luna TTS er en flerspråklig tekst til tale familie fra VUI Labs. Modellen ble omtalt som nummer én på Hugging Face TTS Arena i august 2026, men sto på femteplass hos Artificial Analysis 1. I stedet for å forutsi taletokens ett etter ett, bruker Luna TTS en Qwen3 basert, ikke autoregressiv modell som fyller ut mange tokens parallelt.
VUI Labs ble grunnlagt av Shanghai Jiao Tong professoren Qian Yanmin og seriegründeren Mei Jie.