Luna TTS er VUI Labs’ flersprogede tekst til tale familie. Modellen lå nummer ét på Hugging Face TTS Arena i august 2026, men stod som nummer fem på Artificial Analysis’ øjebliksbillede fra 1.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS er en familie af flersprogede tekst-til-tale-modeller fra den kinesiske startupvirksomhed VUI Labs. Familien består af en standardudgave med fokus på lydkvalitet og en Realtime-version, der er udviklet til samtaler med lav forsinkelse. VUI Labs blev etableret i begyndelsen af 2025 af Shanghai Jiao Tong-professoren Qian Yanmin og serieiværksætteren Mei Jie.
Det, der har gjort Luna-TTS bemærkelsesværdig, er derfor ikke kun en god placering på en rangliste. Modellen forsøger at ændre selve måden, tale genereres på: fra sekventiel forudsigelse af ét token ad gangen til en proces, der minder mere om diffusion, hvor mange taletokens kan skabes parallelt.1
3
Der findes ikke én endelig, global rangliste for tekst-til-tale. Resultaterne afhænger blandt andet af modelversion, sprog, stemme, tekstprompt, antal prøver og tidspunktet for afstemningen. Derfor bør Luna-TTS’ placering beskrives med dato og benchmark i stedet for som et permanent verdensmesterskab.
Samlet peger kilderne på, at Luna-TTS har været blandt de førende modeller og i bestemte perioder har nået første- eller tredjepladsen. De dokumenterer derimod ikke, at modellen vedvarende slår Cartesia, ElevenLabs, Qwen eller alle andre konkurrenter.
Der er heller ikke tilstrækkeligt sammenlignelige data til at fastslå en præcis placering over for ByteDance Seed eller Zhipu. Det vil derfor være for skråsikkert at beskrive forholdet mellem disse modeller som en entydig, samlet sejr eller et nederlag.
Luna-TTS bygger videre på den fortrænede sprogmodel Qwen3-0.6B, som er blevet tilpasset til at arbejde med taletokens i en diffusionsbaseret sprogmodel.2
I en traditionel autoregressiv tekst-til-tale-model forudsiges det næste codec-token trin for trin. Luna-TTS arbejder i stedet med et helt gitter af RVQ-tokens, hvor dele af repræsentationen maskeres og derefter gendannes gennem flere parallelle forbedringsrunder.1
4
Det ændrer den grundlæggende genereringslogik. Resultatet behøver ikke fuldt ud at afhænge af den allerede genererede begyndelse af lydsekvensen. Modellen kan behandle flere positioner i samme runde, hvilket kan mindske forsinkelsen ved lange sekvenser og begrænse risikoen for, at en tidlig fejl forplanter sig gennem resten af talen.1
3
Luna-TTS bruger det egenudviklede Luna-Codec til at omdanne lyd til en diskret tale-repræsentation. De offentligt beskrevne specifikationer er en samplingsfrekvens på 24 kHz, en billedfrekvens på 25 Hz og otte kodebøger.8
9
Det gør lyd til et token-gitter, som en sprogmodel lettere kan arbejde med, samtidig med at repræsentationen skal rumme de akustiske detaljer, der er nødvendige for naturlig tale.
Codec’en er derfor mere end et simpelt komprimeringslag. Den afgør, hvor meget information modellen skal forudsige, hvor mange frames der skal behandles pr. sekund, og hvor let det er at afveje lydkvalitet mod hastighed. Luna-TTS er i praksis designet som et samspil mellem sprogmodel, diskret codec og diffusionsbaseret sampling.
Standardversionen kan generere en hel ytring med en fuldt ikke-autoregressiv proces. Det er imidlertid ikke nok til en flydende samtale: Et system skal helst begynde at afspille lyd, før brugeren eller agenten har færdiggjort hele sætningen.
Derfor bruger Luna-TTS Realtime et kompromis. Modellen genererer blokke sekventielt, men foretager parallel afstøjning inde i hver blok.1
4
En blok består af 32 codec-frames, svarende til 1,28 sekunders lyd. Realtime-udgaven bruger KV-cache til at bevare konteksten og sender de efterfølgende lydblokke ud, efter at den første blok er godkendt.1
Det er derfor ikke helt præcist at kalde Realtime-versionen fuldt ikke-autoregressiv. Den er autoregressiv mellem blokkene, mens selve genereringen inde i den enkelte blok foregår parallelt.
Den tekniske rapport beskriver også en eftertræningsfase med GRPO-forstærkningslæring, tilpasset den diskrete maskediffusionsproces. Derudover understøttes kontrol af følelser og ikke-verbale vokallyde.1
5
Målet er ikke kun, at stemmen skal være forståelig. Den skal også lyde naturlig, udtryksfuld og bedre matche brugerens præferencer.
Rapporten beskriver desuden stemmeredigering og zero-shot-stemmekloning som opgaver, hvor tale-token-gitteret kan udfyldes eller skrives om.1
4 Den faktiske kvalitet af kloningen, længden på den nødvendige referenceoptagelse og stabiliteten på tværs af sprog bør dog testes i praksis. De kan ikke udledes sikkert af arkitekturen alene.
Den tekniske rapport for Luna-TTS Realtime angiver en real-time factor, RTF, på 0,024 i en lokal test efter opvarmning. Det første lydstykke på 1,28 sekunder blev sendt videre efter 41,6 millisekunder.1
5
Andre omtaler angiver, at Realtime-versionen typisk anvender mellem otte og 16 afstøjningsskridt og blev testet på to H20-GPU’er.7
Tallene indikerer høj genereringskapacitet i den målte del af systemet. Men 41,6 millisekunder er ikke det samme som den ventetid, alle brugere nødvendigvis oplever i en cloudtjeneste.
Testen foregik på bestemt hardware med parallel konfiguration, en opvarmet server og en lokal betjeningsprotokol. Netværk, kø, tekstforbehandling, lyddekodning og belastning i produktion kan alle føje ekstra tid til. Tallet bør derfor forstås som tiden til at indsende den første blok under kontrollerede testforhold – ikke som et universelt løfte om API’ets samlede svartid.
Forfatterne oplyser, at Luna-TTS er fortrænet på omkring én million timers tale på kinesisk, engelsk, japansk og koreansk.1
2
Et så stort flersproget datagrundlag kan give bredere dækning af udtale, prosodi og stemmemodellering på tværs af sprog. De offentlige sammendrag indeholder dog ikke nok oplysninger til, at man uafhængigt kan vurdere datakilder, rensningskriterier, fordelingen mellem sprog eller ophavsretlig overholdelse.
Påstanden om én million timers træningsdata kan derfor gengives som en beskrivelse af træningsomfanget. Den dokumenterer ikke i sig selv, at modellen er lige stærk på alle sprog, accenter eller anvendelser.
De offentlige beskrivelser tyder på, at VUI Labs ikke kun vil sælge Luna-TTS som en isoleret talesyntesemodel. Virksomheden arbejder også med model- og API-funktioner, værktøjer til kreative brugere samt stemmebaserede AI-agenter.
I den model er lydkvalitet kun ét led i produktet. Den kommercielle værdi afhænger også af stemmekloning, følelseskontrol, samtalestyring, svartid, driftsomkostninger og integration i kundernes systemer.
Brancheomtale hævder, at VUI Labs allerede er taget i brug inden for blandt andet logistikdisponering, internetforsikring og software til rejse- og hotelbranchen, og at flere kunder tilsammen har gennemført over én million forretningssamtaler.6
Det tal er imidlertid en oplysning fra virksomheden eller en implementeringspart, gengivet i mediedækningen. Det er ikke et uafhængigt revideret nøgletal. De offentlige oplysninger beskriver heller ikke fuldt ud kundelisten, definitionen af en samtale, den aktive periode eller sammenligningsgrundlaget med andre leverandører.
VUI Labs’ tidlige grundlæggerteam kombinerer en akademisk teknisk leder med en person med erfaring inden for produktudvikling og kommercialisering. Qian Yanmin forbindes med virksomhedens forskning i tale og kunstig intelligens, mens Mei Jie er blevet beskrevet som serieiværksætter.
Den kombination kan gøre det lettere at omsætte en forskningsorienteret model til API’er, brancheløsninger og stemmeagenter. Den langsigtede konkurrenceevne vil dog også afhænge af datatilbagemeldinger, kundeloyalitet, beregningsomkostninger pr. forespørgsel og evnen til at levere internationalt.
På tværs af den tekniske rapport og ranglistedata tegner der sig især fire mulige styrker:
Det forklarer, hvorfor Luna-TTS hurtigt kunne nå høje placeringer i enkelte blindlytningstests. Det beviser ikke automatisk, at systemet er bedst på pris, lange tekster, stemmekonsistens, ophavsretlig sikkerhed, API-stabilitet eller alle sprog.
Den tekniske kerne i Luna-TTS-historien er veldokumenteret og interessant: VUI Labs har kombineret en Qwen3-afledt sprogmodel, et diskret tale-codec, maskediffusion, forstærkningslæring og blokbaseret streaming i ét samlet TTS-system.1
Modellen blev omtalt som nummer ét på Hugging Face TTS Arena i august 2026 og som nummer tre i Artificial Analysis’ samtidige rapportering. På Artificial Analysis’ øjebliksbillede fra 1. september stod den imidlertid som nummer fem.8
Den mest præcise konklusion er derfor ikke, at Luna-TTS permanent har slået alle konkurrenter. Det er snarere en model, der allerede er blandt de markante globale TTS-udfordrere, og hvis parallelle diffusionsarkitektur og blokbaserede realtidsgenerering er værd at følge.
For udviklere, der overvejer modellen, er det bedre at teste mere end én samlet rangliste: Det bør blandt andet ske på de relevante sprog, stemmekloning, følelseskontrol, tid til første lydblok, konsistens i lange tekster og den faktiske API-pris.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Luna TTS er VUI Labs’ flersprogede tekst til tale familie. Modellen lå nummer ét på Hugging Face TTS Arena i august 2026, men stod som nummer fem på Artificial Analysis’ øjebliksbillede fra 1.
Luna TTS er VUI Labs’ flersprogede tekst til tale familie. Modellen lå nummer ét på Hugging Face TTS Arena i august 2026, men stod som nummer fem på Artificial Analysis’ øjebliksbillede fra 1. I stedet for at forudsige taletokens ét ad gangen bruger Luna TTS en Qwen3 baseret, diskret maskediffusionsmodel, som kan udfylde mange dele af et tale token net samtidigt.
VUI Labs blev grundlagt af Shanghai Jiao Tong professoren Qian Yanmin og serieiværksætteren Mei Jie.