Luna TTS is een meertalige tekst naar spraakfamilie van VUI Labs. Het model stond in augustus 2026 tijdelijk op de eerste plaats in de Hugging Face TTS Arena, maar stond op 1 september op de vijfde plaats in een Artif...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS is de meertalige tekst-naar-spraakfamilie van het Chinese AI-bedrijf VUI Labs. Er zijn twee hoofduitvoeringen: een standaardversie die vooral op geluidskwaliteit en expressiviteit is gericht, en Luna-TTS Realtime voor interactieve toepassingen met lage vertraging.
VUI Labs werd begin 2025 opgericht door Qian Yanmin, hoogleraar aan Shanghai Jiao Tong University, en serie-ondernemer Mei Jie. De belangstelling voor het bedrijf komt niet alleen voort uit een hoge positie op enkele ranglijsten. Vooral de technische keuze om spraak niet volledig stap voor stap, maar grotendeels parallel te genereren, maakt Luna-TTS interessant.
Er is geen enkele, permanente wereldranglijst voor tekst-naar-spraak. De uitkomst hangt onder meer af van het model- en stemtype, de geteste talen, de gebruikte prompts, het aantal luisterbeoordelingen en het moment waarop de ranglijst wordt bekeken.
De meest voorzichtige conclusie is daarom dat Luna-TTS tot de sterke internationale TTS-modellen behoort en in bepaalde periodes de eerste of derde plaats bereikte. De beschikbare gegevens bewijzen niet dat het model structureel beter presteert dan Cartesia, ElevenLabs, Qwen, ByteDance Seed, Zhipu of alle andere concurrenten.
Voor ByteDance Seed en Zhipu is bovendien geen betrouwbare, rechtstreeks vergelijkbare ranglijst beschikbaar waarmee een exacte onderlinge positie kan worden vastgesteld. Een algemene uitspraak over een volledige overwinning zou daarom verder gaan dan de bronnen toelaten.
Traditionele autoregressieve TTS-modellen voorspellen codec- of spraaktokens doorgaans één voor één. Elk volgend token is daarbij afhankelijk van de tokens die al zijn gegenereerd. Dat kan de latentie verhogen en ervoor zorgen dat een vroege fout zich door de rest van de reeks verspreidt.
Luna-TTS kiest een andere route. Het model is ontwikkeld vanuit het voorgetrainde Qwen3-0.6B-taalmodel en verder getraind als een diffusion language model voor spraaktokens.2 Het volledige raster van RVQ-tokens wordt gedeeltelijk gemaskeerd, waarna het model in meerdere rondes de ontbrekende posities parallel invult.
1
4
Daardoor wordt de volgorde van generatie niet volledig bepaald door een al bestaand prefix van de audio. Het model kan meerdere posities tegelijk behandelen. Dat moet de sequentiële afhankelijkheid verkleinen en een betere balans bieden tussen natuurlijkheid, expressiviteit en snelheid.1
3
Voor de omzetting van audio naar een discrete representatie gebruikt Luna-TTS de eigen Luna-Codec. Openbare beschrijvingen noemen een samplefrequentie van 24 kHz, een framesnelheid van 25 Hz en acht codeboeken.8
9
Een codec is daarbij meer dan een eenvoudige compressiestap. De codec bepaalt hoeveel spraakinformatie het model moet voorspellen, hoeveel frames per seconde nodig zijn en hoe efficiënt parallelle generatie kan werken. De modelarchitectuur, de discrete audiorepresentatie en de manier van samplen zijn bij Luna-TTS dus nauw met elkaar verbonden.
De standaardversie kan een volledige uiting in één globale niet-autoregressieve generatie verwerken. Voor een gesprekssysteem is dat niet ideaal: de gebruiker verwacht audio terwijl de volledige zin nog wordt gevormd.
Luna-TTS Realtime gebruikt daarom een compromis. Tussen audioblokken bestaat een autoregressieve afhankelijkheid, maar binnen elk blok worden de tokens parallel gedenoised. Elk blok bestaat uit 32 codecframes, goed voor 1,28 seconde audio. Met KV-cache wordt de context bewaard en kan audio blok voor blok worden doorgestuurd.1
4
De term “volledig niet-autoregressief” is voor de Realtime-versie dus niet correct. Preciezer gezegd: het systeem is autoregressief tussen blokken en voert binnen elk blok parallelle diffusiegeneratie uit.
Het technische rapport beschrijft een op masked diffusion aangepaste GRPO-nabewerking. GRPO staat voor Group Relative Policy Optimization, een methode voor reinforcement learning waarbij het model verder wordt afgestemd op gewenste uitkomsten. Bij Luna-TTS wordt die stap gebruikt naast expliciete controle over emotie en niet-verbale geluiden, zoals hoorbare expressies.1
5
De architectuur maakt ook stembewerking en zero-shot stemklonen mogelijk als varianten van het invullen of herschrijven van een spraaktokenraster.1
4 Dat betekent echter niet automatisch dat de kwaliteit in elke taal of met elke referentieopname gelijk is. De praktische prestaties hangen af van onder meer de gebruikte stem, de lengte en kwaliteit van het referentiemateriaal en de toepassing waarin het model wordt ingezet.
In het technische rapport worden voor Luna-TTS Realtime een real-timefactor van 0,024 en een eerste audioblok van 1,28 seconde na 41,6 milliseconden genoemd. Die cijfers zijn gemeten met een opgewarmde lokale serveropstelling.1
5
Externe berichtgeving noemt daarnaast doorgaans acht tot zestien denoisingstappen en tests met twee H20-GPU's.7 Binnen de gemeten inferentiegrens wijzen deze cijfers op een hoge doorvoer.
Ze zijn niet hetzelfde als de wachttijd die elke gebruiker in een publieke cloud-API zal ervaren. Netwerkvertraging, wachtrijen, tekstvoorbewerking, audiodecodering en belasting van de productieomgeving kunnen de totale tijd verhogen. De 41,6 milliseconden moeten daarom worden gelezen als de tijd tot het eerste blok in een gecontroleerde lokale test, niet als een algemene garantie voor de end-to-end-ervaring van iedere API-gebruiker.
Volgens de auteurs is Luna-TTS voorgetraind op ongeveer één miljoen uur Chinese, Engelse, Japanse en Koreaanse spraak.1
2 Zo'n corpus kan helpen bij uitspraak, prosodie en het modelleren van stemmen over meerdere talen heen.
De openbare samenvattingen geven echter onvoldoende informatie om zelfstandig te controleren waar het materiaal vandaan komt, hoe het is opgeschoond, hoe de uren over de talen zijn verdeeld of hoe de auteursrechtelijke naleving is geregeld. “Eén miljoen uur” is dus een gerapporteerde omvang van de training, geen bewijs dat Luna-TTS in iedere taal, elk accent of ieder gebruiksscenario de beste resultaten levert.
VUI Labs lijkt Luna-TTS niet als losstaand synthesemodel te positioneren. De openbare berichtgeving wijst op een combinatie van model- en API-diensten, tools voor makers en toepassingen rond voice agents. In zo'n strategie is TTS-kwaliteit slechts één onderdeel. De commerciële waarde hangt ook af van stemklonen, emotiecontrole, gespreksorkestratie, beschikbaarheid, kosten per generatie en integratie in bedrijfssoftware.
Volgens berichtgeving wordt de technologie gebruikt in onder meer logistieke planning, onlineverzekeringen en software voor reizen en hospitality. Meerdere klanten zouden samen meer dan één miljoen zakelijke gesprekken hebben gevoerd.6 Dat cijfer is afkomstig uit bedrijfs- of mediaberichtgeving en is geen onafhankelijk gecontroleerde maatstaf. De openbare bronnen maken niet volledig duidelijk welke klanten zijn meegerekend, hoe een gesprek is gedefinieerd of over welke periode de gesprekken plaatsvonden.
De oprichters wijzen op een combinatie van academische expertise en productervaring: Qian Yanmin leidt de technische en onderzoeksrichting, terwijl Mei Jie als serie-ondernemer de productisering en commercialisering ondersteunt. Of die combinatie op lange termijn een voordeel blijft, zal afhangen van onder meer de kwaliteit van de datalus, klantbehoud, inferentiekosten en internationale levering.
Op basis van het technische rapport en de beschikbare ranglijsten vallen vier punten op:
Deze ontwerpkeuzes helpen verklaren waarom Luna-TTS in bepaalde blinde luistertests snel hoog eindigde. Ze bewijzen op zichzelf echter geen superioriteit op het gebied van prijs, lange teksten, stemconsistentie, auteursrechtelijke veiligheid, API-beschikbaarheid of alle ondersteunde talen.
Het technische verhaal achter Luna-TTS is overtuigend genoeg om serieus te nemen. VUI Labs combineert een uit Qwen3 voortgekomen taalmodel met een discrete spraakcodec, masked diffusion, reinforcement-learning-nabewerking en blokgewijze streaming.1
De ranglijsten vragen wel om nuance. Luna-TTS werd in augustus 2026 in berichtgeving als nummer één op Hugging Face TTS Arena genoemd en als derde op Artificial Analysis Speech Arena. In de Artificial Analysis-momentopname van 1 september stond het model op plaats vijf.8 Dat onderstreept hoe snel dergelijke ranglijsten kunnen verschuiven.
De beste samenvatting is daarom niet dat Luna-TTS alle concurrenten blijvend heeft verslagen. Het model is een belangrijke hooggeplaatste speler in de internationale TTS-markt, met een interessante parallelle diffusieroute en een praktische streamingvariant.
Voor ontwikkelaars die een model willen kiezen, is een algemene ranglijst slechts het begin. Test vooral de talen en stemmen die in de eigen toepassing centraal staan, samen met stemklonen, emotiecontrole, eerste-audiolatentie, consistentie bij lange teksten en de werkelijke API-kosten.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Luna TTS is een meertalige tekst naar spraakfamilie van VUI Labs. Het model stond in augustus 2026 tijdelijk op de eerste plaats in de Hugging Face TTS Arena, maar stond op 1 september op de vijfde plaats in een Artif...
Luna TTS is een meertalige tekst naar spraakfamilie van VUI Labs. Het model stond in augustus 2026 tijdelijk op de eerste plaats in de Hugging Face TTS Arena, maar stond op 1 september op de vijfde plaats in een Artif... De kerntechnologie wijkt af van klassieke spraakmodellen: in plaats van spraaktokens één voor één te voorspellen, gebruikt Luna TTS een op Qwen3 gebaseerde discrete masked diffusionarchitectuur die meerdere tokens par...
De Realtime variant werkt met blokken van 1,28 seconde. In een lokale testopstelling werd het eerste audioblok na 41,6 milliseconden aangeboden, met een real timefactor van 0,024.